模型训练

SFT、DPO 训练与日常 AI 助手有什么关系?

Samesoul 的模型训练面向有专门数据和模型定制需求的用户。日常对话、长期记忆与文档知识库不要求你先训练模型;训练中心是单独的进阶功能。

SFT 与 DPO

  • SFT 使用示例问答,帮助模型学习特定任务的回答方式。
  • DPO 使用偏好与非偏好回答的对比数据,优化回答偏好。
  • 训练效果依赖数据质量、模型与参数;不能保证消除幻觉或准确记住所有事实。

从数据到使用

  1. 在客户端训练中心选择可用基座模型与训练方式。
  2. 按模板准备并上传数据;当前支持的文件类型以上传页为准。
  3. 核对会员权限、预估费用及参数后提交训练任务。
  4. 训练完成后在“我的模型”中查看结果,按可用入口部署并用于对话。

怎样选择

需要持续理解个人偏好时使用记忆;需要查询文档时使用知识库;只有具备训练数据并希望定制模型行为时,再考虑模型训练。

内容更新于 2026 年 9 月 17 日