模型训练
SFT、DPO 训练与日常 AI 助手有什么关系?
Samesoul 的模型训练面向有专门数据和模型定制需求的用户。日常对话、长期记忆与文档知识库不要求你先训练模型;训练中心是单独的进阶功能。
SFT 与 DPO
- SFT 使用示例问答,帮助模型学习特定任务的回答方式。
- DPO 使用偏好与非偏好回答的对比数据,优化回答偏好。
- 训练效果依赖数据质量、模型与参数;不能保证消除幻觉或准确记住所有事实。
从数据到使用
- 在客户端训练中心选择可用基座模型与训练方式。
- 按模板准备并上传数据;当前支持的文件类型以上传页为准。
- 核对会员权限、预估费用及参数后提交训练任务。
- 训练完成后在“我的模型”中查看结果,按可用入口部署并用于对话。
怎样选择
需要持续理解个人偏好时使用记忆;需要查询文档时使用知识库;只有具备训练数据并希望定制模型行为时,再考虑模型训练。
内容更新于 2026 年 9 月 17 日