传送

借道虚空,瞬至原文

传送阵已启动

人工智能实训Day2:大模型对齐技术实践——SFT与DPO

人工智能实训Day2笔记:使用LLaMA-Factory对Qwen1.5-0.5B-Chat进行SFT监督微调(GSM8K)与DPO直接偏好优化(Math-Step-DPO-10K),包括CoT推理增强与β参数敏感性分析。

2026-06-24 111 字 5 阅
共 227 篇 | 总阅 712 次

3 秒后传送至原文