借道虚空,瞬至原文
人工智能实训Day2笔记:使用LLaMA-Factory对Qwen1.5-0.5B-Chat进行SFT监督微调(GSM8K)与DPO直接偏好优化(Math-Step-DPO-10K),包括CoT推理增强与β参数敏感性分析。
3 秒后传送至原文