多语言数学推理中的 On-Policy Delta Distillation(OPD2)研究
一项针对 Qwen3 的研究发现,On-Policy Delta Distillation(OPD2)在多语言数学推理中持续优于原始 OPD,尤其在韩语和日语上提升显著,并普遍缩小了英语与韩语的性能差距。研究还显示,仅用英语数据的 OPD 虽能提升韩语和日语表现,但常使回答偏向英语,凸显了多语言数据对保持目标语言回答的重要性。
ai
一项针对 Qwen3 的研究发现,On-Policy Delta Distillation(OPD2)在多语言数学推理中持续优于原始 OPD,尤其在韩语和日语上提升显著,并普遍缩小了英语与韩语的性能差距。研究还显示,仅用英语数据的 OPD 虽能提升韩语和日语表现,但常使回答偏向英语,凸显了多语言数据对保持目标语言回答的重要性。