Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?
微调真的导致了模型幻象吗?
更高的Unknown比例与性能退化成正比:见figure3a,无论微调多久,更高的Unknown百分比会导致性能退化,这表明Unknown不如Known示例有用。性能也受微调时间的强烈影响,通常早停法性能最好。训练更多的epoch通常会降低性能。 Unknown数据是有害的还是中性的?考虑到数据量固定,上述情况下效果随着Unknown变多而变差可能单纯是Known数据变少了,作者因此将Unknow数据过滤掉,比如筛掉25%的Unknown数据留下一个0.75被数据量的纯Known数据集。结果见figure3b,实线是figure3a里取过来的,虚线是去掉Unknown后的结果,可以对比两个颜色,在早停情况下,效果几乎不变,意味着此时Unknown数据效果较为中性,而当训久了CONVERGENCE时差别很大。而且对于两条纯Known的虚线,其实效果很接近,这表明Unknown的存在是使得具有较高未知比例的ckpt更容易过拟合的原因。 Unknown拟合速度比Known慢:早停可以减轻过拟合Unknown示例带来的幻觉风险。作者在figure1中展示了随着训练,模型在Train中Known/Unknown以及Dev上的表现,可以看到Known的准确性提升得比Unknown快,而且效果最好的时候是拟合了大部分Known以及小部分Unknown的时候。 随着在早停时达到峰值,M拟合更多Unknown会性能恶化,作者甚至拟合了Known和Unknown示例对测试准确率的影响,其线性回归模型见下,具体参数见论文。 作者对微调数据集以外的知识做了评估,在OOD测试集上有类似上述结论的发现:较高的Unknown比例导致较低的OOD测试性能;Unknown对OOD性能有害且也主要在拟合它们时。因此上述结论有迁移性。
撰文:戴剑波;编辑:戴剑波
未经本公众号授权不得转载,欢迎转发。
