测试发现了什么
实验设计不复杂:拿现实中有争议或需要核实的陈述,分别问各家旗舰模型,比较结论。结果是模型之间频繁互相矛盾,而且每家都用同样自信的语气给答案。更麻烦的是分歧没有稳定模式——不是某家系统性偏左或偏右,而是随题目随机摇摆,连「多问几家取共识」这种土办法也救不了。
那还能怎么用
模型的训练目标是生成连贯合理的文本,不是核实真伪;它在事实问题上靠不靠谱,取决于训练数据覆盖得全不全、干不干净,而现实争议恰恰是数据最浑浊的地方。可行的用法是让它做检索和归纳的助手:给出处、列证据,结论留给人来下。要是跳过出处直接问答案,在争议话题上基本就是碰运气。
via: Hacker News