瓶颈在数据,不在参数
参数决定容量的上限,数据决定这些容量有没有被用上。 同样的参数量,喂什么、按什么顺序喂、怎么筛选,结果可以差出很远。
密度 ↑ · 冗余 ↓我们只研究一件事:在参数被严格限制的前提下,一个模型究竟能理解到什么程度。 参数变大、分数变高,是全世界都在走的路,不需要我们再走一遍。
判断先于实验。下面三句话是我们的出发点,也是我们衡量自己工作的尺子。
参数决定容量的上限,数据决定这些容量有没有被用上。 同样的参数量,喂什么、按什么顺序喂、怎么筛选,结果可以差出很远。
密度 ↑ · 冗余 ↓说得流畅不等于答得对,答得对也不等于稳定。 我们优先相信可以核对的东西:事实是否自相矛盾、格律是否成立、引用是否找得到出处。
可验证 · 可复现一个分数如果只说明题目简单,那它衡量的不是模型。 我们宁愿在一个更小、更难的题集上,把失败的原因一条条写清楚。
少测 · 测难 · 写清失败一条管喂什么,一条管怎么长,一条管怎么被约束住。
第三条路线是「何意味 HiWhy」的来源。我们把格律写成不可违反的规则, 而不是可以商量的建议:先保证写出来的是一首诗,再讨论它写得好不好。
评测不是给模型发奖,是给自己找错。
评测我们只用两条标准:能不能验证,以及验证出来有没有用。 一个测不出来的指标,写得再漂亮也只是修辞。
所以我们宁可少测,也要测难的。常识问答、单轮指令跟随、模板化写作, 这类任务已经很难区分方法的好坏;我们更愿意把力气花在需要多步约束、 需要承认边界的问题上。
古体诗是我们用过最诚实的评测集之一:格律、平仄、韵脚、句数、字数全是硬约束, 对与错可以逐条核对,没有解释空间。它衡量不了全部能力, 但它很难被一段漂亮的话糊过去。
一个研究页面如果只有结论,那它更接近宣传。下面这些是我们目前答不上来的问题。