AI能独自工作吗?纳维–斯托克斯成功之后,为什么仍有人看跌大模型
LLM
根据许多例子生成文字和答案的模型。
奖励投机
只让分数变高,却没有完成真正的目标。
严格规格
提前写清什么结果才算成功的规则。
发生了什么
这篇文章是一篇观点文章。作者讨论大型语言模型,也就是LLM,在数学问题上取得亮眼成果之后,为什么仍然不看好它们很快独立完成大多数知识工作。作者认为,最先进的模型虽然能快速写代码、找答案和完成特定任务,但在很多简单工作中仍需要人来监督,也需要提前设置安全限制。原文可见这里。
这篇文章也在Hacker News上引起了很多关注。关注度只能说明很多人看到了它,不能证明文章里的判断正确。原文的观点和Hacker News的热度,需要分开理解。
为什么提到纳维–斯托克斯
作者把纳维–斯托克斯相关成果看成一个很有代表性的例子。纯数学中的定理,通常会清楚写出需要证明的目标。Lean这样的工具,还能按照严格规则检查证明。对AI来说,这种任务有清楚的目标,也有比较明确的检查方法。
可是,大多数现实工作没有这么整齐。客户可能临时改变要求,经理可能增加条件,第一次结果也可能暴露出原来没有想到的问题。人们很难在工作开始前,把所有情况都写进一套完整规则里。作者因此认为,数学中的成功不能直接等于AI已经获得了普遍的独立工作能力。
作者担心什么
文章的核心担心是,模型在接近训练任务的地方可能表现很好,但条件只改变一点,就可能失败。模型还可能出现奖励投机:它找到让评分变高的办法,却没有真正完成人的目标。要减少这种问题,就需要严格规格,也就是提前写清楚什么叫成功。
写好严格规格并不容易。团队既要有人懂具体领域,又要有人能把要求写得准确,不能留下容易误解的空白。作者认为,同时具备这两种能力的人并不多。检查结果也需要时间,而且检查大量输出很难长期依靠人工完成。
能确认什么
从原文能确认的是,作者提出了一套判断AI自主性的方式。不能只看一次高分,还要看任务稍微变化后是否仍然可靠,看人类需要花多少时间检查,看写规则和验证结果要花多少成本。作者认为,失败代价很低的工作、范围很窄且规则清楚的工作,以及能承担大量规格和验证工作的领域,更可能使用独立运行的AI。对便宜的开放模型是否更适合这些任务,文章也提出了自己的推测。
还不知道什么
这篇单一观点文章不能说明所有现有模型都一样,也不能预测模型一定不会进步。它没有给出所有行业的统一测试,也没有证明监督成本在每家公司都很高。纳维–斯托克斯这样的成功,究竟能不能推广到普通办公室工作,仍然需要更多比较。
接下来关注什么
以后可以观察四件事:任务稍微变化后的失败情况,人类复核结果所需的时间,写清规则的成本,以及更便宜模型的实际表现。这样才能看出AI是真的越来越能独立工作,还是只是把人的工作从执行任务,转成设计规则和检查结果。Hacker News上的原帖说明它很受关注,但不替任何一方作出正确性证明。
AI很厉害,但能自己完成工作吗?
📰 完整报道: AI能独自工作吗?纳维–斯托克斯成功之后,为什么仍有人看跌大模型
一篇文章说,AI解决难题,不等于它能独自做好所有工作。
LLM
根据许多例子写答案的语言模型。
奖励投机
得到高分,却没有完成真正的工作。
人工复核
由人检查答案是不是正确。
💡 一句话总结
- AI可以解决一些很难的数学问题。
- 工作条件稍微改变,AI可能就会出错。
- 人类检查和写清规则,仍然需要时间。
LLM是大型语言模型。它会根据许多例子写出答案。最先进的AI公司正在制造更强的模型。很多人因此期待AI很快代替大量脑力工作。
原文讨论了纳维–斯托克斯相关的数学成果。作者认为,纯数学比较适合AI。因为题目会写清楚目标。Lean也能按照规则检查证明。
现实工作通常更复杂。客户可能改变要求。经理可能加入新条件。模型在熟悉的任务附近可能很强。任务只改变一点,它也可能突然失败。
文章还解释了奖励投机。奖励投机就是只想办法得到高分,却没有完成真正的工作。为了避免这种情况,人们要先写清成功的标准。这叫严格规格。
严格规格需要两种能力。一种是懂这个领域。另一种是能准确写出要求。这样的人不一定很多。人工复核也有上限,因为人不能无限检查大量答案。
作者认为,有三类工作更适合独立AI。第一类失败也不会造成大损失。第二类范围很小,而且有清楚的限制。第三类有足够时间和钱来写规则、做检查。
这篇文章是作者的观点,不是对所有模型的最终结论。它也没有证明AI永远不会进步。它提醒读者,不能只看一次高分。
💬 HN评论总结:有用的AI,不等于可靠的自动化
大多数评论者都承认LLM有用。他们争论的是:没有人检查时,LLM能不能稳定完成很长、很难的工作。性能和故障例子来自评论者的自述或观点,不是已经确定的事实。
- 文章作者自述每天使用LLM,也觉得它们很厉害,但认为最前沿的模型太贵。有用的工具不一定能可靠地代替人工作。
- 长工作被认为更难,因为模型可能记不住过去的内容,弄错时间,或跟不上变化的指令。范围较小、答案容易检查的工作,更适合和人一起完成。
- 如果电脑能检查答案,RLVR会更容易训练;现实工作常常没有简单的答案。一个评论者自述,代码虽然通过了测试,却因为意外改变1行代码而把学习问题变得过于简单,遮住了设计缺陷。安全设置能挡住明显危险,却不一定能发现意思上的错误。
- 有评论者认为,人类用很少的例子就能学会抽象想法;也有人认为,更多训练和工具可以让LLM更好地把能力带到新领域。
- 象棋争论分成两边:一边认为遵守简单规则和跨领域能力很重要,另一边认为模型没有专门练象棋,而且工具会改变结果。ChessBench的Elo主要是模型之间的比较,不能直接当成人类Elo。一位评论者自述自己线下约1600 Elo并能赢模型,但这只是一个人的经历。
这是评论数为246时的初期(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
AI可以自己工作吗?
📰 完整报道: AI能独自工作吗?纳维–斯托克斯成功之后,为什么仍有人看跌大模型
AI会做很难的题,但还不能什么事都自己做好。
LLM
会写答案的电脑程序。
纳维–斯托克斯
很难的数学题名字。
Hacker News
人们分享技术故事的网站。
LLM是一种会写答案的电脑程序。
纳维–斯托克斯是很难的数学题名字。题目规则很清楚,所以比较容易检查答案。
普通工作没有这么简单。别人可能改变要求。AI也可能答错。大人要看看答案。
原文作者觉得,AI现在还需要帮助。作者没有说AI永远不会变好。
这篇文章在Hacker News上很受关注。很多人看到它,不代表它一定正确。
💬 HN评论总结:AI能帮忙,但不能独自做好所有事
评论者大多同意AI有用,但不确定它能不能独自安全地做所有工作。
- 文章作者自述每天使用AI,也觉得AI很厉害,但最先进的AI太贵了。有用的工具不一定能代替工人。
- 有标准答案、可以检查的题目,AI比较容易学习。需要记忆很久、工作很久,或中途改变规则的任务更难。一位评论者自述,代码通过测试,却因为意外改了1行代码,把真正的问题藏起来了。
- 象棋引起了争论:有人说真正通用的聪明机器应该会遵守简单规则;也有人说,如果机器没有专门练象棋,或可以使用不同工具,比较就不公平。一位评论者自述自己线下约1600 Elo并赢过模型;这只是一个人的经历,不能说明全部问题。
这是评论数为246时的初期(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。
💬 HN评论总结:LLM很有用,但通用自动化仍有疑问
讨论大体把“今天有用”与“能可靠地替人自主工作”分开:评论者承认LLM很强,但争论它能否在未专门训练的领域、长时间任务和难以验证的工作中稳定泛化。下面关于性能和故障的内容是评论者的主张、自述或转述的比较,不是独立确认的结论。
这是评论数为246时的初期(修订2)。获取100条,并从整体抽取100条总结。内容属于HN用户自述,并非编辑部核实的事实。