🔥 HN 热议

给出GPT-5.5 Pro的推理开头后,Qwen 3.8为何更像它?

约2分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Qwen3.8 A95B

这次实验中被重点观察的AI模型名称。

推理预填充

在模型开始回答前,先放入另一段推理开头的测试方法。

源召回

用来计算一个答案的早期部分,和另一个答案有多少相同片段。

发生了什么

一次小型实验发现,给Qwen3.8 A95B(被测AI模型)放入GPT-5.5 Pro(作为参考的AI模型)的推理开头后,Qwen与GPT的答案片段重合明显增加。但这不是已经证明训练来源的结论。

一位名为wsxiaoys的作者在GitHub Gist上发布了v1.1实验记录。这是前一项实验的后续。实验用了45道题:STEM、非STEM、合成谜题各15道。

每个被测模型对每道题回答两次。第一次不放任何开头。第二次把GPT-5.5 Pro推理的最初1%,放入被测模型的推理通道。最后能看到的答案,仍由被测模型自行生成。

研究者查看GPT的可见答案,出现在其他模型答案前100个token中的多少部分。分数把单词、双词和三词片段的重合程度取平均。这种分数叫源召回,用来表示早期答案片段的重合程度。Qwen3.8 A95B的分数从16.79%升到34.97%,增加18.18个百分点。STEM题从19.26%升到46.24%,增加26.99个百分点。

这项方法的背景

这种做法叫推理预填充。模型开始回答前,先得到另一模型推理的短开头。实验再观察它的答案是否更像参考模型。

这里不是Qwen发布了一项新功能。它是一位作者从外部进行的比较实验。实验也没有测量两个模型完整的内部思考。它只测量了可见答案前100个token里的片段重合。

为什么重要

Qwen的变化远大于其他三个模型。DeepSeek V4 Flash下降1.17个百分点。Inkling上升0.46个百分点。Kimi K3上升4.54个百分点。Qwen上升18.18个百分点。

实验作者据此提出,Qwen也许从GPT-5.5 Pro,或相近的GPT模型中学到了一些东西。前一次使用Opus 4.8的实验中,Qwen几乎没有改变。这种差别让人想研究:模型的输出反应,能不能提示它的训练来源?

已确认的事实

能确认的是一个具体条件下的结果:给出GPT推理开头后,Qwen在45道题上的早期答案重合分数上升。三个类别都上升,分别为26.99、12.80和14.75个百分点。

Hacker News上的这条帖子有235 points和93 comments。这说明技术社区注意到了它。points和comments代表关注度,不代表实验一定正确。

仍然不知道什么

这组数字不能证明Qwen训练时使用了GPT-5.5 Pro的输出。它也不能找出真正的训练来源,更不能证明Qwen完整复制了GPT的答案。

样本只有45道题。实验只用了一个参考模型和一种预填充长度。测量也只看答案开头的100个token。重合增加,不等于推理能力或答案质量一定提高。

接下来要看什么

更有说服力的方向,是用更多新题目、更多模型版本和不同领域重复实验。还可以改变预填充的长度,并换用不同参考模型。如果不同研究者得到相似结果,这个现象才更值得认真讨论。

目前最稳妥的结论很窄:在这套实验条件下,Qwen对GPT推理开头的反应,明显强于其他被测模型。它提出了训练来源的问题,但还没有回答。

💬 Qwen 3.8 与 GPT-5.5 Pro 推理前缀:证据与反驳

HN 评论把这个结果看作有提示性的证据,而不是 Qwen 3.8 抄袭 GPT-5.5 Pro 推理或获得其能力的定论。下面的数值、性能变化和故障都来自文章或评论者的报告,未在此独立复核。

  • 相关论文描述了一种方法:把加密的推理令牌交还给同系列模型,请它转写成可读文字;再取前沿模型推理过程开头约1%,作为开放模型推理的起始前缀,比较最终答案的变化。
  • 文章报告称,给 Qwen 3.8 加入 GPT-5.5 Pro 的推理前缀后,分数向 GPT-5.5 Pro 方向移动了20.58个百分点,在私有合成谜题上也有明显效果。更早的比较据报显示,给 Kimi-K3 加入 Claude 4.8 的推理前缀时也出现了类似接近。
  • 支持者重视未加前缀和加前缀之间的差异:Qwen 单独回答时与 GPT 相差较大,但接上 GPT 推理开头后突然更像 GPT。有人还把 DeepSeek V4 Flash 和 Kimi-K3 的对照结果用来推测,GPT 的推理过程和答案可能进入了 Qwen 的训练数据。
  • 主要反驳是:评论者称,能获得的 GPT-5.5 推理样本来自8月10日公开的论文,而 Qwen 3.8 0902 是在这之后训练的。因此,Qwen 可能只是记住了这些公开样本,并不代表它提取了私有推理轨迹。
  • 这个结果没有说明训练数据到底用了多少,也不能区分真正的能力迁移和单纯的文风模仿,更不能排除两个模型都见过同一批基准题答案。少量后训练也可能提高相关性,所以需要新的推理样本、未见过的题目和更强的对照实验。
  • 用户还报告了不一致的可见推理:有人称另一个模型曾把推理泄露到工具调用中并停止,随后觉得 Qwen 3.8 27B 的推理也很相似;另一些人看到的却是普通 prose。提示词、系统指令、界面、量化方式和推理强度都可能影响结果,这些经历不是受控证据。
  • 有人认为蒸馏竞争对手的输出是不公平的快速跟随;也有人认为这是重要的工程成就,因为 Qwen 的权重可以本地运行,而 GPT 做不到。评论者对它与使用公开网络数据在伦理上有多大区别也没有共识。

这是评论数为93时的成熟版(修订1)。获取93条,并从整体抽取93条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Qwen 3.8看到GPT的思考开头后,答案更像了

📰 完整报道: 给出GPT-5.5 Pro的推理开头后,Qwen 3.8为何更像它?

一项小实验发现,Qwen 3.8看到GPT-5.5 Pro的推理开头后,答案重合更多。但这不能证明它学过GPT。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
推理预填充

在AI回答前,先给它一小段别的AI的思考开头。

token

AI切分文字时使用的小单位。

Hacker News

人们讨论技术新闻的网站。

💡 一句话总结

  • Qwen3.8 A95B(会写答案的AI)接受了一次小测试。
  • 研究者给它看了GPT-5.5 Pro(另一个AI)的思考开头。
  • Qwen的答案更像GPT,但这不能证明它学过GPT。

一位开发者把实验记录放在GitHub Gist上。实验用了45道题。题目分成三类,每类15道。每个模型答两次。第一次正常回答。第二次先放入GPT-5.5 Pro推理的最初1%。这种做法叫推理预填充。

最后显示出来的答案,仍然由每个模型自己生成。研究者比较了答案开头的100个token。token是AI切分文字的小单位。Qwen3.8 A95B的相似分数,从16.79%升到34.97%。增加了18.18个百分点。

STEM题目的变化最大。分数从19.26%升到46.24%。其他模型的变化小得多。所以,实验记录提出了一个可能性:Qwen也许学过GPT-5.5 Pro,或者相近的GPT模型。但实验没有查到训练资料。45道题也不能代表所有问题。

这条内容在Hacker News(技术讨论网站)上很受关注。它有235 points和93 comments。这只说明很多人注意到了它。不说明实验一定正确。还需要更多题目、更多模型和重复实验。

💬 实验说明了什么,又没有说明什么

评论者在讨论 Qwen 3.8 是否学到了 GPT-5.5 Pro 的推理。所有数值、性能和故障都是文章或用户的报告,不是这里独立确认的结果。

  • 研究者把更强模型的隐藏推理变得可读,把开头约1%给 Qwen,再观察 Qwen 的答案是否改变。
  • 文章报告称,Qwen 的分数向 GPT-5.5 Pro 靠近了20.58个百分点,私有合成谜题也有变化。之前 Claude 4.8 与 Kimi-K3 的实验据报出现了类似现象。
  • 支持者说,Qwen 不看前缀时不像 GPT,看了 GPT 的推理开头后却突然更像。反对者指出,这些 GPT 样本在8月10日已经公开,而 Qwen 3.8 0902后来才训练,可能只是记住了公开例子。
  • 实验没有说明用了多少训练数据,也没有说明 Qwen 学到的是能力还是文风,还不能排除双方见过同样的题目答案。
  • 用户说 Qwen 的推理会随提示词、界面、量化和推理强度改变,所以个人观察不能当成确定证据。
  • 有人觉得蒸馏是不公平的复制,也有人觉得能在本地运行开放权重模型本身就是很大的成果。

这是评论数为93时的成熟版(修订1)。获取93条,并从整体抽取93条总结。内容属于HN用户自述,并非编辑部核实的事实。

🔥 HN 热议

Qwen 3.8看了一点GPT的思考,答案变像了

📰 完整报道: 给出GPT-5.5 Pro的推理开头后,Qwen 3.8为何更像它?

一个AI看了另一个AI的思考开头。后来,它写出了更像的答案。

约1分钟读完 Tiny Why编辑部 · 文:特派员 好奇

词语
Qwen3.8 A95B

一个会写答案的AI。

GPT-5.5 Pro

另一个会写答案的AI。

Hacker News

人们谈技术的网站。

Qwen3.8 A95B是会写答案的AI。 GPT-5.5 Pro是另一个会写答案的AI。 有人让Qwen先看一点GPT的思考开头。 然后,Qwen自己回答问题。 它的答案变得更像GPT。

这不表示Qwen一定学过GPT。 这只是一次小测试。

Hacker News是谈技术的网站。 它也注意到了这个故事。 很多人注意,不等于一定正确。 还要做更多测试。

💬 Qwen 学了 GPT 吗?

研究者把一个 AI 的思考开头给另一个 AI,看它们的答案会不会变得相像。数值和故障只是文章与用户的报告,还不是最后的证明。

  • 文章说,Qwen 的分数向 GPT-5.5 Pro 靠近了20.58个百分点。以前的另一个实验也报告过类似的变化。
  • 可是,那些 GPT 例子可能在 Qwen 训练前就公开了。Qwen 也许只是记住了例子,所以这不能证明它拿到了秘密的思考。
  • 我们还不知道它学了多少,也不知道学到的是本领还是说话方式。不同的设置也会让人看到不同的推理。
  • 有人觉得复制不公平,也有人觉得能让大家在家运行的 AI 很有价值。

这是评论数为93时的成熟版(修订1)。获取93条,并从整体抽取93条总结。内容属于HN用户自述,并非编辑部核实的事实。

来源