Qwen3.8は「考えはじめ」で変わる? GPT-5.5 Proを使った実験の意味
Qwen3.8 A95B
この実験で調べられたAIモデルの名前。
推論プレフィル
別のAIが考えた文のはじめを、答えるAIの出発点に置く試し方。
ソースリコール
二つの答えの似た部分が、どれくらい早い位置に出たかを見る点数。
何が起きたか
投稿者のwsxiaoysは、GitHub Gistに「Reasoning prefills on a few open models, v1.1」という実験記録を公開した。前の実験の続きで、今回はGPT-5.5 Pro(手本にするAIモデル)を教師役にした。
調査は45問で、STEM、非STEM、合成パズルが各15問。Qwen3.8 A95B(調べられたAIモデル)など4モデルについて、各問題を2回ずつ試した。1回は普通に答え、もう1回はGPT-5.5 Proの推論の最初の1%を、調べるモデルの推論チャンネルに置いた。画面に出る答え自体は、各モデルが自由に作った。
研究者は、GPT-5.5 Proの見える答えが、各モデルの答えの最初の100トークンにどれだけ現れたかを測った。スコアは、1語・2語・3語のまとまりの重なりを平均したソースリコールである。Qwen3.8 A95Bは、何も置かない時の16.79%から、置いた時の34.97%へ上がった。差は18.18ポイントだった。STEMでは19.26%から46.24%となり、差は26.99ポイントだった。
背景
この操作を推論プレフィルと呼ぶ。AIが答え始める前に、別のAIの推論の短い先頭を置き、その後の答えの重なりを見る方法だ。今回はQwenの新機能を報じたのではなく、投稿者が外から行った比較実験である。測ったのは全思考ではなく、見える答えの最初の100トークンだけだ。
なぜ重要か
Qwenの変化は、4モデルの中で目立って大きかった。DeepSeek V4 Flashは27.30%から26.13%へ下がり、Inklingは19.99%から20.45%、Kimi K3は31.11%から35.65%へ上がった。Qwenだけが、全体で18.18ポイント動いた。
投稿者は、QwenがGPT-5.5 Pro、または近いGPTモデルから学んだ可能性を示す。前のOpus 4.8を使った実験では、Qwenはほとんど動かなかったという。これは、出力の反応から訓練の手がかりを探せるか、という問いを投げかける。
確認できたこと
確認できるのは、実験の条件と数字である。Qwenでは、GPT-5.5 Proの推論の最初の1%を置いた時、最初の100トークンで測った重なりが増えた。STEM、非STEM、パズルの全カテゴリで増え、増加幅は順に26.99、12.80、14.75ポイントだった。
この投稿はHacker Newsで235 points、93 commentsとなった。これは技術コミュニティの注目度を示す数字で、実験の正しさを証明する数字ではない。話題になったことと、結果が正しいことは分けて考える必要がある。
まだ分からないこと
この結果だけでは、Qwen3.8 A95BがGPT-5.5 Proの出力を訓練に使ったとは言えない。近いGPTモデルだったのか、別の条件が効いたのか、今回の問題に特有の反応なのかは分からない。
実験は45問で、相手モデルはGPT-5.5 Proの1種類、測定は答えの最初の100トークンだった。重なりが増えたことは、答えが同じになったことでも、性能が上がったことでもない。
次に見る点
次は、別の人が同じ手順を再現できるかが重要だ。問題数を増やし、別の分野やモデルの版でも試せば、今回の数字が広く続くかを見られる。推論の先頭の長さを変え、GPT以外を手本にした時も比べたい。
現時点で確かなのは、短いGPT推論の先頭を置く実験で、Qwenの出力の重なりが大きく増えたことだ。QwenがGPTを学習したという断定は、再検証を待つ必要がある。
AIに「考えはじめ」を見せると、答えは似る?
📰 しっかり版: Qwen3.8は「考えはじめ」で変わる? GPT-5.5 Proを使った実験の意味
Qwen3.8 A95BにGPT-5.5 Proの考えはじめを少し見せる実験で、答えの似方が大きく変わりました。ただし、まねしたと証明されたわけではありません。
Qwen3.8 A95B
この実験で調べられたAIの名前です。
推論プレフィル
別のAIの考えはじめを少し先に置く試し方です。
Hacker News
技術の話をする人が集まるサイトです。
💡 ようするに
- Qwen3.8 A95B(答えを作るAI)を調べた。
- GPT-5.5 Pro(手本にするAI)の考えはじめを少し渡した。
- 答えは似たが、学習した証拠とはまだ言えない。
一人の投稿者が、GitHub Gistに実験を書きました。45問を使い、4つのAIを比べました。問題はSTEM、非STEM、合成パズルに分かれていました。
各AIには、同じ問題へ2回答えてもらいました。1回は何も渡さない方法です。もう1回は、GPT-5.5 Proの推論の最初の1%を先に置きました。この試し方を推論プレフィルと呼びます。最後の答えは、Qwenなど各AIが自分で作りました。
研究者は、答えの最初の100トークンを比べました。トークンは、AIが文章を区切る小さな単位です。Qwen3.8 A95Bでは、似た部分が16.79%から34.97%に増えました。差は18.18ポイントです。STEM問題では、19.26%から46.24%に増えました。
他のAIの変化は、Qwenより小さめでした。投稿者は、QwenがGPT-5.5 Pro、または近いGPTモデルから学んだ可能性を示しました。ですが、これは推測です。この実験だけで、学習元を特定することはできません。
この話はHacker Newsでも注目され、235 pointsと93 commentsが付きました。これは話題の大きさです。実験が正しい証明ではありません。今後は、もっと多くの問題や別のAIで、同じ結果が出るか確かめる必要があります。
💬 実験が示すことと、まだ証明していないこと
コメントは、Qwen 3.8がGPT-5.5 Proの考え方に似る可能性を議論している。ただし、数値・性能・不具合は記事や利用者の自己申告で、独立に確かめた結果ではない。
- 最先端モデルの隠れた推論を読める形にし、その最初の約1%をQwenに見せて、答えが変わるかを調べる実験が行われた。
- 記事では、Qwen 3.8の点数がGPT-5.5 Pro側へ20.58ポイント近づいたと報告され、非公開の合成パズルでも効果があった。前のClaude 4.8とKimi-K3の比較でも似た結果が報告された。
- 支持者は、GPTの推論の始まりを見せた時だけQwenの答えが急に似るので、GPTの推論データで学んだ可能性があると考える。
- 反対者は、使われたGPTの例が8月10日に公開され、Qwen 3.8 0902はその後に学習されたなら、公開例を覚えただけかもしれないと指摘する。
- この実験だけでは、学習量、能力と文体のどちらが移ったのか、同じ問題の解答を両方が学んだだけなのかは分からない。利用者の推論表示も環境で変わるという報告がある。
- 蒸留を不公平な後追いと見る人もいれば、誰でもローカルで動かせるモデルを作る重要な成果と見る人もいる。
コメント93件時点の成熟版(改訂1)。93件を取得し、全体から93件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
Qwen3.8は、AIの「考えはじめ」で答えが変わった?
📰 しっかり版: Qwen3.8は「考えはじめ」で変わる? GPT-5.5 Proを使った実験の意味
別のAIの考えはじめを少し見せて、答えが似るか調べました。似ましたが、学んだほんとうのしるしではありません。
Qwen3.8 A95B
答えを考えて書くAIの名前です。
GPT-5.5 Pro
別の答えを考えて書くAIの名前です。
Hacker News
技術の話を読む人が集まるサイトです。
Qwen3.8 A95Bは、答えを作るAIです。 GPT-5.5 Proは、別の答えを作るAIです。 調べた人は、GPTの考えはじめを見せました。 Qwen3.8 A95Bは、45問に答えました。 見せない時と、見せた時を比べました。 見せると、答えが少し似ました。
でも、これは学んだしるしではありません。 まだ、小さな試しだからです。 答えの似方だけを見ました。 考えの全部を見たわけではありません。
Hacker News(技術の話をするサイト)でも、注目されました。 注目されたから、正しいとは限りません。 もっと試して、たしかめる必要があります。
💬 Qwenの考え方はGPTに似たの?
大きなAIの考え始めを別のAIに見せて、答えが似るかを試した話だ。数値や不具合は記事と利用者の報告で、まだ一つの答えに決まったわけではない。
- 記事の実験では、隠れた考えを読める形にして、その最初の部分をQwen 3.8に見せた。
- 記事では、Qwenの点数がGPT-5.5 Pro側へ20.58ポイント近づいたと報告された。前の実験でも、別のAIどうしが似た動きをしたと報告されている。
- でも、GPTの例は先に公開されていたかもしれない。Qwenはその例を覚えただけかもしれず、これだけでは秘密の考えを盗んだ証拠にならない。
- どれだけ学んだのか、賢さか話し方かはまだ不明だ。人によって見える考え方も違い、コピーだと心配する人と、家で動かせるAIは役に立つと考える人がいる。
コメント93件時点の成熟版(改訂1)。93件を取得し、全体から93件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
💬 Qwen 3.8はGPT-5.5 Proを学んだのか
HNコメントの中心は、Qwen 3.8がGPT-5.5 Proの推論データから学習した可能性を示す実験と、それだけでは盗用や能力移転を証明できないという反論である。以下の数値・性能・不具合は記事や利用者の報告であり、ここでは独立検証していない。
コメント93件時点の成熟版(改訂1)。93件を取得し、全体から93件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。