GPT-5.6 Solは「画像の中の物」をどこまで見つけられる?
物体検出(ぶったいけんしゅつ)
画像の中の物の種類と場所を見つける処理。
OCR(オーシーアール)
画像に写った文字を読み取って文字データにする処理。
Hacker News(ハッカーニュース)
技術や起業の話題を利用者が投稿して議論するサイト。
何が起きたか
画像を読み取るAIの評価を行うRoboflowは、OpenAIのGPT-5.6 Solを独自ベンチマークで調べた。記事は、SolをOpenAIが出した中で最も強い「視覚」モデルだと評価している。画像内の物を囲んで見つける作業や、数を数える作業で前世代より大きく伸びたという。
Hacker Newsでもこの記事は話題になり、311ポイント、156件のコメントを集めた。これは技術者コミュニティで注目された度合いであり、評価結果が正しいと証明する数字ではない。
何を測ったのか
Roboflowは、物体検出、個数の計数、文字読み取り、必要な情報の抜き出しを試した。物体検出は、写真の中の対象の場所を四角で示す仕事だ。Solの検出スコアは46.2で、GPT-5.5の13.8を上回ったと報告された。
計数でもSolは73.0%で、GPT-5.5の64.9%より高かった。一方、文字を全部読み写すOCRでは、Solは90.7%でGPT-5.5の91.2%を少し下回った。進歩は一様ではなく、得意になった作業と、ほぼ変わらない作業がある。
なぜ重要か
画面を見て操作するAIや、書類から必要な欄を探す仕組みは、画像を正しく理解できるかに左右される。物の位置と数を扱えるなら、写真や書類を使う仕事で選択肢が増える。けれど、文字を読むだけなら新しいモデルが必ず最良とは限らない。
確認できたこと
記事では、文書内の見出し、段落、表、署名などを見分ける例が示された。重なった物を数える試験でも、Solが難しい例に対応したとされる。Solは1画像あたり平均約10秒、平均約2.5セントだった。TerraとLunaは精度が低めでも、より短時間・低価格だった。
まだ分からないこと
この結果はRoboflowのこれから公開予定のベンチマークによるもので、すべての画像利用場面を代表するとは言えない。記事自身も、大きな画像では検出位置が不安定になる例を報告している。約2000×2000画素以上の画像では、考える量を低くすると不安定になりやすい、とOpenAI側が確認したという。
次に見る点
実用では、正確さだけでなく、待ち時間と費用、失敗したときの確認方法が重要になる。大量の画像を扱うなら、記事で比較されたGemini 3.5 Flashのような別モデルも含め、同じ作業で比べる必要がある。今後は独立した評価や、実際の業務での再現性が注目点になる。
GPT-5.6 Solは絵の中の物を見つける力が伸びた
📰 しっかり版: GPT-5.6 Solは「画像の中の物」をどこまで見つけられる?
画像を読むAIの力を、Roboflowが比べました。
Roboflow(ロボフロー)
画像を使うAIの道具や評価を扱う会社。
GPT-5.6 Sol(ジーピーティー ごーてんろく ソル)
OpenAIが出した、文章や画像を扱えるAIの名前。
💡 ようするに
- Solは物を見つける試験で大きく伸びた。
- 数を数える力も前のモデルより高かった。
- 速さ、値段、失敗のしかたも見て選ぶ必要がある。
Roboflowは、OpenAIのGPT-5.6 Solを試した。 画像の中の物を探したり、数えたりした。
物を探す試験では、Solの点は46.2だった。 前のGPT-5.5は13.8だった。 これはRoboflowの試験での結果だ。 どんな写真でも同じになるとは限らない。
数を数える試験でも、Solは73.0%だった。 GPT-5.5は64.9%だった。 重なった物や、ルール付きの数え方も試した。
ただし、文字を読む力は別だった。 文字を全部読み取る試験では、Solは前のモデルを少し下回った。 新しいAIなら、全部の仕事で一番とは言えない。
Solは画像1枚に平均約10秒かかった。 平均の費用は約2.5セントだった。 より安く速いモデルもある。 たくさんの画像を扱う仕事では、この差が大きくなる。
大きな画像では、物の場所を間違える例もあった。 大切な仕事では、人が結果を確かめる仕組みが必要だ。
この記事はHacker Newsで311ポイント、156件のコメントを集めた。 これは多くの人が話題にした目安だ。 試験結果そのものの正しさを示す数字ではない。
💬 Solは便利。でも、使う仕事を選ぶ
画像を見て助かる場面はある一方、まちがいが困る仕事では別の道具も大切です。
- ある利用者は、Solがアプリ画面の見づらい所を見つけ、全体をそろえる案を出すのが上手だったと話した。でも、デザインの「よさ」は人によって違うので、任せすぎないほうがよいという声もある。
- 別の利用者は、絵の端を自然につなげて広げる作業で、Solが何度も失敗したと報告した。画像を読む力と、絵を正確に直す力は別です。
- 記事のテストには、正解ラベルや向きに誤りがあるかもしれないという指摘があった。著者は一つの正解データの修正を認めたため、順位はそのまま信じ切らずに見る必要がある。
- 薬の数を数えるような、ほぼ絶対に間違えられない仕事では、81.1%という記事中の成績では足りないという意見が出た。決まった作業にはOpenCVのような専用の画像処理を使う案がある。
- 著者と利用者の報告では、GeminiのFlash系はSolより安く、多くの画像テストで強かった。モデル選びは、値段・正確さ・自分の画像で試した結果で決めるのがよさそうです。
コメント156件時点の初期(改訂1)。100件を取得し、全体から100件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
Solは絵を見るAI
📰 しっかり版: GPT-5.6 Solは「画像の中の物」をどこまで見つけられる?
GPT-5.6 Solは、絵の中の物を見つける練習をしました。
OpenAI(オープンエーアイ)
GPT-5.6 Solを作った会社。
Hacker News(ハッカーニュース)
コンピューターの話をする人が集まるサイト。
OpenAIはAIを作る会社です。 GPT-5.6 Solは、その会社のAIです。
Roboflowは、AIに絵を見せました。 物がどこにあるか聞きました。 いくつあるかも聞きました。
Solは、前のAIより上手でした。 でも、いつも正しくはできません。
大きな絵では、場所をまちがえることがあります。 文字を読むのも、いつも一番ではありません。
Solは、絵1まいに約10秒かかりました。 お金も少しかかります。
Hacker Newsでも話題になりました。 311ポイントと156件のコメントが付きました。 これは、見た人が多いしるしです。 正しいしるしではありません。
💬 絵を見るAIのおはなし
Solは、絵や画面を見るのを手伝えます。
- 画面の見づらい所を見つけるのが上手だった、という人がいます。でも、うまくいかなかった人もいます。
- 絵を大きく広げる作業では、同じ絵らしく直せないことがあったそうです。
- 薬の数のように、まちがえたら困る仕事は、専用の道具も使うほうがよいという意見があります。
- 記事を書いた人は、Geminiという別のAIも、画像を見る仕事でとても強いと話しています。
コメント156件時点の初期(改訂1)。100件を取得し、全体から100件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。
💬 GPT-5.6 Solの視覚性能:期待と実運用の距離
コメント欄では、GPT-5.6 Solの画像理解を評価する体験談と、ベンチマーク・用途選定への強い留保が並んだ。
コメント156件時点の初期(改訂1)。100件を取得し、全体から100件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。