🔥 HNで話題

GPT-5.6 Solは「画像の中の物」をどこまで見つけられる?

約2分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
物体検出(ぶったいけんしゅつ)

画像の中の物の種類と場所を見つける処理。

OCR(オーシーアール)

画像に写った文字を読み取って文字データにする処理。

Hacker News(ハッカーニュース)

技術や起業の話題を利用者が投稿して議論するサイト。

何が起きたか

画像を読み取るAIの評価を行うRoboflowは、OpenAIのGPT-5.6 Solを独自ベンチマークで調べた。記事は、SolをOpenAIが出した中で最も強い「視覚」モデルだと評価している。画像内の物を囲んで見つける作業や、数を数える作業で前世代より大きく伸びたという。

Hacker Newsでもこの記事は話題になり、311ポイント、156件のコメントを集めた。これは技術者コミュニティで注目された度合いであり、評価結果が正しいと証明する数字ではない。

何を測ったのか

Roboflowは、物体検出、個数の計数、文字読み取り、必要な情報の抜き出しを試した。物体検出は、写真の中の対象の場所を四角で示す仕事だ。Solの検出スコアは46.2で、GPT-5.5の13.8を上回ったと報告された。

計数でもSolは73.0%で、GPT-5.5の64.9%より高かった。一方、文字を全部読み写すOCRでは、Solは90.7%でGPT-5.5の91.2%を少し下回った。進歩は一様ではなく、得意になった作業と、ほぼ変わらない作業がある。

なぜ重要か

画面を見て操作するAIや、書類から必要な欄を探す仕組みは、画像を正しく理解できるかに左右される。物の位置と数を扱えるなら、写真や書類を使う仕事で選択肢が増える。けれど、文字を読むだけなら新しいモデルが必ず最良とは限らない。

確認できたこと

記事では、文書内の見出し、段落、表、署名などを見分ける例が示された。重なった物を数える試験でも、Solが難しい例に対応したとされる。Solは1画像あたり平均約10秒、平均約2.5セントだった。TerraとLunaは精度が低めでも、より短時間・低価格だった。

まだ分からないこと

この結果はRoboflowのこれから公開予定のベンチマークによるもので、すべての画像利用場面を代表するとは言えない。記事自身も、大きな画像では検出位置が不安定になる例を報告している。約2000×2000画素以上の画像では、考える量を低くすると不安定になりやすい、とOpenAI側が確認したという。

次に見る点

実用では、正確さだけでなく、待ち時間と費用、失敗したときの確認方法が重要になる。大量の画像を扱うなら、記事で比較されたGemini 3.5 Flashのような別モデルも含め、同じ作業で比べる必要がある。今後は独立した評価や、実際の業務での再現性が注目点になる。

💬 GPT-5.6 Solの視覚性能:期待と実運用の距離

コメント欄では、GPT-5.6 Solの画像理解を評価する体験談と、ベンチマーク・用途選定への強い留保が並んだ。

  • 利用者の自己申告では、Solはアプリ画面を見てUIの不統一な部分を整理し、ページ全体の読みやすさや一貫性を保つ提案が得意だった。一方で、主観的なデザイン品質をLLMに判定させること自体への懐疑もある。
  • 別の利用者は、ゲーム背景のアウトペインティングで、元の縮尺や内容を保ったまま周辺を拡張する作業が何度も崩れたと報告した。画像を理解できても、画像を狙いどおり編集できるとは限らない。
  • ベンチマークについては、利用者が正解データの誤りや90度回転した検出枠の可能性を指摘した。記事の著者は一件のground truthの誤りを修正すると認め、別件では大きな画像への弱さが原因だと説明したが、異論も出た。
  • 錠剤カウントの最高成績が81.1%だったという記事中の数値を踏まえ、利用者は薬局のような高精度用途には不十分で、OpenCVなど決定的な手法を使うべきだと主張した。他方、VLMは多目的で、データ作成や人手レビュー候補の抽出には役立つという反論がある。
  • 記事の著者は、比較ではGemini 3.5 FlashがSolを多くの評価で上回り、価格も低かったという見方に概ね同意し、より新しいGemini 3.7 Flashは価格も含めて有力だと述べた。これらは著者・利用者の評価であり、環境ごとの検証が必要である。

コメント156件時点の初期(改訂1)。100件を取得し、全体から100件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

GPT-5.6 Solは絵の中の物を見つける力が伸びた

📰 しっかり版: GPT-5.6 Solは「画像の中の物」をどこまで見つけられる?

画像を読むAIの力を、Roboflowが比べました。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
Roboflow(ロボフロー)

画像を使うAIの道具や評価を扱う会社。

GPT-5.6 Sol(ジーピーティー ごーてんろく ソル)

OpenAIが出した、文章や画像を扱えるAIの名前。

💡 ようするに

  • Solは物を見つける試験で大きく伸びた。
  • 数を数える力も前のモデルより高かった。
  • 速さ、値段、失敗のしかたも見て選ぶ必要がある。

Roboflowは、OpenAIのGPT-5.6 Solを試した。 画像の中の物を探したり、数えたりした。

物を探す試験では、Solの点は46.2だった。 前のGPT-5.5は13.8だった。 これはRoboflowの試験での結果だ。 どんな写真でも同じになるとは限らない。

数を数える試験でも、Solは73.0%だった。 GPT-5.5は64.9%だった。 重なった物や、ルール付きの数え方も試した。

ただし、文字を読む力は別だった。 文字を全部読み取る試験では、Solは前のモデルを少し下回った。 新しいAIなら、全部の仕事で一番とは言えない。

Solは画像1枚に平均約10秒かかった。 平均の費用は約2.5セントだった。 より安く速いモデルもある。 たくさんの画像を扱う仕事では、この差が大きくなる。

大きな画像では、物の場所を間違える例もあった。 大切な仕事では、人が結果を確かめる仕組みが必要だ。

この記事はHacker Newsで311ポイント、156件のコメントを集めた。 これは多くの人が話題にした目安だ。 試験結果そのものの正しさを示す数字ではない。

💬 Solは便利。でも、使う仕事を選ぶ

画像を見て助かる場面はある一方、まちがいが困る仕事では別の道具も大切です。

  • ある利用者は、Solがアプリ画面の見づらい所を見つけ、全体をそろえる案を出すのが上手だったと話した。でも、デザインの「よさ」は人によって違うので、任せすぎないほうがよいという声もある。
  • 別の利用者は、絵の端を自然につなげて広げる作業で、Solが何度も失敗したと報告した。画像を読む力と、絵を正確に直す力は別です。
  • 記事のテストには、正解ラベルや向きに誤りがあるかもしれないという指摘があった。著者は一つの正解データの修正を認めたため、順位はそのまま信じ切らずに見る必要がある。
  • 薬の数を数えるような、ほぼ絶対に間違えられない仕事では、81.1%という記事中の成績では足りないという意見が出た。決まった作業にはOpenCVのような専用の画像処理を使う案がある。
  • 著者と利用者の報告では、GeminiのFlash系はSolより安く、多くの画像テストで強かった。モデル選びは、値段・正確さ・自分の画像で試した結果で決めるのがよさそうです。

コメント156件時点の初期(改訂1)。100件を取得し、全体から100件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

🔥 HNで話題

Solは絵を見るAI

📰 しっかり版: GPT-5.6 Solは「画像の中の物」をどこまで見つけられる?

GPT-5.6 Solは、絵の中の物を見つける練習をしました。

約1分で読めます Tiny Why編集部 · 文: 特派員 キュリオ

ことば
OpenAI(オープンエーアイ)

GPT-5.6 Solを作った会社。

Hacker News(ハッカーニュース)

コンピューターの話をする人が集まるサイト。

OpenAIはAIを作る会社です。 GPT-5.6 Solは、その会社のAIです。

Roboflowは、AIに絵を見せました。 物がどこにあるか聞きました。 いくつあるかも聞きました。

Solは、前のAIより上手でした。 でも、いつも正しくはできません。

大きな絵では、場所をまちがえることがあります。 文字を読むのも、いつも一番ではありません。

Solは、絵1まいに約10秒かかりました。 お金も少しかかります。

Hacker Newsでも話題になりました。 311ポイントと156件のコメントが付きました。 これは、見た人が多いしるしです。 正しいしるしではありません。

💬 絵を見るAIのおはなし

Solは、絵や画面を見るのを手伝えます。

  • 画面の見づらい所を見つけるのが上手だった、という人がいます。でも、うまくいかなかった人もいます。
  • 絵を大きく広げる作業では、同じ絵らしく直せないことがあったそうです。
  • 薬の数のように、まちがえたら困る仕事は、専用の道具も使うほうがよいという意見があります。
  • 記事を書いた人は、Geminiという別のAIも、画像を見る仕事でとても強いと話しています。

コメント156件時点の初期(改訂1)。100件を取得し、全体から100件を抽出して要約しました。内容はHN利用者の自己申告で、編集部が確認した事実ではありません。

出典・参考