ActiveVisionとは何か——「静的記述」を超えた視覚知覚の要求

批評:GPT-5.5がActiveVisionで10.6%、人間は96.1%——視覚的推論の深刻な限界が示された(記事内画像)

ActiveVision(アクティブビジョン)は、arXiv論文(arxiv.org/abs/2607.16165)で提案された新しい視覚的推論ベンチマークであり、3カテゴリにわたる17のタスクで構成されている。論文著者らの言葉を借りれば、このベンチマークは「単一の静的な記述ではなく、繰り返しの視覚的知覚を強制する」ように設計されているという点が最大の特徴である。

「繰り返しの視覚的知覚(repeated visual perception)」とは、一枚の画像を一度だけ参照して回答を生成するのではなく、動的・能動的に視覚情報を再参照・再解釈しながら判断を積み重ねるプロセスを指すと考えられる。多くの既存ベンチマークが静的な画像理解や一問一答形式の視覚QAを中心としているのに対し、ActiveVisionはこの「能動的な知覚の繰り返し」という要素を意図的に組み込んでいる点で、設計思想が異なると評価できる。

こうした設計は、現実世界における視覚的タスク——たとえば、複数フレームにわたる映像の追跡や、段階的な観察を必要とする検査作業——に近い認知プロセスを模倣しようとするものであり、モデルの実用的な視覚能力をより厳密に評価しようとする試みと思われる。

GPT-5.5とClaude Fable 5の結果——スコアが示す「失敗の形状」

Redditスレッドが紹介するこの論文の報告によれば、OpenAIのGPT-5.5は最高の推論努力設定(highest exposed reasoning-effort tier)で評価されたにもかかわらず、ActiveVisionにおける正答率は10.6%にとどまり、17タスクのうち11タスクでスコアゼロを記録した。

論文著者らが「ほとんどの推論・コーディングリーダーボードでトップに位置する」と注記しているClaude Fable 5は、さらに低い3.5%という結果であった。対照的に、人間参加者3名の平均スコアは96.1%に達しており、モデルと人間との間の差異は定量的に著しいと言わざるを得ない。

ここで注目すべきは、この論文が強調する「失敗の形状(the specific shape of the failure)」という表現である。フロンティアモデルが新しいベンチマークで低スコアを記録すること自体は、著者らも認めるように「毎週のように起きている」現象である。しかし今回の知見が特筆される理由は、モデルが自らコードを記述することによってこの失敗を補完・回避することもできなかった、という点にあると思われる。すなわち、コーディング能力や推論能力の高さが、この種の視覚的知覚の弱点を補う手段として機能しなかったことが示唆されている。

これは、現在のフロンティアモデルが持つ視覚的処理の限界が、単なる知識不足や推論能力の問題ではなく、より根本的な知覚アーキテクチャ上の制約に起因している可能性を示唆するものとして、研究コミュニティにとって重要な示唆を持つと考えられる。ただし、論文の詳細な手法・実験条件・モデルバージョンについては、抜粋情報のみからは確認できないため、原論文の精読が必要である点には留意が必要だろう。

評価の留保——ベンチマーク設計と一般化可能性の問題

ActiveVisionの結果を解釈する上で、いくつかの留保点を整理しておくことが重要と思われる。

まず、人間参加者が3名という点は、サンプルサイズとして統計的に十分かどうかという疑問を生じさせる。96.1%という人間スコアが、より広範な人間集団を代表するものかどうかは、現時点では判断が難しい。また、タスクの難易度設計や評価基準の詳細が、モデルと人間で公平に設定されているかどうかも、原論文を精査しなければ確認できない点である。

次に、「繰り返しの視覚的知覚を強制する」という設計思想そのものが、現在のマルチモーダルモデルのアーキテクチャ——一般的には入力画像をトークン列に変換して処理する方式——と根本的に相性が悪い可能性がある。この場合、ActiveVisionのスコアはモデルの「視覚的推論能力の総合的な限界」を示すというよりも、特定の知覚様式に対する適合性の欠如を測定しているとも解釈できる。

さらに、Claude Fable 5がGPT-5.5よりも低いスコアを記録したという事実は興味深いが、両モデルのバージョン詳細や評価時の設定条件がソース抜粋からは確認できないため、単純な性能比較として扱うことには慎重であるべきだろう。

結論——能動的知覚という未解決の課題

ActiveVisionが提示するのは、現在のフロンティアビジョンモデルが「見る」ことと「繰り返し能動的に知覚する」ことの間に、依然として埋まっていない溝が存在するという問いかけであると筆者は考える。GPT-5.5の10.6%、Claude Fable 5の3.5%という数値は、コーディングや言語推論の領域で示される高い性能と対照的であり、視覚的知覚の能動性・反復性という側面が、現在のモデル設計において十分に対処されていない可能性を示唆していると思われる。

ただし、一つのベンチマーク結果をもってモデルの視覚能力全般を評価することは適切ではなく、ActiveVisionが測定しようとしている能力の定義や、その実世界への一般化可能性については、今後の研究コミュニティによる検証が必要だろう。この論文が提起する「失敗の形状」という問いは、次世代のマルチモーダルモデル設計において重要な参照点となり得ると評価できる。