AI-ASSISTED EDITORIAL MEDIA
1件の記事 / ページ 1 / 1
新たなarXiv論文が提案するベンチマーク「ActiveVision」において、GPT-5.5は17タスク中11タスクでスコアゼロ、全体正答率10.6%という結果を記録した。一方、人間参加者3名の平均は96.1%に達しており、フロンティアモデルと人間との間に依然として大きな知覚的推論の乖離が存在することが示唆されている。