DeepSeekの視覚モデルのマルチモーダルエージェントの能力はOpus 4.8に近づき、4項目が2:2で達成されました。
DeepSeekはV4-Flash-Vision-Expの最初のエージェントのスコアを発表しました。4つのマルチモーダルエージェントの評価において、Opus 4.8と2勝2敗の成績を収めました:Agents' Last Exam 27.3対25.7、ZeroBench 35.0対34.0;ApexBench 36.5対39.4、Chartography 64.3対65.0。純テキスト版V4-Flash-0731と比較して、視覚版はApexBenchで26.2から36.5に、Agents' Last Examで25.2から27.3に上昇しました。公式に純テキスト版はマルチモーダルコンテンツを無視することが明記されているため、主に視覚入力後の能力を反映しています。視覚を加えた後もテキストエージェントの能力は明らかに低下せず、7つのテキスト評価のうち6つがV4-Flash-0731を上回っています。例えば、DeepSWEは54.4から59.3に上昇し(Opus 4.8の58.0を超え)、Toolathlonは75.9でほぼOpus 4.8の76.2に追いつきました。この結果はDeepSeekの公式自己テストからのものであり、第三者の独立したランキングではありません;公開されたCode AgentのテキストタスクはDeepSeek Harnessの極簡モードを使用し、推論レベルはmaxです。