DeepSeek визуальная модель мультимодального агента достигает уровня Opus 4.8, 4 предмета заканчиваются со счетом 2:2
Сообщение ChainCatcher, DeepSeek опубликовал первые результаты тестирования Agent V4-Flash-Vision-Exp. В 4-х многомодальных оценках Agents' Last Exam 27.3 против 25.7, ZeroBench 35.0 против 34.0; ApexBench 36.5 против 39.4, Chartography 64.3 против 65.0, с результатом 2 победы и 2 поражения против Opus 4.8.
По сравнению с чисто текстовой версией V4-Flash-0731, визуальная версия в ApexBench увеличилась с 26.2 до 36.5, Agents' Last Exam с 25.2 до 27.3. Официально указано, что текстовая версия игнорирует многомодальное содержание, поэтому в основном отражает способности после добавления визуального ввода. После добавления визуального ввода способности текстового агента не уменьшились, в 7 текстовых оценках 6 показали результаты выше V4-Flash-0731, например, DeepSWE увеличился с 54.4 до 59.3 (превысив Opus 4.8 с 58.0), Toolathlon 75.9 почти сравнялся с Opus 4.8 с 76.2.
Этот результат получен из официального самотестирования DeepSeek, не является независимым рейтингом третьей стороны; публичная задача текстового агента Code Agent использует ультра-простой режим DeepSeek Harness, уровень вывода - max.







