В DeepSeek открыли доступ к экспериментальной мультимодальной модели DeepSeek-V4-Flash-Vision-Exp и заявили, что по агентным задачам она приблизилась к Opus-4.8 от Anthropic. В опубликованной самой компанией таблице одиннадцать бенчмарков: в трёх результат новой модели выше, в восьми ниже, а на NL2Repo отставание достигает 12 пунктов. За основу взята текстовая V4-Flash, к которой добавлен разбор изображений и снимков экрана. Вместе с моделью вышла версия 0.1.1 инструментария DeepSeek Harness. Колонки с Opus 5, представленной 2026 года, в таблице нет.

Чтение изображений поверх текстовой V4-Flash
Модель доступна на API-платформе DeepSeek под идентификатором deepseek-v4-flash-vision-exp. К текстовой V4-Flash добавлен разбор изображений и снимков экрана, а распознанное содержимое используется дальше в агентных сценариях. Одновременно вышла версия 0.1.1 инструментария DeepSeek Harness, где поддержка новой модели включена по умолчанию.
Изображения тарифицируются как токены – до 384 токенов на изображение, по расценкам V4-Flash. Компания из Ханчжоу помечает модель как экспериментальную; подробности вынесены в журнал изменений DeepSeek API.
DeepSeek Harness – собственный инструментарий DeepSeek для запуска агентов, открытый сторонним разработчикам в статусе developer preview.
Три результата выше Opus-4.8 из одиннадцати
DeepSeek опубликовала одиннадцать замеров. Выше, чем у Opus-4.8, оказались три: DeepSWE (59,3 против 58,0), Agents' Last Exam (27,3 против 25,7) и ZeroBench (35,0 против 34,0). Перевес ни в одном случае не превышает 1,6 пункта.
В остальных восьми тестах результат ниже, причём в двух отставание крупное: на NL2Repo 57,7 против 69,7, на DSBench-Hard 63,6 против 71,7. Ещё три пары разошлись на доли пункта: Toolathlon-Verified 75,9 против 76,2, Chartography 64,3 против 65,0, Terminal Bench 2.1 83,9 против 85,0.
Особняком идёт AutomationBench. Результаты всех трёх моделей уложились в промежуток от 25,1 до 27,2 пункта – этот набор задач пока не даётся ни одной из них.
| Бенчмарк | V4-Flash-Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83,9 | 82,7 | 85,0 |
| NL2Repo | 57,7 | 54,2 | 69,7 |
| Cybergym | 75,3 | 76,7 | 78,3 |
| DeepSWE | 59,3 | 54,4 | 58,0 |
| Toolathlon-Verified | 75,9 | 70,3 | 76,2 |
| DSBench-Hard | 63,6 | 59,6 | 71,7 |
| AutomationBench (Public) | 25,7 | 25,1 | 27,2 |
| ApexBench (Pass@1) | 36,5 | 26,2 | 39,4 |
| Agents' Last Exam | 27,3 | 25,2 | 25,7 |
| Chartography | 64,3 | – | 65,0 |
| ZeroBench (Pass@5) | 35,0 | – | 34,0 |
Сноска о слепой модели на тестах с картинками
Главное заявление касается прироста на мультимодальных наборах относительно текстовой V4-Flash: на ApexBench 36,5 против 26,2, на Agents' Last Exam 27,3 против 25,2. Сноска в той же таблице объясняет часть разрыва: в этих двух проверках текстовая V4-Flash игнорирует содержащиеся в заданиях мультимодальные элементы. Проще говоря, модель без зрения оценивали на заданиях с изображениями.
Числа новой модели от этого не становятся неверными, но часть прироста измеряет не улучшение зрения, а исходную неприменимость текстовой модели к таким заданиям. Оговорка стоит прямо в таблице, а не в отдельном документе, куда её пришлось бы искать.
Там же описана методика: модели серии DeepSeek прогоняли через DeepSeek Harness в минимальном режиме, с максимальным уровнем усилий, top_p 0,95 и temperature 1,0. Как запускали Opus-4.8, в примечании не сказано.
Прирост к текстовой V4-Flash на шести тестах из семи
В анонсе сказано, что на текстовых задачах новая модель соответствует V4-Flash. По собственным числам компании она их превосходит: из семи текстовых наборов результат выше в шести. Toolathlon-Verified прибавляет 5,6 пункта, DeepSWE – 4,9, DSBench-Hard – 4,0.
Исключение одно и показательное. На Cybergym новая модель набирает 75,3 против 76,7 у текстовой: добавление зрения стоило 1,4 пункта на наборе задач по безопасности.
Все перечисленные числа получены самой DeepSeek на собственном инструментарии. Настройки раскрыты, что для тестов производителя скорее исключение, но независимой перепроверки за ними нет.
Какая именно Opus-4.8 и почему в таблице нет Opus 5
Opus-4.8 вышла . Anthropic представила Claude Opus 5: по заявлению компании, новая модель приближается к уровню Claude Fable 5 при вдвое меньшей цене.
Opus-4.8 при этом никуда не делась. На странице вывода моделей из эксплуатации она числится в статусе Active, а отключение назначено не раньше . Тот же статус одновременно закреплён за пятью моделями линейки Opus.
Соперник выбран действующий и поддерживаемый, а не заброшенный. Чего в таблице нет, так это колонки Opus 5; не публиковал такого сопоставления и никто со стороны. Как V4-Flash-Vision-Exp соотносится с новейшей моделью Anthropic, неизвестно, и обратного в анонсе не утверждается.
Active – в терминологии Anthropic статус модели, которая полностью поддерживается и рекомендована к использованию; для каждой такой модели публикуется дата, раньше которой её не отключат.
Разрыв в цене против отставания на NL2Repo
Коммерческий смысл сравнения держится на цене. По оценке исследования, на которое ссылается первоисточник, V4-Flash оказалась самой дешёвой в эксплуатации среди широко известных моделей: около 0,87 $ за миллион слов против примерно 50 $ у Anthropic.
На таком разрыве отставание в один-два пункта превращается в коммерческий аргумент, а не в поражение. Двенадцать пунктов на NL2Repo – другое дело: работа на уровне целого репозитория и есть то, ради чего корпоративные заказчики покупают агентов.
Отдельно DeepSeek перевела V4-Pro в общедоступный статус – по формулировке компании, с существенно усиленными агентными возможностями, поддержкой формата Responses API и настройкой под Codex. Именно эту модель корпоративный покупатель и стал бы взвешивать, но в пятничной таблице её тоже нет.
Заключение
Формулировка DeepSeek выдержана аккуратно: сказано «близко к Opus-4.8», и на нескольких наборах это действительно так. Лидерства по всей выборке компания не объявляла и с новейшей моделью Anthropic себя не сравнивала.
Проверки, которая закрыла бы вопрос, пока никто не проводил: нужен прогон V4-Flash-Vision-Exp и Opus 5 на одном инструментарии. Без него честная сводка выглядит скромнее заголовков – экспериментальная китайская мультимодальная модель держится в нескольких пунктах от действующей американской на большей части выборки, выигрывает три теста из одиннадцати, обходится кратно дешевле и проваливает самый тяжёлый пункт с разрывом в 12 пунктов.