Новый релиз Cohere проигрывает топовым ИИ в точности, но снижает затраты на обработку PDF до смешных копеек.
Корпоративный ИИ давно уперся в скучную, но очень дорогую проблему: чтобы скормить нейросети тысячи PDF-отчетов, сканы счетов и презентации, их нужно сначала разобрать на запчасти. А инструменты для этого либо безбожно ломают таблицы и схемы, либо стоят как крыло от самолета. В четверг Cohere выкатила Parse 5 — модель, которая сознательно отказалась от борьбы за топ-1 в бенчмарках ради радикального снижения цены.
Parse 5 — это визуально-языковая модель (Vision Language Model) на 2.3 миллиарда параметров. На вход она принимает страницу PDF, слайд PowerPoint или обычный JPEG, а на выходе выдает структурированный Markdown. Весь процесс идет за один проход через архитектуру North-Micro-Vision-Instruct, разработанную Cohere Labs. Размер модели в памяти — около 4.6 гигабайт, контекстное окно — 8192 токена.
Архитектура и возможности
Большинство конкурентов до сих пор работают по схеме «OCR плюс отдельная языковая модель»: сначала распознают символы, потом склеивают логику. Cohere свернула этот конвейер в одну VLM, что заметно ускоряет обработку и снижает количество точек отказа.
Модель поддерживает девять языков со стабильной точностью: английский, арабский, французский, немецкий, итальянский, японский, корейский, португалийский и испанский. Для остальных языков заявлена поддержка zero-shot, но с оговоркой про пониженную точность.
Доступны два режима вывода:
Где запустить и сколько стоит
Parse 5 уже доступна через Cohere API, платформу Model Vault для защищенного корпоративного инференса, Microsoft Foundry и AWS SageMaker. Цена заявлена очень агрессивная: 1.50 доллара за 1000 обработанных страниц. По данным самой Cohere, при масштабе в 750 миллионов документов в год (типичный объем для крупного финансового холдинга) переход с GPT-5.5 на Parse 5 экономит более 98% бюджета на инференс.
Бенчмарк ParseBench: честное серебро
В собственном тесте ParseBench модель набрала 79.2 балла по трем измерениям: таблицы, верность контента и семантическое форматирование. Для понимания расклада приведем оценки конкурентов:
Cohere открыто признает, что не претендует на первое место по чистой точности. Вице-президент по AI Search Нильс Раймерс (Nils Reimers) прямо заявил, что проблема парсинга документов не в распознавании букв, а в сохранении структуры и смысла. Когда на странице перемешаны таблицы, диаграммы, графики и форматирование, большинство инструментов теряют структуру или начинают галлюцинировать контент.
Из теста намеренно исключены две категории: Layout и Chart. Вместо попыток извлечь сырые данные из графиков, Parse 5 дает их текстовое описание. Разработчики считают, что попытка вытащить цифры из диаграммы часто ведет к потере цвета, типа линии и других визуальных нюансов, что критично для агентских сценариев. Поддержку извлечения данных из графиков завезут в следующей версии.
Конкурентный ландшафт
Рынок парсеров сейчас поделен на три лагеря. Универсальные frontier-модели (GPT-5.5, Opus 4.8, Gemini 3.5 Flash) дают топовую точность, но тащат за собой ценник и задержки большой модели на каждую страницу. Специализированные OCR-движки вроде Mistral OCR 4 или LlamaParse держат середину. Облачные документ-сервисы гиперскейлеров (AWS Textract, Google Document AI, Azure Document Intelligence) берут удобством интеграции в экосистему, хотя в тестах Cohere занимают нижние строчки.
Кевин Петри (Kevin Petrie), вице-президент по исследованиям BARC US, отмечает, что анализ документов является главным сценарием для ИИ в бизнесе. По опросу его компании, 62% организаций уже внедрили такие инструменты, потому что именно в неструктурированных данных лежит проприетарный контекст, нужный для запуска агентских систем.
Стефани Вальтер (Stephanie Walter) из HyperFRAME Research считает, что Parse 5 удачно занимает нишу между устаревшим OCR и дорогими универсальными моделями. Для корпоративного масштаба важнее предсказуемая цена и приватное развертывание, чем победа в каждом тесте.
Что важнее: балл или пригодность
Специалисты сходятся в одном: парсинг — это первый фильтр качества во всем стеке корпоративного ИИ. Если таблицы, заголовки и порядок чтения потеряны на этапе загрузки, никакие более крупные эмбеддинги или мощные LLM не восстановят эту структуру. Поэтому перед закупкой решения стоит гонять парсер не на синтетических тестах, а на собственных самых проблемных документах, замеряя точность ответов агентов на их основе.
Главный вопрос при выборе парсера давно перестал быть техническим. Звучит он теперь так: «Не «прочитал ли ИИ PDF», а «может ли теперь агент правильно использовать эту информацию». И Cohere Parse 5 здесь предлагает весьма прагматичный ответ: чуть меньше точности в обмен на радикальное снижение стоимости и скорость внедрения в высоконагруженных процессах.
Будем следить, как модель покажет себя на реальных задачах в РФ и СНГ — особенно интересно, как локализация для русского языка будет работать за пределами заявленных девяти языков.