Unlimited-OCR от Baidu: 3B модель парсит 100-страничные PDF за один проход
Маленькая китайская модель, о которой почти никто не знает, уже собрала почти 2 миллиона скачиваний на HuggingFace. И при этом она делает то, что не могут сделать облака за деньги.
Baidu выложила в open source модель Unlimited-OCR. 3 миллиарда параметров. MIT-лицензия. Парсит 100-страничные PDF за один проход. Локально. Бесплатно. Навсегда.
Что это и почему это важно
Unlimited-OCR — это OCR-модель, которая читает целые документы целиком, а не постранично. Все существующие инструменты — Textract от AWS, Google Vision, Azure Document Intelligence — режут ваш PDF на страницы и обрабатывают каждую отдельно. Между страницами теряется контекст: переносы слов, таблицы на два листа, сквозная нумерация, ссылки между разделами. Unlimited-OCR смотрит на всё сразу.
Технически это называется «one-shot long-horizon parsing» — длинное название для простой идеи: не резать документ, а прочитать его целиком одним запросом.
Как это работает: R-SWA
Главная находка — архитектура Reference Sliding Window Attention (R-SWA). Обычные трансформеры при обработке длинных документов пытаются хранить в памяти каждое слово, которое уже прочитали. На 100 страницах это взрывается по памяти и скорости.
R-SWA работает иначе. Каждый сгенерированный токен «смотрит» на все визуальные токены из документа (reference tokens) и на последние 128 сгенерированных токенов. Кэш KV остаётся постоянным по размеру на протяжении всего декодирования — не растёт с каждой страницей.
На практике это значит: модель может обработать 100 страниц и не умереть от нехватки памяти. Скорость стабильная, ошибки минимальные.
Цифры
Параметров: 3B. Для OCR это немного. Для сравнения: GPT-5.6 Sol — это сотни миллиардов, DeepSeek V4 Pro — 1.6T.
Контекстное окно: 32 768 токенов. Этого хватает на десятки страниц текста в одном проходе.
Точность: 93% на стандартном бенчмарке парсинга документов. Это на 6 пунктов выше baseline. Ошибка past 40 страниц: менее 0.11. Для документа на 100 страниц — вполне рабочий результат.
Мультиязычность: из коробки. Сообщество проверило на кириллических документах и даже рукописной математике с конвертацией в LaTeX — работает.
Сколько стоит и где запускать
Облачный OCR стоит от $1.50 до $15 за 1000 страниц (AWS Textract, Google Vision, Azure Doc Intelligence). Unlimited-OCR запускается у вас на машине. Бесплатно. Данные никуда не уходят.
Поддержка: HuggingFace Transformers, vLLM, SGLang (с OpenAI-совместимым API), Docker Model Runner, Ollama, llama.cpp. Фактически — любой способ запуска, который вы привыкли использовать.
Лицензия: MIT. Можно использовать в коммерческих проектах без ограничений.
Что за DeepSeek-OCR
Baidu построила Unlimited-OCR на базе DeepSeek-OCR, заменив все attention-слои декодера на R-SWA. DeepSeek-OCR был уже неплох, но имел ограничения на длину документов. Unlimited-OCR снял это ограничение архитектурным решением, не увеличивая размер модели.
Сами авторы из Baidu говорят: «We present Unlimited-OCR, aiming to push DeepSeek-OCR one step further.» Скромно, но точно.
Реакция сообщества
На HuggingFace модель уже набрала около 1.9 миллиона скачиваний. На Reddit (r/LocalLLaMA) обсуждение было бурным, но не однозначным: кто-то хвалит архитектуру, кто-то жалуется на качество парсинга на практике. Hacker News обсуждал R-SWA подробно — общее мнение: «умный хак» для работы с длинными документами.
Скептики отмечают, что 3B параметров — это всё-таки мало для сложных документов с таблицами, формулами и нестандартным форматированием. На простых текстовых PDF работает хорошо, на сложных — могут быть артефакты.
Сравнение с конкурентами
Tencent параллельно выложила HunyuanOCR — 1B параметров, заточенный под скорость и мультиязычность. Это другой подход: быстрый и лёгкий вместо длинного и мощного.
Если у вас короткие документы и нужна скорость — HunyuanOCR. Если длинные PDF и нужна полнота — Unlimited-OCR. Выбор зависит от задачи.
Облачные сервисы (Textract, Google Vision) по-прежнему выигрывают на сложных документах с экзотическим форматированием. Но разрыв стремительно сужается, а приватность и цена — на стороне локальных моделей.
Для кого это реально полезно
Юристы, бухгалтеры, исследователи — все, кто работает с длинными PDF-документами и хочет извлечь структурированный текст. Юридические договоры на 80 страниц, научные статьи с формулами, финансовые отчёты с таблицами. Раньше для этого нужен был облачный сервис или ручной труд. Теперь — одна команда в терминале.
Для разработчиков: Unlimited-OCR можно встроить в свой pipeline обработки документов. vLLM и SGLang дают OpenAI-совместимый API — подключается как любой другой endpoint.
Что это значит для рынка
OCR был одной из тех задач, где облачные сервисы казались незаменимыми. Unlimited-OCR показывает, что 3B open-source модель с умной архитектурой может конкурировать с AWS и Google за долю рынка. Бесплатно. Локально. С MIT-лицензией.
Китай продолжает стратегию: выкладывать в open source модели, которые разрушают бизнес-модели западных компаний. DeepSeek удешевил inference. Kimi K3 показал, что frontier-модели могут быть открытыми. Unlimited-OCR бьёт по облачному OCR. Паттерн один и тот же.
Если вы до сих пор платите за OCR по $10 за 1000 страниц — самое время попробовать альтернативу.
Комментарии ()