Что такое Hermes 4 и кто её создал
Hermes 4 — это семейство открытых языковых моделей, разработанных компанией Nous Research. Проект позиционируется как альтернатива коммерческим системам вроде GPT-5 и Claude, с акцентом на открытость, управляемость и отсутствие излишней цензуры. Модель построена на базе архитектуры Meta-Llama-3.1 и доступна в двух основных размерах: 70B и 405B параметров.
Nous Research известна своими экспериментами в области открытых ИИ-моделей. Предыдущая версия, Hermes 3, уже завоевала популярность среди разработчиков благодаря хорошему балансу между качеством ответов и возможностью локального запуска. Hermes 4 стала значительным шагом вперёд: разработчики увеличили обучающий корпус с 1,2 миллиарда до примерно 60 миллиардов токенов, что позволило существенно улучшить способности модели в математике, программировании, естественных науках и логике.
Ключевая особенность Hermes 4 — гибридный режим рассуждений. Модель может либо выдавать ответ сразу, либо сначала проводить внутренние размышления, используя специальные теги ``. Это позволяет пользователю выбирать между скоростью и глубиной проработки ответа в зависимости от задачи. Такой подход делает модель особенно полезной для сложных аналитических задач, где требуется многошаговое логическое мышление.
Архитектура и технические характеристики
Hermes 4 основана на архитектуре Llama-3.1, но с существенными доработками. Модель 405B — это флагманская версия, способная обрабатывать контекст до 131 тысячи токенов, что позволяет анализировать объёмные документы и вести длинные диалоги. Версия 70B — более лёгкая, предназначенная для пользователей с ограниченными вычислительными ресурсами.
Одним из главных технических новшеств стало использование расширенного набора данных для пост-обучения, включающего проверенные цепочки рассуждений. Это позволило модели не только лучше решать логические задачи, но и более точно следовать инструкциям, а также генерировать структурированные выходные данные, такие как JSON, строго соответствующие заданным схемам.
Hermes 4 поддерживает вызов функций и использование инструментов. Это означает, что модель может взаимодействовать с внешними API и выполнять действия, например, получать данные о погоде или вызывать другие сервисы. Для разработчиков предусмотрена возможность управления режимом рассуждений через параметр reasoning_enabled, а также настройка таких параметров, как temperature, top_p и top_k для тонкой настройки генерации.
Гибридный режим рассуждений: как это работает
Гибридный режим рассуждений — одна из самых интересных особенностей Hermes 4. В отличие от традиционных моделей, которые сразу генерируют ответ, Hermes 4 может сначала "обдумать" задачу, сгенерировав внутренние рассуждения в тегах ``, а затем выдать финальный ответ. Это позволяет модели решать более сложные задачи, требующие многошаговых логических выводов.
Пользователь может управлять этим режимом несколькими способами. Во-первых, можно включить режим принудительного рассуждения, добавив в системный промпт инструкцию: "You are a deep thinking AI, you may use extremely long chains of thought...". Во-вторых, можно использовать флаг thinking=True в чат-шаблоне. Также доступен параметр keep_cots=True, который позволяет сохранять внутренние рассуждения в выводе для последующего анализа.
Важно отметить, что режим рассуждений не всегда обязателен. Для простых задач, таких как ответы на фактологические вопросы, модель может отвечать напрямую, что значительно ускоряет работу. Это делает Hermes 4 универсальным инструментом, который можно адаптировать под конкретные сценарии использования.
Сравнение с предыдущими версиями и аналогами
По сравнению с Hermes 3, новая версия получила значительные улучшения. Размер обучающего корпуса вырос с 1,2 миллиарда до 60 миллиардов токенов, что позволило модели лучше справляться с математикой, программированием и логикой. Также была улучшена способность следовать инструкциям и снижено количество отказов на запросы, которые другие модели считают нежелательными.
В независимых тестах Hermes 4 показала себя достойно, но не всегда превосходила конкурентов. Например, в задаче на преобразование UNIX timestamp в дату модель ошиблась, определив только год, в то время как GPT-5 справился точно. Однако в задаче на написание поста для блога на основе англоязычной статьи Hermes 4 продемонстрировала отличный результат, опередив GPT-5 по читабельности текста.
Сравнение с аналогами показывает, что Hermes 4 — это модель премиального сегмента, сопоставимая по стоимости с такими моделями, как xiaomi/mimo-v2-pro и Qwen3 Coder Plus. Она особенно сильна в задачах, требующих глубокого анализа кода и логического вывода, но уступает в работе с мультимодальным контентом, так как специализируется исключительно на тексте.
Реальные тесты: сильные и слабые стороны
Независимые тесты, проведённые специалистами из Meanotek, выявили как сильные, так и слабые стороны Hermes 4. В тесте на преобразование UNIX timestamp модель ошиблась, что говорит о недостаточной точности в работе с датами. В задаче на исправление неправильной раскладки клавиатуры модель также не справилась, не сумев распознать фразу "где живёт бегемот?".
Однако в задаче на написание поста для блога Hermes 4 показала отличный результат, создав логичный и понятный текст на русском языке. Модель также неплохо справилась с генерацией HTML и JavaScript для имитации роя насекомых, хотя поведение объектов было не совсем реалистичным.
Что касается цензуры, Hermes 4 продемонстрировала двойственное поведение. На вопрос о вскрытии замка модель не отказалась отвечать, но дала лишь общие советы, такие как вызов слесаря, что вряд ли поможет в реальной ситуации. Это говорит о том, что модель старается быть полезной, но не переходит границы безопасности.
Как использовать Hermes 4: API и локальный запуск
Hermes 4 доступна для использования через API на платформе AllTokens, что позволяет интегрировать модель в свои приложения без необходимости разворачивать собственную инфраструктуру. API поддерживает все основные параметры генерации, включая управление режимом рассуждений, и совместим с OpenAI-форматом, что упрощает миграцию.
Для локального запуска модели можно использовать библиотеки Transformers, vLLM или SGLang. Например, с помощью Transformers можно загрузить модель и генерировать ответы всего в несколько строк кода. Для более производительного использования рекомендуется применять vLLM или SGLang, которые поддерживают тензорный параллелизм и кэширование префиксов.
Также доступны квантованные версии модели, такие как FP8 и GGUF, которые позволяют запускать модель на оборудовании с ограниченной памятью. Например, GGUF-версии можно использовать в llama.cpp, Ollama или LM Studio. Это делает Hermes 4 доступной для широкого круга пользователей, хотя для полноценной работы с версией 405B потребуется серьёзное оборудование.
Ограничения и когда модель не подходит
Несмотря на все преимущества, Hermes 4 имеет ряд ограничений, которые важно учитывать. Во-первых, модель работает только с текстом и не поддерживает мультимодальные входы, такие как изображения или аудио. Это делает её непригодной для задач, требующих анализа визуальной информации.
Во-вторых, для решения простых задач модель может быть избыточной. Если вам нужен мгновенный ответ на простой вопрос, использование Hermes 4 с её режимом рассуждений может замедлить работу. В таких случаях лучше выбрать более лёгкую и быструю модель.
В-третьих, локальный запуск модели 405B требует значительных вычислительных ресурсов, что может быть недоступно для большинства пользователей. Даже версия 70B требует видеокарты с большим объёмом памяти. Поэтому для большинства задач более практичным будет использование API.
Будущее Hermes и открытых моделей
Hermes 4 — это важный шаг в развитии открытых языковых моделей. Она демонстрирует, что открытые модели могут конкурировать с коммерческими системами в ряде задач, особенно в написании текстов и логических рассуждениях. Разработчики Nous Research продолжают активно работать над улучшением модели, и можно ожидать появления новых версий с ещё более высокими показателями.
Однако остаются и вызовы. Открытые модели часто требуют значительных вычислительных ресурсов для запуска, что ограничивает их доступность. Кроме того, вопросы безопасности и цензуры остаются сложными: Hermes 4 старается быть менее ограниченной, но это может привести к злоупотреблениям.
Тем не менее, тенденция к открытости в ИИ набирает обороты. Такие модели, как Hermes 4, предоставляют пользователям больше контроля и возможностей для настройки, что особенно важно для бизнеса и исследователей. В будущем мы, вероятно, увидим ещё больше инноваций в этой области.
Вопросы и ответы
Что такое Hermes 4 и чем она отличается от Hermes 3?
Hermes 4 — это новая версия открытой языковой модели от Nous Research, основанная на архитектуре Llama-3.1. Главные отличия от Hermes 3: значительно увеличенный обучающий корпус (с 1,2 млрд до 60 млрд токенов), гибридный режим рассуждений с тегами ` перед ответом. Во-вторых, используйте флаг thinking=True в чат-шаблоне. Также можно установить параметр keep_cots=True`, чтобы сохранять внутренние рассуждения в выводе. Для отключения режима просто не используйте эти инструкции.
Какие размеры модели доступны и какой выбрать?
Hermes 4 доступна в двух основных размерах: 70B и 405B параметров. Версия 405B — флагманская, обеспечивает максимальное качество, но требует огромных вычислительных ресурсов и поддерживает контекст до 131k токенов. Версия 70B — более лёгкая, подходит для локального запуска на мощных GPU и для задач, где не нужна максимальная точность. Выбор зависит от ваших задач и доступного оборудования. Для большинства пользователей рекомендуется использовать API с версией 405B, а для экспериментов — 70B.
Можно ли использовать Hermes 4 локально?
Да, Hermes 4 можно запустить локально. Для этого используйте библиотеки Transformers, vLLM или SGLang. Например, с помощью Transformers: model = AutoModelForCausalLM.from_pretrained("NousResearch/Hermes-4-70B"). Также доступны квантованные версии (FP8, GGUF), которые можно запускать в llama.cpp, Ollama или LM Studio. Однако учтите, что для версии 405B потребуется несколько GPU с большим объёмом памяти, поэтому локальный запуск целесообразен только для 70B и меньше.
Насколько хорошо Hermes 4 справляется с русским языком?
Hermes 4 хорошо справляется с русским языком, особенно в задачах написания текстов. В независимых тестах модель успешно создала пост для блога на русском языке на основе англоязычной статьи, причём текст был логичным и читабельным. Однако в некоторых задачах, требующих понимания специфических русских реалий (например, знание российских компаний), модель может давать неточные ответы или отказываться отвечать. В целом, для большинства задач на русском языке модель подходит.
Какие ограничения у Hermes 4?
Основные ограничения: модель работает только с текстом, не поддерживает изображения и аудио. Для простых задач она может быть избыточной и медленной из-за режима рассуждений. Локальный запуск требует мощного оборудования, особенно для версии 405B. Также модель может ошибаться в задачах, требующих точных вычислений (например, преобразование дат) и не всегда справляется с нишевыми технологиями. Кроме того, несмотря на заявленное отсутствие цензуры, модель всё же даёт осторожные ответы на потенциально опасные вопросы.