Liquid AI представила LFM2.5‑2.6B — агентную модель, рассчитанную на работу «на устройстве» без облачных API. Идея проста: приватность и низкая задержка без счёта за токены — и новые сценарии автоматизации становятся реальнее.
Liquid AI выпустила модель LFM2.5‑2.6B, сделанную с упором на агентные задачи — когда ИИ не просто отвечает, а планирует шаги, вызывает инструменты и доводит многошаговые действия до результата, причём без обязательного обращения к облаку.
Главная ставка релиза — «агенты везде»: модель достаточно компактная, чтобы запускаться на пользовательских устройствах, и достаточно быстрая, чтобы не превращать взаимодействие в ожидание прогресса на экране.
Почему локальный агент — это не просто «ещё один LLM»
У облачных помощников есть два привычных ограничения: задержка (зависимость от сети и очередей на сервере) и стоимость каждого запроса. В случае on-device-подхода появляются другие правила игры:
- Приватность: данные и промежуточные шаги не обязаны покидать устройство.
- Скорость реакции: меньше «кругов» до ответа, особенно в сценариях с плохим интернетом.
- Нулевая цена за токены после установки: можно запускать фоновые цепочки действий чаще и смелее — например, параллельно и постоянно, а не «по праздникам».
Что Liquid AI рассказала о модели
LFM2.5‑2.6B — это модель на 2,6 млрд параметров, рассчитанная на агентные рабочие процессы. Компания подчёркивает, что модель может быть полезна там, где важны баланс мощности и ресурсоёмкости.
Ключевые заявленные характеристики и подходы:
- Контекст до 128K и расширенный словарь 128K токенов (с акцентом на поддержку нелатинских письменностей).
- Предобучение примерно на 34 трлн токенов, затем многоэтапная «доводка» под агентные навыки.
- Пост-тренинг в несколько стадий: от supervised fine-tuning до обучения в агентных средах с подкреплением (в том числе через реальные «harness»-среды).
Скорость и требования к железу: что обещают цифры
В публикации Liquid AI делает акцент на том, что модель должна быть быстрой именно при локальном использовании. В качестве примеров компания приводит такие ориентиры:
- до 220 токенов/с на Apple M5 Max;
- до 113 токенов/с на Ryzen AI Max+ 395 при использовании менее 2,5 ГБ памяти;
- около 30 токенов/с на смартфоне;
- на NVIDIA H100 — почти 15 000 выходных токенов/с при высокой конкуррентной нагрузке (в сценариях серверной раздачи).
Эти значения важны не сами по себе, а как сигнал тренда: локальные ассистенты перестают быть «игрушкой», если способны поддерживать нормальный темп диалога и при этом тянуть агентные цепочки.
Что это меняет для обычных пользователей и команд
Локальная агентная модель — это шаг к устройствам, которые могут делать больше автоматически, не передавая каждый шаг в облако. На практике это может выглядеть так:
- личный помощник, который разбирает заметки, письма и задачи на устройстве;
- офлайн-режим для умных функций, когда сеть нестабильна;
- корпоративные сценарии, где политика безопасности не приветствует отправку данных во внешние API.
При этом Liquid AI честно отмечает, что в задачах «тяжёлого» программирования более крупные модели всё ещё могут выигрывать. Но для большого числа бытовых и рабочих автоматизаций важнее не абсолютный максимум интеллекта, а скорость + предсказуемость + стоимость владения.
Экосистема: чтобы модель не была «вещью в себе»
Отдельный плюс релиза — заявленная готовность к внедрению: Liquid AI указывает поддержку популярных стэков для инференса и развёртывания, включая llama.cpp, MLX, vLLM, SGLang и ONNX. Это снижает порог входа для разработчиков: меньше времени уходит на «завести», больше — на полезные сценарии.
