Open source‑проект Lemonade обновился до версии 11.5: ключевое нововведение — готовый Lemonade Router, который помогает автоматически выбирать подходящую модель под запрос. Плюс появилась серверная «очередь задач» /jobs для многошаговых сценариев — удобно для агентных пайплайнов и интеграций.
Open source‑проект Lemonade, который помогает запускать большие языковые модели локально на ПК и рабочих станциях, получил обновление до версии 11.5. Релиз вышел 22 июля 2026 года и, по сути, закрывает одну из самых практичных болей локального ИИ: как не «стрелять из пушки по воробьям», когда задач много, а модели — разные по цене и скорости.
Что такое Lemonade и где он полезен
Lemonade — это локальный ИИ‑сервер для развёртывания LLM‑нагрузок на разных типах железа: на NPU Ryzen AI, на GPU Radeon и на CPU. Его можно использовать и в Windows, и в Linux. Проект развивается при поддержке команды AMD в контексте мероприятия AMD Advancing AI, а кодовая база написана на C++ и Python и распространяется под Apache License 2.0.
Практический смысл такой связки простой: компании и разработчики получают управляемый «вход» в локальный ИИ без обязательного облака — когда важны контроль данных, предсказуемость стоимости и возможность «прикрутить» ИИ к внутренним системам.
Главное нововведение — Lemonade Router
Самое заметное изменение в 11.5 — завершение разработки Lemonade Router. Это компонент, который автоматически маршрутизирует запросы к подходящим моделям по заданным политикам.
Почему это важно: в реальной жизни запросы бывают разными. Одни — короткие и типовые (их можно обслужить быстрой и дешёвой моделью), другие — сложные (и тогда нужна более «тяжёлая»). Если всё отправлять в одну модель «на максимум», вы теряете скорость и ресурсы. Router делает выбор системным.
В стабильном варианте Router поддерживает несколько подходов к маршрутизации:
- правила (когда выбор модели задаётся явно),
- классификаторы (например, по типу запроса),
- семантическое сходство (когда система сопоставляет запрос с примерами/категориями),
- LLM‑as‑router — сценарий, где небольшая LLM сначала решает, к какой «основной» модели лучше отправить конкретный запрос.
Политики маршрутизации можно описывать в JSON‑файлах, а также собирать через графический интерфейс Lemonade. Это делает Router удобным не только для разработчиков, но и для команд, где часть настройки делают инженеры поддержки или аналитики.
/jobs: многошаговые запросы как «задачи», а не как один вызов
В 11.5 также добавили серверный механизм обработки заданий, который позволяет отправлять многошаговые запросы и управлять ими через эндпойнты /jobs. Важная деталь: такие запросы можно приостанавливать, прерывать, возобновлять и удалять.
Это особенно полезно, когда вы строите агентные сценарии или цепочки обработки: например, «прочитай документ → извлеки факты → проверь по правилам → подготовь итог». Вместо того чтобы держать всё в одном долгом запросе, можно работать с процессом как с управляемой задачей — и не терять контроль, если что-то пошло не так.
lemond как MCP‑клиент: задел на интеграции
Ещё одно дополнение — демон lemond теперь может выступать как хост MCP‑клиента для подключения к внешним серверам stdio MCP. По смыслу это добавляет гибкости в интеграциях: локальный ИИ‑контур может «разговаривать» с внешними инструментами через стандартизованный слой, не превращая каждое подключение в отдельный кастомный проект.
Кому стоит обратить внимание на релиз
- Командам, которые запускают LLM локально и хотят балансировать скорость/качество, а не держать одну модель «на всё».
- Разработчикам внутренних помощников, где нужны многошаговые сценарии и управление долгими операциями.
- Тем, кто строит агентные пайплайны и хочет более понятную архитектуру маршрутизации и оркестрации запросов.
Lemonade 11.5 выглядит как шаг от «просто запустить модель» к более взрослой эксплуатации локального ИИ — с правилами, очередями и управляемыми процессами.
