Workweave Router: умный роутинг моделей для агентов
Обзор Workweave Router — open-source маршрутизатора LLM-запросов для агентных систем. Экономия 40–70% при смене одного endpoint.
Что такое Workweave Router и для кого он создан
Weave запустила Router — лёгкий open-source инструмент оркестрации моделей, направляющий AI-запросы к наиболее подходящей LLM менее чем за 50 миллисекунд. Разработан компанией Weave — платформой инженерной аналитики — и решает растущий корпоративный запрос на оптимизацию затрат и гибкость в мультимодельных агентных пайплайнах.
Weave Router — это прокси для маршрутизации моделей, созданный для агентных coding-воркфлоу, где одна задача может включать планирование, исследование кодовой базы, реализацию и ревью. Вместо того чтобы прогонять каждый запрос из Claude Code, Codex, opencode, Cursor или пользовательского API через одну дорогую frontier-модель, Router предоставляет совместимые с Anthropic, OpenAI и Gemini эндпоинты, оценивает каждый запрос с помощью локального embedder’а и кластерного скорера, затем форвардит его к поставщику — DeepSeek, Kimi, GLM, Qwen, Llama, Mistral, OpenRouter или любому OpenAI-совместимому бэкенду.
Инструмент ориентирован на:
- Команды разработчиков, использующие Claude Code, Codex CLI или opencode
- Стартапы и компании, у которых AI-биллинг выходит из-под контроля
- DevOps/MLOps-инженеров, строящих производственные агентные системы
- Исследователей, которым нужен контроль над маршрутизацией без vendor lock-in
Как работает маршрутизация
Маршрутизация — это не эвристика по длине промпта и не жёстко заданный список ключевых слов. Каждый запрос встраивается небольшой ONNX-моделью, оценивается по замороженному набору кластеров намерений и сопоставляется с наиболее дешёвым кандидатом, который исторически показывал паритет с frontier-моделью на данном кластере.
Скорер не просто выбирает модель с наивысшим баллом — он выбирает кандидата, побеждающего по составному критерию стоимости, задержки и многословности.
graph LR
A[Запрос от агента] --> B[Локальный ONNX-embedder]
B --> C[Кластерный скорер]
C --> D{Выбор модели}
D -->|Простой запрос| E[DeepSeek / Qwen / Llama]
D -->|Сложная задача| F[Claude / GPT / Gemini]
E --> G[Ответ агенту]
F --> G
Сессионное закрепление (Session Pinning)
Session pinning — ключевая архитектурная особенность: Router закрепляет решение о модели на всю сессию, а не переоценивает его на каждом шаге. Логика — эффективность кеша промптов: если первый ход роутируется к провайдеру A, а второй к провайдеру B, придётся платить полную стоимость повторного прайминга идентичного контекста у второго провайдера, что нивелирует экономию.
Ключевые возможности
Интеграция одной командой
Инсталлятор одной командой направляет Claude Code, Codex, opencode или pi к Weave Router.
# Интерактивный режим — выбор клиента
npx @workweave/router
# Напрямую для Claude Code
npx @workweave/router --claude
# Для Codex CLI
npx @workweave/router --codex
# Самостоятельный хостинг через docker-compose
npx @workweave/router --local
# Переключение без потери конфига
npx @workweave/router off --claude
npx @workweave/router on --claude
Поддерживаемые провайдеры и модели
Платформа работает как drop-in прокси, совместимый с основными облачными провайдерами — Anthropic, OpenAI и Gemini, а также поддерживает open-weight модели Llama, Mistral и Qwen через OpenRouter или стандартные OpenAI-совместимые бэкенды.
BYOK и самохостинг
Поддерживается BYOK-схема: ключи провайдеров хранятся локально и зашифрованы в покое, для клиентов выдаются отдельные ключи роутера. Самохостинговый стек включает дашборд, Postgres, endpoint для предпросмотра маршрутов, health checks и OTLP-трейсы для Honeycomb, Datadog, Grafana и других observability-инструментов.
Managed-режим
Управляемый (рекомендуемый) режим: нужно зарегистрироваться на router.workweave.ai, добавить ключи провайдеров и указать клиенту базовый URL. Маршрутизация активируется в течение нескольких минут.
Таблица характеристик Workweave Router
| Параметр | Значение |
|---|---|
| Задержка маршрутизации | <50 мс (overhead — единицы мс) |
| Метод классификации | ONNX-embedder + кластерный скорер |
| Поддерживаемые клиенты | Claude Code, Codex CLI, opencode, Cursor (beta), pi |
| Совместимые API | Anthropic Messages API, OpenAI API, Gemini API |
| Open-source модели | DeepSeek, Kimi, GLM, Qwen, Llama, Mistral + любой OpenAI-compat. |
| Режимы развёртывания | Managed (router.workweave.ai) / Self-hosted (Docker) |
| BYOK | Да, ключи зашифрованы локально |
| Observability | OTLP, Honeycomb, Datadog, Grafana |
| Язык реализации | Go |
| Лицензия | Elastic License v2 (ELv2) |
| Экономия затрат | 40–70% (self-reported) |
| GitHub ★ | ~711 (на момент публикации) |
Тарифы и цены
Publicly доступной тарифной сетки на момент публикации нет — Router работает по модели BYOK: вы платите своим провайдерам напрямую, а маршрутизатор экономит на выборе более дешёвых моделей. Managed-сервис доступен по адресу router.workweave.ai.
| Режим | Стоимость | Требования |
|---|---|---|
| Managed | Публично не раскрыта | Аккаунт на router.workweave.ai |
| Self-hosted | Бесплатно (ваш сервер) | Docker, Postgres, провайдерские ключи |
| Провайдеры | Платите напрямую (BYOK) | Ключи OpenAI / Anthropic / OpenRouter |
Насколько реальна экономия?
В блог-посте проекта сообщается об 80–85% снижении затрат без наблюдаемой регрессии качества на production-трафике Claude Code, объясняя это тем, что 60–70% запросов — короткие, структурно простые завершения, с которыми open-source модели справляются на паритете примерно за одну сороковую цены.
В заголовке GitHub-репозитория указана более консервативная цифра: «Cut costs 40–70% with just an endpoint change». Сам путь маршрутизации добавляет лишь единицы миллисекунд накладных расходов.
Оба диапазона — самооценка проекта, а не независимая верификация, поэтому воспринимайте их как ориентир, а не гарантию.
«60–70% production-запросов в Claude Code — короткие завершения, с которыми open-source модели справляются на паритете примерно за 1/40 стоимости frontier-моделей» — Workweave Blog
Плюсы и минусы
| ✅ Плюсы | ❌ Минусы |
|---|---|
Интеграция одной командой (npx) | ELv2-лицензия — не полный open-source |
| Routing overhead — единицы мс | Экономия самооценочная, не верифицирована независимо |
| BYOK — данные не уходят к третьим лицам | Session pinning может не подойти для некоторых воркфлоу |
| Поддержка Claude Code, Codex, opencode, Cursor | Cursor-интеграция пока в early beta |
| Self-hosted с observability (OTLP, Grafana) | Ограниченная документация по edge-кейсам |
| Многоцелевой скорер (цена + задержка + многословность) | Молодой проект (~711 звёзд), зрелость неизвестна |
| Go-реализация — производительность и стабильность | Нет публичных независимых бенчмарков |
Сравнение с альтернативами
| Параметр | Workweave Router | OpenRouter | LiteLLM |
|---|---|---|---|
| Тип | Self-hosted / Managed прокси | Managed SaaS | Self-hosted прокси |
| Метод маршрутизации | ML-embedder (семантика запроса) | Провайдер/цена/latency | Правила, fallback, caching |
| Фокус | Агентные coding-воркфлоу | Широкий доступ к моделям | Governance, observability |
| Лицензия | ELv2 (source-available) | Closed-source | MIT (ядро) |
| Overhead | Единицы мс | ~40 мс | Зависит от конфига |
| Модели | Frontier + OSS через BYOK | 623+ моделей | 100+ провайдеров |
| Цена | BYOK + хостинг | 5.5% fee / 5% BYOK | Бесплатно (ядро) |
| Установка | npx @workweave/router | API-ключ | pip + docker |
| BYOK | ✅ | ✅ (от 1M req/мес бесплатно) | ✅ |
| Observability | OTLP, Grafana, Datadog | Базовая | Расширенная |
Ни OpenRouter, ни LiteLLM не маршрутизируют по смыслу запроса — это принципиальное отличие Workweave Router, использующего ML-классификацию. OpenRouter добавляет около 40 мс задержки к каждому запросу, тогда как Workweave Router по заявлению разработчиков укладывается в единицы дополнительных миллисекунд.
Для тестирования достаточно одной команды и ключа OpenRouter:
npx @workweave/router --claude
Router сам настроит Claude Code на проксирование через managed-сервис. Ключи провайдеров вводятся в дашборде router.workweave.ai.
Вердикт
Workweave Router подойдёт:
- Командам на Claude Code / Codex с высоким monthly spend
- Стартапам, которым нужна мгновенная интеграция без рефакторинга
- DevOps-инженерам, строящим агентные пайплайны с observability
- Тем, кто хочет BYOK без vendor lock-in
Не подойдёт:
- Компаниям, которым нужен полноценный open-source (ELv2 ограничивает)
- Командам с некодинговыми воркфлоу (инструмент заточен под agentic coding)
- Тем, кому нужны независимо верифицированные бенчмарки перед внедрением
Рейтинг: 7.5 / 10
Workweave Router закрывает реальную боль — перерасход на frontier-моделях в агентных системах — и делает это с минимальным порогом входа. ML-маршрутизация по смыслу запроса, а не по длине токенов, выгодно отличает его от конкурентов. Молодость проекта и самооценочная природа заявленных цифр пока не позволяют дать высший балл, но для команд на Claude Code / Codex — это один из наиболее практичных инструментов оптимизации затрат на рынке прямо сейчас.