Ornith-1.5: когда модель сама придумывает себе задачи и учится их решать
Ornith-1.5 — это редкий случай, когда модель не просто решает задачи, а сама придумывает их, строит для себя инструкции и учится на собственных результатах. Похоже на то, как ребёнок сначала ищет опору, а потом начинает ходить самостоятельно.
Self-scaffolding: откуда всё началось
В Ornith-1.0 появилась идея self-scaffolding: модель получает задачу и генерирует для себя «строительные леса» — план, стратегию декомпозиции и порядок действий. Это уже не просто ответ, а рабочая схема решения.
Представьте, что вам дали разобрать двигатель. Scaffold — это не сама инструкция по ремонту, а структура работы: с чего начать, какие инструменты понадобятся и как разбить задачу на части. Проблема в том, что здесь всё ещё нужен человек, который задаёт начальные задачи и систему оценки.
Как ornith-1.5 убирает человека из уравнения
Команда Ornith связала в один цикл три процесса:
- Генерация задач. Модель получает описание среды, кодовую базу или API и предлагает новые задачи, которые выходят за пределы уже решённого.
- Построение scaffold. Для каждой задачи создаётся стратегия решения и подробные инструкции.
- Генерация и оценка решений. Модель решает задачу, получает обратную связь, а reward обучает сразу все компоненты системы.
Смысл в том, что сильные решения порождают более сложные задачи, а более сложные задачи заставляют модель становиться ещё сильнее.
ЦИКЛ САМОСОВЕРШЕНСТВОВАНИЯ ORNITH-1.5
══════════════════════════════════════
┌──────────────────┐
│ Генерация │
│ задач │
└────────┬─────────┘
│
▼
┌──────────────────┐
│ Построение │◄─────────┐
│ scaffold │ │
└────────┬─────────┘ │
│ │
▼ │
┌──────────────────┐ │
│ Решения + │ │
│ Reward │─────────┘
└──────────────────┘
Каждый виток: сложнее задачи →
лучше scaffolding → сильнее модель
Как измерить, что задача хорошая
Reward для задачи строится из трёх сигналов:
- Валидность. Задача корректна, scaffold работает, а правильные и неправильные решения можно различить.
- Frontier difficulty. Задача находится на границе возможностей. Целевой уровень успешности — около 20%.
- Новизна. Задача не дублирует уже сгенерированные примеры.
Такой подход заставляет генератор удерживать баланс: задача должна быть и проверяемой, и достаточно сложной, и при этом новой.
Цифры, которые стоит знать
Ornith-1.5 существует в трёх размерах: 397B параметров на основе Mixture of Experts, а также 35B и 9B. В MoE-архитектуре для каждого токена активируется только часть модели, поэтому 35B MoE при обработке одного токена задействует лишь около 3B параметров.
Флагман Ornith-1.5-397B показывает такие результаты:
- Terminal-Bench 2.1: 86.1
- DeepSWE: 56.0
Для сравнения, Ornith-1.0 набирал 77.5 и 8.0 соответственно. Особенно впечатляет скачок на DeepSWE: с 8 до 56. Это хороший аргумент в пользу подхода, где модель сама создаёт для себя учебные задачи.
ОРНИТ-1.5 В КОНТЕКСТЕ ОТКРЫТЫХ МОДЕЛЕЙ ────────────────────────────────────── Terminal-Bench 2.1 (выше = лучше) Ornith-1.5-397B 86.1 ━━━━━━━━━━━ ■ DeepSeek-V4-Flash 82.7 ━━━━━━━━━━ GLM-5.2 81.0 ━━━━━━━━━ Ornith-1.0-397B 77.5 ━━━━━━━━ DeepSWE (выше = лучше) Ornith-1.5-397B 56.0 ━━━━━━ ■ Claude Opus 4.8 59.0 ━━━━━━ DeepSeek-V4-Flash 54.4 ━━━━━ Ornith-1.0-397B 8.0 ━
Почему это важно для будущего AI
Главная проблема обучения больших моделей — дефицит качественных данных. Их трудно разметить, дорого производить и сложно масштабировать. Ornith-1.5 предлагает альтернативу: модель сама создаёт для себя учебный материал.
Это не безрисковый путь. Есть опасность коллапса в низкокачественные задачи и риск reward hacking, когда модель оптимизирует метрику, а не реальный навык. Но если система умеет находить границы собственной компетенции и строить задачи на этих границах, это уже другой уровень масштабирования обучения.
Отдельно интересно, что Ornith-1.5-9B работает на iPhone и при этом показывает результаты, сопоставимые с моделями значительно большего размера. Это намекает, что архитектура и подход к обучению могут давать прирост не хуже простого увеличения числа параметров.
Выводы
Ornith-1.5 — это важный шаг к моделям, которые умеют не только отвечать, но и учиться. Если система может сама генерировать сложные, верифицируемые задачи, она частично снимает зависимость от ручной разметки и человеческих бенчмарков.
При этом метод ещё требует более прозрачного описания: детали GRPO, контроль разнообразия задач и защита от коллапса пока хотелось бы видеть глубже. Но направление выглядит очень перспективным, особенно для кодогенерации и агентных систем.
Практический вывод простой: self-improvement — это один из самых интересных следующих шагов в развитии AI, и Ornith-1.5 показывает, что этот шаг уже работает не только на бумаге.
Ссылки
- Ornith-1.5: From Self-Scaffolding to Self-Improvement — первичный источник о подходе и результатах
Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.