Ornith-1.5: когда модель сама придумывает себе задачи и учится их решать

20.08.2026 · 5 мин

Ornith-1.5 — это редкий случай, когда модель не просто решает задачи, а сама придумывает их, строит для себя инструкции и учится на собственных результатах. Похоже на то, как ребёнок сначала ищет опору, а потом начинает ходить самостоятельно.

Self-scaffolding: откуда всё началось

В Ornith-1.0 появилась идея self-scaffolding: модель получает задачу и генерирует для себя «строительные леса» — план, стратегию декомпозиции и порядок действий. Это уже не просто ответ, а рабочая схема решения.

Представьте, что вам дали разобрать двигатель. Scaffold — это не сама инструкция по ремонту, а структура работы: с чего начать, какие инструменты понадобятся и как разбить задачу на части. Проблема в том, что здесь всё ещё нужен человек, который задаёт начальные задачи и систему оценки.

Как ornith-1.5 убирает человека из уравнения

Команда Ornith связала в один цикл три процесса:

Смысл в том, что сильные решения порождают более сложные задачи, а более сложные задачи заставляют модель становиться ещё сильнее.

ЦИКЛ САМОСОВЕРШЕНСТВОВАНИЯ ORNITH-1.5
══════════════════════════════════════

    ┌──────────────────┐
    │  Генерация       │
    │  задач           │
    └────────┬─────────┘
             │
             ▼
    ┌──────────────────┐
    │  Построение       │◄─────────┐
    │  scaffold         │          │
    └────────┬─────────┘          │
             │                    │
             ▼                    │
    ┌──────────────────┐          │
    │  Решения +       │          │
    │  Reward           │─────────┘
    └──────────────────┘
    
    Каждый виток: сложнее задачи →
    лучше scaffolding → сильнее модель
Замкнутый цикл, в котором все три компонента улучшают друг друга

Как измерить, что задача хорошая

Reward для задачи строится из трёх сигналов:

Такой подход заставляет генератор удерживать баланс: задача должна быть и проверяемой, и достаточно сложной, и при этом новой.

Цифры, которые стоит знать

Ornith-1.5 существует в трёх размерах: 397B параметров на основе Mixture of Experts, а также 35B и 9B. В MoE-архитектуре для каждого токена активируется только часть модели, поэтому 35B MoE при обработке одного токена задействует лишь около 3B параметров.

Флагман Ornith-1.5-397B показывает такие результаты:

Для сравнения, Ornith-1.0 набирал 77.5 и 8.0 соответственно. Особенно впечатляет скачок на DeepSWE: с 8 до 56. Это хороший аргумент в пользу подхода, где модель сама создаёт для себя учебные задачи.

ОРНИТ-1.5 В КОНТЕКСТЕ ОТКРЫТЫХ МОДЕЛЕЙ
──────────────────────────────────────
Terminal-Bench 2.1 (выше = лучше)

Ornith-1.5-397B    86.1 ━━━━━━━━━━━  ■
DeepSeek-V4-Flash  82.7 ━━━━━━━━━━
GLM-5.2            81.0 ━━━━━━━━━
Ornith-1.0-397B    77.5 ━━━━━━━━

DeepSWE (выше = лучше)

Ornith-1.5-397B    56.0 ━━━━━━   ■
Claude Opus 4.8    59.0 ━━━━━━
DeepSeek-V4-Flash  54.4 ━━━━━
Ornith-1.0-397B     8.0 ━
Ornith-1.5-397B сравним с сильными закрытыми моделями и заметно опережает предыдущую версию на DeepSWE

Почему это важно для будущего AI

Главная проблема обучения больших моделей — дефицит качественных данных. Их трудно разметить, дорого производить и сложно масштабировать. Ornith-1.5 предлагает альтернативу: модель сама создаёт для себя учебный материал.

Это не безрисковый путь. Есть опасность коллапса в низкокачественные задачи и риск reward hacking, когда модель оптимизирует метрику, а не реальный навык. Но если система умеет находить границы собственной компетенции и строить задачи на этих границах, это уже другой уровень масштабирования обучения.

Отдельно интересно, что Ornith-1.5-9B работает на iPhone и при этом показывает результаты, сопоставимые с моделями значительно большего размера. Это намекает, что архитектура и подход к обучению могут давать прирост не хуже простого увеличения числа параметров.

Выводы

Ornith-1.5 — это важный шаг к моделям, которые умеют не только отвечать, но и учиться. Если система может сама генерировать сложные, верифицируемые задачи, она частично снимает зависимость от ручной разметки и человеческих бенчмарков.

При этом метод ещё требует более прозрачного описания: детали GRPO, контроль разнообразия задач и защита от коллапса пока хотелось бы видеть глубже. Но направление выглядит очень перспективным, особенно для кодогенерации и агентных систем.

Практический вывод простой: self-improvement — это один из самых интересных следующих шагов в развитии AI, и Ornith-1.5 показывает, что этот шаг уже работает не только на бумаге.

Ссылки

Дмитрий Полухин — продуктовый дизайнер. Пишу про разработку, AI и дизайн интерфейсов. Обо мне, контакты и профили.