ARC AGI 3 — Skill Issue Скиллы оказались куда лучше системных промптов. В них можно зашить tool use

AI Summary
В новой версии ARC AGI 3 значительно улучшены результаты благодаря внедрению скиллов, которые позволяют более эффективно использовать инструменты и обеспечивают большую консистентность ответов. Используя кастомный скилл для Claude Opus 5, разработчики достигли 100% точности на бенчмарке, что вдвое меньше по количеству шагов по сравнению с предыдущими версиями. Это подчеркивает переход от классического промпт-инжиниринга к более продвинутому скилл-инжинирингу в области искусственного интеллекта.
ARC AGI 3 — Skill Issue
Скиллы оказались куда лучше системных промптов. В них можно зашить tool use, решая проблему повторяемости и консистентности ответов. Это дико полезная фича, когда нужна строгая форма вывода, скажем, для заполнения таблиц.
Парни с помощью кастомный скилла для Claude Opus 5 зарешали ARC AGI 3 на 100%. Скилл буквально заставляет модель лишний раз подумать перед предсказанием на бенчмарке. В итоге, модель улетела с 30% до чистых 100%, что уже лучше кожаных, при этом используя ~вдвое меньшее количество шагов.
Никакого читерства в виде правил датасета внутри скилла нет. В тул-колл тупо зашит жесткий логический блок. Если модель не рассуждает перед ответом и не пытается предугадать следующий шаг, заполняя соответствующие ячейки, предсказание отправляется на доработку. Ну, а в остальном базовые инструкции.
С одной стороны RL вроде как убил классический промпт-инжиниринг, а теперь на его месте уже плотно закрепился скилл-инжиниринг.
Также это показывает насколько беплолезным бенчем оказался ARC AGI на нашей траектории к AGI (не в обиду, Франсуа).
ARC Skill
@ai_newz
Related News
ProgrammingARC AGI 3 — Skill Issue Скиллы оказались куда лучше системных промптов. В них можно зашить тул юз,
В новой версии ARC AGI 3 система скиллов продемонстрировала значительное превосходство над традиционными системными промптами, обеспечивая более высокую точность и консистентность ответов. Разработанный кастомный скилл для Claude Opus 5 увеличил точность модели с 30% до 100%, используя при этом меньше шагов и без применения читерских методов. Это подтверждает переход от классического промпт-инжиниринга к более эффективному скилл-инжинирингу.
ProgrammingSlack is launching collaborative vibe-coding channels
Slack запускает новые каналы для совместного кодирования, позволяя командам работать с AI-агентами без необходимости переключаться между различными инструментами. В рамках запуска Slack Code пользователи смогут создавать открытые каналы для конкретных проектов, а также использовать функции для сравнения изменений в коде и предварительного просмотра HTML-вывода перед публикацией.
Группа Rubytech протестировала российские LLM на китайских GPU
Группа Rubytech протестировала российские языковые модели (LLM) на китайских графических процессорах (GPU). Исследование направлено на оценку производительности и эффективности российских технологий в условиях использования оборудования из Китая. Результаты тестирования могут повлиять на дальнейшее развитие ИТ-инфраструктуры в России.