ARC AGI 3 — Skill Issue Скиллы оказались куда лучше системных промптов. В них можно зашить тул юз,

AI Summary
В новой версии ARC AGI 3 система скиллов продемонстрировала значительное превосходство над традиционными системными промптами, обеспечивая более высокую точность и консистентность ответов. Разработанный кастомный скилл для Claude Opus 5 увеличил точность модели с 30% до 100%, используя при этом меньше шагов и без применения читерских методов. Это подтверждает переход от классического промпт-инжиниринга к более эффективному скилл-инжинирингу.
ARC AGI 3 — Skill Issue
Скиллы оказались куда лучше системных промптов. В них можно зашить тул юз, решая проблему повторяемости и консистентности ответов. Это дико полезная фича, когда нужна строгая форма вывода, скажем, для заполнения таблиц.
Вот вам кастомный скилл для Claude Opus 5, который буквально заставляет модель лишний раз подумать перед предсказанием в ARC AGI 3 и всё. В итоге, модель улетела с 30% до чистых 100%, что уже лучше кожаных, при этом используя ~вдвое меньшее количество шагов.
Никакого читерства в виде правил датасета внутри скилла нет. В тул-колл тупо зашит жесткий логический блок. Если модель не рассуждает перед ответом и не пытается предугадать следующий шаг, заполняя соответствующие ячейки, предсказание отправляется на доработку. Ну, а в остальном базовые инструкции.
С одной стороны RL вроде как убил классический промпт-инжиниринг, а теперь на его месте уже плотно закрепился скилл-инжиниринг, лол.
ARC Skill
@ai_newz
Related News
ProgrammingSlack is launching collaborative vibe-coding channels
Slack запускает новые каналы для совместного кодирования, позволяя командам работать с AI-агентами без необходимости переключаться между различными инструментами. В рамках запуска Slack Code пользователи смогут создавать открытые каналы для конкретных проектов, а также использовать функции для сравнения изменений в коде и предварительного просмотра HTML-вывода перед публикацией.
Группа Rubytech протестировала российские LLM на китайских GPU
Группа Rubytech протестировала российские языковые модели (LLM) на китайских графических процессорах (GPU). Исследование направлено на оценку производительности и эффективности российских технологий в условиях использования оборудования из Китая. Результаты тестирования могут повлиять на дальнейшее развитие ИТ-инфраструктуры в России.
Programming🤯 Стэнфорд научил ИИ-агентов проверять самих себя Исследователи из Стэнфорда предложили LLM-as-a-V
Исследователи из Стэнфорда разработали метод LLM-as-a-Verifier, который позволяет ИИ-агентам самостоятельно проверять свои решения, улучшая их эффективность без необходимости дообучения. В тестах на Terminal-Bench 2.1 новый подход увеличил точность DeepSeek V4 Flash с 79% до 88%, при этом оказавшись в 11 раз дешевле. Фреймворк доступен бесплатно и с открытым кодом.