Programming

ARC AGI 3 — Skill Issue Скиллы оказались куда лучше системных промптов. В них можно зашить тул юз,

August 20, 20262 views1 min read
ARC AGI 3 — Skill Issue

Скиллы оказались куда лучше системных промптов. В них можно зашить тул юз,

AI Summary

В новой версии ARC AGI 3 система скиллов продемонстрировала значительное превосходство над традиционными системными промптами, обеспечивая более высокую точность и консистентность ответов. Разработанный кастомный скилл для Claude Opus 5 увеличил точность модели с 30% до 100%, используя при этом меньше шагов и без применения читерских методов. Это подтверждает переход от классического промпт-инжиниринга к более эффективному скилл-инжинирингу.

ARC AGI 3 — Skill Issue

Скиллы оказались куда лучше системных промптов. В них можно зашить тул юз, решая проблему повторяемости и консистентности ответов. Это дико полезная фича, когда нужна строгая форма вывода, скажем, для заполнения таблиц.

Вот вам кастомный скилл для Claude Opus 5, который буквально заставляет модель лишний раз подумать перед предсказанием в ARC AGI 3 и всё. В итоге, модель улетела с 30% до чистых 100%, что уже лучше кожаных, при этом используя ~вдвое меньшее количество шагов.

Никакого читерства в виде правил датасета внутри скилла нет. В тул-колл тупо зашит жесткий логический блок. Если модель не рассуждает перед ответом и не пытается предугадать следующий шаг, заполняя соответствующие ячейки, предсказание отправляется на доработку. Ну, а в остальном базовые инструкции.

С одной стороны RL вроде как убил классический промпт-инжиниринг, а теперь на его месте уже плотно закрепился скилл-инжиниринг, лол.

ARC Skill

@ai_newz

#AI#machine learning#skills#ARC AGI#Claude Opus

Want to try AI?

Compare the best neural networks in one place — for free

Go to neural networks
Share:
Источник: @ai_newz

Related News

Slack is launching collaborative vibe-coding channelsProgramming

Slack is launching collaborative vibe-coding channels

Slack запускает новые каналы для совместного кодирования, позволяя командам работать с AI-агентами без необходимости переключаться между различными инструментами. В рамках запуска Slack Code пользователи смогут создавать открытые каналы для конкретных проектов, а также использовать функции для сравнения изменений в коде и предварительного просмотра HTML-вывода перед публикацией.

9h ago1
AI
Programming

Группа Rubytech протестировала российские LLM на китайских GPU

Группа Rubytech протестировала российские языковые модели (LLM) на китайских графических процессорах (GPU). Исследование направлено на оценку производительности и эффективности российских технологий в условиях использования оборудования из Китая. Результаты тестирования могут повлиять на дальнейшее развитие ИТ-инфраструктуры в России.

10h ago4
🤯 Стэнфорд научил ИИ-агентов проверять самих себя

Исследователи из Стэнфорда предложили LLM-as-a-VProgramming

🤯 Стэнфорд научил ИИ-агентов проверять самих себя Исследователи из Стэнфорда предложили LLM-as-a-V

Исследователи из Стэнфорда разработали метод LLM-as-a-Verifier, который позволяет ИИ-агентам самостоятельно проверять свои решения, улучшая их эффективность без необходимости дообучения. В тестах на Terminal-Bench 2.1 новый подход увеличил точность DeepSeek V4 Flash с 79% до 88%, при этом оказавшись в 11 раз дешевле. Фреймворк доступен бесплатно и с открытым кодом.

1d ago8