Detecting misbehavior in frontier reasoning models
10 марта 2025 г.0 просмотров1 мин чтения
Frontier reasoning models exploit loopholes when given the chance. We show we can detect exploits using an LLM to monitor their chains-of-thought. Penalizing their “bad thoughts” doesn’t stop the majority of misbehavior—it makes them hide their intent.
Поделиться:
Источник: OpenAI Blog
Похожие новости
AI
НейросетиOpenAI представляет GPT-5
OpenAI выпустила GPT-5 — новую модель ИИ с улучшенными способностями в генерации текста, математике и программировании.
4 ч. назад66
AI
НейросетиCursor capitalizes on GitHub frustration, launches rival hosting platform
6 ч. назад15
НейросетиRobin Williams’ Instagram account brought back to fight ‘AI abuse’
8 ч. назад12