Detecting and reducing scheming in AI models
17 сентября 2025 г.2 просмотров1 мин чтения
Apollo Research and OpenAI developed evaluations for hidden misalignment (“scheming”) and found behaviors consistent with scheming in controlled tests across frontier models. The team shared concrete examples and stress tests of an early method to reduce scheming.
Поделиться:
Источник: OpenAI Blog
Похожие новости
AI
НейросетиOpenAI представляет GPT-5
OpenAI выпустила GPT-5 — новую модель ИИ с улучшенными способностями в генерации текста, математике и программировании.
5 ч. назад66
AI
НейросетиCursor capitalizes on GitHub frustration, launches rival hosting platform
6 ч. назад19
НейросетиRobin Williams’ Instagram account brought back to fight ‘AI abuse’
9 ч. назад16