Faulty reward functions in the wild
21 декабря 2016 г.2 просмотров1 мин чтения
Reinforcement learning algorithms can break in surprising, counterintuitive ways. In this post we’ll explore one failure mode, which is where you misspecify your reward function.
Поделиться:
Источник: OpenAI Blog
Похожие новости
AI
НейросетиOpenAI представляет GPT-5
OpenAI выпустила GPT-5 — новую модель ИИ с улучшенными способностями в генерации текста, математике и программировании.
5 ч. назад66
AI
НейросетиCursor capitalizes on GitHub frustration, launches rival hosting platform
7 ч. назад19
НейросетиRobin Williams’ Instagram account brought back to fight ‘AI abuse’
9 ч. назад16