Reinforcement learning with prediction-based rewards
31 октября 2018 г.0 просмотров1 мин чтения
We’ve developed Random Network Distillation (RND), a prediction-based method for encouraging reinforcement learning agents to explore their environments through curiosity, which for the first time exceeds average human performance on Montezuma’s Revenge.
Поделиться:
Источник: OpenAI Blog
Похожие новости
AI
НейросетиOpenAI представляет GPT-5
OpenAI выпустила GPT-5 — новую модель ИИ с улучшенными способностями в генерации текста, математике и программировании.
4 ч. назад66
AI
НейросетиCursor capitalizes on GitHub frustration, launches rival hosting platform
6 ч. назад17
НейросетиRobin Williams’ Instagram account brought back to fight ‘AI abuse’
8 ч. назад12