[2/2] John Carmack Reveals AGI Future: Robots, Videogames and AI Agents... (Рубрика AI)
Продолжая рассказ о выступлении Джона, надо рассказать про существущие бенчмарки и новые предложенные.
1. Atari 200 M (классика DeepMind) Существующие подходы дают сверхчеловеческий уровень при "месяце экранного времени", то есть бенч уже "почти решён" и нужен следующий шаг 2. Atari 100 K Цель научиться максимум за 2 часа игрового опыта. Альгоритмы вроде BBF/EfficientZero дают прогресс, но чувствительны к задержкам изображения и действий 3. Sequential Atari Catastrophic Forgetting Суть в последовательном освоении 50+ игр без потери навыков. Работает пока не очень (кстати, запрещено прокидывать "task-id", чтобы не читерить) 4. Real-Time Atari via Robotroller Суть в устойчивости по latency и работе "по пикселям" на реальном железе. В итоге, получается ~180 мс лаг от камеры до действия; оценка по фронтальной камере и OCR-cчёту (внутри игры) 5. Unbounded Video Wall (проект на будущее) Исследование, ведомое любопытством в смеси пассивного и активного контента. Тут нет внешнего "эпизода" и чёткого финального счёта Все свои тесты Кармак называет "открытыми", потому что код и оборудование Keen Technologies планирует выкладывать в open-source, чтобы сообщество могло воспроизводить и улучшать результаты.
Если подводить итоги, то
- AGI ≠ просто более крупные LLM. Нужен агент, который учится на лету, не забывает старое и действует в реальном времени.
- Игры остаются лучшим "физически безопасным" мостом между симуляцией и реальным миром, но метрики должны поощрять скорость обучения и устойчивость к задержкам, а не только итоговый счёт.
- Главный вызов - методический. Чтобы избежать узкоспециализированных "трюков", Кармак предлагает жёсткие, но реплицируемые бенчмарки и "встроенную" защиту от читерства
По словам Кармака, прогресс в этих направлениях покажет, как далеко мы на самом деле от AGI и даст более честную картину того, как двигаться в его сторону.
#AI #AGI #ML #Software #Engineering #Architecture