黑栗子 发自 凹非寺
量子位 出品 | 公众号 QbitAI



OpenAI战队在5v5刀塔比赛上打败人类,才是几天前发生的事。

如今,DeepMind为了训练AI电竞的团魂,也已把触手伸向了雷神之锤3竞技场。

DM的强化学习智能体,不止要和AI队友一起攻打人类的阵地,也要和人类队友并肩作战。



至少,在夺旗 (Capture the Flag) 比赛中,AI的胜率比人类高。

而且,这里的比赛,比原版游戏还要复杂多变

拔下对方的大旗

DeepMind团队这次选择的雷神之锤3竞技场,是款3D第一人称多人游戏,也是培育AI团战技能的好地方。

其中的夺旗游戏,两队的目标都是拔掉对方的旗子,将己方旗子守在自己的大本营。

我是蓝方,就需要标记 (Tag) 扛着蓝旗往回跑的红方敌人,我方的旗子才能失而复得。



如果红方把蓝旗搬到了他们的阵地,就不好了。所以,队友之间要紧密配合才行。

规则其实很简单,但场景的变化很复杂。

不过,DeepMind团队还想让情况更复杂一些,给AI更有 (bian) 趣 (tai) 的锻炼。

于是,夺旗游戏的地图上,发生了一些可爱的改动。

各种地图,训练有素

每场比赛之间,地图都会发生变化。这个变化,是随着比赛的进行生成的。



这样一来,智能体要学会应付,许多没有见过的新地图

DeepMind的强化学习模型,有三个要点——

· 第一,既然是团战,当然要把几只智能体扔进竞技场一起训练。

它们要学习,怎样和队友亲密互动,打击敌人。



· 第二,每个智能体要学习,它自己的奖励信号,建立自己的小目标,比如拔掉对方的旗。

优化过程是双层 (Two-Tier) 的,可以优化智能体内部的奖励,让奖励信号更直接地指向胜利

· 第三,智能体在两种节奏里面运行,一种快,一种慢,这样可以增强它们运用记忆体、生成稳定的动作套路,的能力。



神经网络的架构,称为FTW (For The Win) ,为了赢 (字母顺序不要颠倒) 。

这里,有快速慢速训练用的RNN,有一个共享存储模块,可以学习怎样把游戏中的某个,转换为相应的奖励

稳胜人类一筹

训练好的智能体,就做好了赢的准备。

面对地图大小的变化,队友数量的变化,以及敌方的变量,都表现出训练有素的样子。



这是户外地图,红蓝双方都是AI,斗争非常激烈。

室内地图,则是AI与人类选手组成的混合战队,与纯AI战队的斗争。



DeepMind这次一共动用了**40个人类加入战斗,与AI随机组队。看得出他们的比赛并不轻松。

最终的结果,人类胜率不及AI



另外,不管强大的人类,还是普通的人类,Elo评分都没有FTW那么高。

AI为什么赢?

除了看到AI拔旗比人类厉害,团队还想知道,它们是凭什么赢。

于是,就研究了AI的行为模式,观察一下它们是怎么理解比赛的。



各种颜色的点点,分别代表, 旗在阵地,队友扛走敌方大旗,自身处在敌方阵地等等。

不同战况之下,AI的反应明显不同。安全和危险,分得清清楚楚。

甚至有一些神经元,是专为某种特定境况而生的。

没有人教过AI,比赛规则是什么,但它们依然能够在训练中,产生战士的修养和自觉。



另外,团队还发现,AI的战斗力虽然是在非监督学习中炼成的,但它们也像人类一样,会跟着队友走,会在敌方阵地上玩耍,如此种种。

果然,即便再放养,AI的爸爸也还是人类吧。



加入社群

量子位AI社群18群开始招募啦,欢迎对AI感兴趣的同学,加小助手微信qbitbot8入群;

此外,量子位专业细分群(自动驾驶、CV、NLP、机器学习等)正在招募,面向正在从事相关领域的工程师及研究人员。

进群请加小助手微信号qbitbot8,并务必备注相应群的关键词~通过审核后我们将邀请进群。(专业群审核较严,敬请谅解)

实习生招聘

量子位正在招募活动运营实习生,策划执行AI明星公司CEO、高管等参与的线上/线下活动,有机会与AI行业大牛直接交流。工作地点在北京中关村。简历欢迎投递到quxin@qbitai.com

具体细节,请在量子位公众号(QbitAI)对话界面,回复“实习生”三个字。

量子位 QbitAI · 头条号签约作者

վ'ᴗ' ի 追踪AI技术和产品新动态

DeepMind新突破:雷神之锤3战场AI夺旗,团战胜率超过人类相关推荐

  1. 超越AlphaZero,DeepMind新算法MuZero登顶Nature | AI日报

    超越AlphaZero,DeepMind新算法MuZero登顶Nature 2016年,DeepMind 推出了第一个人工智能程序 AlphaGo,在围棋游戏中击败人类.两年后,它的继任者AlphaZ ...

  2. DeepMind新突破!首次用深度学习从第一性原理计算分子能量

    来源:AI科技评论 编译 | 青暮 DeepMind发表了一项新研究,展示了深度学习如何帮助解决现实系统中的量子力学基本方程问题,相关论文发表在物理学期刊<Physical Review Res ...

  3. DeepMind登上Science:“和AI相比,人类都是猪队友”,团战称霸雷神之锤3

    栗子 发自 凹非寺  量子位 报道 | 公众号 QbitAI AI组队,比人类战队的成绩好. AI与人类组队,还是远超人类. DeepMind为了训练强化学习AI的团队协作能力,选择了雷神之锤3竞技场 ...

  4. 中国AI研究新突破,周六见!

    智源悟道1.0 大规模预训练模型项目,本周六发布! 想知道我们将迎来哪些AI研究新突破? 想知道我们将回答哪些面向「通用人工智能」的新问题? 想知道智源「悟道」大规模预训练模型项目,取得了哪些崭新进展 ...

  5. 每日新闻 丨新突破:AI能提前十年预测心脏病,准确率高达90%

    点击蓝字 关注我们 更多精彩,请点击上方蓝字关注我们! 每日新闻播报 第09-05期  1 趋势洞察 工信部:2025年基本建成工业大数据体系 9月4日,工信部在其网站发布<工业大数据发展指导意 ...

  6. 百度新突破:AI同声传译系统STACL,可预测,低延迟

    文章来源:ATYUN AI平台 百度开发了新的AI系统,名为同声传译和预期与可控延迟(STACL),百度声称这代表了自然语言处理的重大突破. 与大多数AI翻译系统不同,STACL能够在演讲者讲话后几秒 ...

  7. DeepMind新成果:让AI做了200万道数学题,结果堪忧

    在这个春光明媚的周末,一部分成年人却不得不在人间历劫--辅导孩子写作业!其中,又以数学这门学科的杀伤力最为强大. 为了挽救在"抛家弃子"边缘疯狂试探的家长们,不少K12教育平台也开 ...

  8. AlphaFold2立功!清华团队用深度学习增强新冠抗体,创AI里程碑

    AlphaFold 2的问世可谓是生物学界海啸级地震,让蛋白质结构预测走上另一个新阶段.同时,AlphaFold的开创性方法也对其他研究产生深远的影响.这不,清华和MIT研究团队在最新研究中就用上了它 ...

  9. Google DeepMind顾问预言:五年后AI将在《星际争霸》中战胜人类

    在纽芬兰和拉布拉多,正在用人工智能进行<星际争霸>比赛. <星际争霸>的幽灵机器人.(来自:维基共享资源) 接下来的两个星期里,在纪念大学(Memorial Universit ...

最新文章

  1. 通过Zabbix全面监控NetScaler负载均衡设备
  2. Java核心技术笔记 语言基础
  3. 使用identity+jwt保护你的webapi(三)——refresh token
  4. 世界上最欢乐的职业,可能就是蹦极的工作人员了!
  5. VueJS实现用户管理系统
  6. 调用Interop.zkemkeeper.dll无法使用解决方案
  7. SharedPreferences的使用,android
  8. Sql JOIN 一张图说明
  9. CSS彻底研究(3) - 浮动,定位
  10. 永远的动漫,梦想在,就有远方
  11. python创建二维空列表_python创建与遍历List二维列表的方法
  12. 中兴面试题 01背包问题
  13. 进行网络数据采集时用 CSS——避免蜜罐
  14. 软件设计师第二章知识点_作为设计师,您可能会找到的最好的第二次展示
  15. 学习笔记——Exploiting Unintended Feature Leakage in Collaborative Learning(协作学习中的非预期特征泄露研究)
  16. java 组合实现汽车类 问题描述:一辆Car有(has)四个轮子(Wheels)和一个发动机(Engine)。现在要求用组合方法设计类Car、类Wheel和类Engine。
  17. Python获取股票机构调研数据
  18. 1+1为什么等于2(哥德巴赫猜想)
  19. 实现翻页或查询后保持复选框勾选状态
  20. SOPHP免费稳定的微信公众号开源框架

热门文章

  1. 浙江省计算机数据库三级报名,浙江省计算机等级考试三级数据库技术
  2. 字节跳动面试:java后端面试宝典
  3. java需求分析和设计,附面试题
  4. 第 14 章 程序员常用 10 种算法
  5. 第 16 章 模板方法模式
  6. mendeley 笔记_免费文献管理器 Mendeley,其实比你想象的好用!
  7. form:errors path 不显示出错信息_视觉激光雷达信息融合与联合标定
  8. mysql 卡住_一次sql卡住的解决过程(mysql)
  9. python中prime_在AP中查找第一个元素,该元素是Python中给定Prime的倍数
  10. mac mysql sequel_苹果系统Sequel Pro—MySQL客户端工具一个大坑