加入「公开课」交流群,获取更多学习资料、课程及热招岗位等信息

作者 | Josh Feast

翻译 | 王子龙

校对 | 王琦

本文阐述导致AI偏见的原因并提出应用的解决方案。

任何对AI偏见的审查都需要意识到一个事实:这些偏见主要源于人类固有的偏见。我们创建、训练的模型和系统就是我们人类自己的真实写照。

 

因此AI从人类那里学习到了性别偏见也就不足为奇了。例如,亚马逊的Alexa和苹果的Siri等常见AI系统的核心—自然语言处理(natural language processing, NLP)就存在性别偏见,而这并不是孤例。此前还发生了几起明显带有性别偏见色彩的案例,包括能够识别性别的计算机视觉系统,其在识别女性时报告的错误率更高,尤其是对于那些肤色较深的女性。

为了开发出更公平的技术,整个行业的研究人员和机器学习团队必须共同努力来纠正这种不平衡。幸运的是,我们开始看到有新的研究致力于解决这些问题。

其中需要特别提到的是目前正在进行的关于词嵌入(Word-embeddings)的偏见研究,词嵌入将词转换为数字表示,然后在自然语言处理模型中用作输入。词嵌入将词表示为序列或数字向量,如果两个词意思相近,它们的映射(associated embedding)在数学意义上也是相近的。词嵌入通过评估单词出现的上下文来编码信息。例如,AI能够客观地把“女王”一词填充到“男人是国王,女人是X”这句话中的X处。但当AI填写“父亲是医生,母亲是护士”这样的句子时,就会引起潜在的问题。这句话中固有的性别偏见反映了我们社会中对妇女的过时看法,这种看法既没有事实根据,也不平等。

很少有研究对情感相关的演讲中的性别偏见进行评估,而情感AI在未来的工作、营销以及几乎所有你能想到的行业中开始扮演更重要的角色。在人类社会中,当一个人对某一类人情感的误解多于另一类时,偏见就会产生。例如,错误地认为某一类人比另一类人更容易生气。目前的机器也有同样的偏见,它们将与情感相关的信息错误地分类。要理解为什么会这样,以及我们如何解决这个问题,先去了解造成AI偏见的原因就显得重要了。

什么导致了AI偏见?

在机器学习的背景下,偏见可能意味着某些人口统计类别的误差更大。因为找不到这种偏见的根源,所以在开发和训练机器学习模型时,研究人员必须考虑许多变量,包括以下因素:

  • 不完整的或偏斜的训练数据集:当训练数据中缺少某种人口统计类别时,就会出现这种情况。在那些有缺失人口统计类别的新数据上使用这些数据训练的模型时,则不能正确地衡量。例如,如果女性演讲者只占你训练数据的10%,那么当你将一个训练过的机器学习模型应用于女性时,很可能会产生更高程度的误差。

  • 训练模型所用的标签:绝大多数商业AI系统使用有监督机器学习,这意味着训练数据是被打上标签的,标签用来训练模型如何作出反应。通常情况下,这些标签是人类想出的,考虑到人们经常表现出偏见(既有有意识的,也有无意识的),这些偏见会无意地编码到由此产生的机器学习模型中。考虑到机器学习模型被训练出来用于估计这些标签,这种对特定性别不公平的分类将被编码到模型,这会导致偏见。

  • 特征和建模技术:机器学习模型的输入值或者实际的模型训练过程中都可能因为测量而产生偏见。例如,几十年来,语音合成,即把文本转换为语音的技术(例如:斯蒂芬·霍金的声音)和自动语音识别,即把语音转换为文本的技术(例如:CC字幕)都有该情况发生。与男性相比,女性演讲者的表现不佳,这是由于对演讲者的分析和建模对于声带较长、音调较低、个子较高的人来说更准确。因此,语音技术对于具有这些特征的演讲者(通常是男性)来说是最准确的,而对于那些音调较高的演讲者(通常是女性)来说就不那么准确了。

机器学习团队避免性别偏见的四个最佳解决方案

和生活中的许多事情一样,AI偏见的原因和解决方案并不是非黑即白的。“公平”本身甚至也必须通过量化来减轻偏见所带来的不必要影响。对于那些想要利用AI的力量,但又担心产生偏见的管理者来说,落实下面的方法对于你的机器学习团队很重要。

  • 确保训练样本的多样性(例如,在训练数据中使用与男性差不多数量的女性音频样本)。

  • 确保给音频打标签的人们有着多元化的背景。

  • 针对不同人口统计类别,鼓励机器学习团队分别评估模型的准确程度。并且当某个类别被不公平地对待时要能识别得出来。

  • 通过收集更多与敏感群体相关的训练数据来解决不公平的问题。在此基础上,可以应用新的机器学习去除偏见技术,该技术不仅惩罚主要变量的识别错误,还额外惩罚造成不公平的错误。

虽然研究这些原因和解决办法是非常重要的第一步,但仍有许多悬而未决的问题需要回答。除了训练机器学习模型之外,业界还需要开发更全面的方法以解答造成上述三个主要偏见的原因。此外,为了应对日益增加的多样性,未来的研究应该考虑性别变量的更广泛表示,如跨性别者、非二元性别等,以此来增强我们对此的理解。

我们有义务创造对每个人都有效和公平的技术。我相信,如果我们能够共同解决这些问题,AI的收益将超过风险。这取决于该领域的所有从业者和领袖合作、研究和开发解决方案,以减少AI对任何人的偏见。

原文标题:

4 Ways to Address Gender Bias in AI

原文链接:

https://hbr.org/2019/11/4-ways-to-address-gender-bias-in-ai

编辑:黄继彦

扫码查看作者更多文章

▼▼▼

(*本文为AI科技大本营转载文章,转载联系原作者)

精彩公开课

推荐阅读

  • 你点的每个“在看”,我都认真当成了AI

改善AI性别偏见的4种方法 | CSDN博文精选相关推荐

  1. 独家 | 改善AI性别偏见的4种方法

    作者:Josh Feast 翻译:王子龙 校对:王琦 本文约2200字,建议阅读8分钟. 本文阐述导致AI偏见的原因并提出应用的解决方案. 图片来源:哈佛商业评论工作人员 / UNSPLASH 任何对 ...

  2. PyTorch实现L2和L1正则化的方法 | CSDN博文精选

    作者 | pan_jinquan 来源 | CSDN博文精选 目录 1.torch.optim优化器实现L2正则化 2.如何判断正则化作用了模型? 2.1未加入正则化loss和Accuracy 2.1 ...

  3. 改进AI/ML部署的5种方法

    http://blog.itpub.net/29829936/viewspace-2642581/ 2019-04-25 13:36:51 在进行任何AI/ML部署之前,组织需要将其数据科学的研究工作 ...

  4. 笔记本电池寿命 检测软件_改善Windows笔记本电脑电池寿命的6种方法

    笔记本电池寿命 检测软件 Laptop owners have a critical enemy: a drained battery. Sure, you can plug it in, but o ...

  5. 改善客户体验 (CX) 的 10 种方法

    改善企业的客户体验 (CX) 可能会对企业的底线产生重大影响.事实上,对客户体验的投资还可以降低运营成本,例如服务成本.毕竟,不满意的客户是昂贵的. 以下有关如何改善客户体验的 10 条建议: 1.  ...

  6. Facebook AML实验室负责人:将AI技术落地的N种方法(上)

    (Facebook AML实验室负责人 Joaquin Candela) 雷锋网(公众号:雷锋网)按:在Facebook,有两个实验室领导着AI发展方向,一个是Yann LeCun领导的FAIR实验室 ...

  7. 避免神经网络过拟合的5种技术(附链接) | CSDN博文精选

    作者 | Abhinav Sagar 翻译 | 陈超 校对 | 王琦 来源 | 数据派THU(ID:DatapiTHU) (*点击阅读原文,查看作者更多精彩文章) 本文介绍了5种在训练神经网络中避免过 ...

  8. 基于深度学习的低光照图像增强方法总结(2017-2019)| CSDN博文精选

    扫码参与CSDN"原力计划" 作者 | hyk_1996 来源 | CSDN博客精选 之前在做光照对于高层视觉任务的影响的相关工作,看了不少基于深度学习的低光照增强(low-lig ...

  9. 深度学习AI美颜系列——人像静态/动态贴纸特效算法实现 | CSDN博文精选

    作者 | Trent1985 来源 | CSDN博客 人像静态/动态贴纸特效几乎已经是所有图像视频处理类/直播类app的必需品了,这个功能看起来复杂,实际上很简单,本文将给大家做个详细的讲解. 我们先 ...

最新文章

  1. spring boot项目 中止运行 最常用的几种方法
  2. visual studio 多行编辑 列编辑
  3. CAP-分布式事务的解决方案
  4. CSS3盒子模型(CSS3)
  5. (转载)mysql查询今天、昨天、7天、近30天、本月、上一月数据
  6. 【渝粤教育】国家开放大学2018年秋季 2312T旅行社经营管理 参考试题
  7. Mysql查询语句使用select.. for update导致的数据库死锁分析
  8. Oracle 数据库常用操作总结一之用户的创建、删除和赋权
  9. 当xshell关闭时如何保持一个jar包程序在后台运行
  10. 愚人节将至,怎么恶搞最过瘾
  11. 怎么学习iOS,如何学习iOS开发?
  12. 车联网百家谈 | 从生物演化角度看自动驾驶发展路径
  13. 共用体union与枚举enum(C++)
  14. 天龙八部怀旧服服务器维护,新天龙八部怀旧服游戏2月4日全服更新维护公告
  15. java 处理 barCode(条形码)
  16. 看牛人如何学习JAVA-如何学习java
  17. onSubmit 使用
  18. 第三章 培养工作兴趣
  19. WF2011 Chips Challenge
  20. 关于校外访问西安电子科技大学校内图书馆资源和教务系统等的方法总结

热门文章

  1. entity framework 使用Mysql配置文件
  2. html传參中?和amp;
  3. linux 性能 管理 与 优化
  4. Nagios+pnp4nagios+rrdtool 安装配置为nagios添加自定义插件(三)
  5. 解析自动驾驶算法四大模块的问题与后续发展
  6. 数据结构 – 顺序表
  7. maven的配置-2019-4-13
  8. Linux 开机网络无法自动连接配置、网络开机自动连接
  9. 关于子业之间相互取得元素或者方法
  10. scala学习笔记-过程、lazy值和异常(6)