今日头条技术架构分析
点击蓝色“架构文摘”关注我哟
加个“星标”,每天上午 09:25,干货推送!
来源:csdn.net/mucaoyx/article/details/84498468
今日头条创立于2012年3月,到目前仅4年时间。从十几个工程师开始研发,到上百人,再到200余人。产品线由内涵段子,到今日头条,今日特卖,今日电影等产品线。
一、 产品背景
今日头条是为用户提供个性化资讯客户端。下面就和大家分享一下当前今日头条的数据(据内部与公开数据综合):
5亿注册用户
2014年5月1.5亿,2015年5月3亿,2016年5月份为5亿。几乎为成倍增长。
日活4800万用户
2014年为1000万日活,2015年为3000万日活。
日均5亿PV
5亿文章浏览,视频为1亿。页面请求量超过30亿次。
用户停留时长超过65分钟以上
1、文章抓取与分析
我们日常产生原创新闻在1万篇左右,包括各大新闻网站和地方站,另外还有一些小说,博客等文章。这些对于工程师来讲,写个Crawler并非困难的事。
接下来,今日头条会用人工方式对敏感文章进行审核过滤。此外,今日头条头条号目前也有为数不少的原创文章加入到了内容遴选队列中。
接下来我们会对文章进行文本分析,比如分类,标签、主题抽取,按文章或新闻所在地区,热度,权重等计算。
2、用户建模
当用户开始使用今日头条后,对用户动作的日志进行实时分析。使用的工具如下:
- Scribe
- Flume
- Kafka
我们对用户的兴趣进行挖掘,会对用户的每个动作进行学习。主要使用:
- Hadoop
- Storm
产生的用户模型数据和大部分架构一样,保存在MySQL/MongoDB(读写分离)以及Memcache/Redis中。
随着用户量的不断扩展大,用户模型处理的机器集群数量较大。2015年前为7000台左右。其中,用户推荐模型包括以下维度:
1 用户订阅
2 标签
3 部分文章打散推送
此时,需要每时每刻做推荐。
3、新用户的“冷启动”
日头条会通过用户使用的手机,操作系统,版本等“识别”。另外,比如用户通过社交帐号登录,如新浪微博,头条会对其好友,粉丝,微博内容及转发、评论等维度进行对用户做初步“画像”。
分析用户的主要参数如下:
- 关注、粉丝关系
- 关系
- 用户标签
除了手机硬件,今日头条还会对用户安装的APP进行分析。例如机型和APP结合分析,用小米,用三星的和用苹果的不同,另外还有用户浏览器的书签。头条会实时捕捉用户对APP频道的动作。另外还包括用户订阅的频道,比如电影,段子,商品等。
4、推荐系统
推荐系统,也称推荐引擎。它是今日头条技术架构的核心部分。包括自动推荐与半自动推荐系统两种类型:
1 自动推荐系统
- 自动候选
- 自动匹配用户,如用户地址定位,抽取用户信息
- 自动生成推送任务
这时需要高效率,大并发的推送系统,上亿的用户都要收到。
2 半自动推荐系统
- 自动选择候选文章
- 根据用户站内外动作
头条的频道,在技术侧划分的包括分类频道、兴趣标签频道、关键词频道、文本分析等,这些都分成相对独立的开发团队。目前已经有300+个分类器,仍在不断增加新的用户模型,原来的用户模型不用撤消,仍然发挥作用。
在还没有推出头条号时,内容主要是抓取其它平台的文章,然后去重,一年几百万级,并不太大。主要是用户动作日志收集,兴趣收集,用户模型收集。
资讯App的技术指标,比如屏幕滑动,用户是不是对一篇都看完,停留时间等都需要我们特别关注
5、数据存储
今日头条使用MySQL或Mongo持久化存储+Memched(Redis),分了很多库(一个大内存库),亦尝试使用了SSD的产品。
今日头条的图片存储,直接放在数据库中,分布式保存文件,读取的时候采用CDN。
6、消息推送
消息推送,对于用户: 及时获取信息。对运营来讲,能够 提⾼⽤用户活跃度。比如在今日头条推送后能够提升20%左右的DAU,如果没有推送,会影响10%左右 DAU(2015年数据)。
推送后要关注的ROI:点击率,点击量。能够监测到App卸载和推送禁用数量。
今日头条推送的主要内容包括突发与热点咨讯,有人评论回复,站外好友注册加入。
在头条,推送也是个性化:
- 频率个性化
- 内容个性化
- 地域
- 兴趣
比如:
按照城市:辽宁朝阳发生的某个新闻事件,发给朝阳本地的用户。
按照兴趣:比如京东收购一号店,发给互联网兴趣的用户。
推送平台的工具和选择,需要具备如下的标准:
- 通道,首先速度要快,但是要可控,可靠,并且节省资源
- 推送的速度要快,有不同维度的策略支持,可跟踪,开发接口要友好
- 推送运营的后台,反馈也要快,包括时效性,热度,工具操作方便
- 对于运营侧,清晰是否确定推荐,包括推送的文案处理
因此,推送后台应该提供日报,完整的数据后台,提供A/B Test方案支持。
推送系统一部分使用自有IDC,在发送量特别大,消耗带宽较严重。可以使用类似阿里云的服务,可有效节省成本。
二、今日头条系统架构
三、头条微服务架构
今日头条通过拆分子系统,大的应用拆成小应用,抽象通用层做代码复用。
系统的分层比较典型。重点在基础设施,希望通过基础设施提高快速迭代、容灾和一系列的工作,希望各个业务团队能更快做业务上的迭代以及架构上的调整。
四、今日头条的虚拟化PaaS平台规划
通过三层实现,通过 PaaS 平台统一管理。提供通用 SaaS 服务,同时提供通用的 App 执行引擎。最底层是 IaaS 层。
IaaS 管理所有的机器,把公有云整合起来,头条有一些热点事件会全国推广推送,对网络带宽比较高,我们借助公有云,需要哪一种类型计算资源,统一抽象起来。基础设施结合服务化的思路,比如日志,监控等等功能,业务不需要关注细节就可以享受到基础设施提供的能力。
五、总结
今日头条重要的部分在于:
数据生成与采集
数据传输。Kafka做消息总线连接在线和离线系统。
数据入库。数据仓库、ETL(抽取转换加载)
数据计算。数据仓库中的数据表如何能被高效的查询很关键,因为这会直接关系到数据分析的效率。常见的查询引擎可以归到三个模式中,Batch 类、MPP 类、Cube 类,头条在 3 种模式上都有所应用。
end
往期推荐
推荐一个Nginx 可视化配置神器
微信小程序商城项目(Java版),拿去毕设又省2千块
高级程序员必知的 7 种软件架构模式!
【震惊】小伙在公司用了个insert into select 居然被开除了。。。
主流微服务全链路监控系统之战
关注公众号《Java派》
回复 1027 获取三本 DDD领域驱动设计 电子书
如有收获,点个在看,诚挚感谢
今日头条技术架构分析相关推荐
- 今日头条技术架构分析,看这篇就对了!
点击上方 "程序员小乐"关注, 星标或置顶一起成长 每天凌晨00点00分, 第一时间与你相约 每日英文 Anywhere, it is a good in the past, re ...
- 今日头条技术架构千字分析,
点击"开发者技术前线",选择"星标????" 让一部分开发者看到未来 今日头条创立于2012年3月,到目前仅4年时间.从十几个工程师开始研发,到上百人,再到 ...
- 今日头条技术架构到底有多牛?
链接:https://blog.csdn.net/mucaoyx/article/details/84498468 今日头条创立于2012年3月,到目前仅4年时间.从十几个工程师开始研发,到上百人 ...
- 结合今日头条技术架构浅谈Java后台开发一些经验 - 立哥技术
- 剑气纵横三万里,一剑光寒九百州 前言:Java语言开发的后台系统(VUE架构),整合Swagger API,相较其他框架结构,有着语言简单,配置方便,轻量化,结构安全稳定的优点.今日头条在这3-5 ...
- 今日头条技术架构到底有多牛
????????关注后回复 "进群" ,拉你进程序员交流群???????? 专业拧螺丝-钟镇刚 链接: https://blog.csdn.net/mucaoyx/article/ ...
- python爬虫今日头条_python爬虫—分析Ajax请求对json文件爬取今日头条街拍美图
python爬虫-分析Ajax请求对json文件爬取今日头条街拍美图 前言 本次抓取目标是今日头条的街拍美图,爬取完成之后,将每组图片下载到本地并保存到不同文件夹下.下面通过抓取今日头条街拍美图讲解一 ...
- 技术架构分析:攻克Dota2的OpenAI-Five
来源:CreateAMind 摘要:OpenAI昨日发布研究成果,宣布Dota2 5v5在限定条件下(英雄阵容固定,部分道具和功能禁用)战胜人类半职业选手.本文主要对其模型技术架构做一些分析总结. 一 ...
- 新浪微博技术架构分析-微博首席架构师杨卫华
新浪科技讯 11月16日下午消息,由新浪微博主办的中国首届微博开发者大会在北京举行,这是国内微博行业的首场技术盛宴.作为国内微博市场的绝对领军者,新浪微博将在此次大会上公布一系列针对开发者的扶持政策, ...
- 微博首席架构师杨卫华:新浪微博技术架构分析和InfoQ访谈
演讲实录 新浪科技讯 11月16日下午消息,由新浪微博主办的中国首届微博开发者大会在北京举行,这是国内微博行业的首场技术盛宴.作为国内微博市场的绝对领军者,新浪微博将在此次大会上公布一系列针对开发者的 ...
- 新浪微博技术架构分析和设计
第一部分:新浪微博技术架构 新浪微博在2014年3月公布的月活跃用户(MAU)已经达到1.43亿,2014年新年第一分钟发送的微博达808298条,如此巨大的用户规模和业务量,需要高可用(HA).高并 ...
最新文章
- wp———跳转系统设置页面的wifi、网络连接、蓝牙、飞行模式等
- Docker容器学习梳理--日常操作总结
- mysql卸载安装视频_MYSQL安装与卸载(一)
- eclipse下tomcat临时目录位置
- BN处理较深的神经网络
- PHPstrom的Disable Power Save Mode
- ADXL362 初次使用总结(使用stm32 HAL 库)
- 黄杏元《地理信息系统概论》考研复习考点精讲(一)
- Silverlight IReader阅读器第二版
- {ResponseInfo:com.qiniu.http.Response@144f47b,status:401, reqId:uwcAAKdVRC2bnUoV, xlog:UP/401, xvia:
- 朱晔的互联网架构实践心得S2E7:漫谈平台架构的工作(基础架构、基础服务、基础平台、基础中间件等等)
- 人脸识别+表情识别系统
- Sql Server Update 更新数据
- Illegal group reference:非法组引用异常
- 磁共振检查头部能检测出什么_头部核磁共振可以检查什么?
- 3dsmax2022版本找不到漫反射和环境光解决
- websphere 实用_将WebSphere Cast Iron Studio PGP活动与外部PGP实用程序一起使用
- linux文件权限3代表啥,3,LINUX文件属性详述
- Qt 之 模仿 QQ登陆界面——旋转窗口篇
- 废弃CSDN博客声明
热门文章
- php kindeditor远程图片上传,KindEditor远程跨域上传的实现
- 计算机aero背景黑,win7系统如何打开和关闭Aero特效
- 凤凰服务器系统,凤凰系统云服务器
- XLINUX-FPGA开发-基础篇-数电-门电路
- Scala基本类型及操作、程序控制结构
- 一套完整仿拉勾网HTML静态网页模板(含38个独立HTML)
- oracle计算金融函数,ORACLE EXTRACT函数
- 谷歌邮箱登录服务器设置
- linux pt远程下载,Linux中使用Transmission下载BT/PT[zz]
- 网吧如何修改dns服务器地址,网吧更改dns服务器地址