新华智云基于MaxCompute建设媒体大数据开放平台

摘要:随着自媒体的发展,传统媒体面临着巨大的压力和挑战,新华智云运用大数据和人工智能技术,致力于为媒体行业赋能。通过媒体大数据开放平台,将媒体行业全网数据汇总起来,借助平台数据处理能力和算法能力,将有价值数据内容和能力开放给用户。本文主要从新华智云数芯平台,媒体行业数据特征,批流处理数据架构,以及通用的媒体大数据平台能力等几个方面介绍了如何基于MaxCompute做媒体大数据开放平台建设。

演讲嘉宾简介:
李金波,新华智云首席数据官。负责阿里巴巴大数据通用计算平台MaxCompute(原ODPS)框架架构。对高可用分布式系统设计开发有多年经验。先后研发过阿里巴巴机器学习平台在线预测系统和通用大数据计算平台框架系统。

本次直播视频精彩回顾,戳这里!https://yq.aliyun.com/live/796
以下内容根据演讲嘉宾视频分享整理而成。

本次的分享主要围绕以下五个方面:

一、关于新华智云
二、数芯-媒体大数据开放平台
三、媒体大数据平台能力
四、Project依赖
五、几点小提示


一、关于新华智云

新华智云是新华社与阿里巴巴合资成立的一家公司,主要面向运用大数据和人工智能技术,致力于为媒体行业赋能。随着自媒体的发展,自媒体公司非常的火热,如今日头条,抖音等。对传统媒体来说,面临着巨大的压力和挑战。传统媒体急切的希望互联网的技术帮助他们赋能。

媒体大脑-数芯

媒体大脑是新华智云底层的产品品牌,数芯是媒体大脑基础的数据平台。数芯定位为媒体大数据开放平台,平台中包含了媒体行业所依赖的各种各样的数据。数芯希望通过平台本身的数据处理能力和算法加工,将挖掘的有价值数据内容和能力开放给上层用户。目前,数芯包含了各种各样的数据,涵盖了400多万互联网站点,主要以中文站点为主,日增7千万文章,包含微信公众号,微博账号,图片以及多媒体来源等。将不同来源存储在平台中,之后对接数据,进行更多的加工和运用。“数据已经不再是一种成本,而是成为一种生产资料”,这句话在媒体行业更能够有所感受。一篇新闻除了是新闻之外,还是一条数据,同时新闻本身又会衍化产生新闻。很多媒体公司利用互联网技术获得大量的新闻内容之后,辅助他们新闻的生成过程。数芯会将媒体数据从不同的源头,不同供应商,以不同内容格式存储到平台中,进行数据清洗,结构化,加工等等一系列的操作之后,生成有价值的内容。如,这段时间之内媒体关注的热点,互联网上发生的事件,同时识别新闻和机构之间的关系,基于实体将各个渠道上的数据整合起来,为用户提供统一的视图。用户可以看到信息的发酵过程,以及信息在什么地方传播。

二、数芯-媒体大数据开放平台

数芯是一个开放的大数据平台,开放的点主要有三个方面。第一,数据的开放。任何数据进到数芯之后,都会在整个大数据处理的链条中做计算,内容结构化,加入标签。同时基于用户感兴趣的数据范围,做标签的特征过滤,筛选用户想要的数据。数芯帮助用户了解互联上的信息,了解互联网上与自身相关的事件。第二,数芯提供智能能力的开放。用户不管怎么努力,不可能获取到互联网上所有的数据;而且不可能每个公司都会自建内容大数据平台,做数据分析,也不可能都配备算法工程师;而且公司的数据处理能力也不是足够强;媒体大数据平台可以帮助用户将与他们有关的数据加工好,通过算法能力获得用户关心的信息。如用户提供一个文章,数芯可以反馈这篇文章与谁相关,相同的文章在什么地方传播,文章由谁编写,发在什么地方等等信息。通过开放算法能力,帮助用户做数据能力和算法能力的应用,提供文本反垃圾服务,互联网内容结构化服务,文本内容实体识别服务,文本去重判定服务,图像人物识别服务和图像标签化服务等等。第三,产品能力的开发,包含舆情监测能力,版权检测,传播分析等能力。

媒体数据特征

媒体大数据有三大特征,第一,媒体数据是非结构化性非常强。与传统行业数仓最大的区别是媒体行业90%以上数据都是非结构化的,如文本,图片,视频等等。第二,数据来源多样性。媒体行业数据有多种外部的数据源,它们有不同的数据提供的方式,提供不同的数据能力。所以必须要有强大的数据汇总能力才能将所有数据汇总在一起并服务好下游客户。另外,数据效性要求非常高。媒体行业天然追逐新闻热点,假如知道一个事件是潜在的热点,媒体希望第一时间对热点进行追踪,报道和解读。媒体机构希望通过数芯平台,能够最快的发现互联网上发生的事情,发现热点之后以最快的方式,将结构化后的数据给到用户。

批流处理结合

基于媒体行业数据的特征,数芯平台采取批,流结合的方式解决目前客户和业务场景对数据的要求。批指的是大量的计算,基于平台特征完成复杂的模型,算法训练,长周期计算,文本实体识别,文本挖掘,借助批量的能力解决数据更深度,更大规模的加工。流指的是流式的计算,完成数据的清洗,结构化,轻计算和实时统计。出来一篇新闻,在整个新闻流传的过程中实时的将信息处理好。目前数芯整体的流计算大概需要300毫秒,即一篇新闻从源头过来,存储到平台,服务化出去中间需要经过300毫秒的时间。

批流结合的数据架构

数据从不同数据源过来,如API,OTS,ROS,log,file等,一方面数据要在实时计算当中做URL去重,正文结构化,标记来源,垃圾识别,实体识别和轻度的实时统计。另外基于MaxCompute,利用DataHub将数据存储在批处理平台中,由于流计算本身不做持久化存储,所以所有数据都将存储在MaxCompute上。数据存储之后做主题建设,关系挖掘,知识图谱计算,算法训练。通过批流结合的的处理方式能够满足客户对数据本身能力的需要。之后,给用户提供搜索能力,大屏能力和BI能力等。


三、媒体大数据平台能力

内容结构化

人们在网页当中看到一篇新闻,而在数据库当中新闻是按字段存储的。比如,分为新闻标题,发布网站,时间,新闻来源,情感等等。平台需要将新闻信息进行结构化,成为后续计算过程需要依赖的数据结构化字段。

主题构建

媒体行业会分主题建设数据。平台会获取到不同的数据源,不同类型的数据。这些数据不可能完全的结合在一起,数芯平台会将所有数据分门别类的分成不同主题,按不同主题建设,存放和加工。媒体是一个非常复杂的行业,对各个行业的数据都是有所诉求,媒体需要挖掘很多不同行业的数据支撑新闻生产和报道。目前,数芯集中在媒体内在的数据,体育,金融,气象等几个主题。数芯一方面将不同的数据源汇总到平台当中,另一方面数据进来之后,挖掘潜在的新闻点,生成选题策划,帮助用户做选题等等工作。

实体识别

实体识别对于媒体大数据来说是最基础的能力。数芯目前积累的实体围绕人,机构,地点等三类数据。新闻行业,媒体行业会围绕某一个实体,关注与实体相关的数据能力。比如,很多公司会关注和自己相关的咨询,关心这些新闻是正面还是负面,哪些机构会发正面的信息,哪些机构会发负面的信息等。只有当将大批量的数据汇集起来之后,才能做相关内容的分析。实体识别场景在媒体大数据领域是非常基础的能力,首先,建立实体库。同时,当有一篇新闻产生,数芯需要实时的识别新闻与哪些人,机构和地点相关。另外,数芯需要汇集实体之间关系,做实体关系图谱。比如,很多品牌会瞄准自己的竞争对手,调整品牌战略,实体关系图谱对很多公司品牌运营的推广有很大的帮助。

情感分析

情感分析也是媒体大数据平台中比较通用的能力,当一篇新闻出来之后,用户需要知道是情感上褒义还是贬义。信息数量少的信息可以人工判断,但是如果每天有上千篇,上完篇的内容就无法通过人工来判断。媒体行业的情感分析与学术上的情感分析有差异。目前,自媒体出来之后短文本的内容越来越多。短文本的情感分析和长文本的情感分析不同,以往都是采用同一个算法实现情感分析,但发现效果并不好。现在,数芯将情感分析场景分开,微博短文本的情感分析用Word2vec+LSTM,新闻类的长文本的情感分析用Word2vec+CNN+RNN。分开之后发现每一类情感分析的效果都有所提升。

内容去重

内容去重是媒体大数据平台非常重要的一部分。去重能力是对于常见的新闻摘录,编辑,删减有准确的判重能力。一篇新闻并不是只由一个人写,它会被很多机构和渠道所转发。如何知道一篇新闻在哪些渠道被转发,其实就是通过去重的方式实现的。通过从大量的渠道汇集数据后,平台需要比对一篇新闻与之前哪篇新闻相似,通过相似度的比对得到结果。最早的时候,去重是基于关键词进行比对,数芯采取关键词和语义,两种方式比对,去重效果明显提升。内容去重可以用于新闻的热度计算,新闻数据顾虑清洗,文章版权追踪等业务场景。

内容标签化

搜索引擎可以用来搜索新闻,通过关键词和文章的匹配度来决定这篇内容是否推荐给用户。但纯搜索的方式已经满足不了用户家的需求。今日头条之所以成功,是因为它基于新闻和用户的习惯推荐内容。内容标签化就是通过机器的方式理解新闻,理解新闻与哪些信息相关,基于文本挖掘的手段,实现对于全网采集的内容数据进行分类打标。

四、Project依赖

很多时候,使用大数据平台要不要分项目都是一个很难的抉择。不分项目的好处是开发人员都在同一个平台工作,互相之间不需要太多的授权,整体工作效率会比较高。分项目的好处是利用不同平台做不同的业务会更清晰,更具条理性。数芯在开始使用MaxCompute时,便采取分项目方式,其考虑的原因有以下三点。首先,分项目可以区分业务优先级,避免低优先级任务影响高优先级的数据产出。另外,可以区分资源消耗型,避免出现高资源消耗任务整体影响数据产出。还有区分内外服务,避免内部服务互相交叉影响。总体上,分项目可以为数据产出的稳定性提供很好的保障。

五、几点小提示

首先,由于媒体行业大部分数据都是非结构化的数据,会造成对单字段的容量要求比较大的问题。而且不同的平台和传输工具对于数据的字段大小的限制不同。在从不同平台做数据传输时,尤其需要关注这个问题。
第二,能用UDF解决的问题,不要使用MR。使用UDF可以提高开发和运维的效率。即尽量用简单的表达式处理逻辑,这对整体数据产出稳定性有好处。
第三,对查询效率要求不高的数据报表可以直连MaxCompute,减少中间环节。如此可以大大减少数据转换和数据维护成本。
第四,Datahub一方面可以接数据源,另外还可以较好的串联批,流之间的计算流程,保持数据一致性和形成依赖。
第五,合理设计批,流的数据处理分工,减少重复计算。
第六,媒体大数据经常需要运用不同的算法,PAI可以帮助解决很多算法问题,减少开发的工作量,提高数据处理的效率。

欢迎对大数据计算技术感兴趣的开发者一起加入“MaxCompute开发者社区”,钉钉群号11782920,或扫下方二维码。

image


媒体大脑强势来袭,新华智云热烈期盼同行者加入,共同战未来!加入我们请戳链接:http://www.xinhuazhiyun.com/join

原文链接
本文为云栖社区原创内容,未经允许不得转载。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/516685.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

docker Gitlab14.5.0 初始化账号以及密码是什么呢?

文章目录1. 进入容器2. 进入bin目录3. 执行命令4. 执行命令5. 修改密码6. 确认密码7. 保存修改8. 操作记录(全)9. 操作截图(全)这时,gitlab已经跑起来了,通过浏览器能正常访问了,那么问题来了&a…

坦白讲!90%的数据分析师都不合格!!

你还要在家待多久,之前托人给你找的工作你也不去,你到底想干什么呀!”大明的女友又开始了每日的说教,大明漠然的关上了门,隔绝了声音。大明是一名技术开发工程师,不知道这是第几次和女友的争吵了&#xff0…

“新基建”提速,工业互联网大数据发展迎新机遇

云栖号资讯:【点击查看更多行业资讯】 在这里您可以找到不同行业的第一手的上云资讯,还在等什么,快来! 近期,中央政治局密集召开会议研究新冠肺炎疫情防控工作,部署统筹做好疫情防控和经济社会发展工作&…

MQ java.lang.OutOfMemoryError: unable to create new native thread

文章目录1. 问题现象2. 分析定位3. 解决方案4. 结果验证5. 总结1. 问题现象 java.lang.OutOfMemoryError: unable to create new native thread 2. 分析定位 生产上所有程序都是在jboss账户下运行,于是查看该账户下所有的线程数总和为950,也即是说&am…

多所高校内使用AI监控并追踪学生行为惹争议!

云栖号资讯:【点击查看更多行业资讯】 在这里您可以找到不同行业的第一手的上云资讯,还在等什么,快来! 据华尔街日报报道,在美国各地大学校园之中,越来越多的技术开始用于集中监视、追踪和管理学生。 学校…

Kubernetes 并非灵丹妙药...

作者 | Alex Hewson译者 | 弯月,责编 | 郑丽媛头图 | CSDN 下载自视觉中国出品 | CSDN(ID:CSDNnews)以下为译文:我经常听到有人问这样一个问题:“我们应该将自家的技术栈托管到Kubernetes上吗?”…

云栖号在线课堂—云服务器数据库快速入门特辑

目前阿里云为用户提供丰富的云服务器ECS产品,不同系列ECS之间存在较大差异,选择合适的ECS,是业务起飞的第一步!除了基础的ECS产品选型和技术揭秘,还有阿里专家分享的ECS迁云工具轻松上云最佳实践、ECS弹性伸缩最佳实践…

Docker Nacos Mysql集群

文章目录一、基础准备1. 节点总览2. 安装docker3. 安装MySQL二、节点部署2.1. 拉取镜像2.2. 节点12.3. 节点22.4. 节点32.5. 搭建完成一、基础准备 1. 节点总览 IP端口用途192.168.159.1338848mysql nacos192.168.159.1338858nacos192.168.159.1338868nacos 我这里是用一台云…

鼠标悬停 显示遮罩层

HTML部分: css部分: .smallbox {width: 100%;.card {position: relative;top: 0;left: 0;width: 224px;height: 302px;margin-right: 70px;overflow: hidden;img {width: 224px;height: 302px;margin-right: 70px;}.message {position: absolute;// bottom: 0;left: 0;right: …

AI技术的“践行者” — 云测试成为企业降本增效利器

云栖号资讯:【点击查看更多行业资讯】 在这里您可以找到不同行业的第一手的上云资讯,还在等什么,快来! 目前,人工智能技术对于加速企业数字化转型、提高信息利用效率等方面都起着重大作用。 尤其在提升社会劳动生产率…

从 Dagger 到 Hilt,谷歌为何执着于让我们用依赖注入?

来源 | 扔物线责编 | Carol文章开始之前,首先来看个视频:开始说到依赖注入,做 Android 的人都会想到一个库:Dagger;说到 Dagger,大家的反应普遍是一套三连:牛逼、高端、我才不用。又牛逼又高端&…

Directory /opt/jfrog/artifactory/var has bad permissions for user id 1030

文章目录1. 现象2. 分析定位3. 解决方案1. 现象 2. 分析定位 由于映射目录无权限导致的 3. 解决方案 ①添加--privilegedtrue ②赋予映射目录777权限 企业案例: mkdir /app/jfrog/artifactory chmod 777 /app/jfrog/artifactorydocker run --name artifactory-…

120万人同时在线考试,这么大的流量如何支撑

云栖号资讯:【点击查看更多行业资讯】 在这里您可以找到不同行业的第一手的上云资讯,还在等什么,快来! 三月原本是全国各地中小学生逐步开启新学期的日子,但这场突如其来的疫情使得1.8亿中小学生只能纷纷在家开启“停课…

异步懒加载和彻底懒加载

异步懒加载: 彻底懒加载 :

JFrog Container Registry 搭建Docker镜像仓库 (docker 版本)

文章目录1. 镜像拉取2. 创建容器3. 效果验证1. 镜像拉取 docker pull artifactory-jcr:latest2. 创建容器 docker run --name artifactory-jcr \ -d \ -v /app/jfrog/artifactory:/var/opt/jfrog/artifactory \ -p 8081:8081 -p 8082:8082 \ --privilegedtrue \ docker.bintr…

美国AI博士指出,自学Python到底能做什么

我见过市面上很多的 Python 讲解教程和书籍,他们大都这样讲 Python 的:先从 Python 的发展历史开始,介绍 Python 的基本语法规则,Python 的 list, dict, tuple 等数据结构,然后再介绍字符串处理和正则表达式&#xff0…

MySQL实战—更新过程

本文属于个人备忘录,主要是极客时间《MySQL实战45讲》学习笔记。 MySQL实战—更新过程 一条查询语句的执行过程一般是经过连接器、分析器、优化器、执行器等功能模块,最后到达存储引擎。那么更新语句又是如何执行? 和查询流程不同的是&…

系列文章:Kubernetes日志采集最佳实践

前言 上一期主要介绍Kubernetes日志输出的一些注意事项,日志输出最终的目的还是做统一的采集和分析。在Kubernetes中,日志采集和普通虚拟机的方式有很大不同,相对实现难度和部署代价也略大,但若使用恰当则比传统方式自动化程度更…

JFrog Container Registry 搭建Docker镜像仓库 (tar.gz 版本)

文章目录1. 下载安装包2. 解压3. 启动软件4. 防火墙5. 效果验证1. 下载安装包 https://www.jfrog.com/ 2. 解压 tar -zxvf jfrog-artifactory-jcr-7.27.10-linux.tar.gz3. 启动软件 前台启动 cd /app/artifactory-jcr-7.27.10/app/bin./artifactory.sh4. 防火墙 关闭防…

智领云荣登“中国大数据企业50强” | 2020大数据产业生态大会盛大召开 智领云斩获多项殊荣

近年来,我国大数据生态环境不断向好,产业发展维持高增长态势,大数据技术在与政府、企业核心业务的融合中,释放出了更多创新活力和应用潜能。 8月27日,2020(第五届)大数据产业生态大会在京隆重召…