数据标注为AI发展加工“优质原料”
时间:2025-01-27 13:41:31来源:科技日报

图为广东省公共数据标注基地(清远)。 受访者供图

随着人工智能迅猛发展,高质量训练数据短缺逐渐成为制约行业进步的一大瓶颈,而数据标注产业可为人工智能创新发展提供强大动力。国家发展改革委、国家数据局、财政部、人力资源和社会保障部四部门日前联合印发的《关于促进数据标注产业高质量发展的实施意见》(以下简称《实施意见》),提出到2027年的发展目标:数据标注产业专业化、智能化及科技创新能力显著提升,产业规模大幅跃升,年均复合增长率超过20%。

我国数据标注产业现状如何?数据标注产业高质量发展还需要跨过哪些“门槛”?针对这些问题,科技日报记者进行了采访。

 原始数据变为可用资源

“通俗地说,训练人工智能大模型的过程就像老师教学生识字。”华南理工大学计算机科学与工程学院副院长张通形象地解释道,数据标注就是给数据“贴标签”或者“做记号”,需要专业人员向大模型阐释各个数据的标签及需执行的相应任务。他们“教导”大模型参与训练的数据是什么,给图像、语音、文本等各种数据“贴标签”。高质量的数据标注,有助于机器精准理解、快速学习、高效训练,显著提升大模型的准确性和泛化能力。

在训练ChatGPT时,美国开放人工智能研究中心(OpenAI)就投入了大量资源用于数据标注。为确保标注任务高质量完成,使ChatGPT能更好地理解人类指令,保障大模型的准确性与可靠性,OpenAI聘请了众多“老师”。这些“老师”涵盖一般数据标注人员和专业人士,还包括博士级别的专家。

数据标注是人工智能发展的核心基石之一。“数据标注产业是对数据进行筛选、清洗、分类、注释、标记和质量检验等加工处理的新兴产业,其核心任务是对原始数据进行加工,使之成为可用于训练人工智能大模型的优质原料。”张通介绍,数据标注作为训练大模型至关重要的一环,直接影响机器学习模型的性能,对支撑人工智能能力水平提升有重要作用。

在张通看来,未经处理的原始数据只是潜在资源,而经过标注处理后沉淀的数据,才能在市场上进行有效交易和流通,从而充分释放数据要素价值。培育壮大数据标注产业,对于提升数据供给质量、推动人工智能创新发展不可或缺。

业内人士认为,随着人工智能技术不断成熟、应用领域持续拓展,数据标注行业将迎来更广阔市场空间,尤其是在低空经济、智慧城市、自动驾驶、智慧医疗等新兴科技领域展现出巨大潜力。

 产业步入快速发展阶段

全球数据标注市场目前正处于迅速增长期。近年来,我国数据标注产业已进入快速发展阶段,产业链条不断完善,技术创新成果逐步实现市场化应用。据测算,2023年我国数据标注产业规模已达800亿元左右。

四川成都、辽宁沈阳、安徽合肥、湖南长沙等7个承担数据标注基地建设任务的城市,在大模型标注、自动化标注等领域取得重要突破。长沙信息产业园作为长沙首批数据标注基地之一,已吸引智能网联汽车、数据标注、网络安全等1万余家各类数字企业入驻,成功打造了人工智能创新中心算力服务平台。

广东积极推进数据标注训练试点和基地建设,为大模型训练提供坚实数据支撑。2023年9月,广东省公共数据标注训练试点正式启动。在广东省公共数据标注基地(清远),百度、燕湖科技、好思达等一批在自动驾驶、政务公共标注领域表现突出的企业已率先入驻。凭借龙头企业的带动作用和数字经济产业的集聚效应,清远的数据标注产业蓬勃发展。

“我们以数字经济产业为核心,与数字经济产业龙头企业紧密合作,致力于打造国家级数据标注产业集聚区和产教融合示范区。”广东省公共数据标注基地(清远)负责人李艳康介绍,落户在此的百度智能云(清远)人工智能基础数据产业基地已累计引进孵化数据标注企业5家,培育专业数据标注师超300人。未来,基地将持续培育孵化更多优秀数据标注企业,推动清远数据服务产业不断壮大发展。

复合型人才缺口仍然较大

《实施意见》的出台,将进一步提升数据供给质量,有效解决制约人工智能产业发展的高质量数据短缺问题。

值得注意的是,随着人工智能应用的不断深化,对数据标注的需求也愈发细分化和专业化。2024年7月,张通团队和广州华银康医疗集团股份有限公司在人工智能与数字经济广东省实验室(广州)共建AI病理研究中心,着手研发人工智能病理大模型,让人工智能模型能像专业医生一样看病问诊。在其中的数据预处理环节,中心特别聘请了3位资深的主任级医师进行数据标注。

“医疗、材料等专业领域,涉及到专业对象和术语结合的标注过程,只有专业从业人员才能胜任标注工作。而且,标注任务极其耗时、耗力、耗资源。整个标注工作并非一蹴而就,而是需要在实际应用场景中优化、持续迭代,促使模型智能化水平不断升级。”张通说,当前我国数据标注行业人才缺口仍然较大,亟待培养复合型数据标注人才,这是我国数据标注产业高质量发展必须跨过的“门槛”。

《实施意见》对加强标注人才队伍建设作出部署。以人才项目计划和科技项目等为抓手,培育和引进高端专业人才;制(修)定人工智能训练、数据标注相关职业国家职业标准;支持数据标注领域职业资格与职业技能等级衔接互认……一项项举措,将为数据标注产业高质量发展提供支撑。

完善的产业生态建设对数据标注行业发展同样重要。《实施意见》提出,畅通数据采集、标注、人工智能应用产业链,推动数据标注产业上下游协同发展;支持数据标注龙头企业和第三方机构等建设数据标注开源平台,助力中小企业发展;培育一批人力资源、供需对接、国际合作、法律审计等服务数据标注的第三方机构,完善数据标注产业生态。

“未来数据标注行业的发展,也可考虑‘以人工智能促人工智能’的思路,即让已经完成学习的人工智能反哺数据标注工作,提高效率。这是值得深入探讨且极具价值的研究方向。”张通认为,数据标注行业的发展有望加速推动数字经济与实体经济深度融合,加快形成新质生产力。

标签:

生活指南
  • 借TikTok拿订单、收点赞,中国制造和美景都成全球“爆款”

    中国正以更开放的姿态拥抱全球。近期,官方再度放宽优化过境免签政

  • 巨头失速、直播求变,2024年电商行业“等风来”?

    年终盘点|巨头失速、直播求变,2024年电商行业等风来?这一年电商

  • 立足新课标 赋能促成长——驻马店市第五十八小学开展教师新课程标准测试活动

    为进一步加深教师对于新课标的理解,提高学科素养和专业水平,更新教育

  • 汽车中控死机怎么解决?汽车中控台有异响怎么解决?

    汽车中控死机怎么解决?当汽车中控出现死机时,可以通过强制重启的方

  • 国家统计局:10月份规模以上工业增加值增长5.3%

    中新网11月15日电 据国家统计局网站消息,10月份,规模以上工业增

  • 四川省在全国率先完成省市县三级国土空间总体规划批复

    党中央、国务院作出多规合一改革部署以来,在省委、省政府坚强领导

  • “衣中茅台”比音勒芬,业绩正在放缓

    10月30日晚,比音勒芬发布2024年三季度财报。其中三季度,比音勒芬

  • 凝聚金融动能 农行德阳分行全力助推乡村振兴

    今年以来,农行德阳分行积极响应相关号召,选派6名金融干部投身各区

  • 双节北京接待游客1187.9万人次

    刚刚过去的2023年中秋国庆八天长假,北京市接待游客1187 9万人次,

  • 中企亮相巴黎车展凸显中欧产业合作信心

    在法国举行的第90届巴黎车展上,许多中国车企的新款智能电动汽车亮

  • 冬春航季成都天府机场将新开、加密多条国际及地区航线

    成都天府国际机场(下称天府机场)25日发布消息称,冬春航季天府机场

  • 向“新”发力,中国金融业助力赋能新质生产力

    中新网北京10月27日电 (记者 夏宾)从2024金融街论坛年会到2024年S

  • 基金转换手续费的算法是什么?基金转换和赎回哪个好?

    基金转换手续费的算法是什么?其实基金转换手续费是分为两部分的,第

  • 天天热门:把咖啡和非遗穿身上,佤族织锦“自生香”惊艳世人

    第二十二届中国昆明国际花卉展上,西盟县展出的咖啡纱线佤族织锦产

  • 兰州公交集团启动候车亭升级改造工程 100个公交站点将旧貌换新颜

    小站台包含着大民生。近日,细心的市民发现,雁白大桥、广场西口、

  • ​西平县应急管理局开展“我们的节日•重阳”诗歌朗诵活动

    为弘扬中华优秀传统文化,传承尊老、敬老、爱老的传统美德。重阳节来临

  • 民生
    • (新春走基层)湖北咸宁一组村民喜领“年终大礼包”

    • 西平出山镇特辑:历史文脉中的特色产业——猕猴桃+芦花鸡“林”聚财富特辑:历史文脉中的特色产业——猕猴桃+芦花鸡“林”聚财富

    • 新春走基层︱铁路信号“保健医”午夜“出诊”保春运

    • 共筑金融云上新核心 华为主机上云方案亮相2024金融主机上云工作会议