数据标注为AI发展加工“优质原料”
时间:2025-01-27 13:41:17来源:科技日报

图为广东省公共数据标注基地(清远)。 受访者供图

随着人工智能迅猛发展,高质量训练数据短缺逐渐成为制约行业进步的一大瓶颈,而数据标注产业可为人工智能创新发展提供强大动力。国家发展改革委、国家数据局、财政部、人力资源和社会保障部四部门日前联合印发的《关于促进数据标注产业高质量发展的实施意见》(以下简称《实施意见》),提出到2027年的发展目标:数据标注产业专业化、智能化及科技创新能力显著提升,产业规模大幅跃升,年均复合增长率超过20%。

我国数据标注产业现状如何?数据标注产业高质量发展还需要跨过哪些“门槛”?针对这些问题,科技日报记者进行了采访。

 原始数据变为可用资源

“通俗地说,训练人工智能大模型的过程就像老师教学生识字。”华南理工大学计算机科学与工程学院副院长张通形象地解释道,数据标注就是给数据“贴标签”或者“做记号”,需要专业人员向大模型阐释各个数据的标签及需执行的相应任务。他们“教导”大模型参与训练的数据是什么,给图像、语音、文本等各种数据“贴标签”。高质量的数据标注,有助于机器精准理解、快速学习、高效训练,显著提升大模型的准确性和泛化能力。

在训练ChatGPT时,美国开放人工智能研究中心(OpenAI)就投入了大量资源用于数据标注。为确保标注任务高质量完成,使ChatGPT能更好地理解人类指令,保障大模型的准确性与可靠性,OpenAI聘请了众多“老师”。这些“老师”涵盖一般数据标注人员和专业人士,还包括博士级别的专家。

数据标注是人工智能发展的核心基石之一。“数据标注产业是对数据进行筛选、清洗、分类、注释、标记和质量检验等加工处理的新兴产业,其核心任务是对原始数据进行加工,使之成为可用于训练人工智能大模型的优质原料。”张通介绍,数据标注作为训练大模型至关重要的一环,直接影响机器学习模型的性能,对支撑人工智能能力水平提升有重要作用。

在张通看来,未经处理的原始数据只是潜在资源,而经过标注处理后沉淀的数据,才能在市场上进行有效交易和流通,从而充分释放数据要素价值。培育壮大数据标注产业,对于提升数据供给质量、推动人工智能创新发展不可或缺。

业内人士认为,随着人工智能技术不断成熟、应用领域持续拓展,数据标注行业将迎来更广阔市场空间,尤其是在低空经济、智慧城市、自动驾驶、智慧医疗等新兴科技领域展现出巨大潜力。

 产业步入快速发展阶段

全球数据标注市场目前正处于迅速增长期。近年来,我国数据标注产业已进入快速发展阶段,产业链条不断完善,技术创新成果逐步实现市场化应用。据测算,2023年我国数据标注产业规模已达800亿元左右。

四川成都、辽宁沈阳、安徽合肥、湖南长沙等7个承担数据标注基地建设任务的城市,在大模型标注、自动化标注等领域取得重要突破。长沙信息产业园作为长沙首批数据标注基地之一,已吸引智能网联汽车、数据标注、网络安全等1万余家各类数字企业入驻,成功打造了人工智能创新中心算力服务平台。

广东积极推进数据标注训练试点和基地建设,为大模型训练提供坚实数据支撑。2023年9月,广东省公共数据标注训练试点正式启动。在广东省公共数据标注基地(清远),百度、燕湖科技、好思达等一批在自动驾驶、政务公共标注领域表现突出的企业已率先入驻。凭借龙头企业的带动作用和数字经济产业的集聚效应,清远的数据标注产业蓬勃发展。

“我们以数字经济产业为核心,与数字经济产业龙头企业紧密合作,致力于打造国家级数据标注产业集聚区和产教融合示范区。”广东省公共数据标注基地(清远)负责人李艳康介绍,落户在此的百度智能云(清远)人工智能基础数据产业基地已累计引进孵化数据标注企业5家,培育专业数据标注师超300人。未来,基地将持续培育孵化更多优秀数据标注企业,推动清远数据服务产业不断壮大发展。

复合型人才缺口仍然较大

《实施意见》的出台,将进一步提升数据供给质量,有效解决制约人工智能产业发展的高质量数据短缺问题。

值得注意的是,随着人工智能应用的不断深化,对数据标注的需求也愈发细分化和专业化。2024年7月,张通团队和广州华银康医疗集团股份有限公司在人工智能与数字经济广东省实验室(广州)共建AI病理研究中心,着手研发人工智能病理大模型,让人工智能模型能像专业医生一样看病问诊。在其中的数据预处理环节,中心特别聘请了3位资深的主任级医师进行数据标注。

“医疗、材料等专业领域,涉及到专业对象和术语结合的标注过程,只有专业从业人员才能胜任标注工作。而且,标注任务极其耗时、耗力、耗资源。整个标注工作并非一蹴而就,而是需要在实际应用场景中优化、持续迭代,促使模型智能化水平不断升级。”张通说,当前我国数据标注行业人才缺口仍然较大,亟待培养复合型数据标注人才,这是我国数据标注产业高质量发展必须跨过的“门槛”。

《实施意见》对加强标注人才队伍建设作出部署。以人才项目计划和科技项目等为抓手,培育和引进高端专业人才;制(修)定人工智能训练、数据标注相关职业国家职业标准;支持数据标注领域职业资格与职业技能等级衔接互认……一项项举措,将为数据标注产业高质量发展提供支撑。

完善的产业生态建设对数据标注行业发展同样重要。《实施意见》提出,畅通数据采集、标注、人工智能应用产业链,推动数据标注产业上下游协同发展;支持数据标注龙头企业和第三方机构等建设数据标注开源平台,助力中小企业发展;培育一批人力资源、供需对接、国际合作、法律审计等服务数据标注的第三方机构,完善数据标注产业生态。

“未来数据标注行业的发展,也可考虑‘以人工智能促人工智能’的思路,即让已经完成学习的人工智能反哺数据标注工作,提高效率。这是值得深入探讨且极具价值的研究方向。”张通认为,数据标注行业的发展有望加速推动数字经济与实体经济深度融合,加快形成新质生产力。

标签:

最新
  • 数据标注为AI发展加工“优质原料”

    图为广东省公共数据标注基地(清远)。 受访者供图随着人工智能迅

  • 《票友大会》以“声”入戏 呈现鲜活票友群像

    中新网北京1月25日电 (记者 应妮)从地铁司机、环卫工人、农民到高

  • 大寒节气北京今天晴朗在线 最高温9℃较常年同期偏高

    中国天气网讯 今天(1月20日)是大寒节气,北京天气晴朗在线,最高气

  • 中国科学院院士陶智:川渝地区低空经济发展的重要方向是农业

    中新网重庆12月22日电 (记者 刘贤)低空经济目前已经进行商业化探

  • ATP新生力量总决赛:商竣程因伤退赛

    中新社北京12月21日电 20日在沙特阿拉伯吉达进行的2024年男子职业

  • 以“链”为媒 向新而行

    以链为媒 向新而行(现场评论)一块深埋地下的矿石如何历经千淘万漉

  • 孙勇:“流量为王、产品为本、用户为要” 打造营销传播的“内功心法”

    新华网博鳌12月4日电(王梦冉)12月2日至4日,2024企业家博鳌论坛系

  • 常州市“大件运输一件事”改革案例成功办结

    常州市首个大件运输一件事改革案例11月28日办结。当天,连云港明江

  • 崇川经济开发区:科学之旅,点亮童心未来

    11月23日下午,崇川经济开发区观畅社区、山港桥社区、中沙社区联合

  • 小红书商业服饰潮流行业负责人欧迪:场景驱动需求、需求人群化、审美百花齐放

    11月20-22日,2024世界服装大会围绕融和:共同发展的力量主题再启新

  • 股票分红需要持股多久?股票分红怎么登记股权?

    股票分红需要持股多久?股票分红跟持股多久无关,只和投资者股权登记

  • 广湛高铁还建吴川牵引变电所搬迁并完成接触网送电

    2024年11月4日凌晨,随着还建吴川牵引变电所馈线断路器合闸完成,茂

  • 盘活乡村闲置资源 推动产业融合发展

    马上基地就可以正式启用了,到时候经过屠宰的乳鸽就可以直接在这里

  • 10月全球制造业PMI为48.8% 保持弱势平稳恢复态势

    中新社北京11月6日电 中国物流与采购联合会6日发布数据,2024年10

  • 共绘数字新时代 2024中国程序员节即将开幕

     在数字化浪潮中,程序员们以智慧和代码为基石,构建起了数字

  • 专家在渝建言城市韧性提升:立体覆盖、协同融合 全球快讯

    中新网重庆10月19日电 (张旭)什么是城市韧性?跟城市安全有何关联

  • 旅游
    • ​西平县柏苑街道开展“九小”场所消防安全知识培训会

    • 即时看!基诺浦机能鞋,让科学护足理念走进千家万户

    • 全球球精选!商城县民政局召开民政系统警示教育大会

    • ​信阳市召开烟花爆竹监管暨“打非”工作部署会 全球新消息