前言
作为“具身智能域下人形机器人产业链条的法律透视”系列文章的第三篇,本文转向以数据平台、仿真平台及世界模型训练能力为核心的企业——该类企业未必直接制造机器人整机,但其掌握的数据集、仿真环境和模型能力,决定了机器人能否从演示走向规模化应用。
与主要生成文本、图片等内容的人工智能系统相比,世界模型更直接地连接环境感知、模型判断和物理执行。研发数据通常来自真实设备或仿真环境,模型能力又可通过机器人在现实场景中持续验证,并形成新的运行数据。因此,数据取得、加工训练、产品部署和结果反馈彼此关联,任何环节的合规缺口,都可能沿训练和应用链条影响后续的商业化。
基于上述业务特征,本文围绕数据合法来源、标注加工、模型上线及资产确权四个环节展开,重点讨论训练数据的合法来源、数据标注的用工及成果归属、算法备案与安全评估,以及世界模型训练中的开源合规。
一、数据来源:多元取得路径下的合法性基础
如前文所述,数据来源是企业法律尽调的第一道关口,训练数据来源决定企业是否具备持续训练和商业交付的基础。因此,来源审查应围绕“取得是否合法、授权是否覆盖训练、后续使用是否可追溯”三个问题展开。
(一)自行采集:授权边界与个人信息合规
数采设备持续采集现场数据,并不当然形成企业可自由支配的训练资产。在工业场景中,运行日志、产线参数往往构成客户商业秘密,若企业将为A客户采集的数据擅自纳入通用训练池并间接服务于A的竞品,便可能涉及违约以及商业秘密侵权;自采数据中若混入他人享有著作权的图像、三维模型或数据库内容,模型训练过程中的复制与汇编行为同样可能触发知识产权侵权。因此,针对上述风险,应重点审查是否在客户合同中明确数据采集的授权范围及限制,是否对自采数据中可能混入的第三方权利内容进行事前筛查。
个人信息保护则是自行采集环节日常最高频的合规触发点。数采设备在家庭、公共场所或商业环境中运行,视觉、语音、深度传感器直接采集人脸、声纹、行踪轨迹等生物识别信息,甚至可能覆盖未成年人。依据《个人信息保护法》,此类处理活动必须具备明确的合法性基础并履行告知义务;涉及敏感个人信息的,还需落实单独影响评估、访问控制及最小必要措施。
(二)外部采购与合作共享:穿透审查数据授权链条
对于第三方数据集、标注平台数据、客户项目数据或产学研合作数据,供应商出具的完整授权链文件、概括性合规承诺只能作为审查起点。企业还应能够说明数据由谁采集、原始授权是否允许模型训练和商业化、是否存在地域和期限限制、能否用于微调或形成衍生成果,以及数据主体撤回、权利人异议或合作终止后如何删除、返还和停止使用。
(三)公开获取与网络抓取:区分数据可访问与可训练
公开网页、公开视频或开放数据集虽然降低了取得成本,但数据可访问并不等同于可以不受限制地用于训练或商业化。尽调中需要结合已公开信息的合理处理范围、著作权及其他民事权益、网站服务协议、数据集许可条件和抓取方式进行综合判断。对来源不明、许可缺失或包含高风险样本的数据,应建立排除、替换和删除机制,不能仅以技术清洗代替合法性论证。
(四)合成与仿真数据:基础素材和工具许可、内容合规
合成或仿真数据可以减少对真实世界采集的依赖,却不当然成为“无权利负担”的数据。其生成仍可能依赖真实图像、运动轨迹、三维资产、CAD图纸、仿真引擎或预训练模型,因此仍需向前追溯基础素材和技术工具的授权许可,确认其是否覆盖训练与商业部署,并判断生成样本是否高度映射特定个人、场所或商业秘密。
此外,合成或仿真数据不因系人工生成而当然豁免内容安全义务。含暴力、色情等违法有害内容的样本,若进入训练集,仍可能触发《生成式人工智能服务管理暂行办法》项下对训练数据来源、质量及内容安全的要求;此类数据往往因“非真实采集”而被忽略审查,反而容易成为合规盲区,因此企业应将合成与仿真数据纳入与真实数据同等的内容安全审核范围。
二、标注加工:用工安排、过程控制与成果归属
来源合法解决的是数据能否进入训练体系,标注和加工环节则决定数据能否被稳定使用。标注加工涉及人员组织、权限管控、标注规则和成果归属等多个环节。人员组织和数据权限若管控不当,可能引发劳动关系争议或数据泄露;标注规则和成果归属若约定不清,则直接影响企业能否有效控制训练数据集及模型改进成果。
(一)用工安排
数据标注常见外包、兼职、灵活用工和内部员工等模式。实务中不能仅依据合同名称判断法律关系,还应当结合任务分配、工作指挥、考核管理和报酬支付等实际安排,穿透认定实质法律关系,进而防范劳动关系认定及用工责任风险。企业通过标注平台或外包服务商开展数据标注的,应重点关注是否存在未经企业许可的转包或分包,并关注实际参与人员的身份核验、安全培训及保密管理情况。
(二)过程控制
真实场景下采集的数据可能包含个人信息以及客户商业秘密,该等数据通过外包方式进行标注时,仅在外包合同中设置保密条款通常不足以覆盖实际风险。企业应结合数据敏感程度,分别或同时采取脱敏展示、分级授权、禁止下载、终端隔离等技术措施,以防范可能发生的泄密风险。同时,为确保数据标注的质量,企业亦应形成清晰、具体、可执行的标注规则,以规则约束行为,为模型输出的可靠性与责任追溯提供基础。
(三)成果归属
标注成果并不限于单个标签,还可能包括标签体系、标注规则、评测集和错误样本库。任一成果的权属缺失,都可能对后续使用造成不利影响。因此,为防范因权属不清产生的法律纠纷,世界模型企业应在与受托方签订的合同中分别明确标注数据、衍生数据、工具脚本和模型改进成果的权利归属、许可范围、保密义务。
三、模型上线:算法备案、安全评估与持续管理
(一)监管适用:区分服务对象和功能形态
数据取得和加工训练过程具备合法基础,并不当然意味着模型能力可以直接对外提供。世界模型企业可能通过API、SDK、云服务、私有化部署或机器人终端等方式输出能力,相关监管义务应根据服务对象、功能形态、提供方式和影响范围判断。
依据《互联网信息服务算法推荐管理规定》1和《生成式人工智能服务管理暂行办法》2,企业使用大模型并不当然触发算法备案和安全评估。触发与否,取决于模型是否用于提供互联网信息服务、是否面向境内公众、是否具有舆论属性或社会动员能力等因素。一般而言,仅供内部研发使用、或仅向特定机构客户提供但未直接面向境内公众提供生成式服务的,通常不会触发前述规定中要求的算法备案和安全评估义务。特别地,如向特定机构客户提供模型能力,虽不必然触发算法备案和安全评估义务,但双方仍需通过合同明确各自承担的合规责任——需结合对服务功能、模型更新及输出控制的实际分工,判断责任边界;客户后续将模型能力嵌入面向公众的机器人或平台时,企业模型直接向公众提供服务,该情形仍有可能触发算法备案和安全评估义务。因此,模型供应商有必要通过合同约定和技术机制落实用途限制、上线通知及监管协助,在下游使用场景发生变更时及时评估是否触发相关监管义务,同时也避免因下游使用方式变化导致责任界限不清。
(二)持续管理:统筹内容标识、日志留存与重大变更
模型合规不能止于上线前审查。世界模型如同时生成对话、图像、音视频或分析报告,需根据《人工智能生成合成内容标识办法》判断是否履行标识义务——机器人执行物理抓取、移动或避障等行为虽不属该办法规制的“网络信息内容”,但一旦模型输出包含可传播的数字内容,标识义务即可能触发。
上线后的内容审核、投诉处理、日志留存及安全事件处置,不应仅停留在纸面制度,而应成为可验证的日常运营记录——这些记录在监管检查或客户审计中,往往直接决定企业合规状态是否被认可。更关键的是,当数据来源、基础模型、接口权限或部署场景发生实质变化时,原有合规结论可能不再成立,需重新审查是否触发备案变更或安全评估。将动态复核嵌入模型迭代流程,是企业应对监管检查和客户审计的基础能力。
四、资产权属:知识产权配置与开源软件合规
前述合规要点主要解决训练数据能否合法进入模型、模型能力能否合规对外提供的问题。但模型实现预期功能只能说明其具备技术效果,不能据此证明企业对训练素材、数据集、模型权重、仿真环境及第三方组件享有充分权利。因此,企业应从不同成果的权利基础出发,进一步判断开源依赖所附带的许可条件,并通过交易文件明确相关权利边界。
(一)分层确权:分类识别数据、模型与仿真成果的权利基础
数据平台与世界模型企业的技术资产通常由不同性质的成果共同构成,其权利基础并不相同。训练素材可能仅在授权范围内使用,清洗标注数据集还涉及原始数据权益、加工投入和合同安排;模型代码、技术方案、参数权重及训练方法,则需根据其形成方式分别判断是否适用著作权、专利权、商业秘密或合同保护。
企业应对各类成果享有哪些权利、相关权利基于何种法律事实取得,以及其使用、许可和对外交付是否受到限制进行系统梳理。此外,在根据客户特定场景提供数据处理、模型微调、仿真环境搭建或私有化部署服务时,还应区分客户提供的数据和业务资料、企业原有的基础模型及技术工具,以及项目实施过程中形成的定制成果和通用技术改进,并分别明确其使用范围和权利归属。
(二)开源审查:建立软件、模型和数据等核心物料清单
世界模型企业的技术资产通常同时依赖开源软件、预训练模型和第三方数据集,但三者的许可逻辑并不相同。开源软件的许可证可能要求衍生代码开源;预训练模型的自定义许可证可能限制商用场景、要求来源声明或禁止特定用途;数据集许可证则可能禁止商业训练或限制再分发。因此,企业应建立覆盖软件、模型、数据的物料清单,将每项依赖与实际使用方式对应——说明其用于内部研发、云端服务、终端部署还是客户交付,并据此判断是否产生源代码提供、来源声明或再分发等义务。对于自定义许可证或附有限制性条件的模型和数据集,应结合具体条款单独评估,不能直接套用传统开源软件的审查结论。
(三)交易安排:以证据链和合同条款固化权利与责任边界
技术资产能否得到认可,取决于企业能否以完整证据说明相关权利的形成过程。数据来源及授权记录、员工和外包成果归属文件、模型版本资料以及开源许可履行材料,应当能够与企业当前使用和交付的产品相互对应,而不能仅以零散文件证明个别环节已经履行。
对外合同还应根据实际合作模式,对客户在合作过程中向企业提供的业务数据(如产线日志、三维扫描等)的合法性、训练用途和成果归属作出安排,并明确开源依赖的披露范围、模型更新及故障处理机制、第三方权利主张的应对方式和双方责任承担。技术记录、权利文件和合同约定相互印证后,交易各方才能据此判断相关技术资产的使用范围、权利限制和商业价值。
需特别说明的是,除前述证据链和合同约定外,企业还应结合商业、技术上的考量,进一步确认技术资产的保护方式。如拟将特定的模型架构、训练方法或仿真技术方案以专利形式保护的,需依法向中国国家知识产权局提出专利申请并经授权。又如,涉及计算机软件的著作权虽自创作完成即产生,但办理软件著作权登记亦可为权属证明提供初步证据。
五、结语
对数据平台与世界模型企业而言,合规治理的重点不在于机械增加若干台账,而在于建立能够还原技术能力形成过程的管理体系。企业应以具体应用场景为起点,贯通数据取得、标注加工、模型上线等环节,使每项模型能力均能够追溯至其数据来源、授权基础、质量控制、版本变化及许可条件。当数据来源、训练目的、模型能力、部署场景发生实质变化时,企业还应及时重新评估原有合规结论是否继续成立。将证据留存和动态复核嵌入研发、部署及商业化流程,不仅有助于企业持续合规经营,也能够使其在融资或资本市场审核中更有依据地说明核心技术资产的来源、权利边界及可持续使用条件。
[1] 《互联网信息服务算法推荐管理规定》第二条,在境内利用生成合成、个性化推送、排序精选、检索过滤、调度决策等算法技术向用户提供互联网信息服务的,属于该规定所称的算法推荐服务。该规定第二十四条和第二十七条进一步要求,具有舆论属性或者社会动员能力的算法推荐服务提供者,应当履行算法备案手续,并按照国家有关规定开展安全评估。
[2] 《生成式人工智能服务管理暂行办法》第二条将适用范围限定为利用生成式人工智能技术向境内公众提供生成文本、图片、音频、视频等内容的服务;该办法第十七条规定,其中具有舆论属性或者社会动员能力的,应当开展安全评估,并履行算法备案及变更、注销备案手续。
声 明
《君合法律评论》所刊登的文章仅代表作者本人观点,不得视为君合律师事务所或其律师出具的正式法律意见或建议。如需转载或引用该等文章的任何内容,请注明出处。未经本所书面同意,不得转载或使用该等文章中包含的任何图片或影像。如您有意就相关议题进一步交流或探讨,欢迎与本所联系。