申请实习证 两公律师转社会律师申请 注销人员证明申请入口 结业人员实习鉴定表申请入口 网上投稿 《上海律师》 切换新版
当前位置: 首页 >> 业务研究大厅 >> 专业论文

从田纳西到国会山:美国AI声音克隆立法的最新进展与争议

    日期:2026-09-23     作者:唐月园(数字科技与人工智能专业委员会,北京市金杜律师事务所上海分所)

 引言:声音克隆技术的冲击与法律挑战

 近年来,人工智能(AI)技术的跨越式发展使得生成与某个特定自然人的声音极为相似的虚假语音变得越来越容易。这一被称为声音克隆Voice Cloning)或深度伪造语音Deepfake Audio)的技术,能够通过音频样本,训练出与特定自然人音色、语调、韵律高度近似的合成语音。声音克隆主要分为两种形式:其一为文本转语音Text to Speech),即AI将用户输入的文字内容转化为目标声音的语音输出;其二为语音转换Voice Conversion),即在说话内容不变的情况下,利用AI学习并模仿特定自然人A的声音(包括音色及韵律),从而将特定自然人B(原本的说话人)的声音替换为特定自然人A(转换后的说话人)的声音。

 艺人因其声音具有鲜明的个性标识和巨大的商业价值,成为声音克隆技术滥用的主要受害者。2024513日,OpenAI发布了多模态大模型ChatGPT-4o,并重点展示了其语音对话能力。然而,知名演员斯嘉丽·约翰逊(Scarlett Johansson)很快发现,该模型中名为“SKY”的语音助手的声音与她本人的嗓音惊人地相似,以至于她的亲友和多家媒体均无法区分。斯嘉丽随后发表声明称,OpenAI曾多次邀请她为ChatGPT配音,均被她拒绝;甚至在发布会前几天,OpenAI还曾联系她寻求授权。尽管OpenAI辩称“SKY”的声音来自另一位专业配音演员,但斯嘉丽认为,OpenAI在未经许可的情况下克隆了她的声音,要求立即下架该语音。这一事件引发了全球范围内对AI声音克隆侵权问题的广泛关注,也促使各国立法和司法机构加快回应。

在美国,艺人的声音可能落入个人形象权的保护范围。个人形象权指个人有权控制“代表其个体特征且具有商业价值的形象要素,并由此获得报酬”。这一权利目前并没有联邦层面的统一立法,而是由各州通过成文法或判例单独进行保护,且各州在个人形象权的保护范围、保护期限、可否继承与转让等问题上均存在不同规定。例如在纽约、加州等地,声音可以得到个人形象权的保护,但在其他州则不尽然。

 随着AI声音克隆技术的愈发成熟,利用AI克隆艺人声音的现象也愈加普遍。这一现象引起了艺人及音乐、影视行业的担忧和抗议,因为逼真的AI克隆声音正在广泛且实质地替代艺人的真实声音,不仅严重损害艺人的经济利益,同时削减了人类创作的价值。为了保护艺人的声音免受人工智能未经授权的克隆,美国各州及联邦纷纷着手修改既有立法,不仅致力于将声音明确纳入个人形象权保护范围,并且聚焦于对AI声音克隆行为的规制。其中以田纳西州的立法及美国联邦的两部草案最具有代表性,以下将分别予以介绍。

 一、田纳西州:The ELVIS Act

 田纳西州是美国音乐产业的核心地带,拥有音乐之城纳什维尔(Nashville)以及乡村音乐发源地布里斯托(Bristol)。音乐产业为该州提供了超过61,617个就业岗位,并为美国经济贡献了约58亿美元的GDP。面对AI声音克隆对音乐产业的巨大冲击,田纳西州原有的1984年《个人权利保护法》(the Personal Rights Protection Act,简称TPRPA)仅保护姓名、照片和肖像,并未包含声音,艺人声音未被明确纳入个人形象权的保护范围,AI声音克隆更不属于个人形象权可以禁止的行为。

 为了保护当地的重要支柱音乐产业,2024124日,田纳西州长Bill Lee提出田纳西州需尽快修改1984年的《个人权利保护法》,并且应在新法中重点解决AI未经授权以他人声音制作声音克隆音频的问题。2024321日,田纳西州修改了1984年《个人权利保护法》的部分条款,并将修正后的法案命名为《确保肖像、声音和图像安全法案》(Ensuring Likeness Voice and Image Security Act,简称The ELVIS Act)。The ELVIS Act不仅明确将声音纳入田纳西州个人形象权的保护范围,而且将个人形象权的保护范围明确扩张至AI声音,这在各州立法中尚属首次。

(一)声音定义的扩展与权利主体范围

 The ELVIS Act将“声音”定义为:一种在媒介中可以被轻易识别并且可归属于特定个人的声音,不论该声音是否包含该特定个人的真实声音或模拟声音(Simulation of the Voice of the Individual)。生成式AI通过学习特定个人的声音样本,能够输出令人难辨真伪的模拟声音,使他人将该模拟声音与特定个人关联。The ELVIS Act中明确将“模拟声音”纳入“声音”定义,意在规制利用AI技术进行声音克隆的行为。

 根据The ELVIS Act,艺人对声音享有个人形象权,这是一种财产性权利,可以转让和继承,不因艺人死亡而终止。除艺人本人外,其法定监护人、继承人、受遗赠人、遗产管理人等在艺人的声音权益受到侵害时,均有权提起诉讼。相较于田纳西州1984年的《个人权利保护法》,The ELVIS Act在上述有权起诉的主体外,还对获得排他许可的主体赋予了起诉资格。依据The ELVIS Act1106条,如果唱片公司等主体与艺人签订合同,对声音权益的利用获得排他性许可,则这部分主体可以单独就侵权提起诉讼。

(二)AI声音克隆的侵权责任

未经授权创建及使用AI克隆声音(第1105(a)(1)条)

 该条款规定,任何人出于广告宣传、劝诱购买产品或服务、募集资金等商业目的,在明知当事人未同意的情况下,擅自使用他人声音(包括真实声音和模拟声音)的行为,都构成侵权。本法规定的“声音”含义包括真实声音及模拟声音,而可能发生的侵权行为可以分为以下两类情形:

 情形A:使用他人真实声音、未经授权自行创建AI克隆声音:如果AI开发公司出于商业目的、未经授权擅自使用艺人的真实声音训练AI,并创建AI克隆声音,构成侵权。

 情形B:未自行创建、但明知且使用他人未经授权而创建的AI克隆声音:如果AIGC使用者“明知(knowingly)”所使用的声音是AI公司未经授权、利用他人真实声音训练合成的AI克隆声音,但依然决定使用上述AI克隆声音,也可能构成侵权。

发布、传输或提供AI克隆声音(第1105(a)(2)条)

The ELVIS Act1984年的《个人权利保护法》的基础上新增了§1105.(a)(2)条款,本条规定了“发布、传输和提供AI克隆声音者”的责任:在明知对他人声音的使用未经授权的情况下,仍发布、表演、分发、传输或者以其他方式向公众提供该声音,则此类行为的实施者也需要承担责任。不同于§1105.(a)(1)中未经授权创建、使用AI克隆声音的行为需要具有“商业目的”才能构成侵权,§1105.(a)(2)对于“传播、发布或向公众提供”AI克隆声音的行为并没有前述的“广告宣传、劝诱购买产品或服务、募集资金”等商业目的表述。这意味着如果个人或企业出于“非商业目的”发布、传输和提供AI克隆声音的行为也可能构成侵权。由于流媒体、社交平台是发布和传输的主要媒介,因此此类平台被认定为侵权的风险较大,但承担责任仍然以“明知”为要件。

 分发、传输或提供用于克隆声音的算法(第1105(a)(3)条)

§1105.(a)(3)The ELVIS Act的立法创新。面对不断更新迭代的AI技术,The ELVIS Act意在从源头加强对艺人声音的保护,在§1105.(a)(3)中对存在侵权风险的算法进行规制。如果某人“分发、传输或向公众提供某种主要目的或功能是为了制作特定的、可识别个人的声音的算法、软件或技术”,则需承担侵权责任。由于相应算法来自科技公司及开发者,因此科技公司及开发者研发用于AI克隆声音的算法时,需要关注向社会公众提供和传播相应技术的法律风险。值得注意的是,本条同样没有“广告宣传、劝诱购买产品或服务、募集资金”目的要求。

 对于“分发、传输、提供”用于克隆声音的算法的行为,虽然The ELVIS Act规定了承担侵权责任的条件,但相关条款仍存在诸多模糊之处。首先,法案中多次提及的“分发、传输或以其他方式提供”含义不明,这一规定可能导致责任主体的范围边界难以界定。例如提供访问入口的搜索引擎或者聚合相应算法服务链接的网页都会可能落入这一范畴。不明确的责任边界若过度扩张,可能阻碍科技创新和音乐影视创作。其次,针对可能用于AI声音克隆的算法或软件,如何判断§1105.(a)(3)中算法的“主要目的和功能”就是为了未经授权生成克隆声音,法案中并未给出需要考虑的因素。事实上,开发者提供声音算法时,可能难以预测并控制算法的实际用途。比如开发者可能出于善意的正常用途向公众提供具有多项功能的通用人工智能模型,但部分公众却将其用于侵权。并且,相应算法在运行过程中也可能难以由开发者控制或识别是否已经获得授权,以及授权是否有效。

除以上内容外,The ELVIS Act还就救济措施、赔偿责任、合理使用等内容进行规定。囿于篇幅所限,此处不再详述。

二、美国联邦:NO FAKES Act No AI FRAUD Act

The ELVIS Act外,针对涌现的AI技术,美国两党议员也期望在联邦层面为生成式AI的使用设置法律界限。以下将简要介绍美国联邦层面与AI声音克隆相关的立法进展。

(一)NO FAKES Act


2023年10月12日,克里斯·库恩斯(Chris Coons)等议员提出《培育原创、促进艺术和保障娱乐行业安全法案(草案)》(Nurture Originals, Foster Art, and Keep Entertainment Safe Act of 2023,简称NO FAKES Act),该法案的目标是“保护代表个人声音、肖像、姓名等个人特征的个人形象权免受生成式AI的不公平使用”。NO FAKES Act首次在美国联邦层面将“声音”纳入“个人形象权”保护范围,并禁止未经授权创建代表个人特征的数字复制品(Digital Replica)或发布、分发、传输或以其他方式公开此类复制品,实施前述行为的主体需承担侵权责任。NO FAKES Act尚未正式通过,仍在讨论阶段。目前讨论的焦点包括:是否应当采用“通知——删除”规则;个人死亡后70年的个人形象权保护期是否应当延长或缩短;相较于州法,NO FAKES Act是否应当优先适用等问题。

 (二)No AI FRAUD Act

 2024110日,玛德琳·迪恩(Madeleine Dean)等议员提出《禁止人工智能伪造复制品和未经授权复制法案(草案)》(No Artificial Intelligence Fake Replicas And Unauthorized Duplications Act,简称No AI FRAUD Act),这一法案旨在从美国联邦层面建立防止生成式AI未经授权使用个人声音和肖像的法律机制。No AI FRAUD Act明确个人对自己的声音、肖像等可识别特征享有财产权,该权利可转让可继承,并且在个人死亡后的10年内仍受到保护。根据No AI FRAUD Act,以下三种行为均构成侵权,需对权利人承担赔偿责任:(1)分发、传输或以其他方式向公众提供声音克隆服务;(2)发布、表演、分发、传输或以其他方式向公众提供数字声音复制品(Digital Voice Replica),且明知该数字声音复制品未经授权;(3)实质上促进、指导或以其他方式便利前述第(1)、第(2)两项行为的主体,如果明知第(1)、第(2)项的行为未经授权,也需承担赔偿责任。目前该法案尚未正式批准通过。

 三、小结与展望

综上所述,美国在AI声音克隆侵权问题上呈现出州法与联邦同步跟进的立法格局。田纳西州的The ELVIS Act将声音纳入田纳西州个人形象权的保护范围,而且将个人形象权的保护范围明确扩张至AI声音,为各州树立了标杆;NO FAKES Act No AI FRAUD Act则试图在联邦范围为生成式AI的使用设置法律界限。可以预见,随着AI技术的快速迭代,美国的声音保护法律将不断调整,而司法实践也将对现行条款的模糊之处作出具体解释。