追踪AI训练数据版权争议及大模型合理使用边界。最新进展:OpenAI否认Codex吸收数学家未公开研究,美司法部与最高法相继表态支持训练豁免,同时媒体诉讼与数学家指控持续发酵。趋势上,合规焦点正从训练豁免转向人脸人声等细分场景。
OpenAI就Navier-Stokes方程证明的抢功争议作出回应,明确否认使用了纽约大学数学家Tristan Buckmaster的未公开研究。公司调查后表示,Buckmaster过去两个月提交给Codex的prompt不可能以任何方式影响该内部模型,包括通过训练。 Buckmaster此前与Levent Alpöge研究同一方向,并将大量草稿放入Codex。两人进展传到OpenAI后,OpenAI在数天内集中算力完成Navier-Stokes证明,Buckmaster因此怀疑自己的未公开研究被模型学习。OpenAI还划定时间边界为7月3日,称此后任何用户输入都不可能影响该系统,但未解释该日期的含义。两人的关键突破发生在8月中旬,晚于该边界。
区块律动最高人民法院发布人工智能相关司法新规,明确大模型训练在特定条件下可获得合规豁免,为AI企业使用数据训练模型留出空间。但新规并未解决人脸、人声等生物特征信息用于训练的合规问题,相关边界仍不清晰。
Huxiu数学家Andreas Thom近日发文质疑,OpenAI在训练Astra时可能吸收了他与数学家Gábor Kun围绕Gromov soficity conjecture研究时留下的对话内容,随后Astra解决了高度相关的问题。该猜想是群论领域长期未决的重要问题,Thom已研究20年。 OpenAI今年8月公布Astra“十大数学突破”,其中第3项为构造出non-sofic group,此前称由内部版本Astra完成,遭数学界质疑后已修改表述,承认该证明依赖包括Kun和Thom研究在内的近期数学工作。 目前尚无证据证明OpenAI确实将相关私人对话用于训练Astra,但该指控再次引发对AI训练数据来源、未发表研究成果归属及“AI发现”是否建立在人类未公开成果之上的讨论。
区块律动9月4日,两家美国媒体在纽约南区联邦地区法院起诉OpenAI与微软,指控其未经授权复制新闻报道(含付费墙内容)用于训练ChatGPT、微软Copilot等AI产品,削弱读者访问官网或付费订阅的必要性,要求销毁侵权作品副本、涉事训练数据集及AI模型。OpenAI称模型基于公开数据训练且符合合理使用原则,微软表示意外并愿沟通解决。
Readhub美国政府近日向法院提交意见,支持人工智能公司在未经许可的情况下使用受版权保护的内容训练大型语言模型。文件指出,若美国企业因版权规则面临更高的数据获取成本,可能在AI竞争中落后于不受同等约束的外国竞争者,并对国家安全造成影响。
Cnbeta美国司法部首次就AI版权问题公开表态,主张将AI训练视为“合理使用”。这一立场可能影响正在进行的AI版权诉讼,并引发内容创作者与科技公司之间的进一步争议。
新浪财经9月3日,据《华尔街日报》报道,美国政府已表态支持OpenAI在与出版商的版权纠纷中的立场。此举可能影响AI训练数据使用相关法律争议的走向。
脚本之家法国AI公司Mistral更新隐私政策,默认将用户输入用于模型训练,仅企业版用户可豁免。此举引发对数据隐私与AI训练数据来源的讨论。
Buzzing电子前哨基金会(EFF)向法院提交意见,呼吁法官不要因人工智能热潮而重写版权法。EFF认为,现有版权法已能平衡创作者与技术创新,不应因AI发展而仓促修改法律框架。该组织强调,过度扩张版权保护可能阻碍AI研发与合理使用。
BuzzingAnthropic公司被指控在训练其Claude AI模型时使用了未经授权的数据,这一行为被称为“历史上最公然盗窃”。目前,相关指控已引发广泛关注,但具体细节尚未完全披露。
凤凰科技多家公共利益与消费者权益组织致信美国联邦贸易委员会(FTC),要求调查主要人工智能开发商涉嫌购买、扫描并系统销毁实体书籍以训练大语言模型的行为。信件于周五提交给FTC主席Andrew Ferguson及委员Mark Meador,签署方包括多个倡导组织。此举引发对AI训练数据来源合法性与版权问题的关注。
Techstrong8月22日,十余家民间社会组织致信美国联邦贸易委员会(FTC),呼吁其动用监管权力,审查大型AI公司通过购买、扫描并销毁实体书籍获取训练数据的行为。公开信指出,此类做法可能构成不公平竞争,抬高竞争对手的数据获取成本,并切断初创AI公司的关键训练资料。此前有报道称,Anthropic曾斥资数百万美元购买书籍并拆除书脊扫描用于训练Claude,谷歌、微软和OpenAI也面临类似版权诉讼。这些组织并非要求限制AI训练,而是希望FTC在头部企业借此建立市场优势前介入审查。
区块律动林清轩旗下男士品牌近日陷入“AI溶图”争议,原创作者公开表示其作品未经授权被用于AI处理。目前品牌方尚未就此作出正式回应,事件引发对AI生成内容版权问题的关注。
新浪财经近期关于“AI焚书”的报道引发热议,但事实与象征意义存在错位。AI公司确实在购买纸质旧书并破坏性扫描,如Anthropic的“巴拿马计划”一年内花费数千万美元扫描数百万本书,但这一数量在二手书市场中占比极小。实体书被销毁不等于知识消失,扫描后的内容被转化为数字图书馆并用于模型训练。然而,采购确实可能集中在稀有或绝版书籍上,造成不可替代的文化损失。舆论应理性看待,而非仅凭情绪判断。
投资界日本政府公布人工智能相关草案,敦促AI开发者披露训练数据来源,以提升透明度并应对版权争议。该草案旨在规范AI开发流程,平衡技术创新与数据权利保护。
凤凰科技Axios调查显示,OpenAI新增Computer History功能,Mac用户可让ChatGPT和Codex记录指定应用和网站的点击、输入及切换,形成长期工作记忆。该功能默认关闭,不录屏录音,临时操作记录不用于模型训练。Google则推出Search Services History,保存用户通过Lens、Search Live、Translate上传的图片、文件和音视频,并用于训练生成式AI,符合条件的账户默认开启,部分数据脱钩后最长保留4年。Meta也利用用户与Meta AI的互动调整Facebook和Instagram的内容与广告。
区块律动Anthropic的“毁书训AI”丑闻再次引发争议。404 Media调查发现,ISBNdb正为AI公司批量采购旧书,单笔订单最高达百万册,并通过保密协议隐藏买家身份。报道未直接点名Anthropic,但其此前“买书、拆书、扫描、回收”项目被再次提及。该公司曾购买数百万本实体书,切掉书脊后高速扫描,再将原书送去回收,内部文件显示其不希望外界知晓该计划。稀有书和绝版书也可能被送入流水线。此外,有神秘买家大批扫货旧书,最终追踪到亚马逊位于拉斯维加斯的仓库。亚马逊承认通过商业渠道购书,但未透露数量及扫描数据去向。马斯克承诺保留原书,但Sacks批评其双标。
脚本之家美国电影协会(MPA)与字节跳动就生成式人工智能知识产权保护达成合作,双方签署谅解备忘录,建立相关知识产权保护合作框架。合作涉及字节跳动旗下Seedance、Seedream等视频及图像生成模型,旨在应对AI内容创作中的版权问题。
CnbetaAirTag追踪调查发现,亚马逊为提高AI训练图书扫描效率,会先切掉书脊再逐页扫描,该方式会直接毁坏图书。
新浪科技一项通过AirTag进行的追踪调查显示,一批约1000本稀有图书的匿名订单最终被送至亚马逊位于拉斯维加斯东北部的LAS8仓库VGT3区域。该订单经Biblio平台下达,书商按调查方要求在其中一本书内藏入追踪器。亚马逊员工论坛讨论证实,该设施会破坏性扫描大量图书,疑似用于AI训练数据。
Simonwillison亚马逊被曝大规模采购书籍,扫描后用于AI训练数据,并将书籍销毁。404 Media进行的一项调查通过在珍本书中放置追踪装置,追踪到这批书最终流入亚马逊的AI训练设施,首次揭示这一此前未被报道的运作。追踪显示,亚马逊购书量巨大,涉及大量珍稀书籍。此事引发对AI训练数据来源与图书收藏保护的关注。
Upstract记者在稀有书籍运输包裹中放置追踪设备,以查明哪家AI公司买下这批书。追踪结果显示,包裹最终抵达亚马逊一处设施,该设施将书籍扫描后销毁,用于AI模型训练。
404 MediaTwitch宣布将创作者直播内容默认用于训练亚马逊生成式AI,采用全员默认勾选机制。此举引发主播强烈不满,平台高管承认深知主播抵制态度,但称若默认不加入将无人主动参与。主播可通过频道设置的安全与隐私标签页选择退出。事件凸显平台与创作者在AI版权和数据使用权上的深层矛盾。
Readhub流媒体平台Twitch因默认将创作者输出内容用于训练亚马逊AI,引爆创作者权益争议。创作者群体担忧其内容未经充分授权即被用于模型训练,呼吁平台明确选择机制并保障权益。目前争议持续发酵,相关平台尚未作出公开回应。
Tmtpost扎克伯格今日发表长文,公开为AI模型蒸馏辩护,称模型向其他模型学习本就是开源生态的一部分,美国若想继续领跑开源AI,应放松对蒸馏和训练数据的限制。他反驳“蒸馏有害”的说法,认为能观察到的东西就应允许学习,否则只会让其他国家开源模型追赶更快。Meta同日发布的开源模型Muse Glimmer正是基于Muse Spark蒸馏而来。此前OpenAI、Anthropic均在严防大规模抓取模型输出,与扎克伯格立场相反。
区块律动Anthropic等多家AI公司被曝将旧书切页扫描,以获取大语言模型训练数据。相关做法可能涉及未经授权使用受版权保护的作品,引发外界对AI训练数据来源合法性的关注。目前涉事公司尚未作出公开回应。
Mashable华夏出版社在书籍中标注禁止用于AI训练,负责人称维权困难但需表明态度。
网易财经Anthropic被曝通过“巴拿马计划”大规模购买纸质书并切割扫描用于AI训练,引发绝版书损毁与文化传承担忧。
投资界Claude在训练数据版权与越狱问题上引发争议,AI对数据的渴求正蔓延至物理世界。
TmtpostAnthropic致函美国国会,指控阿里巴巴通过大规模蒸馏攻击窃取其Claude模型知识产权,涉及2.5万虚假账户和2880万次交互。
脚本之家AI公司通过中间商批量收购二手纸质书,扫描后销毁用于训练数据,以避开被AI生成内容污染的互联网,引发版权争议与知识流失隐忧。
投资界为训练AI,稀有书籍遭损毁,供应商正紧急应对。
Kotaku德国法院判定美国AI音乐生成平台Suno侵犯版权,须公布违法所得并赔偿,且未经授权不得使用相关音乐人作品训练AI模型。
雪球巴西创意工作室与丹麦字体公司联合推出开源字体ShieldFont,能让AI爬虫抓取的内容显示为乱码,以保护网页文字不被随意用作训练数据。
Cnbeta扎克伯格称Instagram将把所有公开帖子用于AI模型训练,并利用分析结果优化算法。
凤凰科技Anthropic因使用盗版书籍训练AI被判支付15亿美元和解金,并曾购买纸质书销毁扫描,引发对AI训练数据版权的广泛争议。
投资界AI公司购买珍稀书籍切除书脊扫描获取纯净训练数据,马斯克要求SpaceX AI进行无损扫描。
Cnbeta多家人工智能公司为训练聊天机器人,销毁了数百万本书籍,引发AI版权与伦理争议。
Yahoo FinanceAI开发者大量购买实体书籍,切割扫描后丢弃原书用于训练AI模型。
DecryptAI公司被曝购买大量书籍用于训练模型后,将书籍销毁以隐藏来源。
HnrssAI 公司被曝大量收购旧书,用于获取不受版权争议的纯净训练素材。
AI公司被曝大量收购旧书以获取纯净训练素材。
Anthropic被曝购买数百万本实体书拆书扫描后回收,马斯克要求保留稀有书改用无损扫描,Sacks批评其双标。
区块律动AI公司为训练模型大量销毁稀有书籍,引发数据来源争议。
Hnrss