中国 AI 力量

深入洞察市场脉搏,精选高价值分析报告

欧盟五国将测试年龄验证应用以保护儿童 中国 AI 力量
Jul 15, 2025

欧盟五国将测试年龄验证应用以保护儿童

路透布鲁塞尔7月14日电 – 欧盟委员会周一表示,法国、西班牙、意大利、丹麦和希腊将测试一款年龄验证应用的蓝图,以保护网络儿童安全。当前全球对社交媒体影响儿童心理健康的担忧日益加剧。 这款年龄验证应用程序的搭建基于与欧洲数字身份钱包相同的技术规范,后者将于明年推出。五个参与国可根据自身需求定制该模型,将其整合至国家应用程序或保持独立运行。 欧盟委员会还发布了针对在线平台的指导方针,要求其采取保护未成年人的措施,作为遵守《数字服务法案》(DSA)的组成部分。 这项具有里程碑意义的立法于去年生效,要求谷歌母公司 Alphabet(GOOGL.O)、Meta Platforms(META.O)、字节跳动旗下 TikTok 等在线企业加大力度处理非法和有害网络内容。 埃隆·马斯克旗下的 X 平台、TikTok、Meta 的 Facebook 和 Instagram 以及多家成人内容网站目前正接受欧盟监管机构调查,以确认其是否遵守《数字服务法案》。 欧盟监管机构表示,新指南将帮助在线平台解决成瘾性设计、网络欺凌、有害内容和陌生人不受欢迎的接触等问题。 “平台没有理由继续实施危害儿童的行为,”欧盟技术主管汉娜·维尔库宁在一份声明中表示。 社交媒体对儿童心理健康的影响已成为全球日益关注的问题, 美国数十个州起诉 Meta 公司 ,而澳大利亚去年禁止 16 岁以下儿童使用社交媒体 。

月之暗面 AI 的 Kimi K2 在关键基准测试中超越 GPT-4——且完全免费 中国 AI 力量
Jul 13, 2025

月之暗面 AI 的 Kimi K2 在关键基准测试中超越 GPT-4——且完全免费

月之暗面科技旗下热门 Kimi 智能助手的研发方,这家中国人工智能初创企业于周五发布了一款开源语言模型,在编程和自主智能体任务方面展现出卓越性能,直接向 OpenAI 和 Anthropic 的闭源系统发起挑战。 这款名为 Kimi K2 的新模型采用混合专家架构,总参数量达 1 万亿,其中激活参数为 320 亿。公司同步推出两个版本:面向研究人员的基座模型,以及专为聊天和自主智能体应用优化的指令调优版本。 “Kimi K2 不仅能回答,更能执行行动,”公司在发布博客中宣称,”通过 Kimi K2,高级智能体技术变得前所未有的开放和易用。我们期待见证开发者创造的无限可能。” 该模型的突出特点是针对”智能体”能力进行了优化——能够自主使用工具、编写和执行代码,并在无需人工干预的情况下完成复杂的多步骤任务。在基准测试中,Kimi K2 在极具挑战性的软件工程基准 SWE-bench Verified 上取得了 65.8%的准确率,超越了大多数开源替代方案,并与某些专有模型持平。 大卫遇见歌利亚:Kimi K2 如何击败硅谷斥资数十亿打造的模型 这些性能指标讲述的故事足以让 OpenAI 和 Anthropic 的高管们警醒。Kimi K2-Instruct 不仅与行业巨头同台竞技——更在企业客户最关心的任务上系统性超越了它们。 在 LiveCodeBench——这个堪称最贴近现实的编程基准测试中,Kimi K2 以 53.7%的准确率完胜 DeepSeek-V3 的 46.9%和 GPT-4.1 的 44.7%。更令人震惊的是:它在 MATH-500 测试中斩获 97.4%的高分,远超 GPT-4.1 的 92.4%,这表明月之暗面公司(Moonshot)在数学推理这一基础领域取得了重大突破,而这是那些资金更雄厚的大型竞争对手尚未攻克的。 但基准测试无法体现的是: 月之暗面取得这些突破所用的模型,其成本仅为行业巨头训练和推理支出的零头。当 OpenAI 耗费数亿美元计算资源换取渐进式改进时,月之暗面似乎找到了一条通往相同目标的效率路径。这正实时上演着经典的创新者困境——这个锐意进取的行业新秀不仅达到了巨头的性能标准,而且做得更好、更快、更便宜。 这不仅仅关乎炫耀的资本。企业客户一直在等待能够真正自主完成复杂工作流程的 AI 系统,而不仅仅是生成令人印象深刻的演示。Kimi K2 在 SWE-bench Verified 上的优异表现表明,它或许终于能兑现这一承诺。 MuonClip 突破性进展:为何这一优化器可能重塑 AI 训练经济学 在 Moonshot 的技术文档中隐藏着一个可能比模型基准分数更重要的细节:他们开发的 MuonClip 优化器 ,实现了”零训练不稳定性”的万亿参数模型稳定训练。 这不仅是一项工程成就——更可能引发范式转变。训练不稳定性一直是大型语言模型开发的隐性成本,迫使企业重启昂贵的训练流程、实施高额安全措施,并接受次优性能以避免系统崩溃。月之暗面的解决方案通过重新调整查询和关键投影中的权重矩阵,从根本上解决了注意力逻辑爆炸问题,而非在后续环节进行修补。 其经济影响令人震惊。如果 MuonClip 被证明具有普适性——而 Moonshot 暗示确实如此——这项技术将大幅降低大模型训练的计算开销。在这个训练成本动辄数千万美元的行业里,即便是微小的效率提升,也能转化为按季度而非年度衡量的竞争优势。 更耐人寻味的是,这体现了优化理念的根本性分歧。当西方 AI 实验室普遍采用 AdamW […]

TikTok 未能成功驳回指控其”成瘾性设计”剥削儿童的诉讼 中国 AI 力量
Jul 12, 2025

TikTok 未能成功驳回指控其”成瘾性设计”剥削儿童的诉讼

核心要点 新罕布什尔州法院驳回了 TikTok 要求撤销指控其针对儿童使用操控性设计功能的诉讼请求。 该州指控 TikTok 被故意设计成具有成瘾性,旨在剥削其年轻用户群体。 美国总统特朗普已批准字节跳动(TikTok 母公司)第三次延长出售其美国 TikTok 业务的期限。 本周一名法官驳回了 TikTok 撤销新罕布什尔州诉讼的动议,该诉讼指控该平台针对儿童青少年使用具有操纵性的设计功能。 ″法院的裁决是让 TikTok 为危害儿童的违法行为承担责任的重要一步,”州总检察长约翰·福梅拉周五在声明中表示。 新罕布什尔州高等法院法官小约翰·基辛格在周二裁决中表示,该州指控内容有效且具体充分,可继续审理,并指出民事诉讼是”基于该应用程序涉嫌存在缺陷和危险功能”,而非应用程序内容。 该州指控社交媒体平台 TikTok 被故意设计成具有成瘾性,旨在剥削其年轻用户群体。 诉讼指控该平台采用”成瘾性设计功能”以延长儿童使用时间,增加他们接触广告的机会,并通过 TikTok 电商平台 TikTok Shop 诱导消费。 TikTok 发言人周五在声明中表示,该诉讼”提出的指控已过时且经过刻意挑选”。 ″我们持续为青少年账户提供默认开启的强力安全保护措施和屏幕使用时长限制,为家长提供监督青少年的家庭配对工具,实施严格的直播要求,并积极持续执行我们的社区准则,”发言人表示。 这起案件是最新例证,表明各州总检察长正将矛头指向科技公司的产品设计元素和安全政策,而非平台其他用户生成的内容。 多个州指控 Meta 在其系列应用中植入具有成瘾性的功能,对儿童心理健康造成危害。 新墨西哥州于 9 月对 Snapchat 提起诉讼,指控该应用营造了”性捕食者能轻易通过性勒索手段锁定儿童”的环境。 今年 4 月,新泽西州总检察长就儿童安全功能存在误导性宣传问题起诉了社交信息平台 Discord。 国会曾试图对社交媒体平台实施监管,但未能取得成效。2024 年受阻的《 儿童网络安全法案 》已于五月重新提交国会审议。 该法案将要求社交媒体平台履行”注意义务”,防止其产品对儿童造成伤害。 TikTok 面临的最新法律挑战正值其在美国前景未明之际。 2024 年 4 月,前总统乔·拜登签署法案,要求字节跳动剥离 TikTok 业务,否则该应用将在美国面临封禁 。该应用已于 1 月总统唐纳德·特朗普就职前夕从苹果和谷歌应用商店下架。 特朗普上任后推迟了禁令执行,并不断延后最后期限。 […]

元超级智能——领先的计算能力、人才与数据 中国 AI 力量
Jul 12, 2025

元超级智能——领先的计算能力、人才与数据

本文信息来源:semianalysis Meta 以约 300 亿美元估值惊人收购 Scale AI 49%股份,表明这家年现金流达 1000 亿美元的广告机器根本不在乎钱。尽管资源看似无限,Meta 在模型性能上却一直落后于基础实验室。 真正的警钟是当 Meta 在开源权重模型领域被深度求索(DeepSeek)超越时。这惊醒了沉睡的巨人。如今马克·扎克伯格进入全力创始人模式,亲自领导 Meta 的冲锋,并指出公司两大核心短板:人才与算力。作为仍在执掌科技巨头的最后几位创始人之一,马克根本不需要半分析(SemiAnalysis)来告诉他应该放缓股票回购以投资未来! 来源:Meta 财报及半分析(SemiAnalysis)预估 除了砸钱解决问题外,他正在从根本上重新思考 Meta 在生成式 AI 领域的策略。他正从零开始组建全新的”超级智能”团队,并亲自以令顶级运动员薪资相形见绌的待遇挖角顶尖 AI 人才。该团队挖角对象的典型报价是四年 2 亿美元——这相当于同行薪资的 100 倍。更有甚者,OpenAI 的研究/工程负责人曾拒绝过几份价值十亿美元的邀约。 更具标志性的是,扎克伯格将整个数据中心建设方案扔进废纸篓,现在正斥资数十亿美元在”帐篷”里搭建 GPU 集群! 来源:SemiAnalysis 数据中心模型 ——截至 2025 年 7 月 6 日 正如本报告详述,所有选项都摆在台面上。我们将解析 Meta 为追求超级智能在算力与人才领域史无前例的自我革新,以及这段征程的来龙去脉。从 Llama 3.0 开源统治到 Llama 4 巨兽的史诗级溃败,这位 AI 巨头虽受挫却未出局。事实上,我们相信 Meta 训练算力的增长速度将足以比肩 OAI。按人均研究人员计算,该公司正从 […]

中国月之暗面科技发布开源模型以重夺市场地位 中国 AI 力量
Jul 12, 2025

中国月之暗面科技发布开源模型以重夺市场地位

 7 月 11 日电 – 中国人工智能初创企业月之暗面科技周五发布了一款新的开源 AI 模型,加入本土竞争对手的类似发布浪潮,试图在竞争激烈的国内市场重夺地位。 该公司在声明中表示,这款名为 Kimi K2 的模型具有增强的编程能力,擅长通用代理任务和工具集成,能更有效地分解复杂任务。 月之暗面公司宣称,该模型在部分领域表现优于主流开源模型(包括深度求索的 V3 版本),并在编程等特定功能上可媲美 Anthropic 等美国领先企业的竞品模型。 此次发布顺应了中国企业开源 AI 模型的趋势,这与 OpenAI、谷歌等美国科技巨头将最先进 AI 模型保持闭源的做法形成鲜明对比。包括 Meta Platforms(META.O)在内的部分美国企业也已发布开源模型。 开源策略能让开发者展示技术实力,扩大开发者社区及全球影响力,这一战略或将助力中国应对美国限制其科技发展的举措。 其他已发布开源模型的中国企业还包括深度求索、阿里巴巴(9988.HK)、腾讯(0700.HK)和百度(9888.HK)。 由清华大学毕业生杨植麟于 2023 年创立的月之暗面是中国知名 AI 初创企业之一,并获得了阿里巴巴等互联网巨头的支持。 该公司在 2024 年因用户蜂拥使用其长文本分析能力和 AI 搜索功能而声名鹊起。 但随着深度求索今年发布包括 1 月推出的 R1 模型在内的低成本产品线(这些产品震撼了全球 AI 行业),其市场地位已有所下滑。 根据追踪 AI 产品的中国网站 aicpb.com 数据,月之暗面的 Kimi 应用去年 8 月月活跃用户数排名第三,但到今年 6 月已下滑至第七位。

中国 AI 力量
Jul 12, 2025

OpenAI 挑战者智谱考虑将 IPO 转向香港

核心要点 智谱正考虑将首次公开募股(IPO)计划从中国大陆转向香港,据知情人士透露。 知情人士表示,智谱正与财务顾问合作筹备首次股票发行,可能筹集约3亿美元资金。 相关考量仍在进行中,尚未做出最终决定,知情人士补充称包括募资规模在内的细节仍可能变动。 知情人士透露,中国人工智能初创企业智谱 AI 正考虑将原计划在内地的首次公开募股(IPO)转移至香港进行,这将进一步助推香港市场的交易热潮。 据不愿具名的知情人士称,获得阿里巴巴集团和腾讯控股投资的智谱 AI 正与财务顾问合作筹备首次公开募股,预计募资规模约 3 亿美元。 根据向中国证监会提交  的 IPO 文件显示,作为少数几家与 OpenAI 在全球范围内展开竞争的中国初创企业之一,智谱 AI 最初筹备的是在中国内地上市。 知情人士表示,相关考量仍在进行中且尚未做出最终决定,并补充称包括融资规模在内的细节仍可能变动。其中一位人士透露,智谱最终也可能选择在中国大陆上市。 总部位于北京的智谱公司代表未就置评请求作出回应。 香港资本市场交易正推动当地投行活动复苏。彭博汇编数据显示,2025 年迄今香港 IPO 和增发交易已募集约 400 亿美元资金,创下自 2021 年破纪录年份以来的最高水平,较去年同期的 57 亿美元实现大幅跃升。 自深度求索崛起以来,智谱与从月之暗面到 MiniMax 等竞争对手快速推出低成本 AI 服务,旨在抢占这一新兴行业的制高点,并为未来技术发展树立标准。 智谱近期获得上海国有创投公司及其母公司张江集团 10 亿元人民币(1.39 亿美元)注资。 被称为国内”AI 四小龙”之一的 MiniMax 计划最快今年上市,彭博新闻社上月报道称。 成立于 2019 年的智谱拥有自主研发的免费 AI 研究助手 AutoGLM,以及 GLM 系列开源模型。

OpenAI 因外国间谍威胁加强安全措施 中国 AI 力量
Jul 09, 2025

OpenAI 因外国间谍威胁加强安全措施

该人工智能集团已增设指纹扫描并聘请军事专家以保护重要数据 本文信息来源:FT 在声称遭到中国竞争对手的针对性攻击后,OpenAI 已全面改革其安全运营体系,以保护知识产权免受企业间谍活动侵害。 据多位接近这家估值3000亿美元人工智能公司的人士透露,近月来的变革包括加强对敏感信息的管控,以及强化员工背景审查。 这家总部位于旧金山的初创公司自去年起就不断加强安全措施,但在中国 AI 初创企业深度求索(DeepSeek)于一月份发布竞品模型后,相关管控措施进一步提速。 OpenAI 声称 ,深度求索公司不当复制了这家加州公司的模型,采用名为”蒸馏”的技术来发布竞争性 AI 系统。此后 OpenAI 已加强防范此类手段的安全措施。 深度求索公司未就相关指控置评。 “这一事件促使 OpenAI 采取更严格措施”,一位接近其安全团队的人士表示。他补充说,由山姆·奥特曼领导的这家公司正在”积极”扩充安全人员编制并完善操作规程,包括网络安全团队建设。 全球 AI 军备竞赛加剧了人们对技术窃取企图的担忧,这可能威胁经济与国家安全。美国当局去年曾警告科技初创企业,包括中国在内的外国对手正加大力度获取其敏感数据。 OpenAI 内部人士透露,这家初创公司自去年夏天起就在其旧金山办公室实施了更严格的政策,限制员工接触算法及新产品等关键技术信息。 知情人士表示,这些被称为信息”帐篷化”的政策大幅减少了能够接触新型开发算法的人员数量。 例如,当 OpenAI 去年开发内部代号为”草莓”的 o1 新模型时,项目组员工被要求在公共办公区域讨论前,必须确认其他同事同属”草莓帐篷”成员。 这种严格措施给部分员工带来工作困扰。”管控变得非常严密——要么掌握全部权限,要么毫无权限,”一位人士表示。他补充说,随着时间推移,”更多人被授权接触必要信息,同时无需知晓其他无关内容”。 据知情人士透露,该公司目前将大量专有技术保存在隔离环境中,这意味着计算机系统保持离线状态并与其他网络分离。他们补充说,办公室还设置了生物识别检查,个人必须扫描指纹才能进入特定房间。 为了保护模型权重(影响模型响应提示的参数),OpenAI 采用了”默认拒绝出口策略”,这意味着除非明确批准,否则任何设备都不得连接互联网。 知情人士称,OpenAI 还加强了数据中心的实体安防措施。英国《金融时报》去年曾报道,由于中国间谍活动威胁加剧,OpenAI 是多家加强员工及潜在招聘对象背景审查的硅谷企业之一。 华盛顿与北京之间的战略竞争日益加剧,美国实施出口管制加大了中国获取和发展尖端技术的难度。但鉴于亚裔技术人才在美国科技公司中的普遍性,外界也对美国科技企业排外情绪抬头表示担忧。 OpenAI 于去年 10 月从大数据分析公司 Palantir 挖来戴恩·斯塔基(Dane Stuckey)担任首席信息安全官一职。Palantir 以承接大量军方和政府业务著称。 斯塔基与 OpenAI 安全产品副总裁马特·奈特(Matt Knight)协同工作。据知情人士透露,奈特一直在探索如何利用 OpenAI 的大型语言模型来增强其抵御网络攻击的能力。 去年,美国退役陆军上将保罗·中曾根加入 OpenAI 董事会,协助监督该公司防范网络安全威胁的工作。 OpenAI 表示正大力投资其安全隐私项目,旨在引领行业发展。公司补充称,这些调整并非针对任何特定事件。

AI耗尽全网高质量数据后,下一个十年拼什么? 中国 AI 力量
Jul 08, 2025

AI耗尽全网高质量数据后,下一个十年拼什么?

作者:yidingjiang 大型语言模型是近三十年来互联网上可自由获取的人类文本意外催生的副产品。Ilya Sutskever 将这种信息储备比作化石燃料——储量丰富但终究有限。研究表明,按照当前的数据消耗速率,前沿实验室可能在 2030 年前就会耗尽最高质量的英文网络文本。即便这些预测被证明过于悲观,一个不争的事实是:当今模型消耗数据的速度远超人类生产数据的能力。 David Silver 和 Richard Sutton 将这一即将到来的阶段称为”经验时代”,其核心突破将依赖于学习智能体自主生成的数据。本文中,我想进一步延伸他们的观点:真正的瓶颈不在于获取任意经验,而在于收集对学习真正有益的关键经验。人工智能的下一波进展将更少依赖于参数堆砌,而更多取决于探索——即获取新颖且富含信息量的经验的过程。 要讨论经验收集,就必须考虑收集它们的成本。归根结底,规模化是个资源问题——计算周期、合成数据生成、数据整理流程、人工监督,任何能产生学习信号的投入。为简化表述,我将这些成本统一归入一个名为”浮点运算量”的记账单位。严格来说,一次浮点运算指一个浮点操作,但这个术语已成为衡量”系统消耗了多少资源”的通用标准。我在此借用这个概念并非因其工程精确性,而是它提供了一种通用的抽象计量单位。我的讨论仅基于相对投入量,不涉及具体的芯片配置、数据或人工时间的组合。请将浮点运算量视为”任何制约规模的稀缺资源”的简写。 在接下来的章节中,我将阐述若干观察,并将通常出现在不同语境中的观点联系起来。”探索”最常用于强化学习(RL)的语境,但我会在更广泛的意义上使用这个词——远超出其在 RL 中的常规角色——因为每个数据驱动系统都必须先决定收集哪些经验数据,才能从中学习。这种对”探索”的用法也受到我的朋友 Minqi 那篇精彩文章《通用智能需要重新思考探索》的启发。 本文其余部分的结构如下:首先,预训练如何无意中解决了部分探索问题;其次,为何更好的探索能带来更好的泛化能力;最后,我们未来应该将数十万 GPU 年的算力投入哪些方向。 预训练即探索 标准的 LLM 流程是先用大量文本通过下一个词预测任务预训练一个大模型,随后通过强化学习微调模型以实现特定目标。若没有大规模预训练,强化学习阶段将难以取得进展。这种对比表明,预训练完成了某些对于白板式强化学习(即从零开始)而言困难的任务。 近期研究中一个看似矛盾却普遍观察到的趋势是:小型模型一旦通过能力更强的大型模型生成的思维链进行蒸馏,就能展现出显著提升的推理能力。有人将此解读为”大规模并非有效推理前提”的证据。在我看来,这种结论存在误导性。我们真正应该思考的是:如果模型容量不是推理的瓶颈,为何小模型仍需从大模型中蒸馏知识? 对于这两项观察结果,一个有力的解释是:预训练的巨大成本实际上是在支付一笔高额的”探索税”。未经预训练或预训练规模较小的模型,单凭自身很难可靠地探索解决方案空间并独立发现优质解法 1 。预训练阶段通过在海量多样化数据上投入巨大算力,学习到丰富的采样分布(在此分布下更可能获得正确延续),从而支付了这笔税款。而蒸馏机制则让小型模型得以继承这笔”税款”,借助大模型巨额投入所获得的探索能力实现自我提升。 为何这种预付费式探索如此重要?广义而言,强化学习循环的运行机制可概括为: 探索阶段。智能体生成若干随机探索轨迹。 强化。优质轨迹被赋予更高权重,劣质轨迹则被降权处理。 要使这个学习循环有效,智能体在探索阶段必须能够生成至少一定数量的“优质”轨迹。这一概念在强化学习中有时被称为覆盖度。对于 LLMs 而言,这种探索通常通过从模型的自回归输出分布中进行采样来实现。在这种探索机制下,正确的解决方案需要已经存在于原始采样分布中且具备一定可能性。如果低容量模型通过随机采样很少能偶然发现有效解,那么它就没有任何有用的内容可供强化。 在没有任何先验信息的情况下进行探索是一个非常困难的过程。即便在最简单的表格型强化学习设定中——每个情境(状态)和每个动作都能被列举在表格里——理论表明学习过程仍需要大量尝试。表格型强化学习中关于训练回合数的样本复杂度著名下限是  (Dann & Brunskill, 2015),其中  表示状态空间大小,  表示动作空间大小,  表示时间跨度,  表示与最优解的”距离”。这意味着最小训练回合数会随状态-动作对数量线性增长,并随时间跨度的平方增长。对于 LLMs 而言,状态空间现在包含所有可能的文本前缀,动作空间则是任意下一个标记,两者规模都极其庞大。若没有任何先验信息,这种设定下的强化学习实际上是不可能实现的。 迄今为止,探索的艰巨工作主要依赖于预训练和从轨迹样本中学习更优的先验分布。然而这也意味着,模型能直接采样的轨迹类型会严重受限于先验分布。要取得进一步突破,我们必须找到超越先验分布的方法。 探索促进泛化 传统强化学习研究往往聚焦于逐个攻破单一环境,例如 Atari 或 MuJoCo。这相当于在同一个数据点上进行训练和测试。但模型在单一环境中的表现,并不能充分说明其应对真正新场景的能力。机器学习的核心终究在于泛化能力:对于许多难题,若能预先知晓,我们完全可以设计定制化解决方案。真正的价值在于解决那些未曾见过、甚至未曾预料到的问题。 强化学习的泛化性能对语言模型至关重要。训练过程中,LLM 仅接触有限数量的提示样本,但在实际部署时却必须处理与训练样本差异巨大的任意用户查询。值得注意的是,当前 LLMs 在具有可验证奖励的任务(如编程谜题或形式化证明)中表现优异,因为这些任务的正确性易于检验。更具挑战性的问题在于将这些能力泛化至边界模糊的领域(例如生成研究报告或撰写小说),这类任务反馈稀疏且模棱两可,大规模训练与数据收集也更为困难。 训练通用化模型有哪些可选方案?深度学习的一个永恒主题是数据多样性驱动稳健泛化。探索直接控制着数据的多样性。在监督学习中,一个标注样本通过单次前向传播就能揭示其全部细节 2 ,因此增加数据多样性的唯一途径就是收集更多数据。相比之下,在强化学习中,每次交互仅能暴露环境的狭窄片段。因此,智能体必须收集足够多样化的轨迹序列,才能构建具有代表性的环境认知。若采集的轨迹缺乏多样性(例如简单随机采样),策略就可能对狭窄片段过拟合,甚至在同一环境中也会表现失常。 当存在多个环境时,这个问题会愈发严重。Procgen 是流行的强化学习泛化基准测试,它包含一系列类 Atari 游戏,这些游戏采用程序化生成环境,因此原则上每个游戏都包含”无限多”种环境。其目标是在固定数量的环境中训练固定步数后,能够泛化到完全未见过的环境 3 。 针对这一基准测试,现有方法大多将其视为表征学习问题,并采用源自监督学习的正则化技术(如随机失活或数据增强)。这些方法虽有效果,却忽视了强化学习最重要的结构要素之一——探索。由于智能体需自主收集数据,它们完全可以通过改变探索策略来提升泛化能力。在早期研究中,我与合著者已证明:仅需为现有强化学习算法搭配更强的探索策略,无需显式正则化就能使其在 […]

下一代交互界面是面孔 中国 AI 力量
Jul 07, 2025

下一代交互界面是面孔

本文信息来源:felicis 人与计算机之间的交互界面不断演进,从二进制开关到图形用户界面,再到小型黑色镜面设备,如今又发展到自然语言提示 。但一种新界面正在崛起:数字化身。 数字化身(或称数字人类)将先进 AI 模型与视听线索相结合,实现了与计算机实时拟人化交互。它们构建起一个直观的互动层,日益契合 AI 不断增长的能力。 数字化身长期具备商业潜力。腾讯近二十年前推出的 QQ 秀,六个月内就吸引了五百万付费用户。而近期 AI 技术的突破正使数字化身成为不可或缺的存在。诸如 HeyGen(3.5 万客户,年收入超 3500 万美元)和 Synthesia(6 万客户,年收入超 1 亿美元)等初创企业印证了激增的市场需求。Mercor 和 Delphi 等公司已将数字化身作为产品体验的核心组件。而 Canopy、Anam 等新锐企业更在持续拓展技术疆界。 三大趋势正推动这一加速进程: 善用时间优势治疗诊所、销售团队、健身教练、网红博主和客服中心正运用虚拟形象实现24/7全天候运营,摆脱人类疲劳与排班冲突的限制。例如,高管教练可以通过提供融合其方法论与声音特色的虚拟形象指导课程,实现业务规模化扩展。 推理与记忆增强型 AI 推理技术使虚拟形象能进行情境感知的连贯对话,极大提升了实用性与可信度。当今 AI 模型已能通过律师资格考试、记忆数千词汇(该容量将持续增长)并解决复杂逻辑问题。这些能力飞跃将促使人类更信赖 AI 虚拟形象。 跨越恐怖谷实时音视频生成技术的最新突破使虚拟形象显著逼真化。像 Tolan 这样的平台能提供富有情感表现力的外星人形象,其应用在 App Store 已收获 4.4 万条评价,平均评分达 4.8 星。一位 Reddit 用户表示与 Tolan 对话时” 哭得像个孩子 “。Anam 的虚拟形象则突破性地实现了实时人类情感模拟,而 Tavus 的数字化身已被德勤、安泰保险、字节跳动等团队投入使用。 ‍ 来自 Anam、Tolan 和 Tavus 的虚拟形象 ‍ 口袋中拥有个性化、具备推理能力的数字伴侣将在多场景中发挥作用。虚拟形象技术即将颠覆的领域包括: 创作者: 深化准社会关系。 陪伴者: 缓解孤独与关怀需求。 医疗保健: 全天候诊断支持。 游戏: 沉浸式互动体验。 招聘: 可扩展的面试与辅导。 销售: 强化的产品演示与入职培训。 治疗: 高度在场、情感敏锐的辅助。  […]