Jul 20, 2025
本文信息来源:astralcodexten 2022 年 6 月,我和一位评论者打赌 100 美元,说人工智能将在 2025 年 6 月之前掌握图像构图能力。 DALL-E2 刚刚问世,展现了 AI 艺术的潜力。但它无法遵循复杂的指令;它的图像只能与提示的“氛围”相匹配。例如,以下是它尝试的一些作品:“一个红色球体放在蓝色立方体上,右边是一个黄色金字塔,所有这些都放在绿色桌子上”。 当时我写道: 我不会错误地认为这些问题是AI艺术固有的。我猜一个稍微好一点的语言模型应该能解决大部分问题……据我所知,一些更大型的图像模型已经解决了这些问题。我预计这些问题在未来几个月的研究中会得到解决。 评论者们对此表示反对,认为这种预测过于乐观。AI 只不过是一只模式匹配的“随机鹦鹉”。要想准确回答问题,需要对语法有深入的理解,而这需要超越法学硕士(LLM)的全新范式。例如,Vitor 的言论: 你为什么对此如此自信?像 DALL-E 这样的系统无法以需要实际内部世界模型的方式理解语义,在我看来,这正是问题的核心。我们也可以在语言模型本身中看到这种确切的失败模式。只有当人类要求一些模糊且有很大解读空间的内容时,例如缺乏太多内部逻辑或连续性的诗歌或奇幻故事,它们才能产生良好的结果。 并不是自吹自擂,但两年前你天真地说过,我们现在就会有类似 GPT 的模型,规模扩大几个数量级(100T 参数)(https://slatestarcodex.com/2020/06/10/the-obligatory-gpt-3-post/#comment-912798 )。 我承认我的预测,你现在也同样天真。在我看来,真正解决这个问题似乎已经是AI完备的了。我愿意为此打赌(欢迎提出关于操作化的想法)。 所以我们打赌了! 好的。我建议在 2025 年 6 月 1 日实现这一目标,如果我们能够获得当时最好的图像生成模型(由我决定),或者能够说服其他有权限的人来帮助我们,我们将向它提供以下提示: 1. 一幅彩色玻璃画,画中一位女士在图书馆里,肩上停着一只乌鸦,嘴里叼着一把钥匙 2. 一幅油画,描绘了一位工厂里的男人看着一只戴着高顶礼帽的猫 3. 一幅数字艺术画,描绘了一个孩子骑着一只尾巴上挂着铃铛的骆驼穿越沙漠 4. 太空中一名宇航员抱着一只涂着口红的狐狸的 3D 渲染图 5. 像素艺术:大教堂里一位农民手握红色篮球 我们为每个提示生成10张图片,就像DALL-E2一样。如果10张图片中至少有一张在3/5的提示中完全正确地描述了场景,那么我赢了,否则你赢了。输家支付给赢家100美元,无论结果如何,我都会在博客上公布(可能是公开讨论)。如果我们意见不一致,由Gwern来评判。 当时的一些图像模型拒绝画人类,所以我们同意在需要人类的图片中用机器人代替人类。 2022年9月,我在Google Imagen上取得了一些不错的结果,并宣布我在三个月内赢得了这场为期三年的赌注。评论者们冲我大喊大叫,说Imagen的预测仍然不够准确,我宣布胜利为时过早。这场争论愈演愈烈,以至于“RLHF和人类法学硕士评估平台”Surge的Edwin Chen介入,并咨询了他的专业AI数据标注团队。他们的结论很明确:AI很糟糕,而我错了。为了避免进一步丢脸,我同意等到赌注结束,并在2025年6月重新评估。 赌注现在结束了,官方裁判格温认定我赢了。在我得意洋洋之前,先来看看那些让我们走到这里的照片吧。 人工智能组合性:三年回顾 […]