探索AGI的双重路径:从语言与世界模型出发

5450

在过去的三年里,AGI的发展主要围绕语言展开,关注点包括文本数量、模型参数、上下文长度和推理能力,同时还涉及工具使用与智能体的构建。这条路径已经展现了强大的能力,使机器能够进行阅读、写作、编程、信息检索和规划,逐步承担起某些复杂任务。然而,当任务从简单的“在网页上填写表格”转变为“稳稳拧入灯座的灯泡”时,面临的挑战就变得复杂起来。机器人不仅需要识别物体,还需判断手指如何接触、旋转时的可能性,以及如何在出现偏差时进行调整。这要求其具备一个能够在行动前预演结果、在行动后进行反思的内部模型。

目前AGI发展出现了不同的发展路径,一方面是以语言模型和智能体为核心的方向,另外一方面则是利用世界模型进行实时交互和动作规划。例如,两家来自清华实验室的企业,智谱和生数,分别代表了这两种路线:前者通过语言与智能体的整合推进,而后者通过世界生成与交互推进。这两者如同在同一座山的不同侧面攀登,前者从人类已知的语言与知识出发,而后者则从世界的动态变化和反馈入手。

理解后者的挑战,尤其需要关注在实际操作中的细微差别。将灯泡拧入灯座,看似简单,但真正的难点在于动作的细节和反馈:手指需感受到微小的阻力,旋转的角度偏差会导致卡住,而力度过大会导致动作变形。人类的手并不需要先计算出复杂的公式,而是通过视覺和触觉的反馈即刻调整,这是“手巧”的真正含义。当前的机器人距离这一能力仍有差距。虽然它们能够理解“把灯泡拧上去”的指令,并在实验室里重复某些训练轨迹,但当面临新的情境时,考验的并非它们的运动能力,而是其内在世界的构建。 球友会

about image

这也是为何世界模型正在成为AI研究的新前沿。最近,生数推出的Motus2,正是沿着这一思路,寻求在“手必须真正接触世界”这一领域的新突破。

在不同领域,关于世界模型的研究逐渐聚焦于同一个核心问题。无论是视频生成、空间智能,还是机器人与自动驾驶,系统都必须面对同样的闭环:智能体观察世界、采取行动、改变世界,并基于新的观察进行反馈。

李飞飞和World Labs团队在一篇文章中将当前的世界模型进行了分类,厘清了各自的功能及其在不同链路上的输出。随后,朱军团队则从不同角度探讨了系统如何使这些能力相互耦合,以实现真正的通用性。 球友会

通过分层次理解,朱军团队将通用世界模型划分为五个级别,从基本的世界生成到与外界交互、行动反馈,直到发展出具备自主感知与探索能力的智能体,最终实现多元协同的复杂系统。这些研究的交汇与深入,有助于推动AGI的进一步发展。

运动的每一滴汗水,都是通向健康和幸福的脚印!...

运动的每一滴汗水,都是通向健康和幸福的脚印!...