GLM-5.3你来定!智谱唐杰行家搜集观念,指摘区清一色:视觉

鹭羽 发自 凹非寺量子位 | 公众号 QbitAI
最近,清华证明、智谱灵魂东说念主物唐杰聊得有点high。
昨天先是畅聊AI阐发,“AI的末端即是AGI,一场猎龙游戏”。引起无为热议后,一醒觉来今天又在当众搜集观念:
诸君!下个版块的GLM,你思要啥?

浏览量一刹干到了40w+,这影响力真够顶的!
不外要说网友们为啥这样壮胆,还得倒回前年GLM-4.6刚开源那会儿。
彼时唐杰也问过这样一趟,指摘区纷纷暖和支招,一条条需求自后陆连继续都在GLM后续版块中有所竣事。
真·有问必答·阿拉丁。
是以此次他一张口,懂行的东说念主立马团建去了~有po我方痛点的,也有智谱自家职工鄙人面留言。
比如这位网友告枚举出了我方的愿望清单:更强的Agent智商、超长凹凸文保持质料、更生动的API……

更有甚者安分祷告:求你了GLM!作念一个雷同Codex的桌面运用!!

真谛的是,此次GLM-5.3的指摘区,刷得最多的如故——
视觉!

GLM的视觉之痛
两周前,智谱刚刚开源GLM-5.2。
强到离谱!开源界AI编程第一、行家第二,仅屈居于大名鼎鼎的听说级模子Fable-5。

但要说痛点,很显然,亦然果真痛:
没视觉啊……
纯文本模子,搞得动百万Token超长凹凸文和深度逻辑推理,但偏巧没搭载视觉编码器,看不了图也造不出图。
反不雅拿来对所在Fable-5,它是原生多模态模子,视觉智商应有尽有。
于是GLM用户双双流下景仰的泪水:我也思领有TT

而况重要在于,不是智谱作念不出视觉。刚巧相悖,本年4月智谱发过一个叫GLM-5V-Turbo的模子。
原生多模态的Coding基座,欧美人成精品网站播放从预检修阶段就把视觉和文本揉在悉数,能看懂打算稿、截图、网页界面,然后告成吐出能跑的代码,主打视觉+代码+Agent一体化。
再往前看,智谱也作念过不少多模态模子,CogVLM视觉编码器就出自他们之手。唐杰本东说念主发表过的视觉论文,更是一执一大把。
是以问题根本不是有莫得视觉智商,而是智谱没把视觉放进最强旗舰模子中去。
这极少从唐杰过往的发言中也可见一斑,比如前年底的大模子年终回来,他先是细则多模态是明天。
但立时他又补刀说念:
问题是,当下的多模态对升迁AGI的智能上界,匡助有限。可能最有用的风光如故分开荒展,文本、多模态、多模态生成。诚然范围的探索这三者的迷惑细则能发现一些很不相同的智商,但这需要勇气和浑朴的本钱守旧。
你品,你细品。
唐杰这种冲在AI一线的科学家,盯着的永久如故第一性旨趣——模子智能。视觉不错让模子更好用,但要让模子更智慧,靠的如故复杂推理那套硬功夫。
这即是用户和厂商的视角互异。
AGI关于用户太远方了,是以用户更在乎的是,脚下贴张图模子能不行接住、截个屏模子能不行看懂。
于是就出现了这条推文里最奥秘的拉扯。一边是科学家盯着智能的天花板,认为视觉仅仅精雕细琢;一边是全宇宙的开荒者都在都刷刷呼喊视觉。
更何况,敌手也来势汹汹。
Kimi K2.5本年1月即是原生多模态了,Qwen3.5-Omni三月份端到端把文本/图像/音频/视频全结伴进一个模子,更别说海外上Gemini 3那种原生文图音视频一把执的。
GLM旗舰款补足视觉,险些是一衣带水。且等接下来端上桌的GLM-5.3。
One More Thing
终末再望望唐杰最近的一些共享吧,还挺值得商量的。
(其一)

(其二)

(其三)

(其四)

参考结伴:[1]https://x.com/jietang/status/2071454597521215748?s=20[2]https://x.com/ZixuanLi_/status/2071491673511674059?s=20[3]https://m.weibo.cn/status/5247011059141988

