GLM-5.3你来定!智谱唐杰全球征集意见,评论区清一色:视觉
鹭羽 发自 凹非寺
量子位 | 公众号 QbitAI
最近,清华教授、智谱灵魂人物唐杰聊得有点high。
昨天先是畅聊AI认知,“AI的终局就是AGI,一场猎龙游戏”。引起广泛热议后,一觉醒来今天又在𝕏当众征集意见:
各位!下个版本的GLM,你想要啥?
浏览量瞬间干到了40w+,这影响力真够顶的!
不过要说网友们为啥这么捧场,还得倒回去年GLM-4.6刚开源那会儿。
彼时唐杰也问过这么一回,评论区纷纷热情支招,一条条需求后来陆陆续续都在GLM后续版本中有所实现。
真·有求必应·阿拉丁。
所以这次他一张口,懂行的人立马团建去了~有po自己痛点的,也有智谱自家员工在下面留言。
比如这位网友直接列出了自己的愿望清单:更强的Agent能力、超长上下文保持质量、更灵活的API……
更有甚者诚恳祈祷:求你了GLM!做一个类似Codex的桌面应用!!
有趣的是,这次GLM-5.3的评论区,刷得最多的还是——
视觉!
GLM的视觉之痛
两周前,智谱刚刚开源GLM-5.2。
强到离谱!开源界AI编程第一、全球第二,仅屈居于大名鼎鼎的神话级模型Fable-5。
但要说痛点,很明显,也是真的痛:
没视觉啊……
纯文本模型,搞得动百万Token超长上下文和深度逻辑推理,但偏偏没搭载视觉编码器,看不了图也造不出图。
反观拿来对标的Fable-5,它是原生多模态模型,视觉能力应有尽有。
于是GLM用户双双流下羡慕的泪水:我也想拥有TT
而且关键在于,不是智谱做不出视觉。恰恰相反,今年4月智谱发过一个叫GLM-5V-Turbo的模型。
原生多模态的Coding基座,从预训练阶段就把视觉和文本揉在一起,能看懂设计稿、截图、网页界面,然后直接吐出能跑的代码,主打视觉+代码+Agent一体化。
再往前看,智谱也做过不少多模态模型,CogVLM视觉编码器就出自他们之手。唐杰本人发表过的视觉论文,更是一抓一大把。
所以问题压根不是有没有视觉能力,而是智谱没把视觉放进最强旗舰模型中去。
这一点从唐杰过往的发言中也可见一斑,比如去年底的大模型年终总结,他先是肯定多模态是未来。
但随即他又补刀道:
问题是,当下的多模态对提升AGI的智能上界,帮助有限。可能最有效的方式还是分开发展,文本、多模态、多模态生成。当然适度的探索这三者的结合肯定能发现一些很不一样的能力,但这需要勇气和雄厚的资本支持。
你品,你细品。
唐杰这种冲在AI一线的科学家,盯着的始终还是第一性原理——模型智能。视觉可以让模型更好用,但要让模型更聪明,靠的还是复杂推理那套硬功夫。
这就是用户和厂商的视角差异。
AGI对于用户太遥远了,所以用户更在乎的是,眼下贴张图模型能不能接住、截个屏模型能不能看懂。
于是就出现了这条推文里最微妙的拉扯。一边是科学家盯着智能的天花板,觉得视觉只是锦上添花;一边是全世界的开发者都在齐刷刷呼喊视觉。
更何况,对手也来势汹汹。
Kimi K2.5今年1月就是原生多模态了,Qwen3.5-Omni三月份端到端把文本/图像/音频/视频全统一进一个模型,更别说国际上Gemini 3那种原生文图音视频一把抓的。
GLM旗舰款补足视觉,几乎是迫在眉睫。且等接下来端上桌的GLM-5.3。
One More Thing
最后再看看唐杰最近的一些分享吧,还挺值得琢磨的。
(其一)
(其二)
(其三)
(其四)
参考链接:
[1]https://x.com/jietang/status/2071454597521215748?s=20
[2]https://x.com/ZixuanLi_/status/2071491673511674059?s=20
[3]https://m.weibo.cn/status/5247011059141988
一键三连**「点赞」「转发」「小心心」**
欢迎在评论区留下你的想法!
— 完 —
💬 希望掌握最新AI资讯,欢迎加入量子位「每日AI交流群」👇
💼 这里有大厂做模型的、有创业公司跑落地的、有媒体追热点的,也有VC看项目的。
🙌 添加小助手【qbitbot13】,备注**「姓名-公司-职位」**,审核通过后入群。
🌟 点亮星标 🌟
科技前沿进展每日见
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/edudaily/post/20260815/GLM-5.3%E4%BD%A0%E6%9D%A5%E5%AE%9A%E6%99%BA%E8%B0%B1%E5%94%90%E6%9D%B0%E5%85%A8%E7%90%83%E5%BE%81%E9%9B%86%E6%84%8F%E8%A7%81%E8%AF%84%E8%AE%BA%E5%8C%BA%E6%B8%85%E4%B8%80%E8%89%B2%E8%A7%86%E8%A7%89/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com