节目片头
大家好,欢迎来到 Next Token|词元之外。这是一档关注 AI 技术、产品与现实影响的视频播客,同时提供音频版。旗舰栏目 Next Token Weekly,由杨攀、歸藏、橘子和向阳乔木每周圆桌对谈,分享观察、实践与不同判断。不只预测下一个词元。¶
开场:为什么做一档每周 AI 回顾节目
大家好,欢迎收看、收听《Next Token|词元之外》。这是我们每周 AI 大事的回顾节目 Next Token Weekly。我是杨攀,这一期我是当值主理人。¶
我们这个节目还有三位主理人,分别是乔木、橘子和歸藏。三位主理人,每一位跟大家打个招呼吧。¶
大家好,我是向阳乔木。¶
大家好,我是橘子。¶
大家好,我是歸藏。¶
那我们就快速直入主题。我们几个人之前就特别想录一个系列节目,每周固定时间给大家 Review 一下,过去一周在整个 AI 圈内发生的各种事件、新闻,并且基于我们的理解做一些解读。这样大家关注我们的节目,就可以了解过去一周发生的新鲜大事,对齐最新的 AI 认知。¶
今天分几个部分跟大家交流。我们这次回顾的是 8 月 27 号到 9 月 3 号这一周。先讲讲过去一周发布的模型,数量非常多;然后聊聊 AI Agent 相关的产品;第三部分聊一些我们感兴趣的硬件;最后是一些大的商业事件和新闻。¶
我先念一下过去一周发布的模型名字,然后几位主理人一起聊聊。不按时间顺序了,我就直接拉个列表。¶
过去一周是波澜壮阔的一周。就在我们录节目之前,昨天晚上应该发布了 Gemini 3.8 Flash,紧接着这个 Benchmark 刚刚登顶,Meta 的 Muse Spark 1.3 就发布了。¶
过去一周还有 Fable 5.1、Mythos 5.1,再往前推是 Qwen 3.8 Max、Qwen 3.8 Flash Next。还有过去一周非常火的智谱 GLM 5.3 Flash,也就是大家知道的“牛来”模型,以及混元的 Hunyuan 4 Preview。¶
智谱 5.3 虽然是上上周发的,但上周也做了开源。DeepSeek V4 Flash Vision 也做了开源,而且是体验版。¶
还有几个比较小众的,一个是 Google 的 Gemini Omni 1.1 Flash,是一个全模态模型。还有 Gemini 3.5 Transcribe,是一个语音转文本模型,以及 Meta 的 Muse Voice Transcribe。¶
另外,上周还有个大事件,虽然不是上周新发的模型,就是 MiniMax H3 的无限流。这个轰动了全网,可能探索出了一个新的玩法。¶
以上是我作为这周主理人整理的模型列表。我们下面聊聊,上周对这些模型有什么看法?歸藏先来开个头。¶
GLM 5.3 Flash 与 MiniMax H3,便宜模型为何更容易进入真实使用
我感觉比较值得关注的是 GLM 5.3 Flash。主要是我觉得,很多东西大家用不起,就不关注。尤其对国内用户来说,比如 Fable 5.1 或者 Mythos 5.1,太贵了。发布以后,他自己说推理缓存成本降了 75%,但 200 美元的 5 小时额度,3 分钟就干完了,很多人也用不起。¶
这种能力比较好、成本比较低的,大家都很关注。包括 Hunyuan 4 Preview,在 WorkBuddy 上的一些试用体验,可能大家也关注比较多。¶
试用 2 周。¶
无限流这个东西,我怎么印象中去年其实就有类似的东西,但是好像没有火起来?¶
它有点产品化在里面了。¶
让你感觉到好像跟以前的东西不一样。¶
去年其实有好几家都做这种演示,感觉就是展示这种前沿技术,也没有被实际用。¶
实时的。¶
去年好多家是那种没有什么主题,就跟做梦一样,那种不行。你看刚刚那个场景,其实有点儿节目视频的意思。¶
它能用。之前那些东西都非常 Demo,而且消耗的算力非常恐怖,所以很多都是内测,给我们用一下,过段时间也不开放。¶
有点儿真用。而且它会有时间限制,说这个东西,你这个场景生成是最多生成多久。¶
它就崩了。¶
质量比之前高很多,就起码能看了,之前确实是,是不能看的,实时的那种。¶
可视觉还是挺……¶
对 C 端用户只能对这个东西有感知,你说我 Agent 强了多少,我实际执行时长了多少,我能够做,做什么医疗什么的,没有感知,就是只能还是看这些视觉的。¶
所以模型厂商训练数据的时候,也肯定是一直在这上加。¶
营销好。¶
是不是对硬件也会有影响,我觉得好多个人都开始,想买好点的显卡,自己部署。¶
而且它能那啥。¶
那就不止 H3 了。我家里有 128GB Mac Studio,这一波模型其实试了好多。最早是阿里的 Qwen 系列,27B、35B;后面这波 DeepSeek V4 Flash,我就在电脑上装了一个,推理速度能达到差不多 30 TPS,已经能用了。¶
接下来这个“牛来”,5.3 Flash,也还可以,我在电脑上试了。还有 Qwen 3.8 Flash Next,这些都属于本机有个 256G 内存就可以搞定的。¶
我觉得 100B 是一个非常甜点的参数,在目前看来,100B 非常……¶
但我还是觉得,本地推理仍然是特定场景。一般人要回本,其实是算不过来账的。那肯定算不过来。¶
我做过一个极端测算:买那个 Mac Studio,如果每时每秒都在跑,大概两年能回本。但正常普通人用,基本上就奔着 10 年、20 年去了,因为你不可能一直自己在用。¶
环境。他们都在用的。¶
Computer Use 啥的都需要。说到 Computer Use,我觉得就是今天……¶
Computer Use 正在怎样改变 Vibe Coding 的验收
最近这半年,模型的 Computer Use、Browser Use 能力提升极大,我觉得这极大提升了效率。原来我们大量工作都需要停下来让人去处理,现在好多事情基本上完全不用了。¶
AI 自己的。¶
也不用 Cookie 啥的。¶
用的那个,用那个基础上的迭代。¶
一直在做。¶
所以有时候做产品不能离谱,它好,你就光明正大地借过来用就行。¶
直接。¶
他部署了多少万张卡,不知道,但是……¶
我觉得……¶
他是弄了一个集群,之前不是说有传言在……知道。他主要是效率高,那个他那个推理效率是之前那个版本的 10 倍。¶
但你看,明显感觉“牛来”虽然模型参量比较小,跟 Google Gemini 走的却不是一个路线。Gemini 在拉速度,100 以上的 TPS;智谱走的是普惠,速度没拉上去,但原来不是供应量不够吗?现在把供应量放开了。¶
不会,它那个跟卡有关系,它国产卡可能速上……¶
也对,也想拉,确实没有,确实不如 TPU。TPU 确实在这波儿里是,没毛病……¶
但量大,你看它在 OpenRouter 开放那么久,能支撑全球的这种使用,很牛逼的。66T,1 周消耗 66T。所以也以至于一度 X 上好多人推测说这是谷歌的模型吗?这是什么英伟达支持的算力吗?¶
你说不是中国,因为中国没这么多卡。¶
不,没对,没这么多卡。¶
不,Flash 是新架构,之前是没有多模态的。¶
以后新模型用不起。¶
很贵,而且据说这还是降价后的价格。¶
没事,有成本。¶
好模型与便宜模型,Agent 能否自动完成路由
你看,如果接下来便宜的模型这么好用,或者反过来说,好用的模型这么便宜,如果最好的和可用的之间拉开了 10 倍空间,我觉得从 Agent 的角度出发,不同价格的模型混合应用,其实应该好好推一下。¶
现在还是人在切。¶
但我觉得核心问题是,如果说 AI 去控制模型切换,AI 控制不好。¶
你看现在有两种路线,一种是从 Router 角度去做,我觉得那就更离谱了,至少 Agent 还有个判断。¶
路由。¶
那现在是怎么做?就是判断这个任务的难度,然后分配给不同成本的其他模型。¶
而且哪个 Agent 在跟做吗?不知道。¶
有哪边在跟做吗?¶
不用不用折腾。¶
现在还有一个问题是缓存的问题。所以现在还是基本上就是 Agent Teams,¶
Harness 评测:完成率、Token 成本与“斩杀线”
模型一样的情况下。¶
那属于缓存,没有没有。¶
那不算 Bug。¶
我看那个评测里,效率最高的是 Codex,后面我们找时间可以单独聊。它现在也做了个“斩杀线”,就是一条曲线,在边上的就相当于斩杀线。¶
DeepSeek Harness 的效率非常高,而且它分别评测了 DeepSeek Harness 的三种模式。这三种模式的 Token 消耗和效率还不一样,这么细。¶
我觉得有可能是简单。¶
它其实有可能是简单。¶
它那个架构确实高效。¶
它的架构是。¶
Claude Code 的架构其实很重。你看,他们已经删了一半提示词,因为它是从那个时代过来的。提示词有很多,包括早期的一些 TODO 之类的,边界上的东西太多了。¶
加了一堆。¶
Pi,我早晨看了这个报告。Pi 在斩杀线里面,相当于被斩杀了,它不在边上。因为斩杀线就是说,要么便宜,要么好。它在里面,相当于应该是被 DeepSeek Harness 给盖住了。¶
它自己比较轻量,但扩展性弱很多,MCP 什么的支持都不好。¶
然后你依赖社区,社区就给你在那儿……¶
那比较适合开发者自己 DIY,但现在感觉 DeepSeek Harness 更适合 DIY。DeepSeek Harness,我觉得……¶
用。¶
你 DIY 没有意义,这个东西你 DIY 完之后你干嘛呢?¶
做不好。¶
是给那个用户自己玩儿的,那对你玩儿还行。但实际上 DeepSeek Harness 是为了接下来模型跟 Agent 的联合训练,其实是……¶
自进化。¶
原来比如 Claude Code,顶多你的数据就是这个 Agent 的行为轨迹,但 Agent 本身没法自进化。¶
我最近还有一个体会。同样一个需求,比如做背景调研,这次为咱们节目准备资料,我说把咱们四个人在全网的信息跑一遍、搜一下。同样的需求给 Codex,可能找着找着就没有了,我估计就二十分的水平。¶
但是用 DeepSeek Harness,人类手工找得到、找不到的信息,它全都能找到。而且最神奇的是,我不知道为什么,也没研究过,它可以读微信公众号文章。它首先能搜到,然后能把那个 URL 里完整的内容全部拉下来,而且非常轻,肯定不是用 Browser,就是直接拉下来。¶
读不了。¶
比较遵守 LLM.txt 协议。¶
之前他那个。¶
不是,他就是不读。¶
一个意思。¶
类似的意思。¶
之前 Atlas 就这样,就是他能看到,但是他不读。¶
因为公众号,我们正常人都能看,然后那理论上这个 AI 看也是没那问题不大。¶
你比如说我用那个。¶
你 UA,UA。¶
得伪装成人。¶
那他搜索是用的什么?因为这种东西肯定是要调搜索工具的。¶
我没有拆,我没有仔细拆。¶
那他们还是用杭州那家博查提供的信息源。¶
应该不是。¶
现在。¶
应该不是。¶
可能也不止 1 家吧。¶
我。¶
他海外信息肯定用的不是博查,博查没有英文信息的。¶
哪个?¶
就那个套在 CLI 上的 Agent 写作 CLI。¶
Herdr,Herdr。先启动它,你在终端里边先把它启动了,在它里边再启动 CLI。能相互沟通,你就可以给 DeepSeek Harness 派接到。¶
对,太 Geek 了,好多极客会喜欢用,他们要先启动它,然后再调各种。¶
而我已经好久不用 Terminal。¶
而他是。¶
我也¶
是,实在是。¶
但你不应该,你还是技术出身,你不应该。¶
人还是喜欢界面,还是喜欢有变化的东西。¶
所以人还是喜欢。¶
太爽了。我真的不知道,就是我往死里用,我唯一最接近 1 次用完的,就是 85%,1 周额度,唯 1 次。¶
你是用了 85% 还是剩 85%?¶
用 85%,然后嘎巴给我重置了,就是我没办法用完,除非说我疯狂那个。¶
反正你。¶
你编程用不完的,正常编程用不完的,除非让他写文章。¶
我发现干嘛怎么用的吧。¶
剪视频,写文章,肯定能用的。¶
剪,疯狂的截图,疯狂多模态。¶
剪视频。¶
国内模型为什么突然加速发布
工作。¶
所以至于现在模型发布变得越来越快,再加上国产的那个推理卡,现在也能用了。¶
B300 已经管够了。¶
所以我不知道你这个杨攀,你懂他这个事情,这么多。¶
我觉得第一个是,我记得之前谁说过,模型训练在这个行业内其实没什么秘密,至少在中国这几个模型厂里没什么秘密。一家会了,很快大家就……¶
其实都是可以买卖的,你的卡,你的数据,各种都有现成的,只有人才不能买卖,别的……¶
所以我们这儿还是相当……尤其是在图像和视频模型产品,那就更是。¶
但我觉得我们这儿也只是话语权的问题,大家发声不了。其实我觉得国内那个情绪也在起,只是没有声音,不让发声。¶
有可能。¶
核心还是工作问题。¶
你们为什么又贵又……¶
但现在模型这么卷,已经到了大家注意力不够的程度。K3 之后,出那个 Qwen 3.8 Max,能力其实差不多,就没有人关心。¶
这一点我特别同意。最近这两周,明显感觉别人问哪个模型怎么样,或者哪个 Agent 怎么样,经常有人问我。我说我已经试不过来了,模型试不过来,Agent 也试不过来。¶
这几天我试了好几个,Hunyuan 4 Preview 试了,Qwen 3.8 Max 0902 也试了,真的我现在都找不出特别好的测试 Case 来。¶
你分辨不出来了。¶
没区别。¶
都差不多。¶
我觉得现在唯一能感受到的就是速度快慢,而且好多叫 Flash 的也不快。¶
当所有模型都差不多,用户该如何选择
就像你说的。¶
自己试是最好的。¶
我觉得你说这个对于模型厂商就价值 100 万。¶
那也就是说光免费已经都不够了。¶
不,它每天消耗量还是很大的,你能明显看到它是我们每天消耗量第一的。¶
但是按照歸藏逻辑顺着来,就是说你免费了,但是没有形成这一波冲击和再传播,其实你那个免费也白免费。¶
我觉得很有,他出的量不够。¶
效果也不够大。¶
那最后拼还是这个性价比。¶
要么你就定义新的斩杀线。¶
那才是斩杀线。¶
是巨大的。¶
是的是的。¶
是¶
是的。¶
进度条不涨的。¶
太狠了。¶
是不是现在就是 5.3,智谱 5.3 Flash 跟 DeepSeek V4 Flash 之间也有个强竞争关系。¶
没有强竞争关系。¶
我觉得。¶
因为微生 Flash 是被完爆。¶
完全不可。那也就是说,现在就是斩杀线上那个甜点就是 5.3 Flash。¶
那个免费提供基本上。¶
它永远在斩杀线里,真离谱,那个欧。¶
为啥?¶
我们控的无限。¶
都没有人聊。¶
他成本低,即使是算 API 的那个钱,他也在那个线里。就他孤零零的,那个斩杀线一直在发生变化,一直在缩圈,但是他永远在里边。¶
他就一直没变。¶
那么牛逼。¶
最近好像都没有人聊了。¶
它比 DeepSeek Flash 还便宜好几倍。¶
便宜,老便宜了。¶
语音与多模态模型为什么仍然难用
这个其实比较小吧,就是顺便做的。¶
还没整合。¶
不会让你发这个。¶
哪会让你拿钱拿卡去搞这个,他们天天搞,每天都发嘛。¶
扎心了。¶
完全是映射的是吧。¶
真的是映射的,你看 Shiyi 他们也做。¶
我觉得这个核心是什么呢?我最近在做那个剪辑的 Skill,我发现什么呢?这些模型除了 LLM 以外,这些跟多模态和内容生产有关的模型,用起来太麻烦了。¶
我觉得也是。¶
你起码你哪怕在 Coding Plan 里,或者你给我一个多模态的 Coding Plan,让我快速地调用,或者是让我体验一下,找不着在哪儿用。在那个文档的汪洋大海里翻找这个模型名称,我去。¶
他是 to B 的卖法儿。¶
呀,就是厂商的朋友如果听我们的博客,赶紧注意了,今天我们前面已经讲了多少好的机会和点子了。¶
我们跟云厂商合作的时候发现,接一个模型的成本太高了。好不容易接完,结果发现首 Token 延迟竟然是别人家的 100 倍,特别恐怖。¶
所以我觉得,各行业这种中转站一直有机会。¶
就是中转站做得比云厂商都好。¶
但是中转站最大的问题是,做中转站的绝大多数都比较短视,没有认真把中转站本身这个产品做好。¶
做好了。¶
做好。¶
哼。¶
他找的方向就很好,做的是多模态,里边除了 LLM 以外,包含了所有的视频模型和图像模型。¶
是。¶
那也是好久没有声音了。¶
他们现在开始卖套壳了。¶
他们转型了。¶
转型。¶
你看,橘子选择是对的。橘子,给大家介绍你的商业逻辑。¶
不是,我是……¶
不要羞于卖 Token:体验套利与中转站机会
我说过,今天你不要怕别人说你是卖 Token 的。在 AI 时代,你不卖 Token 你卖啥?¶
是的是的,我也是。¶
对,我也是最近这个月才通透的。我就去大湾区一圈,跟几个创业公司的老板聊一圈,大家就是怎么讲呢,这个做 AI 行业的,无论你做应用层还是做什么的,不要羞于定位自己是卖 Token,大家都给卖 Token 打工。¶
不要把你这个工程能力视为壁垒。¶
没有壁垒。¶
我们前面做的任何事情,都是为了让用户从我这儿买 Token。¶
现在一个人。¶
我从你这儿用 Token,比如说云厂商那儿接不上,然后我提供给你一个,你能让 Agent 直接调,这不就是一个优势?¶
这是什么体验套利。¶
就体验套利,云厂商用起来太难了,反而是各个产品里更好用一点。¶
这里边我再说个我最近的一个看法。前面因为说大家已经没有时间去体验那么多 Agent、体验那么多模型,我现在有一个感觉,¶
原生模型加原生 Agent,会不会成为默认组合
不仅是因为它联合训练质量好的原因,¶
是因为爱屋及乌吗?¶
我们不说对错,我觉得以后消费者会不会也形成这么一种习惯。¶
一定会这样,因为你……¶
原汤化原食。¶
非常丝滑。¶
它无论从哪个方面,都非常顶尖。¶
它这个架构设计的时候,其实当时就考虑了模型训练,对它所有的东西都存下来了。¶
而且迭代也这么长时间。还有一个问题,就是经常快速迭代。你看国内的 Agent 迭代速度,再看它的迭代速度,1 天左下角那个更新能弹八百遍。¶
老量。¶
然后他们的工程团队我觉得也没有那么多人,非常少的人。¶
而且也没有迭代崩什么的。¶
明显感觉 Claude Code 的屎山比 Codex 多很多。¶
多很多。而且 Claude Code 是 CLI 驱动的,按理来说它要更好迭代,反而现在比 Codex 要麻烦很多。¶
也是。¶
它的 Token Plan 里,模型价格不是翻了好几倍吗?比 API 都贵。¶
我理解它是那种综合的,所以导致它需要平衡每一个模型的额度。¶
还是说他应该定为中档的用户。还有一点,就是原厂的 Agent 的订阅绑定。¶
还是方便,很方便。¶
而且还有一个地方,¶
Omarchy:一个 Agent 优先的 Linux 是什么体验
它是 4.0 以后,然后那个你看 Ruby on Rails 那个连,作者这个之类,然后它推广非常猛,而且确实。4.0,我之前没有关注过 3.0,去年好多人又装过它那个 3.0 版本,然后有夸的有骂的,但是 4.0 呢,确实完成度高了很多。然后好多去年骂的,今年就觉得,这个是可以当主力机了,而且它的设计里边是 Agent 的优先,怎么体现 Agent 的优先呢?它装完以后,你几乎想到的所有 Agent 全内置到系统里了,从。¶
一堆 CLI 全塞进去。¶
Claude Code 所有的都加进去。¶
你进去套配个 Token Plan。¶
那我得体验一下。¶
你就拉起一个 Terminal 来,然后只要你能拉起来、能打字,它就能修。¶
你说都全屏。¶
默认一个就全屏,2 个就分屏,3 个就是变成三分屏,然后自动四分屏。¶
自动分屏。¶
你要用哪个的话,按个 F 就全屏换出来,再按它就回去,通过这种方式来降低切换成本,而且所有都是快捷键。¶
拼贴。¶
那回去体验一下。¶
你看 Mac 电脑不是有多桌面吗?多桌面呢,就是你也不知道切到哪个桌面了。它一开始正常也是 1、2、3、4 这种列,然后你可以跟 Agent 说,每个桌面给我命个名,它自己就去全给你改了,就是自定义非常强。¶
非常底层的这个加 AI Native 的。¶
AI 系统。¶
AI Native,非常 AI Native 的 OS。¶
但也会被人笑,说你那么多发行版,我加个 Agent 不就是这样了吗?¶
其实还是不太一样,还是做挺多。¶
那其实不太一样,它太胖了。¶
体验原生的。¶
其实从这个角度,它就本身就是个 Harness。巨型 Harness。¶
但体验也会有不好的问题,因为国内支持不是很好。他说马上要做一个国内的官网,加上国内镜像。我第一次装的时候,是谁要做这个事儿?¶
上国内镜像。¶
基金会。¶
因为国内不是好多人那个……¶
后来能装。¶
有点儿那个状态。但如果喜欢自由度非常高、Agent 优先掌控的,我觉得这个系统可以说是第一个比较吸引人的系统。而且界面也非常……我觉得它很重设计,可能这个人品位比较好,它里边内置了一个……¶
挺漂亮的。¶
它有一些设计的理念。刚才你说那个分屏,其实就是 Mac 那个分屏,各种窗口看起来是很好,但其实普通人用起来也很难受。调起来……我这儿我们公司有一堆人都不会调,不会用快捷键调那个屏、半屏什么的。¶
我也不会,我也……我也不会。¶
滚动发版之后,Benchmark 还有没有意义
具体。¶
应该架构都不一样,这俩。OK。¶
那参数不一样,那肯定预训练那个模型就不一样。¶
了解。¶
那个进化版,进化版。¶
应该会有个测试版,一直就是新的,你就默认它一周更新好几次就行。¶
那就是一直后训练合版。不,但它毕竟对外还是出个版本号,这属于对外以后都不提版本号。¶
不是很重要。就是这是某种程度的掀桌耍流氓。¶
现在都这样,我觉得都这样。¶
对。¶
我橘子说得对。一方面,这么搞的话就没法做 Benchmark。但没法做 Benchmark 是双刃剑:第一,你没法说它烂;但反过来,其实你也没法说它好。¶
但是大家以后怎么固化下来?以前大家会说某个版本模型能力强或不强,但如果你持续滚动更新,我觉得这事儿就被淡化了。¶
这怎么理解呢?就是招更多人测试,然后好的 Case 卖端,然后展示,是吗?¶
或者说,你在进测试组的时候,你的 Case 就默认被归档了,也就是你在测试的时候就是收钱的。¶
就是归档的意思,把钱花在找好的、三方独立的 Benchmark 上。哪怕这个东西不公开到手里。¶
独立。我觉得那个挺有意义的。¶
挺有意思的,意义不知道有没有。¶
因为现在公开的 Benchmark 已经感觉到没啥意义了。¶
没有意义。¶
WorkBuddy、Qoder、OpenClaw 与 DeepSeek Harness
我看到新闻是那个美团在让大家全员反思,为什么抓龙虾。¶
这个一会儿我们也可以聊一聊。¶
而且他们之前强制。现在说你们都怪你们。¶
这个事儿可能就不好细挖了,一会儿说。¶
还有就是 DeepSeek Harness,其实热度过了,但是我看到的是它持续在迭代版本。包括你看在我那个群里,不是还有人聊了那个话题,就大家有些人已经懵了,说这个 DeepSeek Harness 的版本号到底是个什么规则。事实上那个版本号是有一个规则,按 Semantic Versioning 发的那个规格,就是它一直在发新版本。¶
老更新。¶
就是你把,我觉得一定程度上把复杂度转嫁给开发者了,然后你更新又频繁,导致我的插件永远无法兼容你的。¶
它是破坏性更新。¶
你别着急,它没稳定呢,¶
不,它不可能稳定,我觉得它不可能稳定。¶
很多人说我为什么你的库不更新,我说我追不上。¶
所以也得做发行版。¶
没关系,本身就不是为你们做的。¶
没区别。¶
是你太投入感情了。¶
AGI 的时候就可以用了。¶
还有这事儿,你让模型自己自迭代就完了。不,这个不,你这个做成 Skill,这 Skill 就是……¶
不。¶
他更新你更新。¶
不,就是这 Skill 就是你读一下两这个中间版本的差距,然后自己去 Fix 你原来已经……¶
不。¶
这个有点儿理想化了。¶
没有,修不了,那 Bug 老多了,它自己有 Bug,他们自己无法保证自己品质,主要是。¶
你们基座都有 Bug,你那插件儿去,你说靠这个读 Gap 不可能。¶
人家本身就是测试版,持续测试版。¶
不,是测试预览版,开发者预览版。¶
一会儿 Alpha,一会儿 RC。¶
都加个 Preview。¶
都加个 Preview。¶
都是 Preview。¶
OpenClaw 和 Coding Agent 正在双向融合
反正他发的时候,说是我们那个体验什么的都好了,修了这些问题,说我们现在有界面了,体验更好,然后发完。结果过会儿一刷新,一堆骂的,说还是很垃圾,还是不能用。¶
我提些不同意见,就是我自己的体会,因为我就特别难理解,大家都说这个自己的 OpenClaw 一直崩,我用了半年我从来没崩过,我不知道为啥。¶
而且我的第二个就是跟大家体验不一样的是,我上个月换了 Hermes,换完之后,我觉得跟我原来的 OpenClaw 体验差距极大。就我就说个细节,就是我跟 OpenClaw 就连续,就是其实我有时候交代一个任务,我要发好几条消息的。就 OpenClaw 会很自然的把它理解成一个事儿,中间也不会停下来或者发给我打断。那个 Hermes 就是你跟它,你跟它,比如我通常是发个照片,然后我说一下,我让基于这照片干啥,它好,经常就停下来,反正就我觉得极不顺畅。而且我从来没有修过我的 OpenClaw,一直是运,稳定运行,我也不知道为啥。¶
你还用。¶
如果你只是让它找找些信息给你做周报啥的,你不用,没啥影响。¶
也不会挂。¶
你使用场景有问题,因为原来是老加模型,改模型配置,一折腾就会出问题。¶
改配置是最容易挂的。¶
那个配置完全没有保护。¶
那我应该就不折腾了。¶
可以把网关改坏。¶
主要是没有东西可以用。¶
生态就是。¶
上上周吧,是上上周吧。¶
我的意思是,就无人关注的角落。¶
你看,2 个词都不对。¶
带人。¶
简称外包。¶
外包。¶
还不是叫外包。¶
是的,走路的身体。¶
Work。¶
可能是因为我之前做生态比较多,所以对生态这事儿比较敏感。¶
还挺快的,扣子刚发完更新,然后立刻被合了,然后更新撤回了。¶
就立马。所以可能内部组织还得调整一段时间,因为大家动作是……¶
动作还是比较坚决的。¶
执行很快。¶
那 Beep 掉。¶
去掉了。¶
然后被磨掉了。¶
太有意思了。¶
还是挺突然的。¶
都对这个不感兴趣。¶
继续吧。¶
Grok Bot:为什么 Agent 需要一台永不下线的云电脑
应该。¶
那个还挺好。¶
我觉得它潜力非常大。¶
所以。¶
而且这个云端必须是持久化的。我用,你一定要 100% 给我承诺,这上面的所有数据永远不会丢。¶
不丢。¶
之前某厂商的那个 Agent 还发生过,直接用东西就没了,就不提名字了。¶
各种虚拟机。¶
现在很多虚拟机都是这种关机,或者是那种动态分布的。¶
好多都是虚拟机,你看原来那个。¶
我觉得领先得小一年都得。¶
1 年。¶
但理念领先,不过它没有做到永久,也没有做到持久化,它是每个任务对应一台电脑,也没做持久化。¶
ChatGPT Cloud 其实也是给了 1 台主机。¶
Chat¶
Work。也是有,那个主机配置巨高,12G 的运存。¶
但是你看 Grok Bot 就专门把它有个名字,一个产品放在那儿了,但其实那个,你看刚才我们说的叫 ChatGPT Work 里的 Cloud,这个已经藏了三层了,¶
我觉得核心是体验和成本。¶
很复杂。¶
聊天,就什么都没有,聊天。¶
什么都没有,但功能都在里边。¶
而且我觉得,有了 1 台电脑以后,发现能做好多黑科技的事情。比如说我说你去帮我挨个测试下 Product Hunt 前十的产品,他真的是打开一个浏览器。¶
装。¶
那台电脑是什么操作系统?¶
你看,就是我们使用这个,不断使用互联网、移动互联网 AI 的过程,就是不断把自己的隐私、各种权限慢慢释放,这都是置换出来的。¶
让渡的过程。¶
大家不 care 这个。¶
这不重要,你换出来,才能得到这个功能和体验。¶
不 care。¶
然后方便。¶
所以你登录。¶
你点授权,好,授权。¶
就渐进式的,需要时候才展现。¶
这点我特别想吐槽。¶
渐进式授权:需要连接器时,再让用户点一下
比如说我跟我的任何一个 Agent 说,你帮我规划一下路径。比如我说我这周去上海,要见几个人,分别几点、在什么地方,你帮我规划。它需要调高德的 MCP,我为了这个任务,再去高德申请个 APIKEY,回来再配上,这太麻烦了。这个事儿不就是你应该帮我搞定的吗?¶
API。¶
国内。¶
我的意思是,刚才乔木说渐进式的,我有这个需求,你应该帮我去解决跟高德的基础设施连接、授权,甚至付费都 OK。你应该帮我解决,不要让我去搞这个东西。¶
哪怕说你让我的积分多耗点儿,在这个时候,你跟我说多耗点儿,我无所谓。¶
Skill,这些页面,单独的页面。¶
暴露给用户是吧。¶
这些东西,27 年产品里就都不应该有。¶
现在就是 Agent 太复杂了。他需要接下来就是需要把这些都简化了,还是不够智能。¶
API 打不通。¶
上下文是最,上下文最严重的问题。¶
开放性太差了。¶
所以 AI 时代就把这些倒推,逼着这些生态该打。¶
我看到个新闻,¶
金融数据、算命与真正有收益的 Agent 场景
不让 AI 去读。¶
重点抄结论。¶
这个才是真正用户。¶
之前他们不是统计 Query 吗?就是炒股、算命这些东西。¶
算命是吧。¶
但是不是工作,这不是办公。¶
所有办公 Agent。¶
不是 Office,现在整 Office。¶
反而我觉得,你说我们办公场景里边有什么东西是需要你加速到说,效率提升到能产生收益的?你说好多白领工作,那些 Paperwork,比如什么周报,你加速 100 倍有什么用呢?其实没用。¶
你想想办公场景里面意味着啥,大家能想到的就是 PPT、PDF 来回转换,接文档。¶
我最近做过调研,你知道吗,程序员用了 AI 以后更累了,但是非程序员,就是写 PPT 的、写文档的,用了 AI 以后都摸鱼了。原来干 8 小时,现在干一个小时、俩小时。¶
主要是原来写的那文档吧,就是车轱辘话,现在还是车轱辘话,无所谓,没有变化。¶
但写代码的你知道,写的更多就更累了。¶
这写的 Bug,写的越多 Bug 越多。¶
也不是写的更累,是因为你要开了太多项目,你觉得都能搞,你自己监控 AI 累。¶
就 Bug 也多。¶
对 Bug。¶
Microduck 为什么一夜走红
看看后边还有什么话题,我们说说硬件。硬件方面,我整理了最近 7 天的几个热点:一个是 Hugging Face 的 MicroDuck,那个小鸭子机器人;还有苹果新发的 Mac Mini M6 和 Mac Studio,虽然不算完全上周的事,但高配已经涨到几万、十几万,内存也直接奔着 128、256、512 去了;另外 Plaud 也发了个新耳机,他们好长时间没发新产品了。¶
好多展会是不是都有这种小机器人,眨眼睛的那种。¶
但它这个设计明显很好,Demo 也很好。成本太高了,它一个鸭子能把东西夹起来,要是用普通小机器人用手弄,感觉很普通。我觉得这个东西一是足够便宜,二是好玩,其实跟人相比没有那么大用处。¶
定制上了,高。原来它这是什么后空翻,什么这那的,¶
但我的观点就是,它火爆就是因为是 Hugging Face 发的,你换个人发试试。¶
但也不一定吧,不一定。¶
不是,Hugging Face 收购的公司发的,这个公司在被收购之前,之前的产品就火。¶
之前是那个桌面小机器人是吧。¶
这种玩具是什么呢?一个好玩,一个没用,就是足够的没用才能好玩。¶
而且它便宜,这个价格就是……¶
不便宜。¶
挺便宜的。¶
300 多美元。¶
你知道别……¶
中国机器人的价格。¶
那没法比。¶
它其实技术含量上……算了,不说了。¶
不,大家都含量都不……¶
起码它还能自己后空翻呢,中国机器人还得拿遥控器呢。¶
ESP32 成为“新乐高”,全民发明家时代来了
本地模型进入浏览器和机器人
Mac Studio、本地推理与一台始终在线的电脑
放下来,好像还有什么优化,我没细看。¶
我问问各位,你们现在手里有没有比如 Mac Studio 什么,后边有没有买的计划。¶
我现在一个 Mac Mini,一个 Mac Studio。¶
你那个多大内存呢?¶
还有个。Studio 我买的就是正常 32G,我不想跑本地,我。¶
32G。那 32G 的 Mac Studio 跟 Mac Mini 的定位有啥区别?¶
我们公司用它跑一些测试,只能开 2 个,两组线。¶
反正我手里那个,我是特别幸运,我是今年春节之前下的,而且是……¶
我也是。¶
升值了。¶
你那个升值了,128G 内存,才 29,900。¶
其实它的 CPU 不是最重要的,对内存。¶
你知道我用了那么一台设备以后,体感是啥吗?就是你感觉不到那个电脑的存在。用所有东西都是丝滑,你感觉到全是软件,感觉不到这个硬件。¶
硬件没有瓶颈,你没有感知,没有说硬件出问题了或者怎么样。¶
那个特别爽。¶
而且主要是它一直在线,我的那个 Studio 从买回来到现在没有关过机。¶
我也是,没关过。那你们俩就是比如接下来 1 年,有买 Studio 的计划吗?¶
我暂时没有吧。¶
云端 Agent 与本地 Memory,能否两者兼得
你要一个东西。¶
但我觉得维护本地 Memory 和本地上下文这事还是很重要,感觉后面一定会有这样的产品,就是快速地把你的那个一直都有,但是它做得不好。¶
你需要有个同步机制。¶
就或者说你……¶
那你不能就像说的,就放弃隐私都是云。¶
但问题是你有时候它 AI 会变化,你给了它,然后你下不下来,但是又别的又真的又很好,你,又没法用了,所以就是还是得有个本地的一个一个……¶
好像说那个扣子那个新版本,本来就是一个云端的扣子来操作你的电脑,它连起来,手机上能操作动,那个还挺好的。¶
那本地还有一个网盘呢。Cursor 最近也要发新的那个 Agent,那个就是可以托管在本地的 Cursor Agent,然后跟云连起来,跟你说类似的。¶
跟那个是一个家族,但是不同的产品线。¶
应该是趋势。¶
其实有一个 Agent 产品,帮我把本地的托管环境管理起来,把我本地跟云连起来,作为一部分,其实也挺好的。¶
所以我觉得 NAS 这事,NAS 也可以办。¶
NAS 会不会成为个人 AI 上下文的家
越来越 Geek 了。¶
我买了。¶
我是内测买的。¶
那肯定会买。¶
怎么样?¶
它就正常的 NAS,它都没 Docker,¶
你用过?¶
我那个已经给公司了,太难用了。¶
我现在也是,我自己的 Memory 同步 GitHub 太……就是巨饼,文件巨饼太多。¶
而且还有就是多模态的问题,就是我经常玩图像视频,那 GitHub 我又不能把多模态的图像视频传上去。¶
GitHub 也不稳定。¶
所以我觉得还是 NAS 比较好,而且 NAS。¶
读写太多了。¶
是这样的,而且这个我觉得很重要,以后云盘就应该这样搞。¶
这个存储越来越贵了。¶
第三个,第 O3、D100 和 O100 3 个芯片。¶
但那东西感觉也没啥用了,封的差不多了。¶
好多用户。¶
主要太封闭了。¶
收购、ARR 与 Claude 套餐争议:本周商业新闻快扫
Hugging Face 的价值,以及英伟达为何要为产业托底
我觉得就该它收购吧。¶
我有一个感觉,你说 OpenRouter 也被收购了,Hugging Face 也被收购了,按我们历史经验的话,这是一个信号,就说明这个产业到了某一个节点上了。¶
我觉得是看到了价值。之前 Hugging Face 和 OpenRouter,很多人是对他们不看好的,存在感越来越低。然后最近核心问题是中国的开源模型的问题,这些属于开源模型基建和发布的东西,对它们俩的价值提升很大,我觉得。¶
它俩价值在中国一直被低估吧,你不是要写一篇文章吗,你也没写。¶
我是。¶
这个角度是啥呢?写文章好写。¶
一句话点评 OpenRouter 是啥。¶
不,应该是一句话说清楚,其他为啥不是 OpenRouter。¶
其实我是感觉,你们有没有发现,英伟达现在拿自己的信用在给整个产业做兜底。我觉得它收购 Hugging Face,从某一个角度讲,它自己就是一个锚。包括现在英伟达拿自己的信用给很多 neocloud 厂商做信用抵押,不专业地说,就是英伟达承诺,你的卡多少年之后,我英伟达回购。¶
融资,算力。¶
他要在 AGI 做大基建。¶
所以就是 Hugging Face 如果有难处,或者需要在下一层价值的时候,英伟达肯定要出手。¶
或者说他在不遗余力地保证这个市场是一个多级的状态。¶
而且是相对比较健康稳定。¶
让各个模型厂商之间保持平衡,不要出现一家独大、反过来拿捏别人的情况。¶
那个 CPU,Jalapeno 是吧。¶
其实我觉得这个也跟这个有关系。¶
CPU。GPU。¶
而且有了 AI 之后,你软件那层就很容易。¶
设计简单,生产不够,都乱冒烟了都。¶
是问题。¶
AI 有泡沫吗?真正的问题可能仍是供给不足
Token Is New Money:买 Mac Studio 像在家里“铸币”
其实我觉得 Stripe 收购 OpenRouter 那个也很有意思。Stripe 以前管的是现金交易,管的是钱,但其实未来 Token 就是钱,所以非常合理,Token Is New Money。¶
那 Token 就代表生产力,所有互联网上的生产力都来追 Token。¶
你看你去买 Mac Studio 什么的,就相当于自己印钞票,就是印得有点慢。真的,相当于回到了以前大家自己铸币的状态,我挖了一块金矿,搞个铸币,回到了去中心化发行货币。¶
以物易物了,现在是这种以物易物的状态。¶
很有意思。你看包括 Flash 什么各种模型,你本地也能跑了,本质上就是你能铸币了。¶
你看,刚才你提到一点,一句我觉得特别金句,就是说你扣我点儿 Token Credit 都可以,你那句话背后不就是等于货币了。¶
免费用。全用。¶
是你看现在的模型,我感觉对于大多数普通人来说都已经够足够用了。¶
那很够用了,很够用了,¶
我觉得 5.3 Flash 在这种这种就绝对够用。¶
小模型,¶
可能更多是靠端侧或者小一点的模型来实现。比如像你说给窗口改个名儿什么的,帮我整理整理我的机器,那些就是。¶
不需要很好的。¶
普通小模型就足够了。¶
而且如果你用 Flash 的话,其实每个月的开销也就十几美金就搞定了。很便宜。¶
主要是。¶
大部分人还是能用得起的。¶
但是大部分人用的话,还是不够,卖不着。¶
但我发现有个很奇怪的现象,就是大家永远会追新。¶
SOTA 模型与便宜模型,会不会抢同一批生意
旧的模型理论上是可以搞定的,但大家永远还是想用新的、好的。¶
结构渗透了。¶
这是金字塔的两个维度。¶
而且下面这些人也会转化到上面,如果被渗透了以后,也会开始消费上面的。¶
我想问,现在有没有那种模型,比如我们去年老说的 Claude 3.5 时刻,使得 Agent 各种能力都变强了?但现在没有人去用更早期的模型,除非有特别的需求,比如你要写文字,才会用 4.5 之前的模型,甚至这些模型都会被下架。¶
我觉得核心是因为推理效率在不断提升,厂商追求效率就会下架旧模型。¶
今天你看牛来这么便宜,也比 Claude 3.5 强多了。¶
要强,比那个要强多了,但。¶
强多了。¶
但是大家还是说我会用,就是你真的有需求解决复杂任务的,你还是希望用好模型 1 次性搞定,尽可能少的修改。¶
我觉得那个还是就是负责创造的人群还是特殊的,就是慢慢的 Token 就变成一种消费了,它就不是不是用来就是创造是创造,消费是消费。¶
那所以对于现在这个模型这个价格上来说,感觉是已经是可以在大规模的场景上,普通人可以用了,但是还没有发生。¶
就是它其实是没有需求。¶
没有需求。¶
或者需求就变就变成消费了,它不是创造。¶
如果是去看普通人的话,他其实是没有需求的。¶
我们这很多时候用来做东西,用来工作,没有人需要。¶
就像你……¶
正有工作的人可能是中国十分之一。¶
1,000 万程序员,中国 1,000 万程序员,一点儿几,1.2 亿办公白领,就有电脑的。¶
白领,¶
就极限了。¶
再加上可能公务员,其他人就……¶
就这么多。¶
没了。¶
就这么多。¶
我后来想,如果你在外面休闲的时候,不会刻意想着要找一件事让 AI 去帮我做,我就想着把当下的东西做好。¶
AI 短剧把 Token 消费带进新的内容市场
所以 AI 还没有进入消费。¶
所以消费进入了,就是那个短剧,AI 短剧涨得很快。¶
短剧。¶
它那边儿涨的呢。¶
那是 Kill Time。¶
所以那个是很猛的,就是因为接触消费了,所以消耗量巨大。¶
巨大。¶
其实反倒是我们前面说的 H3,接下来会开拓一个大市场,H3 就是那个领域的 DeepSeek Flash,类似 Flash。¶
还有小说的。¶
我现在已经能刷到很多,剧本、画面都非常精致的。¶
非常精良。哪个不是《西游记》?是不是上了?¶
湖南卫视那个,超……什么《后西游记》那个。¶
湖南卫视。¶
《后西游记》。¶
全是 AI 做的。¶
卫视播出的。¶
它就是一种完全新的媒介了。¶
而且你发现没有,一开始看到 AI 短剧会很厌烦,觉得生成的太有 AI 味儿了。但后来点进去看一个,发现剧情还可以,就会忽略掉那种 AI 味儿,让文字、剧本转成视频可视化这个效果,应该又拓宽了消费人群。¶
是新媒介。¶
就是精品化。所以刚才聊到的,可能会有一个类似起点的短剧平台。¶
但全球市场主要是因为海外对此非常抵触。¶
没有,只要这样好,也迟早会真香的。你说海外抵触,它很快会真香的。¶
AI 应用市场回暖了吗?利润空间比需求更现实
那我最后一个想聊的话题,就是你有说法,说这个下半年 AI 应用市场要回暖,大家有对这事儿有什么看法吗?¶
主要是。¶
就上半年好像就已经没有人投 AI 应用了。¶
我觉得核心是……¶
采访一下橘子,你们是 AI 应用吗?¶
我们算算吧。¶
那你对这个 AI 应用市场回暖这事儿怎么看?¶
最本质的原因是中国的投资人太缺钱了,大家只能聚焦在一个赛道,比如上半年就是世界模型、具身智能。世界模型其实是一回事,就是太聚焦了,所有人都在这儿疯狂地投,只相信这一个东西。但上半年好像已经结束了,大钱都已经投完了。¶
但是 AI 应用确实有点乏善可陈。¶
主要又回到卖 Token 了,Token 不够。Token 利润对,一个是没 Token 可卖。¶
自己用行,但是你卖就没有意义。¶
所以我觉得还是没有利,没有 Token 可卖。¶
那还卖爆了呢。¶
我觉得还是商业模式得创新。就是我们认了卖 Token 这事儿,但是卖 Token 上怎么样拿出利润来,这是很难的。而且现在还有一个问题,就刚才说的,没有 Token 可卖,就是 GLM 5.3 Flash 的供应其实不够。¶
Seedance 2.5 的供应也不够。它没有办法给你折扣的原因是它不够用,它不够卖,所以它没办法给你折扣。¶
但这事儿相当长时间内不会有什么变化的。¶
所以需要一个新的在金融上的,在 Token 经济上的新的模式或者范式去打通这个东西。¶
其实整个模型的发展,我觉得相当于基建部分,还没有发展得特别好。现在你想,就跟当年网络都供不应求的时候一样,你说要基于网络去搭建什么 Web 2.0 的东西,这个就很扯。¶
好像还没通网呢。¶
所以还得再等。或者是流量不够的。¶
但我觉得还有一点,就是上半年共识太高了,¶
为什么 AI 应用团队仍然跑不过模型厂商
产品迭代速度,正在成为新的组织能力
Codex 团队的协作方式为什么难复制
我这周我们优化了什么,提高了内存的读取 80%,然后它不会出现 Bug。这不挺好吗?¶
这个真牛逼,就是大家放在一起之后没有 Bug。¶
不,也不是没 Bug,它不会出现恶性 Bug。¶
这个说明他们工程上也搭的很好。¶
就是它整个的协作架构,说明是领先好几代的。¶
所以大厂这些,就是你。¶
我觉得组织构架协作方式肯定是有问题的。¶
你的程序员、架构师,你都是最厉害的,但现在发现它是最封闭的,不如开源团队。¶
其实这个才是最本质的 AI Native,就是在协作架构层面上,能解决这些问题。¶
所以我觉得,就像刚才说的,你的前端、设计师、产品经理,应该自主去做。每一个人都是产品经理,每一个人都是研发,以及每一个人都是宣发。每一个人都需要闭环,如果做不到闭环,那别做。¶
Token Maxxing 不等于 AI 原生组织
我跟你说,这是当前所有大厂最痛苦的。因为我最近跟好多大厂交流,聊那个 AI 原生组织的事情,所有大厂现在都找不到这条路。Token Maxxing 没用,就是觉得说这个 Token Maxxing 提效什么都做了,但是组织到底 AI 原生组织咋搞,就是所有大厂都找不到。¶
你看 Claude Code 就是 Token Maxxing,他们全部用 AI 做,但速度没有上来。而且 OpenAI 那个团队他们是分享过的,就是他们非常重视产品设计和对齐。就是大家在大方向上,其实这些人都是对齐的,体验非常……自己做自己,只是说你做的时候在拆完之后,自己疯狂迭代。我觉得这个就是他们把整个协作和 AI 这件事情做的模式创新了。¶
设计工程师、全栈闭环与“每个人都是 OPC”
或者说就是 AI 原生组织里边,就是原来的一些重要的角色,比如说这个 1 号位,比如说 HR 负责人,其实在 AI 原生组织里的地位就大下降。¶
或者说你就应该,如果你的 AI 原生,你说你叫 AI 原生组织,但是你现在还是分为,就传统的这些岗位名称。设计前端 QA,然后后端,甚至说你把前端后端合了变成一个全栈,我觉得这个都不算,就是每一个人都是全栈,每个人都是 OPC。就是他应该把握这个功能,从开发,从需求定义到结束。¶
它是生长出来的。¶
原来按照管理的办法,就刚才我说的,1 号位和 HR,那都是在管理。¶
它是生长出来的。他们之间不断地交互和磨合,先找了一堆这样的人,然后这些人之间不断磨合,最后……¶
磨合,形成了一个方法。¶
这些人其实素质非常高,对人的要求是很高的。以前那种螺丝钉模式,他不可能一下扩展这个能力。¶
其实大厂也好,招人也是喜欢招这种人,只是不都盼到现在这个岗位上了,没有这种。¶
大厂现在的问题是。¶
大厂还是在去设计组织,设计流程。¶
或者说大厂原来就要他大厂 HR,原来就把这些人故意的让他螺丝钉化,故意的,你现在不可能掰过来,因为所有人都是这样的。¶
就是我们有一套文化,你得先进来融入我们。¶