
Weekly #003|火线解读 Jev 新范式;用 Agent 还得买带鱼屏? - Next Token|词元之外
如果模型不负责聊天,只负责反复做一个小判断,它能进入哪些工作流?当 Agent 已经能操作电脑,为什么人反而开始惦记一块带鱼屏? 本期从 Jev 聊起:筛选记忆、给联系人打标签、语义查询、过滤广告——这些不太像聊天,却可能需要大量模型调用的场景,是否值得用新的方式处理?我们也讨论了一个容易混淆的边界:输出满足类型约束,并不等于判断一定正确。 随后,话题转向多模态、小模型和真实创作:用 GPT-6 Astra 辅助生成训练数据、用代码做宣传片和配乐,以及 Vibe Coding 带来的一个朴素烦恼——硬盘越来越不够用了。 浏览器、聊天区、任务列表挤在同一块屏幕上,用 Agent 是否真得配一块带鱼屏?后半场从这个具体的工作界面聊开,继续追问 Agent 的落地条件:语音输入、多账号、常驻电脑、云端 Mac、企业数据与日志。能力之外,工作环境和人的监督同样重要。 本期录制于 2026 年 9 月 19 日,四位主理人通过腾讯会议远程录制。节目中的体验、观点与预测属于参与者个人判断,不代表对产品能力的独立验证;具体功能与可用性以官方信息为准。 本期讨论 Jev 不走聊天路线,适合做哪些高频判断? 结构化输出、模型准确率和“没有幻觉”,为什么不能混为一谈? 多模态、小模型和代码工具,怎样进入真实创作? 当 AI 不断生成文件和项目,存储与工作空间怎么管理? 让 Agent 常驻电脑之后,数据边界与监督如何安排? 本期人物 歸藏:联合主理人,本期当值。 向阳乔木:联合主理人。 橘子:联合主理人。 杨攀:联合主理人。 时间轴 00:00 节目片头 00:49 本期精彩片段 01:30 四位主理人开场 01:41 Jev:不聊天,做结构化判断 03:47 微信好友标签与高频判断 07:22 语义搜索与数据库查询 08:47 “没有幻觉”不等于判断正确 17:18 用模型过滤隐性广告 20:57 把新模型接入现有 Agent 25:07 多模态:音视频为什么要一起理解 27:51 量化与本地小模型 31:43 SVG、图标与设计工作流 35:19 用 GPT-6 Astra 造数据、训练小模型 40:59 实时语音与 Computer Use 43:44 具身智能与零样本任务 48:07 Vibe Coding 把硬盘用满之后 56:56 用代码做宣传片和配乐 01:09:39 语音输入产品与实时反馈 01:20:07 Codex 多账号与工作空间 01:24:29 常驻 Agent 与多平台内容分发 01:26:42 Coding 与 Office:两种工作模式 01:29:52 云端 Mac 与 Agent 执行环境 01:30:49 企业数据与日志边界 01:36:25 AI 剧与内容生产 01:38:06 AI 参与研发与人的监督 01:40:04 片尾 相关资料 TypeSafe:System One Models 与 Jev Arrow 2(SVG 生成模型) StepAudio 3 Realtime 官方页面 术语说明 Jev 的类型约束与决策准确性是两个问题;符合预设输出结构,不意味着对事实或业务问题的判断一定正确。Computer Use 指通过电脑界面执行操作,不等同于 AGI 的认定。 关于节目 Next Token|词元之外是一档关注 AI 技术、产品与现实影响的视频播客,同时提供音频版。旗舰栏目 Next Token Weekly,由杨攀、歸藏、橘子和向阳乔木每周圆桌对谈,分享观察、实践与不同判断。 节目主页:nexttoken.tv 社群 欢迎加入 Next Token Discord,分享你的使用体验和不同判断。 音乐 Electric Dreams / Origami — Scott Buckley,依据 CC BY 4.0 使用。音乐来源:Scott Buckley Music Library。 English summary Recorded in Mandarin Chinese on September 19, 2026, with Guizang, Xiangyang Qiaomu, Orange, and Yang Pan joining remotely. We explore Jev and high-frequency structured decisions, why type-safe output does not guarantee accuracy, multimodal tools and small models, and the practical workspace needs of computer-using agents—from ultrawide monitors and voice input to always-on computers, cloud Macs, enterprise data, and human oversight. Experiences and predictions reflect the participants’ perspectives, not independently verified product capabilities.

