https://www.youtube.com/watch?v=cFx9Z3ZXca0
TypeSafe CEO Diogo Almeida 播客访谈:Jev模型、System‑One架构与可编程AI革命
说明:无真实时间轴,按照文档token总长度,通过内容位置估算内容占比百分比。
第(一)部分 访谈开篇:Jev发布后的个人状态与行业现状 (0%‑10%)
1 发布Jev之后的身心状态:Diogo作为技术型CEO,身心极度疲惫,感觉自己像“残破的躯体”,需要处理大量突发问题;但精神层面感到振奋,认为当下自己终于和现实对齐,开发者群体看懂了Jev的价值,基于AI的经济革命重新成为现实可能性,对开发者社区满怀感激。
2 优先面向开发者而非VIP投资人:发布会后优先举办面向普通工程师、开发者的线上大厅会(town hall),拒绝把时间大量分配给投资人等权贵人群;他认为理想状态应该把绝大多数时间留给开发者社区,甚至曾设想一边前往演播室一边开线上大厅会,只是想法太过疯狂作罢。
3 社区数据与自嘲不懂自我营销:Discord社区已达到10万用户,Twitter账号热度暴涨;自嘲自己是社交平台新手,完全不擅长自我推广,还闹出把个人信息流趋势当成全网热搜的乌龙。
4 开篇抛出核心行业矛盾:提出一个长久困惑他的行业悖论——AI已经能够解决千禧数学大奖级别的难题,却连大量基础、机械的经济类工作都无法自动化;强大的自动化引擎缺少对接现实经济工作的接口;即便TypeSafe公司消失,竞争对手也要花费1‑2年才能追赶上来,Jev已经改变技术历史的发展路径。
第(二)部分 Jev是什么:System‑One(系统一)可编程模型定位 (10%‑22%)
1 Jev所属的新模型类别:System‑One模型:团队内部把Jev归为System‑One(系统一)模型,不倾向叫“决策模型”,因为能力范围会超越单纯决策;本次Jev更偏向低调的研究预览,公司内部还有大量储备技术没有放出。
2 和传统大模型本质定位差异:传统预训练大语言模型面向互联网文本自动补全;RLHF聊天模型面向人类文本回复;而System‑One机器原生大可编程模型,消费方是代码,模型输出直接供程序读取,这也是TypeSafe公司名字的由来。
3 Jev核心优化目标:每美元的智能(intelligence per dollar):名字源自Jevons悖论;团队把资源全部投入该指标的前沿;承认模型需要做权衡,可靠性、成本、校准、速度都是重要维度,但Jev系列的旗帜就是最大化单位成本下的智能水平。
4 校准(calibration)议题引入:聊到RLHF带来的模式坍缩(mode dropping / mode collapse)问题,模型输出会偏向人类最希望听到的答案,而不是模型自身真实置信度,这对程序调用场景非常有害。
第(三)部分 批判RLHF缺陷、对Yann LeCun JEPA的务实评价 (22%‑33%)
1 RLHF的关键弊病:模式坍缩Mode Collapse:Diogo刻意保证Jev发布视频全部内容真实准确,他认为RLHF带来严重模式坍缩;为了长文本生成尽量少出错,RLHF模型会变得极度保守,破坏概率分布、破坏模型校准。
2 反驳Yann LeCun一张著名图表的推论:LeCun图表提出序列越长模型出错概率会持续走高;Diogo认可图表数学逻辑,但现实实证并不完全成立,根源来自模式坍缩;GAN生成图像时会丢弃少数类别只输出高频样本,RLHF语言模型发生同类现象。
3 看待Yann LeCun JEPA(联合嵌入预测)方案:承认JEPA是非常酷的早期研究,但现实实用性存疑;自己是务实主义者,不迷信缩放定律;缩放定律意味着投入指数级资源只换来次线性能力提升,只有收益足够高才值得;大量优质研究成果躺在论文里,缺少面向真实任务打磨。
4 行业前景预判:可编程AI会迎来淘金热:Jev的发布不仅仅利好TypeSafe公司,会催生一整个平行生态,大量团队会探索如何让软件获得更强AI能力,重回早期互联网那种蓬勃创造的时代,打破“只有头部大实验室可以做AI”的垄断叙事。
第(四)部分 安全对齐:反对在技术底层做拒绝(refusal)对齐 (33%‑46%)
1 区分「安全原则」和「安全对齐」两件事:Diogo不反对安全这个原则本身,但认为当前行业流行的安全对齐往往损害用户利益;模型拒绝输出(refusal)对于聊天产品尚可接受,但作为API底层内核属于类型错误(type error)。
2 底层API中拒绝机制的致命问题:当AI作为后台依赖库运行时,如果随机触发拒绝,下游开发者完全无法预知,会造成软件随机、不可控崩溃;这套对齐思路的设计者往往缺少软件开发实践,执着于把AI打造成AI同事,而不是释放AI全部底层能力。
3 区分能力对齐(capability alignment)vs安全对齐(safety alignment):能力对齐:让模型完成开发者想要做的事,追求可预测、少测试,目标接近数据库一样可靠;安全对齐:强制模型遵从第三方的价值观约束,违背指令跟随;聊天产品做安全对齐合理,但API基础设施层面不可接受。
4 边界:不在技术内核植入价值判断:个人主观不希望产品被用于伤害人类,但拒绝在模型技术层植入过滤;每一次强制价值对齐都会撕裂、损伤模型智能;类比数据库:数据库不应该为使用者拿它做的坏事负责;作为API服务商,不应该窥探下游开发者完整业务逻辑,任务会被拆解成微小单元,这才是给予工程师最大能力的边界;只要Diogo掌权,就会把这类偏见从技术层剥离。
5 战争/恶意使用的讨论:承认业界担忧AI被用于战争杀人,但通用基础技术层不适合做这类拦截;可以在产品层、业务层处理,不能破坏底层模型智能。
第(五)部分 基准评测(Benchmark)立场、数据才是模型能力的核心 (46%‑58%)
1 API条款误解澄清:预览版本曾有限制基准测试的条款,团队后续会移除,不禁止外部基准测试。
2 强烈反对公开基准评测,认可私有代理评测:公开基准极易被刷分、游戏;历史上各大实验室专门采集模仿MMLU的数据刷榜单;公开基准无法衡量难以量化的“智能的独特质感(geniqua)”。
3 正确评估模型的思路:必须放到自己真实业务工作流中做自定义评估,靠实际使用感受建立信任;公司的核心工作就是持续提升模型可靠性的“9个9”级别;Jev其实可以在一年半之前就对外发布,但团队刻意没有那么做。
4 “最痛教训”:任务目标(northstar)、数据远大于算力:引用Sutton观点,算法胜过算力;数据比算力重要得多;LLM发展三次重要转向:RLHF转向指令跟随;RLVR做了小方向调整;TypeSafe的RLCD确立面向程序闭环的新任务。
5 TypeSafe定位是极度重视数据的实验室:模型能力本质来自数据;数据极度复杂,想要提升可靠性指标全靠数据;公司在疯狂招聘数据方向人才;好的数据人员需要具备品味,甄别模型输出问题,以通用方式修复缺陷,而不是只修复个别样本。
6 不训练用户数据:即便条款允许,也坚决不用用户真实业务数据训练;真实世界用户数据服从幂律分布,会造成过拟合,撕裂模型;目标是打造软件底层基础设施,类似TCP协议,要能适配未来科幻级未知业务;真实世界的数据会让模型过拟合当下,无法应对未来场景;数据团队像艺术家,定位、修复模型“锯齿缺陷(jaggedness)”,追求通用维度修复,而不是修补个案。
第(六)部分 RLCD概念辨析,AI自动化现实困境,行业未来畅想 (58%‑70%)
1 RLCD不是凭空造黑话,是一套新任务北极星:RLHF、DPO等后代算法本质都是在完成RLHF的任务目标;RLCD是TypeSafe确立的全新任务目标:面向可编程AI,把人类从循环中剥离,目标是让自动化可以运行;同时保持务实,如果现有技术达不到,不会强行追求不切实际的目标。
2 吐槽行业过度承诺兑现不足问题:RLVR和RLHF都有严重过度宣传问题;回到开篇悖论,AI很强却无法自动化大量基础经济工作,缺少适配经济工作的接口;即便TypeSafe消失,该方向追赶也要耗费1‑2年;这已经改写技术历史,行业会大量探索多种不同类型模型,百花齐放。
3 担忧AI寒冬已经被Jev的出现避免:如果自己没有推动这条路线,一旦出现AI寒冬,Diogo会觉得自己负有个人责任;RLHF放大了过度承诺与现实的鸿沟;Jev上线不到一周,已经被投入真实生产工作,进入狂野的拓荒时代。
4 发布之后业务数据情况:日处理token规模突破重大里程碑,不只是人类试用,大量机器后台持续调用;认为注册签名数量参考价值很低,很多注册者不是开发者,拿它当聊天机器人使用,会产生认知错位;一个重度用户循环脚本产生的价值远高于海量普通人类试用;平台团队实现极高可用性,比肩头部厂商。
5 公司定位:不想做新势力AI实验室(neolab),目标是可靠开发者平台:不在乎成为噱头型新AI实验室,希望成为稳定可靠、开发者信赖的基础设施,点燃开发者创造。
第(七)部分 可靠性、确定性、版本策略、智能/美元 vs 智能/秒指标权衡 (70%‑82%)
1 可靠性的两层内涵:一是输出智能本身的一致性,稳定完成预期任务;二是服务层面的正常运行时间、可扩展性;现在推理大模型聪明,但可靠性还不如实习生;梦想达到写代码心流状态,开发者无需试探就相信模型输出,非平凡分支也能精准执行,但这是漫长工程。
2 确定性(determinism / seed):相同输入不一定输出相同结果:团队不把“同输入同输出”当作北极星;单元测试需要确定性,但更关键的是鲁棒性robustness:语义相似输入给出相似输出;测试方法:prompt中插入无意义唯一ID,语义不变但文本变,模型输出应当接近;确定性可以做,但会牺牲单位成本智能;如果社区给出足够强业务理由,未来可以提供。
3 模型版本、LTS长期支持策略:部署上线后的模型不会偷偷悄悄更新改动;会快速迭代发布新版模型,但不承诺对旧版本无限长期支持;大量LTS版本会分裂集群,损害整体体验;不排除对Jev现有版本做临时LTS支持,团队在研究一套对开发者友好的LTS方案。
4 两大指标权衡:intelligence‑per‑dollar(Jev主线)和intelligence‑per‑second:Jev系列优先每美元智能;每秒钟智能对实时业务价值巨大,但不作为Jev的主战场;实时业务、后台批量业务二者对延迟的需求完全不同;承认行业现状很多模型更快但是更贵,Jev处在“更快同时更便宜还维持智能”这个稀缺象限。
5 评测:反对游戏评测指标,但坚持内部评测:强烈反对外部公开基准被刷分,但TypeSafe拥有严格内部评测;最重要原则是不能游戏内部评测,坚持求真,不能自欺欺人。
第(八)部分 Jev API三大原语:Choice、Score、Bernoulli(nule)以及开发最佳实践 (82%‑92%)
1 三种全新API原语,不属于传统编程语言类型:
- Choice:近似枚举、switch‑case语句,可映射为函数调用;
- Score:类似LLM打分评判,用于排序、阈值判断,不是简单整数浮点数;
- Bernoulli(简写nule):源自伯努利概率,类似布尔但连续概率输出,对应if条件判断; 团队内部还曾想命名为pool等玩梗名字。 2 API设计理念:面向计算机消费,拒绝字符串模板思维:输入的状态、指令、判断条件全部支持结构化JSON对象;不要把一切塞进system message(类比全局脏变量),不要全部拼接成字符串模板;字符串模板是面向人类交互的旧范式;AI函数应当传入程序状态变量。 3 给开发者实战建议:问题分解到最小语义单元:把复杂问题拆解为大量微小独立查询;哪怕模型当下能力有限也要坚持该范式;拆解之后每一步都可评估、可测试;不要靠一个巨大system prompt完成全部任务。 4 举例:拒绝逻辑该如何写:不要直接问“我是否应该拒绝”,而是拆成多个独立问题,分别评估不同风险维度;遇到错误可以新增问题、设置阈值、增加测试用例,永久修复,不受上下文丢失影响,相当于“不用训练机器学习就完成ML工作流”。 5 关于校准偏差、微调(fine‑tuning)的态度:承认模型会出现校准错误;目前没有开放微调;对微调持开放态度但有顾虑:微调过拟合窄任务,损失通用能力,损害边缘案例表现;备选方案:阈值调参、问题拆解、多模型级联(置信度低就调用更强模型);未来会考虑不同尺寸模型,动态调度模型能力。 6 长期愿景:希望成为类似Visa一样不起眼的公共基础设施;本次发布只是低调研究预览,还有大量技术储备;未来还会出现更多机器原生模型类型,不完全局限于决策模型。
第(九)部分 发布前后验证、主要应用场景、编码Agent生态变局 (92%‑97%)
1 发布前内部验证情况:发布前一半以上接触原型的非技术人员无法理解产品;技术圈信徒高度看好;产品更像维生素而非止疼药;目标受众是开发者;社区菜谱(cookbooks)文档投入巨大心血,并非AI生成,来自真实业务问题沉淀,原本担心教育用户会成为巨大瓶颈。
2 四大主要应用场景:
- 暗数据Dark Data:大企业囤积大量数据,过去LLM处理成本太高,Jev可以做大规模分析,数据科学家重点场景;
- 编码Agent:体量最大场景之一;
- 实时交互场景:电商、AI助手、游戏;
- 可验证观测场景:对其他LLM输出做校验; 另外还有计算机操作(computer use),属于实时方向,社区demo效果惊艳,但可靠性还有很大提升空间。 3 编码Agent生态的变化:现有商业编码Agent构建于单一模型范式;开源编码Agent接入Jev之后会迎来新机会;一旦有人找到只能在Jev上实现的杀手功能,会迅速扩散;TypeSafe正在撰写面向编码Agent的设计模式文档,计划对外放出。
第(十)部分 安全节奏讨论、个人创业心路、给研究者的建议、未来值得探索的方向、访谈收尾 (97%‑100%)
1 对“前沿AI应当降速”观点的批判:该观点建立在“所有人都必须做更多RLVR”的前提之上;而Type‑Safe路线最优选择就是零RLVR;行业太少人去探索全新任务北极星;大众不了解技术的选项空间,被少数实验室叙事引导。
2 从OpenAI离职创业心路:早在ChatGPT发布之前就思考该问题;反思Instruction‑GPT最终只用在文案生成,没有释放经济价值;逆向推导AI驱动经济革命发生时,调用AI的主体是代码而不是人类;最初以为该方向一两周就能搞定,实际耗费数年;融资、组建TypeSafe;自认为0企业家特质,从来不想当CEO。
3 给前沿实验室受挫研究者的建议:警惕“新AI实验室”热潮,很多缺少清晰任务北极星,只是花钱做实验;最重要的是确立真正解决现实问题的任务目标;如果你找到了全新任务方向,勇敢跳出固有范式。
4 留给外界的研究课题(自己团队暂时不会主攻):① 智能驱动游戏开发,NPC、故事世界;② 摆脱KV缓存桎梏的编码Agent体系,重新思考状态管理、子任务、记忆、多Agent锁与协同,上下文管理本质是内存管理问题。
5 公司招聘方向:大量招聘数据/模型能力人才、平台基建人才;希望在全球部署服务(目前缺少欧洲服务器);目标不止Jev单一模型,希望打造AI领域的AWS,System‑One只是TCP一样的底层,上层还有很多层等待探索。
6 访谈收尾:Diogo评价公司文化,不崇拜CEO权威,鼓励互相吐槽;对未来迭代充满期待,结束访谈。
This article was originally published by DEV Community and written by cognitalk.
Read original article on DEV Community