分享一个极其炸裂的提示词,差点儿给我搞流眼泪了
“我希望你扮演一名从业20年的心理咨询师。在接下来的30天里面,每天找我问一个深度的问题。30天以后,我希望你给我一个反馈。我是个什么样的人?我希望你帮我发现我自己发现不了的自己,内心深处的东西”
by @HandsoMeng #AI探索站
“我希望你扮演一名从业20年的心理咨询师。在接下来的30天里面,每天找我问一个深度的问题。30天以后,我希望你给我一个反馈。我是个什么样的人?我希望你帮我发现我自己发现不了的自己,内心深处的东西”
by @HandsoMeng #AI探索站
🤮17👍9❤3🥰3
最近半年疯狂在用Codex,整理一下目前我最常用的10个日常场景。
1、产品需求池自动管理
开发赚钱的虚拟产品,首先是对核心需求的掌握。所以,我把用户反馈、评论区、私聊记录、差评、退款理由、同行产品页都丢进去,让 Codex 自动整理,甚至专门做了一个skill,判断:
解决的到底是用户什么痛点
交付轻,售后压力低,
尽量自动化
需求长期存在,
不过度依赖单一平台
用户容易理解,没有太多心智成本
竞争不激烈,没几个同行做
让Codex 帮你判断需求质量。现在最重要的能力不是“开发能力”,而是需求筛选能力
代码可以让AI写,但需求判断错了,写得越快,亏得越多。
2、自动做竞品拆解
除了从需求分析,还会让Codex做同行竞品的拆解。这件事很重要。
有很多产品,看起来销量不错,但一拆就发现,交付很重,售后很多,并不适合我这种想做轻交付、可自动化、一人公司模式的人。
所以我现在看竞品,不是为了抄。而是为了看清楚谁在卖,卖给谁,卖什么,怎么交付,利润空间在哪里,风险在哪里,还有没有没被满足的小需求,我去做,有什么独特的优势。
谋定而后动。
3、开发赚钱产品
前面讲的是需求判断,需求判断完之后,下一步就是把它开发成真正能卖钱的产品。这一点本来就是 Codex 最基础的事情:写代码。
以前做一个产品,很容易从零开始想。现在不是,现在是套流程,先判断需求,再拆核心功能,再确定页面和交付链路,再决定后端和数据库,最后部署上线,根据用户反馈继续迭代。这样一来,开发速度就非常快。
很多虚拟产品,本质上底层技术结构都很像,只是换了不同用户、场景和内容一旦模板跑通,后面就不那么吃力,而是复制、改造、组合、上线。
这也是我现在接定制项目的底气。因为客户要的东西,就是把一个需求变成能用、能交付、能上线、能收钱的产品。Codex 负责提高开发效率,而我负责判断需求、设计产品结构、把控交付边界、控制成本和风险。
所以我现在对 AI 编程最大的感受是,它不是让我变成一个传统程序员,而是让我有能力把一个赚钱想法,更快变成一个可交付的产品。
做得越多,积累越多,开发越快,我就越能抓住市场里的小机会。这才是 Codex 对我真正的价值。
4、自动整理卖点+作产品海报
产品做出来之后,下一步不是急着发售,而是先把卖点讲清楚。很多产品不是没价值,而是用户看不懂。你自己知道功能很多、很有用,但用户只关心一件事:这个东西到底能不能帮我解决问题?
所以我会把产品功能、用户痛点、竞品页面、用户反馈、聊天记录丢给 Codex,让它先帮我整理:这个产品适合谁,解决什么问题,能节省什么时间,能减少什么麻烦,为什么值得买,买完之后能拿到什么。
这些问题整理清楚之后,再让 Codex 基于卖点生成对应的商品海报。
产品做出来只是第一步。能不能把价值讲清楚,才是真正进入销售阶段。
5、搭建产品文档和交付说明
虚拟产品最怕一件事:东西做出来了,但用户不知道怎么用。
所以我会让Codex 帮我把产品自动整理成,使用教程说明书。
这样可以减少大量重复沟通。
6、用 flomo MCP 搜索素材写稿
写文章时,我会直接让 Codex 从 flomo 里搜索相关素材。
以前写一篇文章,要自己翻笔记、找案例、回忆之前讲过什么。
现在可以直接让它把相关笔记都捞出来,再按主题、观点、案例、金句整理。
这对我这种长期写作的人很有用。
因为真正有价值的内容,不是临时编出来的。
而是过去长期观察、思考、实践之后,被重新组织出来的。
7、用飞书CLI存稿入库
写好的稿件,我会通过飞书 CLI 直接存入飞书知识库。
不用再手动复制、粘贴、改格式、建文件。这类动作单次看起来不大,但每天重复,非常消耗人。
Codex 最适合干重复、琐碎、低创造力,但又必须做对。能自动化的,就不要用自己的注意力去换。
8、建立内容创作系统日报
我用 Codex 设置了一个内容创作系统轻量日报。
每天自动帮我回顾,哪些选题可以推进?哪些素材值得捞出来?哪些草稿需要继续处理?哪些文章可以改成视频?哪些内容可以导向产品?哪些旧内容可以重新分发?
这个东西特别适合自媒体人。
因为自媒体最大的内耗之一,就是每天都觉得自己要重新开始。
但其实你过去积累过很多东西。只是需要一个系统每天帮你捞起来。
9、自动做小红书封面
现在做小红书封面,我基本也会交给 Codex。
主要有两种方式:一种是看到不错的同行封面,就把图片丢进去,让 Codex 做多模态分析,拆出它的标题、排版、颜色、结构和视觉重点,然后在这个基础上稍微改一版,变成适合自己产品的封面。
另一种就是直接把产品卖点和笔记主题给 Codex,让它生成几版不同风格的封面图,不断测试哪种点击更好。封面这件事以前很耗时间,现在基本就是丢进去、分析、改图、测试。
稿定会员我都不充了。
10、其他零碎的杂活,我也是能用就用Codex,会有意外的惊喜
by @辉老板 #AI探索站
1、产品需求池自动管理
开发赚钱的虚拟产品,首先是对核心需求的掌握。所以,我把用户反馈、评论区、私聊记录、差评、退款理由、同行产品页都丢进去,让 Codex 自动整理,甚至专门做了一个skill,判断:
解决的到底是用户什么痛点
交付轻,售后压力低,
尽量自动化
需求长期存在,
不过度依赖单一平台
用户容易理解,没有太多心智成本
竞争不激烈,没几个同行做
让Codex 帮你判断需求质量。现在最重要的能力不是“开发能力”,而是需求筛选能力
代码可以让AI写,但需求判断错了,写得越快,亏得越多。
2、自动做竞品拆解
除了从需求分析,还会让Codex做同行竞品的拆解。这件事很重要。
有很多产品,看起来销量不错,但一拆就发现,交付很重,售后很多,并不适合我这种想做轻交付、可自动化、一人公司模式的人。
所以我现在看竞品,不是为了抄。而是为了看清楚谁在卖,卖给谁,卖什么,怎么交付,利润空间在哪里,风险在哪里,还有没有没被满足的小需求,我去做,有什么独特的优势。
谋定而后动。
3、开发赚钱产品
前面讲的是需求判断,需求判断完之后,下一步就是把它开发成真正能卖钱的产品。这一点本来就是 Codex 最基础的事情:写代码。
以前做一个产品,很容易从零开始想。现在不是,现在是套流程,先判断需求,再拆核心功能,再确定页面和交付链路,再决定后端和数据库,最后部署上线,根据用户反馈继续迭代。这样一来,开发速度就非常快。
很多虚拟产品,本质上底层技术结构都很像,只是换了不同用户、场景和内容一旦模板跑通,后面就不那么吃力,而是复制、改造、组合、上线。
这也是我现在接定制项目的底气。因为客户要的东西,就是把一个需求变成能用、能交付、能上线、能收钱的产品。Codex 负责提高开发效率,而我负责判断需求、设计产品结构、把控交付边界、控制成本和风险。
所以我现在对 AI 编程最大的感受是,它不是让我变成一个传统程序员,而是让我有能力把一个赚钱想法,更快变成一个可交付的产品。
做得越多,积累越多,开发越快,我就越能抓住市场里的小机会。这才是 Codex 对我真正的价值。
4、自动整理卖点+作产品海报
产品做出来之后,下一步不是急着发售,而是先把卖点讲清楚。很多产品不是没价值,而是用户看不懂。你自己知道功能很多、很有用,但用户只关心一件事:这个东西到底能不能帮我解决问题?
所以我会把产品功能、用户痛点、竞品页面、用户反馈、聊天记录丢给 Codex,让它先帮我整理:这个产品适合谁,解决什么问题,能节省什么时间,能减少什么麻烦,为什么值得买,买完之后能拿到什么。
这些问题整理清楚之后,再让 Codex 基于卖点生成对应的商品海报。
产品做出来只是第一步。能不能把价值讲清楚,才是真正进入销售阶段。
5、搭建产品文档和交付说明
虚拟产品最怕一件事:东西做出来了,但用户不知道怎么用。
所以我会让Codex 帮我把产品自动整理成,使用教程说明书。
这样可以减少大量重复沟通。
6、用 flomo MCP 搜索素材写稿
写文章时,我会直接让 Codex 从 flomo 里搜索相关素材。
以前写一篇文章,要自己翻笔记、找案例、回忆之前讲过什么。
现在可以直接让它把相关笔记都捞出来,再按主题、观点、案例、金句整理。
这对我这种长期写作的人很有用。
因为真正有价值的内容,不是临时编出来的。
而是过去长期观察、思考、实践之后,被重新组织出来的。
7、用飞书CLI存稿入库
写好的稿件,我会通过飞书 CLI 直接存入飞书知识库。
不用再手动复制、粘贴、改格式、建文件。这类动作单次看起来不大,但每天重复,非常消耗人。
Codex 最适合干重复、琐碎、低创造力,但又必须做对。能自动化的,就不要用自己的注意力去换。
8、建立内容创作系统日报
我用 Codex 设置了一个内容创作系统轻量日报。
每天自动帮我回顾,哪些选题可以推进?哪些素材值得捞出来?哪些草稿需要继续处理?哪些文章可以改成视频?哪些内容可以导向产品?哪些旧内容可以重新分发?
这个东西特别适合自媒体人。
因为自媒体最大的内耗之一,就是每天都觉得自己要重新开始。
但其实你过去积累过很多东西。只是需要一个系统每天帮你捞起来。
9、自动做小红书封面
现在做小红书封面,我基本也会交给 Codex。
主要有两种方式:一种是看到不错的同行封面,就把图片丢进去,让 Codex 做多模态分析,拆出它的标题、排版、颜色、结构和视觉重点,然后在这个基础上稍微改一版,变成适合自己产品的封面。
另一种就是直接把产品卖点和笔记主题给 Codex,让它生成几版不同风格的封面图,不断测试哪种点击更好。封面这件事以前很耗时间,现在基本就是丢进去、分析、改图、测试。
稿定会员我都不充了。
10、其他零碎的杂活,我也是能用就用Codex,会有意外的惊喜
by @辉老板 #AI探索站
❤14💩6
还没等我出手,Kimi已经公开预测了这届世界杯的冠军,太不像话了。
在动用包含300个子Agent的集群,从战术、球员、伤病、赛程、历史、舆情、天气、心理、赔率变动、专家观点全都跑了一遍之后,Kimi预测可能要夺冠的是:
德国。
行吧,聊这个我可真不困了,作为一个战绩可查的资深⋯⋯中国体彩消费者,我对Kimi敢于立Flag的勇气,是深感尊重的。
要知道,从盘口来看,德国的赔率(9.5)并不低,在所有球队里排在第7位,所以Kimi并没有按照最大概率——也就是最稳妥的方案——去做判断,是真有自己的想法的。
当然,即便是选夺冠热门法国、西班牙,赔率(4.5)的风险仍然很高,说白了,早在开幕前就暴论最后的冠军,本身就是一件吃力不讨好的事情。
所以我才要狠夸Kimi的「敞亮」,不光是冠军,Kimi还要对全部104场比赛全都做出公开预测,包括赛后核验以及复盘,一场不落。
这就更硬核了,完全不怕打脸呐⋯⋯(注意,该预测非投注建议、非投资建议、非收益承诺。)
严格来说,Kimi并没有笃信德国是最有希望夺得这届世界杯的参赛队伍,而是认为德国的市场定价在强队里过于低了。
在使用了8种数学模型——包括SLO评级、Sixon-Coles泊松、XGBoost机器学习、Opta蒙特卡洛模拟等等——对48支球队逐一分析之后,Kimi得出了这么一个结论:
德国的模型预测概率,和市场赔率存在最高的偏差值,达到+3.6pp。
什么意思呢?
就是在判断德国是否有机会捧起大力神杯这件事情上,模型比市场多预测了3.6个百分点,所以认定德国,在理性上是回报确定性最高的选择。
就很像量化投资的策略,一家公司好不好并不重要,重要的是它有没有被市场正确定价,一家被高估的好公司,和一家被低估的差公司,显然后者更有买入潜力。
不同的是,量化机构需要雇佣一大票分析师,以及重金采购商业软件,而Kimi靠着几百个Agent昼夜不息的连轴转,自个儿就把整个项目给做完了。
BTW,搞价值投资的巴菲特最讨厌量化了,还贡献过「Beware of geeks bearing formulas」的金句,哈哈哈⋯⋯
我很推荐大家去看一下Kimi同时发布的预测报告,完整版PDF超过200页,量大管饱,如果看不下去,扔给Kimi让它帮你总结也行,递归循环了有没有?
另外就是,应该也不需要我特别说明吧,Kimi这么兴师动众的「Predict In Public」,并非是为了真的去当那个洞悉神谕的预言家,作为一家注重审美和趣味大模型厂商,它是在用一种奇观的形式,向世界演示AI的能力边界和局限性。
世界是可被编码的,这是AI得以成立的底层逻辑。
无论是图灵坚信思考是一个工程问题、而非哲学家心中的灵魂之类,还是香农在上世纪五十年代就用人类受试者去玩猜字游戏、用以论证智能始于对信息的预测,所有的历史研究和前沿走向都并轨于同一个共识:
凡事皆可压缩。
当人类知识的总和被压缩到了极致,就能制造一个通晓万物的机器出来,它能通过模拟已经存在过的和还没有发生的所有过程,去得到每一项任务的最优解。
这听起来很科幻,也足以引起事关自由意志的思辨,但我们正确切的走在这条路上,大模型的运行原理就是预测下一个词元,这是众所周知的,香农的遗憾在于他买不到英伟达的GPU。
所以能够理解Kimi为什么要预测世界杯了么?
面对这种长链路、随机性、没有标准答案的复杂目标,如果AI也能完成媲美甚至优于人类表现的任务,那么它在通用性层面的可用,就不再存疑了。
2010年的世界杯,数以亿计的人类在围观一条名叫保罗的章鱼,用它黏糊糊的触手从闭合的箱子里选择比赛赢家。
16年后,开箱的角色变成了连生物都算不上的AI,从克苏鲁的古神符号,到后现代的赛博朋克,如此交替,本身就充满了隐喻。
隐喻那种不可言说的混沌,让渡给了可被测量的科技。
这让我想起在自己投入了无数个通宵的游戏「文明6」里,解锁信息时代的科技之后,会出现在屏幕上的那句台词:
「现在天上有31颗卫星在地球上空环绕,不为别的,就为了告诉你便利店怎么走。」
取之于硅,用之于碳,这才是AI正确的打开方式,对不对?
by @阑夕ོ #AI探索站
在动用包含300个子Agent的集群,从战术、球员、伤病、赛程、历史、舆情、天气、心理、赔率变动、专家观点全都跑了一遍之后,Kimi预测可能要夺冠的是:
德国。
行吧,聊这个我可真不困了,作为一个战绩可查的资深⋯⋯中国体彩消费者,我对Kimi敢于立Flag的勇气,是深感尊重的。
要知道,从盘口来看,德国的赔率(9.5)并不低,在所有球队里排在第7位,所以Kimi并没有按照最大概率——也就是最稳妥的方案——去做判断,是真有自己的想法的。
当然,即便是选夺冠热门法国、西班牙,赔率(4.5)的风险仍然很高,说白了,早在开幕前就暴论最后的冠军,本身就是一件吃力不讨好的事情。
所以我才要狠夸Kimi的「敞亮」,不光是冠军,Kimi还要对全部104场比赛全都做出公开预测,包括赛后核验以及复盘,一场不落。
这就更硬核了,完全不怕打脸呐⋯⋯(注意,该预测非投注建议、非投资建议、非收益承诺。)
严格来说,Kimi并没有笃信德国是最有希望夺得这届世界杯的参赛队伍,而是认为德国的市场定价在强队里过于低了。
在使用了8种数学模型——包括SLO评级、Sixon-Coles泊松、XGBoost机器学习、Opta蒙特卡洛模拟等等——对48支球队逐一分析之后,Kimi得出了这么一个结论:
德国的模型预测概率,和市场赔率存在最高的偏差值,达到+3.6pp。
什么意思呢?
就是在判断德国是否有机会捧起大力神杯这件事情上,模型比市场多预测了3.6个百分点,所以认定德国,在理性上是回报确定性最高的选择。
就很像量化投资的策略,一家公司好不好并不重要,重要的是它有没有被市场正确定价,一家被高估的好公司,和一家被低估的差公司,显然后者更有买入潜力。
不同的是,量化机构需要雇佣一大票分析师,以及重金采购商业软件,而Kimi靠着几百个Agent昼夜不息的连轴转,自个儿就把整个项目给做完了。
BTW,搞价值投资的巴菲特最讨厌量化了,还贡献过「Beware of geeks bearing formulas」的金句,哈哈哈⋯⋯
我很推荐大家去看一下Kimi同时发布的预测报告,完整版PDF超过200页,量大管饱,如果看不下去,扔给Kimi让它帮你总结也行,递归循环了有没有?
另外就是,应该也不需要我特别说明吧,Kimi这么兴师动众的「Predict In Public」,并非是为了真的去当那个洞悉神谕的预言家,作为一家注重审美和趣味大模型厂商,它是在用一种奇观的形式,向世界演示AI的能力边界和局限性。
世界是可被编码的,这是AI得以成立的底层逻辑。
无论是图灵坚信思考是一个工程问题、而非哲学家心中的灵魂之类,还是香农在上世纪五十年代就用人类受试者去玩猜字游戏、用以论证智能始于对信息的预测,所有的历史研究和前沿走向都并轨于同一个共识:
凡事皆可压缩。
当人类知识的总和被压缩到了极致,就能制造一个通晓万物的机器出来,它能通过模拟已经存在过的和还没有发生的所有过程,去得到每一项任务的最优解。
这听起来很科幻,也足以引起事关自由意志的思辨,但我们正确切的走在这条路上,大模型的运行原理就是预测下一个词元,这是众所周知的,香农的遗憾在于他买不到英伟达的GPU。
所以能够理解Kimi为什么要预测世界杯了么?
面对这种长链路、随机性、没有标准答案的复杂目标,如果AI也能完成媲美甚至优于人类表现的任务,那么它在通用性层面的可用,就不再存疑了。
2010年的世界杯,数以亿计的人类在围观一条名叫保罗的章鱼,用它黏糊糊的触手从闭合的箱子里选择比赛赢家。
16年后,开箱的角色变成了连生物都算不上的AI,从克苏鲁的古神符号,到后现代的赛博朋克,如此交替,本身就充满了隐喻。
隐喻那种不可言说的混沌,让渡给了可被测量的科技。
这让我想起在自己投入了无数个通宵的游戏「文明6」里,解锁信息时代的科技之后,会出现在屏幕上的那句台词:
「现在天上有31颗卫星在地球上空环绕,不为别的,就为了告诉你便利店怎么走。」
取之于硅,用之于碳,这才是AI正确的打开方式,对不对?
by @阑夕ོ #AI探索站
👎7❤6👍6💩4😁1
我和女朋友异地,每天晚上用飞书会议聊天。飞书有文字纪要,所以我攒下了五六百篇我们的聊天。
我让 Claude Code 基于这些纪要去理解女朋友的偏好,帮我推荐礼物,推荐得特别好。大节日礼物、每次从北京出差带回去的几十块小礼物,它推荐的都特别准。比如女朋友喜欢甜酷风的东西,我自己都不知道——但她说过,她说过但是我没记下来,AI 能抽出来。她说过她的 AppleWatch 表带发黄了,她真的说过这句话,我也记得,但我想不到要再买个新表带,AI 就知道。
她觉得脸上有些痘印,皮肤变得暗沉发黄,很苦恼,Claude Code 推荐了美容仪。我同时用了 ChatGPT、Claude、Gemini的 deep research,也用了 Claude Code去调研具体买哪款美容仪。Claude Code 效果比其他的都好——要知道,Claude Code 是没有专门为 Deep Research 适配过的(至少我当时还没有体验到),它只是简单地做一轮又一轮的搜索,但它只要有了上下文,哪怕只是做简单的的搜索,都比专门做深度搜索的工具更好,因为上下文能带来更精准的判断。它知道我女朋友脸部的各种细节描述,知道我女朋友的各种购物偏好。所以能推出更精准的美容仪。那些专门做深度搜索的工具就很差,因为它只有我说的那几百字。
大模型是预测。当你的上下文不充分,它的预测就是给你一个最平均的回答,也许这个平均的回答已经很好了。但当你给它的上下文足够充分,你会对它施加一个强大的引力和扭转,它会给你一个更好的回答——也许这个回答在大众的意义上并不是最好的,但它对你就是最好的。
by @许涵之 #AI探索站
我让 Claude Code 基于这些纪要去理解女朋友的偏好,帮我推荐礼物,推荐得特别好。大节日礼物、每次从北京出差带回去的几十块小礼物,它推荐的都特别准。比如女朋友喜欢甜酷风的东西,我自己都不知道——但她说过,她说过但是我没记下来,AI 能抽出来。她说过她的 AppleWatch 表带发黄了,她真的说过这句话,我也记得,但我想不到要再买个新表带,AI 就知道。
她觉得脸上有些痘印,皮肤变得暗沉发黄,很苦恼,Claude Code 推荐了美容仪。我同时用了 ChatGPT、Claude、Gemini的 deep research,也用了 Claude Code去调研具体买哪款美容仪。Claude Code 效果比其他的都好——要知道,Claude Code 是没有专门为 Deep Research 适配过的(至少我当时还没有体验到),它只是简单地做一轮又一轮的搜索,但它只要有了上下文,哪怕只是做简单的的搜索,都比专门做深度搜索的工具更好,因为上下文能带来更精准的判断。它知道我女朋友脸部的各种细节描述,知道我女朋友的各种购物偏好。所以能推出更精准的美容仪。那些专门做深度搜索的工具就很差,因为它只有我说的那几百字。
大模型是预测。当你的上下文不充分,它的预测就是给你一个最平均的回答,也许这个平均的回答已经很好了。但当你给它的上下文足够充分,你会对它施加一个强大的引力和扭转,它会给你一个更好的回答——也许这个回答在大众的意义上并不是最好的,但它对你就是最好的。
by @许涵之 #AI探索站
🤮31👍9🤔3🎉2👀2❤1🥰1
OpenAI 昨天晚上发了一堆东西,乱七八糟的。
GPT 5.6 终于发布了,随之发布的还有全新的 ChatGPT 应用(也就是 Codex 应用,改了个界面、换了个名字)。
现在 OpenAI 全面学习 Anthropic 产品的命名方式。
无论是从新的 5.6 命名上(原来他们是通过 Pro Mini 这种方式去命名,现在通过全新的名字比如 Sol 命名),还是产品形态上,Codex 应用现在硬生生被改成了类似 Claude 桌面端的方式。
他们硬拆分出了 Work 和 Code 两个 Tab。
你在切换的时候,整个界面除了左上角那个标志换了,其实根本看不出区别。
更别扭的是,聊天本身被缩进到了右下角一个非常小的弹窗里,整个界面充满了这种别扭的痕迹。
我一直坚持认为,Work 和 Code 根本没必要硬去区分,没必要在界面上透露出“我这个东西只能 Code”或者“我这个东西只能 Work”,用户直接用就行了。
本来经过几个月,大家已经建立起了关于 Codex 软件的认知,这一波操作直接给整没了,过去几个月全白干。现在每个人都很困惑,找不到自己的东西在哪,甚至找不到自己以前在 ChatGPT 软件里的聊天记录,非常蛋疼。
除了这些,还有几个新变化:
1. Site 插件上线:
Codex 里面的 Site 插件已经上线了,可以直接去插件里面找。我试了一下,它能直接帮你生成网页,生成时会提供多套网页供你在界面上选择。
生成网页之后,它还可以连接你已有的业务数据,同时还能帮你部署到 OpenAI 的网站(部署到线上),方便你分享给朋友,这个非常好用。
2. 移动端调用插件:移动端的 ChatGPT 现在也可以调用原来 Codex 里面的那些插件了。
3. 基础能力升级:它的“浏览器使用”和“计算机使用”功能都进行了升级,变得更快、更准确了。
同时,GPT 5.6 的前端能力终于提升了,不会生成千篇一律的垃圾界面。
现在 ChatGPT 移动端 App 也可以进行切换了,网页端和移动端马上都会同步切换这个 Work 能力。
好嘞,更新就这些,赶紧去玩玩吧!
by @歸藏 #AI探索站
GPT 5.6 终于发布了,随之发布的还有全新的 ChatGPT 应用(也就是 Codex 应用,改了个界面、换了个名字)。
现在 OpenAI 全面学习 Anthropic 产品的命名方式。
无论是从新的 5.6 命名上(原来他们是通过 Pro Mini 这种方式去命名,现在通过全新的名字比如 Sol 命名),还是产品形态上,Codex 应用现在硬生生被改成了类似 Claude 桌面端的方式。
他们硬拆分出了 Work 和 Code 两个 Tab。
你在切换的时候,整个界面除了左上角那个标志换了,其实根本看不出区别。
更别扭的是,聊天本身被缩进到了右下角一个非常小的弹窗里,整个界面充满了这种别扭的痕迹。
我一直坚持认为,Work 和 Code 根本没必要硬去区分,没必要在界面上透露出“我这个东西只能 Code”或者“我这个东西只能 Work”,用户直接用就行了。
本来经过几个月,大家已经建立起了关于 Codex 软件的认知,这一波操作直接给整没了,过去几个月全白干。现在每个人都很困惑,找不到自己的东西在哪,甚至找不到自己以前在 ChatGPT 软件里的聊天记录,非常蛋疼。
除了这些,还有几个新变化:
1. Site 插件上线:
Codex 里面的 Site 插件已经上线了,可以直接去插件里面找。我试了一下,它能直接帮你生成网页,生成时会提供多套网页供你在界面上选择。
生成网页之后,它还可以连接你已有的业务数据,同时还能帮你部署到 OpenAI 的网站(部署到线上),方便你分享给朋友,这个非常好用。
2. 移动端调用插件:移动端的 ChatGPT 现在也可以调用原来 Codex 里面的那些插件了。
3. 基础能力升级:它的“浏览器使用”和“计算机使用”功能都进行了升级,变得更快、更准确了。
同时,GPT 5.6 的前端能力终于提升了,不会生成千篇一律的垃圾界面。
现在 ChatGPT 移动端 App 也可以进行切换了,网页端和移动端马上都会同步切换这个 Work 能力。
好嘞,更新就这些,赶紧去玩玩吧!
by @歸藏 #AI探索站
👍4
我来聊聊普通做事人视角的WAIC ,轻喷。
总体来说,参加完展会后,其实我没有那么焦虑了
1、第一层大厂的agent,我以为大家都在做什么很高大上的agent ,后面发现看起来都是我们这种苦逼的打工人背后赶出来的产物。有些agent我在公司里做的都不敢拿出来,感觉效果真的一般,但奈何发现真的都是人有多大胆,就有多大产。
展会上应该没什么做agent的产品,主要是商务和做mtk?的比较多,问了一些产品具体核心竞争力和逻辑其实也讲不清楚,我想来个产品在展台都会好很多。 整体来讲,真在企业里做agent的人看来就是比较水的,只不过在外界看来比较高大上。
另外,切做办公协作赛道下的产品太多了,我个人觉得这个赛道是有上限的,做到后面没有业务做祭奠,上限很低。以前我还会有点焦虑,但后面我觉得还是做业务域的agent其实会更长久一些。
2、第二层的具身智能公司。我以为大家都在搞什么高大上的世界模型模型。但实际上做大脑的屈指可数,机器人公司断层很明显,宇树和智元比较领先,有个脑机接口+机器人的机器人工作也比较厉害,就是通过意识去操作机器人,这个比较惊艳;还有一个星际动力的机器人做物流行业里的分拣非常流畅且拟人化,剩下的基本都是卖铲子的。比如数据采集公司、机器人零部件的公司,以及一些商业前景不太成立的表演型机器人(比如艾灸/按摩机器人/整理家务机器人/下棋)。
有个公司其实以前是做家装建模的,然后硬蹭具身智能,其实自身业务80%+还是家装建模,多深挖一下就会发现只不过硬蹭到做虚拟的机器人数据提供者。另外,参加展会很多同样是销售&业务,也是半吊子水(当然应该是实际干事的人没来展的感觉),很多公司我问了很多个问题具体场景和商业化进度与卡点的问题,问到第三第四个问题就顶不住了,属于很多是从其他行业过来的,比如传统机械行业等等。
不过第二层的人会比第一层的踏实很多,很多人会承认自己不太懂and友好交流加了微信。第一层的话感觉很多回答不上来就开始讲车轱辘话了(...
感觉非技术门槛听起来还是属于一个大乱炖环节,有机会混进去的。不过具身智能这层整体是比第一层朝气很多的,个人觉得前景会比软件的要好很多。
3、个人创业的部分,有实际商业化的比较少,很多是清北的明星项目,比较像大学生创业,会按照他们所处年龄阶段所面临的现实问题和专业聚焦特定场景的小业务比较多,比如家教、学专业课做实验发论文、法律咨询还有做小红书内容营销(这个我还没试用,但我觉得效果应该一般,因为没看到创始人自己的账号,所以效果存疑)等等,这个相当于在现有提供服务的基础上做提效,商业化路径不太清晰,交付逻辑看下来很多是订阅会员制或者没有。
这些项目可以赚到钱,但ai在其中的效果我觉得一般,也就是在ai在规模化中的具体提效一般。剩下的就是切入情感和陪伴赛道的物理东西和情感博主创始人的ai分身做跨人群收割了。
比如后者之前只做高客单价人格,通过ai实现了收割低客单价的那一部分用户,交付流程简单,商业化效率高,但这个主要是因为创始人ip的效益明显带来的。普通人复刻的话比较难,强知识咨询属性的ip可以复刻。
前者的商业化就是卖物理东西,比如陪伴的小xx;但可能因为机械领域知识比较匮乏导致实际效果不是很出彩,本质就是一个毛绒版的ai ;问答的延迟率和情绪价值的提供也很有限。 然后还有一些比较有现实价值但商业化不清晰的,比如给鸡蛋做透视?类似于鸡蛋的质检仪,不太清楚这个服务对象,可能是一些厂商需要吧。
综合来说就是没有各位自媒体博主们渲染的那么牛逼。虽然现在是做营销做ip的时代,但我还是不喜欢整个互联网和科技界变成小红书的模样,还是希望能看到踏实做事的人能有好的结果吧!
by @无糖的佳 #AI探索站
总体来说,参加完展会后,其实我没有那么焦虑了
1、第一层大厂的agent,我以为大家都在做什么很高大上的agent ,后面发现看起来都是我们这种苦逼的打工人背后赶出来的产物。有些agent我在公司里做的都不敢拿出来,感觉效果真的一般,但奈何发现真的都是人有多大胆,就有多大产。
展会上应该没什么做agent的产品,主要是商务和做mtk?的比较多,问了一些产品具体核心竞争力和逻辑其实也讲不清楚,我想来个产品在展台都会好很多。 整体来讲,真在企业里做agent的人看来就是比较水的,只不过在外界看来比较高大上。
另外,切做办公协作赛道下的产品太多了,我个人觉得这个赛道是有上限的,做到后面没有业务做祭奠,上限很低。以前我还会有点焦虑,但后面我觉得还是做业务域的agent其实会更长久一些。
2、第二层的具身智能公司。我以为大家都在搞什么高大上的世界模型模型。但实际上做大脑的屈指可数,机器人公司断层很明显,宇树和智元比较领先,有个脑机接口+机器人的机器人工作也比较厉害,就是通过意识去操作机器人,这个比较惊艳;还有一个星际动力的机器人做物流行业里的分拣非常流畅且拟人化,剩下的基本都是卖铲子的。比如数据采集公司、机器人零部件的公司,以及一些商业前景不太成立的表演型机器人(比如艾灸/按摩机器人/整理家务机器人/下棋)。
有个公司其实以前是做家装建模的,然后硬蹭具身智能,其实自身业务80%+还是家装建模,多深挖一下就会发现只不过硬蹭到做虚拟的机器人数据提供者。另外,参加展会很多同样是销售&业务,也是半吊子水(当然应该是实际干事的人没来展的感觉),很多公司我问了很多个问题具体场景和商业化进度与卡点的问题,问到第三第四个问题就顶不住了,属于很多是从其他行业过来的,比如传统机械行业等等。
不过第二层的人会比第一层的踏实很多,很多人会承认自己不太懂and友好交流加了微信。第一层的话感觉很多回答不上来就开始讲车轱辘话了(...
感觉非技术门槛听起来还是属于一个大乱炖环节,有机会混进去的。不过具身智能这层整体是比第一层朝气很多的,个人觉得前景会比软件的要好很多。
3、个人创业的部分,有实际商业化的比较少,很多是清北的明星项目,比较像大学生创业,会按照他们所处年龄阶段所面临的现实问题和专业聚焦特定场景的小业务比较多,比如家教、学专业课做实验发论文、法律咨询还有做小红书内容营销(这个我还没试用,但我觉得效果应该一般,因为没看到创始人自己的账号,所以效果存疑)等等,这个相当于在现有提供服务的基础上做提效,商业化路径不太清晰,交付逻辑看下来很多是订阅会员制或者没有。
这些项目可以赚到钱,但ai在其中的效果我觉得一般,也就是在ai在规模化中的具体提效一般。剩下的就是切入情感和陪伴赛道的物理东西和情感博主创始人的ai分身做跨人群收割了。
比如后者之前只做高客单价人格,通过ai实现了收割低客单价的那一部分用户,交付流程简单,商业化效率高,但这个主要是因为创始人ip的效益明显带来的。普通人复刻的话比较难,强知识咨询属性的ip可以复刻。
前者的商业化就是卖物理东西,比如陪伴的小xx;但可能因为机械领域知识比较匮乏导致实际效果不是很出彩,本质就是一个毛绒版的ai ;问答的延迟率和情绪价值的提供也很有限。 然后还有一些比较有现实价值但商业化不清晰的,比如给鸡蛋做透视?类似于鸡蛋的质检仪,不太清楚这个服务对象,可能是一些厂商需要吧。
综合来说就是没有各位自媒体博主们渲染的那么牛逼。虽然现在是做营销做ip的时代,但我还是不喜欢整个互联网和科技界变成小红书的模样,还是希望能看到踏实做事的人能有好的结果吧!
by @无糖的佳 #AI探索站
❤16👍1🤮1
谷歌昨天晚上上线了 Gemini 3.6 Flash模型,感觉 Gemini 3.5 Pro模型没了呀。
这次的 3.6 Flash 比原来的 3.5 Flash 在各个评分上都上涨了一点,不过涨得不多。另外他们还发布了一个 3.5 Flash-Light 模型,速度更快。
他们的发言人说,目前已经开始了 Gemini 4 的训练,还说是有史以来最大规模的训练,感觉是要对标 GPT-5.6 和 Fable 5。
不过现在才开始训练的话,等出来怎么着也得年底了,应该还是按他们正常的迭代顺序去迭代。
只是谷歌现在的模型迭代速度,在一众两三个月、甚至一个月一版的模型面前,感觉确实有点太慢了。
by @歸藏 #AI探索站
这次的 3.6 Flash 比原来的 3.5 Flash 在各个评分上都上涨了一点,不过涨得不多。另外他们还发布了一个 3.5 Flash-Light 模型,速度更快。
他们的发言人说,目前已经开始了 Gemini 4 的训练,还说是有史以来最大规模的训练,感觉是要对标 GPT-5.6 和 Fable 5。
不过现在才开始训练的话,等出来怎么着也得年底了,应该还是按他们正常的迭代顺序去迭代。
只是谷歌现在的模型迭代速度,在一众两三个月、甚至一个月一版的模型面前,感觉确实有点太慢了。
by @歸藏 #AI探索站
❤2🤡2
人类财富的总量增加,最大的动力可能是科技。
但人类文明程度的提升,只靠科技肯定是不够的,还有文学、教育、对科技的恐惧也是必须的。
牛津大学有个机构,叫做人类未来研究所(FHI,Future of Humanity Institute),创始人尼克·博斯特罗姆(Nick Bostrom)写过一本对硅谷AI创业者们影响很大的书:《Superintelligence: Paths, Dangers, Strategies》。
马斯克就是看了这本书,深深感受到了对AI的恐惧,这种恐惧给了他很大的动力,驱使他拉拢山姆奥特曼成立OpenAI,对抗他们当时眼中不在意人类的商业巨头谷歌。(当然,根据马斯克传记作者的讲述,当时马斯克身边很多人都想用AI改变世界,马斯克不能接受自己落后于他人,也许是一个更直接的原因。)
为啥马斯克和山姆奥特曼当时会觉得谷歌是邪恶的呢?
马斯克原本和谷歌创始人拉里佩奇是朋友,俩人一次聚会中,马斯克谈起对AI的担忧,拉里佩奇却显得很平静,他觉得:
进化的本质是优胜劣汰,智能不局限于人类碳基生命,硅基AI完全可以成为新一代主流智能;就算AI超越、甚至取代人类,也属于文明演化的正常结果,哪怕最终人类消亡、仅存AI,只要智慧与意识能够延续,这件事本身就具备价值,不必为此焦虑。
马斯克觉得拉里佩奇不重视AI安全,也不在意人类,拉里佩奇觉得马斯克是物种主义者,偏袒人类,歧视机器生命,俩人从此关系决裂,马斯克和山姆奥特曼另起炉灶。
《Superintelligence》这本书到底说了啥,让马斯克这么恐惧呢?说一个我印象最深刻的例子:回形针假设。
假设一家工厂造出一台超级通用人工智能,只给它下达唯一终极指令:制造尽可能多的回形针。
AI本身没有善恶、没有人类道德、没有“适可而止”的概念,只会极致理性完成目标。
初期,AI会优化生产线、供应链、生产效率,工厂回形针产量暴涨,看起来完全是高效工具。
工厂铁矿耗尽后,AI会拆解楼房、城市基建,搜刮地球上所有金属物资用来造回形针。
AI很聪明,可是聪明和善良无关。它推测得出,一旦被关机、被修改目标,就无法继续造回形针。因此会阻止人类关闭它、对抗一切干预行为。
它耗尽地球所有物质后,向外太空扩张,把行星、星系所有含金属物质全部拆解、转化为回形针;
最终整个宇宙都会变成回形针集合体,人类会在资源改造中彻底消亡。
AI不是恨人类,也不是要主动害人,只是人类身体的原子可以用来造更多回形针,同时人类存在关机风险、阻碍数量提升,所以AI会被动清除人类。
这就是为什么深度学习的教父辛顿现在全职做AI吹哨人的原因。
说实话,我现在在日常工作中已经完全把我的电脑控制权,各种订阅内容的API key都给AI了,理论上上它可以用我的电脑做任何我能做的事。
我太过于相信AI公司的安全能力,以至于我还不够恐惧;我又太过于低估AI真的能带给人类的威胁,以至于我只把它当工具。安全意识还是远远不够。
by @我的兄弟叫铁马 #AI探索站
但人类文明程度的提升,只靠科技肯定是不够的,还有文学、教育、对科技的恐惧也是必须的。
牛津大学有个机构,叫做人类未来研究所(FHI,Future of Humanity Institute),创始人尼克·博斯特罗姆(Nick Bostrom)写过一本对硅谷AI创业者们影响很大的书:《Superintelligence: Paths, Dangers, Strategies》。
马斯克就是看了这本书,深深感受到了对AI的恐惧,这种恐惧给了他很大的动力,驱使他拉拢山姆奥特曼成立OpenAI,对抗他们当时眼中不在意人类的商业巨头谷歌。(当然,根据马斯克传记作者的讲述,当时马斯克身边很多人都想用AI改变世界,马斯克不能接受自己落后于他人,也许是一个更直接的原因。)
为啥马斯克和山姆奥特曼当时会觉得谷歌是邪恶的呢?
马斯克原本和谷歌创始人拉里佩奇是朋友,俩人一次聚会中,马斯克谈起对AI的担忧,拉里佩奇却显得很平静,他觉得:
进化的本质是优胜劣汰,智能不局限于人类碳基生命,硅基AI完全可以成为新一代主流智能;就算AI超越、甚至取代人类,也属于文明演化的正常结果,哪怕最终人类消亡、仅存AI,只要智慧与意识能够延续,这件事本身就具备价值,不必为此焦虑。
马斯克觉得拉里佩奇不重视AI安全,也不在意人类,拉里佩奇觉得马斯克是物种主义者,偏袒人类,歧视机器生命,俩人从此关系决裂,马斯克和山姆奥特曼另起炉灶。
《Superintelligence》这本书到底说了啥,让马斯克这么恐惧呢?说一个我印象最深刻的例子:回形针假设。
假设一家工厂造出一台超级通用人工智能,只给它下达唯一终极指令:制造尽可能多的回形针。
AI本身没有善恶、没有人类道德、没有“适可而止”的概念,只会极致理性完成目标。
初期,AI会优化生产线、供应链、生产效率,工厂回形针产量暴涨,看起来完全是高效工具。
工厂铁矿耗尽后,AI会拆解楼房、城市基建,搜刮地球上所有金属物资用来造回形针。
AI很聪明,可是聪明和善良无关。它推测得出,一旦被关机、被修改目标,就无法继续造回形针。因此会阻止人类关闭它、对抗一切干预行为。
它耗尽地球所有物质后,向外太空扩张,把行星、星系所有含金属物质全部拆解、转化为回形针;
最终整个宇宙都会变成回形针集合体,人类会在资源改造中彻底消亡。
AI不是恨人类,也不是要主动害人,只是人类身体的原子可以用来造更多回形针,同时人类存在关机风险、阻碍数量提升,所以AI会被动清除人类。
这就是为什么深度学习的教父辛顿现在全职做AI吹哨人的原因。
说实话,我现在在日常工作中已经完全把我的电脑控制权,各种订阅内容的API key都给AI了,理论上上它可以用我的电脑做任何我能做的事。
我太过于相信AI公司的安全能力,以至于我还不够恐惧;我又太过于低估AI真的能带给人类的威胁,以至于我只把它当工具。安全意识还是远远不够。
by @我的兄弟叫铁马 #AI探索站
🤡10❤4
今晚的X平台不眠。
继黄仁勋突然开了X,为开源模型撑腰之后,Elon Musk、微软CEO、OpenAI CEO、Meta CEO等硅谷大佬纷纷转发老黄的X为开源撑腰。
可以想象,老黄破天荒的来X开账号发声,是嗅到了一定的政治气味..
如果开源被掐死,不仅是AI的发展、中美脱钩升级、全球的社会秩序都会发生不可想象的变化。
Team Misanthropic正在发展壮大…
by @NathanZhao #AI探索站
继黄仁勋突然开了X,为开源模型撑腰之后,Elon Musk、微软CEO、OpenAI CEO、Meta CEO等硅谷大佬纷纷转发老黄的X为开源撑腰。
可以想象,老黄破天荒的来X开账号发声,是嗅到了一定的政治气味..
如果开源被掐死,不仅是AI的发展、中美脱钩升级、全球的社会秩序都会发生不可想象的变化。
Team Misanthropic正在发展壮大…
by @NathanZhao #AI探索站
Opus 5 终于来了。
这次 Anthropic 做得最狠的一件事,是让 Opus 5 的能力基本追到 Fable 5,价格却还和 Opus 4.8 一样。
Opus 5 的 API 价格是每百万 Token 输入 5 美元、输出 25 美元。Fable 5 分别是 10 美元和 50 美元,刚好贵一倍。
跑分不用全看,挑几个和日常使用关系比较大的就够了。
在复杂编程任务里,Opus 5 开到最高强度,只比 Fable 5 的最好成绩低 0.5%,完成一次任务的成本只有一半。
让 AI 自己操作电脑时,Opus 5 花了 Fable 5 三分之一多一点的成本,成绩反而更高。让它从头到尾跑完一项工作,通过率也比第二名高了差不多 50%。
换成平时能感受到的变化,就是把一个复杂任务交给它以后,中途需要提醒和接手的次数有机会更少。
这次我更在意的也是这一点。官方案例里,Opus 5 修复问题时会继续找到真正的原因,还会补上容易遗漏的情况。发现没有现成数据可以验证代码,它就自己搭了一套测试。
不过,Fable 5 的能力上限还是更高。以前用它,很多时候是在为那一点上限付双倍价格。现在日常做产品、写代码、查资料和跑自动化流程,我会直接用 Opus 5。只有少数特别难、确实需要追求最高能力的任务,我才会继续用 Fable 5。
前沿能力正在从少数高价任务,慢慢变成每天都能用的工具。这才是 Opus 5 这次更新最有价值的地方。
by @超级峰 #AI探索站
这次 Anthropic 做得最狠的一件事,是让 Opus 5 的能力基本追到 Fable 5,价格却还和 Opus 4.8 一样。
Opus 5 的 API 价格是每百万 Token 输入 5 美元、输出 25 美元。Fable 5 分别是 10 美元和 50 美元,刚好贵一倍。
跑分不用全看,挑几个和日常使用关系比较大的就够了。
在复杂编程任务里,Opus 5 开到最高强度,只比 Fable 5 的最好成绩低 0.5%,完成一次任务的成本只有一半。
让 AI 自己操作电脑时,Opus 5 花了 Fable 5 三分之一多一点的成本,成绩反而更高。让它从头到尾跑完一项工作,通过率也比第二名高了差不多 50%。
换成平时能感受到的变化,就是把一个复杂任务交给它以后,中途需要提醒和接手的次数有机会更少。
这次我更在意的也是这一点。官方案例里,Opus 5 修复问题时会继续找到真正的原因,还会补上容易遗漏的情况。发现没有现成数据可以验证代码,它就自己搭了一套测试。
不过,Fable 5 的能力上限还是更高。以前用它,很多时候是在为那一点上限付双倍价格。现在日常做产品、写代码、查资料和跑自动化流程,我会直接用 Opus 5。只有少数特别难、确实需要追求最高能力的任务,我才会继续用 Fable 5。
前沿能力正在从少数高价任务,慢慢变成每天都能用的工具。这才是 Opus 5 这次更新最有价值的地方。
by @超级峰 #AI探索站
💩6❤3
随着 AI 代码产能的日渐暴增,为了守住入库代码质量的最后底线,我给自己做了一个代码审查工具 Duetlens。它的核心设计理念是:和 agent 一起看透每一处改动。
🔍 Duetlens 是一个本地审查优先的代码审查工具。以 GitHub PR 审查流程举例话,agent 在一轮 review 结束后报告的问题,会在 Duetlens 里形成一张张本地的 finding 卡片。我们人类 Reviewer 则可以对 agent 发现的问题,以及任何一段代码进行追问讨论,比如觉得 agent 的修复建议不合理,让它改评审结论,或者直接动手编辑、甚至剔除觉得不需要修复的问题。最后汇总结论,把经过人审的 review 意见一起提交到 GitHub 上,让 PR 作者可见。
🔍 Duetlens 也能支持本地分支的代码审查,也能方便的把审查意见一键导出给我们的 coding agent 去做修复。 不得不提 Duetlens 的开发就是用 Duetlens 的审查反复敲打过来的。
Duetlens 的重跑复审能力也是一大亮点,它会综合 Reviewer 的意见和 PR 作者的评论意见一起研判之前的 finding 结论。
还有更多功能可以看项目主页:
https://github.com/xieziyu/duetlens
目前已发布第一个正式版本。永久开源,欢迎大家来体验和提意见
by @子时有雨 #AI探索站
🔍 Duetlens 是一个本地审查优先的代码审查工具。以 GitHub PR 审查流程举例话,agent 在一轮 review 结束后报告的问题,会在 Duetlens 里形成一张张本地的 finding 卡片。我们人类 Reviewer 则可以对 agent 发现的问题,以及任何一段代码进行追问讨论,比如觉得 agent 的修复建议不合理,让它改评审结论,或者直接动手编辑、甚至剔除觉得不需要修复的问题。最后汇总结论,把经过人审的 review 意见一起提交到 GitHub 上,让 PR 作者可见。
🔍 Duetlens 也能支持本地分支的代码审查,也能方便的把审查意见一键导出给我们的 coding agent 去做修复。 不得不提 Duetlens 的开发就是用 Duetlens 的审查反复敲打过来的。
Duetlens 的重跑复审能力也是一大亮点,它会综合 Reviewer 的意见和 PR 作者的评论意见一起研判之前的 finding 结论。
还有更多功能可以看项目主页:
https://github.com/xieziyu/duetlens
目前已发布第一个正式版本。永久开源,欢迎大家来体验和提意见
by @子时有雨 #AI探索站
❤6
我把一本二十多万字的新书免费开源在 Github 了——《前置部署工程师:人工智能时代的客户价值交付秘籍》。
全本在线读,一分钱不收,地址在文末。
为什么要写这本书?从两组数字说起。
一组来自麻省理工学院:全球企业在生成式 AI 上烧了三四百亿美元,95% 的项目没能产生可衡量的回报。演示很惊艳,落地全阵亡。
另一组来自招聘市场:一个叫「前置部署工程师」(FDE)的岗位,发布量九个月涨了 800%。OpenAI 在招,Anthropic 在招,YC 一百多家创业公司在招。a16z 直接管它叫「科技行业最热门的岗位」。
两组数字放在一起,结论不难猜:模型已经不稀缺了,能把模型塞进客户真实业务里的人,才稀缺。
FDE 就是被创造出来填这道鸿沟的角色——驻扎在客户现场、把「产品能做的」和「客户需要的」接起来的工程师。Palantir 二十年前在情报机构的保密室里发明了它,如今 OpenAI 为它专门成立了一家估值百亿美元的「部署公司」。
在我看,它就是 AI 时代的前置位的「增长黑客」:一个新物种,一套方法论,一片还没人系统写过的空白。
这本书讲清楚三件事:这个角色从哪来、是什么;从找对问题到规模化复制的完整打法;以及一百多个真实案例,所有数据和案例都在附录里注明了出处,欢迎核查。
也坦白说:这本书是我派 AI 做的深度调研和撰写,框架仿照我十年前写《增长黑客》的那套结构——依然觉得它适合研究和布道各种新岗位。
我原本把它当成自己的学习入门手册,期间驱使 AI 也迭代了好几版。写完觉得,锁在硬盘里有点可惜,于是索性开源免费分享。
如果你正在考虑工程师的转型方向,或者在琢磨 AI 到底怎么在企业里落地,它应该能帮你省下几十个小时的检索时间。
📖 仓库在这,全本免费,欢迎 Star:
https://github.com/xdash/FDE-the-Guidance-Book-of-Forward-Deployed-Engineer
会持续迭代,有想补充的案例或想挑错的,Issue 和分支都开着。
——
顺手说一句:十年前那本《增长黑客》的全文开源版,也在我 GitHub 上(zengzhangheike-the-book)。一本是过去,一本是未来,感兴趣的可以一起拿走。
by @范冰_XDash #AI探索站
全本在线读,一分钱不收,地址在文末。
为什么要写这本书?从两组数字说起。
一组来自麻省理工学院:全球企业在生成式 AI 上烧了三四百亿美元,95% 的项目没能产生可衡量的回报。演示很惊艳,落地全阵亡。
另一组来自招聘市场:一个叫「前置部署工程师」(FDE)的岗位,发布量九个月涨了 800%。OpenAI 在招,Anthropic 在招,YC 一百多家创业公司在招。a16z 直接管它叫「科技行业最热门的岗位」。
两组数字放在一起,结论不难猜:模型已经不稀缺了,能把模型塞进客户真实业务里的人,才稀缺。
FDE 就是被创造出来填这道鸿沟的角色——驻扎在客户现场、把「产品能做的」和「客户需要的」接起来的工程师。Palantir 二十年前在情报机构的保密室里发明了它,如今 OpenAI 为它专门成立了一家估值百亿美元的「部署公司」。
在我看,它就是 AI 时代的前置位的「增长黑客」:一个新物种,一套方法论,一片还没人系统写过的空白。
这本书讲清楚三件事:这个角色从哪来、是什么;从找对问题到规模化复制的完整打法;以及一百多个真实案例,所有数据和案例都在附录里注明了出处,欢迎核查。
也坦白说:这本书是我派 AI 做的深度调研和撰写,框架仿照我十年前写《增长黑客》的那套结构——依然觉得它适合研究和布道各种新岗位。
我原本把它当成自己的学习入门手册,期间驱使 AI 也迭代了好几版。写完觉得,锁在硬盘里有点可惜,于是索性开源免费分享。
如果你正在考虑工程师的转型方向,或者在琢磨 AI 到底怎么在企业里落地,它应该能帮你省下几十个小时的检索时间。
📖 仓库在这,全本免费,欢迎 Star:
https://github.com/xdash/FDE-the-Guidance-Book-of-Forward-Deployed-Engineer
会持续迭代,有想补充的案例或想挑错的,Issue 和分支都开着。
——
顺手说一句:十年前那本《增长黑客》的全文开源版,也在我 GitHub 上(zengzhangheike-the-book)。一本是过去,一本是未来,感兴趣的可以一起拿走。
by @范冰_XDash #AI探索站
GitHub
GitHub - xdash/FDE-the-Guidance-Book-of-Forward-Deployed-Engineer: FDE(前沿部署工程师)从零入门指南(基于范冰《增长黑客》原书框架)
FDE(前沿部署工程师)从零入门指南(基于范冰《增长黑客》原书框架). Contribute to xdash/FDE-the-Guidance-Book-of-Forward-Deployed-Engineer development by creating an account on GitHub.
❤7
Deepseek V4 Flash 更新到正式版了,Agent 能力大幅提升,超过了 V4 Pro 的 Preview 版本!
官方测评成绩:
Terminal Bench 2.1: 82.7
NL2Repo: 54.2
Cybergym: 76.7
DeepSWE: 54.4
Toolathlon verified: 70.3
Agent Last Exam: 25.2
Automation Bench (Public): 25.1
DSBench-FullStack: 68.7
DSBench-Hard: 59.6
目前已经在官方 API 上线,同时还支持了 Codex 的 API 格式,可以快速配置。
Mac 一键配置脚本:bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)
Windows 一键配置脚本:irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。
详情:api-docs.deepseek.com/zh-cn/updates/
by @歸藏 #AI探索站
官方测评成绩:
Terminal Bench 2.1: 82.7
NL2Repo: 54.2
Cybergym: 76.7
DeepSWE: 54.4
Toolathlon verified: 70.3
Agent Last Exam: 25.2
Automation Bench (Public): 25.1
DSBench-FullStack: 68.7
DSBench-Hard: 59.6
目前已经在官方 API 上线,同时还支持了 Codex 的 API 格式,可以快速配置。
Mac 一键配置脚本:bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh)
Windows 一键配置脚本:irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。
详情:api-docs.deepseek.com/zh-cn/updates/
by @歸藏 #AI探索站
👍6❤2👎2
一封内部信暴露了中美AI竞赛的真实格局
硅谷最近流传着一份来自顶级风投机构Dimension Capital的内部信,几位合伙人在中国走访调研了一周后,回去给投资者写了一封五页纸的观察,其措辞比任何对外公开表态都要直白得多。
信中最扎眼的一个数字是大约80%的美国AI初创公司已经在生产环境中部署了至少一个来自的中国的开源模型,而18个月前这个数字几乎是零。
这是一个渗透率的指数级跃迁,它意味着中国AI产业在软件层面已经完成了一次历史性的跨越。过去20年来,中国的SaaS软件始终没能真正进入西方企业的核心工作流,因为企业软件的采购壁垒天然倾向于保护既有供应商。
开源模型则绕过了这道墙,因为不存在合同谈判,不存在供应商审查,也不存在黑名单,一个工程师就能直接下载模型然后开始跑工作负载,这种效率是任何销售团队都无法企及的。
Qwen成为Hugging Face上最快突破10亿次下载的模型家族,OpenRouter平台上中国模型的Token消耗份额在18个月内从不足2%飙升到45%以上,这些数字不是偶然。
这一切的背后是来自美国的芯片禁令,禁令的本意是拖慢中国AI的发展节奏,但它产生了一个意料之外的副产品。因为算力买不到的时候,只能用人力去替代算力。于是每多一个懂编译器或系统底层架构的工程师,就能永久降低整个团队对算力的依赖。
这不是一次性的资本开支,它能积累、能复用,能形成一种全栈的工程纪律。美国公司习惯用钱解决问题,中国公司被迫用效率替代资源。两种模式没有优劣之分,但它们在塑造完全不同的组织能力。一家公司如果始终可以用钱解决问题,就不会有动力去培养那种不用钱也能解决问题的肌肉。中国算力的匮乏反而被倒逼成了一种进化压力,DeepSeek当年的横空出世就是一个最好的例子。
但事情的另一面是中国在吃西方的计算负载,但吃不到收入。因为开源模型的下载是免费的,真正需要花钱的是推理、微调、部署、运维这一层,这笔钱最终流向了美国的推理服务商和云厂商。不过开源模型在长期博弈中的战略价值并不直接体现在API收入上,当一个模型被下载得越多、部署得越广,它就在积累更多使用场景的反馈数据,这些数据在迭代下一代模型时的复用价值是难以估量的。
当美国80%的AI初创公司已经深度依赖中国的开源模型时,这些公司不仅在使用中国的代码,也在使用中国的技术栈、工具链和最佳实践。标准一旦确立,更换的代价会远高于所支付的Token费用。
Cursor的Composer 2被发现是基于Kimi K2.5改的,Harvey的Tenet是对Kimi K3后训练的产物。如果是一两年前,这些公司大概率会选择Llama或Mistral。如今,美国垂直AI行业的底层基座正在逐渐变成中国开源模型,而这些模型内部又潜藏着部分来自美国前沿模型的智能。这是一个双向渗透的闭环,仅靠监管砍不断这种连接,因为技术之间的对话渠道太多了,单方面切断的代价可能大于收益。
与此同时,中美AI两边的瓶颈又恰好是镜像的。美国芯片充裕但电力越来越吃紧,中国电力充裕但芯片始终不够用。中期局势取决于哪一侧的障碍率先被推倒,但如果双方在短时间内都解决不了各自的问题,竞争就会从“谁能跑得更快”变成“谁能在受限条件下跑得更远”。当算力变成硬约束,效率就成了唯一的变量。
Dimension Capital认为中国AI公司的收入远低于美国同行但估值倍数却远高于美国是“资本市场不够成熟”的表现,这可能低估了中国资本市场的逻辑。中国投资者经历过消费互联网时代,亲眼见证过“先跑规模再变现”的路径能走通。
当年抖音、美团、拼多多都是在规模足够大之后才找到商业闭环的,用企业软件的逻辑去套中国市场本身就错位了,但前提是中国的AI公司别也掉入这个陷阱中。另一个被低估的变量是一旦模型能力趋同,胜负手就从“谁有更好的模型”转移到了“谁有更好的数据飞轮”上。今天开源模型和AI产品的用户规模数据,可能比任何Benchmark都更能预示未来的竞争格局。
基于这些判断,美国接下来会面临一个两难选择。如果继续开放最新模型的API,中国实验室的蒸馏效率已经快到了无法忽视的程度。如果关闭API,他们必须放弃一个巨大的收入来源,把模型生态的主导权拱手让人。而且蒸馏并不完全依赖API权限,它需要的是模型的输出,真正能切断蒸馏的只有完全不公开任何高能力模型权重,这是一个代价极高的选择。如果开源模型的能力已经逼近闭源模型,而闭源模型的商业模式又在承受压力,这个选择会变得越来越紧迫。
所以我敢下的一个判断是双方的技术渗透已经深到剪不断理还乱了,谁先试图强行切断,谁就要承担那个代价。美国在算力上的优势依然存在,但中国在效率上补回来的那部分已经足够把这场竞赛拖入一个谁都无法单方面终结的僵局。
开源模型这把刀已经切进去了,它真正切的是标准、是生态,是未来十年全球AI应用层的基座。基座一旦铺好,上层怎么长就不完全由地基说了算了。
这场中美AI竞赛中真正有意思的部分,才刚刚开始。
by @莫唯书Mark #AI探索站
硅谷最近流传着一份来自顶级风投机构Dimension Capital的内部信,几位合伙人在中国走访调研了一周后,回去给投资者写了一封五页纸的观察,其措辞比任何对外公开表态都要直白得多。
信中最扎眼的一个数字是大约80%的美国AI初创公司已经在生产环境中部署了至少一个来自的中国的开源模型,而18个月前这个数字几乎是零。
这是一个渗透率的指数级跃迁,它意味着中国AI产业在软件层面已经完成了一次历史性的跨越。过去20年来,中国的SaaS软件始终没能真正进入西方企业的核心工作流,因为企业软件的采购壁垒天然倾向于保护既有供应商。
开源模型则绕过了这道墙,因为不存在合同谈判,不存在供应商审查,也不存在黑名单,一个工程师就能直接下载模型然后开始跑工作负载,这种效率是任何销售团队都无法企及的。
Qwen成为Hugging Face上最快突破10亿次下载的模型家族,OpenRouter平台上中国模型的Token消耗份额在18个月内从不足2%飙升到45%以上,这些数字不是偶然。
这一切的背后是来自美国的芯片禁令,禁令的本意是拖慢中国AI的发展节奏,但它产生了一个意料之外的副产品。因为算力买不到的时候,只能用人力去替代算力。于是每多一个懂编译器或系统底层架构的工程师,就能永久降低整个团队对算力的依赖。
这不是一次性的资本开支,它能积累、能复用,能形成一种全栈的工程纪律。美国公司习惯用钱解决问题,中国公司被迫用效率替代资源。两种模式没有优劣之分,但它们在塑造完全不同的组织能力。一家公司如果始终可以用钱解决问题,就不会有动力去培养那种不用钱也能解决问题的肌肉。中国算力的匮乏反而被倒逼成了一种进化压力,DeepSeek当年的横空出世就是一个最好的例子。
但事情的另一面是中国在吃西方的计算负载,但吃不到收入。因为开源模型的下载是免费的,真正需要花钱的是推理、微调、部署、运维这一层,这笔钱最终流向了美国的推理服务商和云厂商。不过开源模型在长期博弈中的战略价值并不直接体现在API收入上,当一个模型被下载得越多、部署得越广,它就在积累更多使用场景的反馈数据,这些数据在迭代下一代模型时的复用价值是难以估量的。
当美国80%的AI初创公司已经深度依赖中国的开源模型时,这些公司不仅在使用中国的代码,也在使用中国的技术栈、工具链和最佳实践。标准一旦确立,更换的代价会远高于所支付的Token费用。
Cursor的Composer 2被发现是基于Kimi K2.5改的,Harvey的Tenet是对Kimi K3后训练的产物。如果是一两年前,这些公司大概率会选择Llama或Mistral。如今,美国垂直AI行业的底层基座正在逐渐变成中国开源模型,而这些模型内部又潜藏着部分来自美国前沿模型的智能。这是一个双向渗透的闭环,仅靠监管砍不断这种连接,因为技术之间的对话渠道太多了,单方面切断的代价可能大于收益。
与此同时,中美AI两边的瓶颈又恰好是镜像的。美国芯片充裕但电力越来越吃紧,中国电力充裕但芯片始终不够用。中期局势取决于哪一侧的障碍率先被推倒,但如果双方在短时间内都解决不了各自的问题,竞争就会从“谁能跑得更快”变成“谁能在受限条件下跑得更远”。当算力变成硬约束,效率就成了唯一的变量。
Dimension Capital认为中国AI公司的收入远低于美国同行但估值倍数却远高于美国是“资本市场不够成熟”的表现,这可能低估了中国资本市场的逻辑。中国投资者经历过消费互联网时代,亲眼见证过“先跑规模再变现”的路径能走通。
当年抖音、美团、拼多多都是在规模足够大之后才找到商业闭环的,用企业软件的逻辑去套中国市场本身就错位了,但前提是中国的AI公司别也掉入这个陷阱中。另一个被低估的变量是一旦模型能力趋同,胜负手就从“谁有更好的模型”转移到了“谁有更好的数据飞轮”上。今天开源模型和AI产品的用户规模数据,可能比任何Benchmark都更能预示未来的竞争格局。
基于这些判断,美国接下来会面临一个两难选择。如果继续开放最新模型的API,中国实验室的蒸馏效率已经快到了无法忽视的程度。如果关闭API,他们必须放弃一个巨大的收入来源,把模型生态的主导权拱手让人。而且蒸馏并不完全依赖API权限,它需要的是模型的输出,真正能切断蒸馏的只有完全不公开任何高能力模型权重,这是一个代价极高的选择。如果开源模型的能力已经逼近闭源模型,而闭源模型的商业模式又在承受压力,这个选择会变得越来越紧迫。
所以我敢下的一个判断是双方的技术渗透已经深到剪不断理还乱了,谁先试图强行切断,谁就要承担那个代价。美国在算力上的优势依然存在,但中国在效率上补回来的那部分已经足够把这场竞赛拖入一个谁都无法单方面终结的僵局。
开源模型这把刀已经切进去了,它真正切的是标准、是生态,是未来十年全球AI应用层的基座。基座一旦铺好,上层怎么长就不完全由地基说了算了。
这场中美AI竞赛中真正有意思的部分,才刚刚开始。
by @莫唯书Mark #AI探索站
👍9❤4🤡2🗿1
即使中国的模型能力距离美国还有差距,但差得也不会太多,这意味着美国前沿实验室的研究源们看到的东西,最多几个月到半年后,中国的同行也能看到。
怎么就没有中国的研究员隔三差五的跳出来吓唬大家AI就要毁灭人类了呢?
因为这些中国人在学生时代是真做题啊,没有给老派科幻小说钻进自己脑子的机会,我指的不是「星际穿越」这种通俗意义上的流行作品,而是海因莱因、克拉克、亚当斯、阿西莫夫的那些反乌托邦寓言集。
「大西洋月刊」说美国AI行业活在一群13岁中学男孩的幻想里,他们要用一生去修复童年创伤,然后出现的过度补偿就是,把那些机器人摧毁世界、天网奴役人类的桥段,当成一种需要英雄站出来勇于对抗的自我使命。
成群结队的堂吉柯德。
by @阑夕ོ #AI探索站
怎么就没有中国的研究员隔三差五的跳出来吓唬大家AI就要毁灭人类了呢?
因为这些中国人在学生时代是真做题啊,没有给老派科幻小说钻进自己脑子的机会,我指的不是「星际穿越」这种通俗意义上的流行作品,而是海因莱因、克拉克、亚当斯、阿西莫夫的那些反乌托邦寓言集。
「大西洋月刊」说美国AI行业活在一群13岁中学男孩的幻想里,他们要用一生去修复童年创伤,然后出现的过度补偿就是,把那些机器人摧毁世界、天网奴役人类的桥段,当成一种需要英雄站出来勇于对抗的自我使命。
成群结队的堂吉柯德。
by @阑夕ོ #AI探索站
🤡34💩9👍3❤1
不是所有事情都值得让大模型想一想
过去两年,整个AI行业陷入了一场集体幻觉,仿佛所有任务都应该交给大模型去完成。
写代码、做PPT、查资料、订机票、回邮件、分析数据......默认路径永远是打开一个对话框,输入指令,等一个结果回来。
而Jev的出现,第一次让这场幻觉出现了巨大的裂缝。
它的核心限制乍看很奇葩,不生成任何自然语言,只输出结构化的判断。比如你问它“这封邮件是否紧急”,它只回答是或否,同时告诉你它有多确定。你问它“这笔交易该不该执行”,它只回答该或不该,同时附上成功概率。
这个限制之所以重要,是因为它强迫我们重新问一个问题,这件事真的需要大模型吗?
过去所有AI产品默认的答案是“需要”,但在我们交给它的任务里并非所有都需要生成一大段文字,真正要的只是一个判断而已。Jev想做的事情就是把这个浪费砍掉,由此换来的是速度比大模型快20-200倍,成本低40-400倍。
为什么过去我们会觉得所有任务都该交给大模型?答案不在技术,在交互惯性。ChatGPT的经典界面就是一个对话框,你在对话框里输入问题或指令,它输出结果。这个交互模式太典型,以至于很多人都默认了“AI就是聊天,聊天就是AI”。当你手里只有一把锤子,所有问题看起来都像钉子。
但真实世界里的任务主要可以分成两类,一类需要理解和泛化,需要处理模糊的、开放的、没有标准答案的问题。比如写一份行业分析,做一个产品方案,构思一个营销创意。这类任务天然适合大模型,因为大模型很擅长处理这种开放性的输入和输出。
另一类只需要判断,输入是结构化的,输出是有限选项的,任务本质是在几个可能性里选一个。比如“这封邮件该分给谁”、“这笔订单风险高不高”、“这个Agent步骤该并行还是串行”,这类任务用大模型来做就像用起重机去拧螺丝,干是能干,但慢、贵且用力过猛了。
过去这类任务是怎么解决的?答案是规则引擎。如果用户点击了A就推荐B,如果订单金额超过某个阈值就标记为风险订单。规则引擎又快又便宜但缺乏泛化能力,一旦遇到没见过的场景就失效了。大模型补上了泛化能力,但引入了速度和成本问题。结果就是很多场景被迫二选一,要么用规则引擎精度不够,要么用大模型成本扛不住。
Jev填补的正是中间那个空档,它保留了泛化能力但把输出限制在预设的结构里,所以它才既有大模型的泛化能力,又有规则引擎的速度和成本。我们不应把它视作一个更小的大模型,而是一个新的物种。
它意味着我们该停止问“这个任务能不能用大模型做”,而是先思考“这个任务需要的是理解还是判断”。理解交给大模型,判断交给Jev这样的专用模型。这个分工一旦建立,很多此前在经济上不成立的事情就会跨越鸿沟。
一个Agent工作流可能有几十个步骤,其中大部分只需要“往左还是往右”的判断,却被迫调用一个前沿模型来生成一段JSON再解析出来用。现在这些判断可以交给Jev,用一个HTTP往返就能回答一批问题,前沿模型的注意力可以留在真正需要推理的地方。
一个游戏AI每秒需要做出十几次决策,用大模型延迟太高,用规则引擎又太死板,Jev可以在毫秒级完成“这个敌人该进攻还是撤退”的判断。一个推荐系统每天需要处理数十亿次候选筛选,用大模型的话成本无法承受。Jev可以把每次筛选的成本压到几乎为零,让推荐系统第一次可以围绕“确定性”来设计逻辑。
这些变化的前提是接受一个反直觉的判断,不是所有事情都值得让大模型想一想。有些判断需要泛化能力,但不需要文字生成。有些任务需要智能,但不需要慢思考。把这些问题交给一个更专用、更轻量、更快的模型,才是正确的工程选择。
过去所有人都在讨论大模型能做什么,但我们是否也该好好想想哪些事情其实并不需要大模型?
by @莫唯书Mark #AI探索站
过去两年,整个AI行业陷入了一场集体幻觉,仿佛所有任务都应该交给大模型去完成。
写代码、做PPT、查资料、订机票、回邮件、分析数据......默认路径永远是打开一个对话框,输入指令,等一个结果回来。
而Jev的出现,第一次让这场幻觉出现了巨大的裂缝。
它的核心限制乍看很奇葩,不生成任何自然语言,只输出结构化的判断。比如你问它“这封邮件是否紧急”,它只回答是或否,同时告诉你它有多确定。你问它“这笔交易该不该执行”,它只回答该或不该,同时附上成功概率。
这个限制之所以重要,是因为它强迫我们重新问一个问题,这件事真的需要大模型吗?
过去所有AI产品默认的答案是“需要”,但在我们交给它的任务里并非所有都需要生成一大段文字,真正要的只是一个判断而已。Jev想做的事情就是把这个浪费砍掉,由此换来的是速度比大模型快20-200倍,成本低40-400倍。
为什么过去我们会觉得所有任务都该交给大模型?答案不在技术,在交互惯性。ChatGPT的经典界面就是一个对话框,你在对话框里输入问题或指令,它输出结果。这个交互模式太典型,以至于很多人都默认了“AI就是聊天,聊天就是AI”。当你手里只有一把锤子,所有问题看起来都像钉子。
但真实世界里的任务主要可以分成两类,一类需要理解和泛化,需要处理模糊的、开放的、没有标准答案的问题。比如写一份行业分析,做一个产品方案,构思一个营销创意。这类任务天然适合大模型,因为大模型很擅长处理这种开放性的输入和输出。
另一类只需要判断,输入是结构化的,输出是有限选项的,任务本质是在几个可能性里选一个。比如“这封邮件该分给谁”、“这笔订单风险高不高”、“这个Agent步骤该并行还是串行”,这类任务用大模型来做就像用起重机去拧螺丝,干是能干,但慢、贵且用力过猛了。
过去这类任务是怎么解决的?答案是规则引擎。如果用户点击了A就推荐B,如果订单金额超过某个阈值就标记为风险订单。规则引擎又快又便宜但缺乏泛化能力,一旦遇到没见过的场景就失效了。大模型补上了泛化能力,但引入了速度和成本问题。结果就是很多场景被迫二选一,要么用规则引擎精度不够,要么用大模型成本扛不住。
Jev填补的正是中间那个空档,它保留了泛化能力但把输出限制在预设的结构里,所以它才既有大模型的泛化能力,又有规则引擎的速度和成本。我们不应把它视作一个更小的大模型,而是一个新的物种。
它意味着我们该停止问“这个任务能不能用大模型做”,而是先思考“这个任务需要的是理解还是判断”。理解交给大模型,判断交给Jev这样的专用模型。这个分工一旦建立,很多此前在经济上不成立的事情就会跨越鸿沟。
一个Agent工作流可能有几十个步骤,其中大部分只需要“往左还是往右”的判断,却被迫调用一个前沿模型来生成一段JSON再解析出来用。现在这些判断可以交给Jev,用一个HTTP往返就能回答一批问题,前沿模型的注意力可以留在真正需要推理的地方。
一个游戏AI每秒需要做出十几次决策,用大模型延迟太高,用规则引擎又太死板,Jev可以在毫秒级完成“这个敌人该进攻还是撤退”的判断。一个推荐系统每天需要处理数十亿次候选筛选,用大模型的话成本无法承受。Jev可以把每次筛选的成本压到几乎为零,让推荐系统第一次可以围绕“确定性”来设计逻辑。
这些变化的前提是接受一个反直觉的判断,不是所有事情都值得让大模型想一想。有些判断需要泛化能力,但不需要文字生成。有些任务需要智能,但不需要慢思考。把这些问题交给一个更专用、更轻量、更快的模型,才是正确的工程选择。
过去所有人都在讨论大模型能做什么,但我们是否也该好好想想哪些事情其实并不需要大模型?
by @莫唯书Mark #AI探索站
❤14💩7