机械荟萃山庄

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
热搜: 活动 交友 discuz
查看: 50|回复: 0

一觉醒来AI Agent都替你做好了那是白日做梦

[复制链接]

2万

主题

3万

帖子

22万

积分

超级版主

Rank: 8Rank: 8

积分
227554
发表于 前天 11:28 | 显示全部楼层 |阅读模式
最近社区里有一种氛围,就是大家都在聊“睡前给 Agent 设个 goal,早上起来项目就做好了。”


pandas 创始人 Wes McKinney 前几天直接说了一句,"I think loops are bullshit." Loop 工程就是扯淡。
他的团队只有 3 个人,每周合并数百个 PR,最近 30 天 token 消耗折合 API 价超过 5 万美元。这不是那种“我试了一下觉得不行”的嘴炮选手,这是重度使用 AI Agent 之后得出的结论。
他反对的不是使用 Agent,他反对的是让 Agent 围绕彼此的输出不断循环,人离开键盘,然后期待自动得到好结果。告诉你这能行的人,要么没做过复杂工程,要么在卖你东西。


之前试过社区推荐的各种 goal 类、loop 类 skill。设一个大目标,让 Agent 自己规划、自己执行、自己验证。跑了一晚上,第二天打开一看?
表面上省了两个小时的设计时间。但后面打磨、修正、有些地方直接推倒重做,花了至少五个小时。你以为你在偷懒,其实你在给未来的自己挖坑。


因为 Agent 缺乏品味和判断,它执行速度很快,但它不知道这个设计方向对不对,不知道这个取舍在业务上合不合理,不知道哪些地方可以粗略些,哪些必须精准。这些判断,目前只有人能做。
你在前期跳过了这些判断,后期一定要还债。


那 Wes 自己怎么用 Agent?
他团队的做法是,人负责设计和拍板。不确定的时候找另一个 Agent 提反对意见,做对抗性审查。
设计转成明确的 spec 之后才让 Agent 拆解执行,每步检查是否符合 spec。最终代码由人验收。
流程里当然有循环,但关键区别是,循环的操控权在人手里。不是 Agent 自嗨跑了 100 轮然后扔给你一坨东西让你 review。



大模型是概率生成系统,加上物理层面的上下文窗口限制,决定了它天然不具备复杂工程所需的 “全局视角”:
每一轮循环的输出,都是基于上一轮结果的概率性推演,没有绝对的对错校验,误差会随着循环轮次指数级累积,最终从 “方向偏差” 变成 “完全跑偏”;
它无法在上下文中完整持有一个项目的全部架构约束、历史决策、业务隐性规则、技术债务权衡。每一步执行都是 “局部最优解”,但局部最优拼在一起,往往是全局混乱。



社区里很多人对 Agent 的期待,本质是把工程简化成了 “代码生成任务”。但真实的复杂工程,核心工作量从来不是敲代码,而是一系列无法被量化成规则的判断与取舍:
这个需求到底是真需求还是伪需求?这里是牺牲一点性能换可维护性,还是反过来?
这个技术债现在可以欠,还是绝对不能碰?
方案 A 和方案 B 在当前团队、当前业务阶段下,哪个综合成本更低?
Agent 执行速度很快,但它不知道什么是 “合理”,不知道什么是 “够用”,不知道什么是 “得不偿失”。

你想得越清楚、规则给得越明确,Agent 帮你省的时间就越多。
你自己都模棱两可、想靠 AI 帮你想清楚,最后只会收获一堆看起来很完整、实则千疮百孔的半成品。
评估 AI 效率不能只算 “生成花了多久”,要把后期 debug、重构、理解代码、修复隐性问题的时间全算进去。
很多时候看似省了 2 小时设计,实则多花 5 小时填坑,本质是负收益。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|小黑屋|手机版|Archiver|机械荟萃山庄 ( 辽ICP备16011317号-1 )

GMT+8, 2026-8-26 03:19 , Processed in 0.089313 second(s), 20 queries , Gzip On.

Powered by Discuz! X3.4 Licensed

Copyright © 2001-2021, Tencent Cloud.

快速回复 返回顶部 返回列表