COPU会议纪要|2026.8.4

8 月 4 日,陆主席主持召开 COPU 例会。
本次会议首先发表了陆主席《开源 AI 完胜闭源 AI》的文章,文中表明:早在三年前,COPU 就站在全球捍卫开源 AI 的前列。
开源 AI 完胜闭源 AI
陆首群 2026.8.2
早在三年前,COPU 就参与了全球开源 AI 与闭源 AI 的博弈,并一直站在捍卫开源 AI 的前列。
今年 6 月 25 日,COPU 在《21 届开源中国开源世界高峰论坛》上所作的主题报告中,以及在《专题研讨》中提出关于开源 AI 演讲的新观点,更引起全球的关注。
7 月 24 日,英伟达(CEO 黄仁勋)在 X 网站上发表《开放权重与美国在 AI 领域的领导地位》的倡议,他鉴于开源 AI 对闭源 AI 的优势,要求开放 AI 的权重(闭源变开源),至今已引起美国近 50 家 AI 巨头的联署,在这封联署信上签名的有:英伟达、微软、IBM、Linux 基金会、Google、OpenAI、AMD、CISCO、GitHub、HuggingFace、Arena、Meta、Block、RedHat、Cloudflare、Palantir、Y Combinator、Ollama、Arcee AI、Box、CrowdStrike、Emergence Capital、Mariana Minerals、Mistral、Mozilla、Perplexity、Reflection、Ropl、ServiceNow、Telnyx、黑森林实验室、安德森·霍洛维茨基金等。
在这封联署信中,没有开源巨头 Anthropic 和 AWS 联署的名字。Anthropic 创始人 Dario Amodei 曾凭他近来以闭源模型 Claude Opus 4.6/4.7/4.8 在全球编程竞赛中几度夺取王冠的经历,偏执地认为闭源 Claude 是全球第一,但在开源 AI 的进迫下,他被迫认可他并不反对开源,只是反对中国 AI 占领全球 AI 第一的地位。AWS 是 Anthropic 的投资者,与 Anthropic 采取同一立场是不言而喻的,我可以预言:Anthropic 昨天还自称他的闭源 AI 全球第一,今后他也不得不开放闭源的权重。
COPU 捍卫开源 AI 的做法,也符合今天我国的国家战略。
中美两国 AI 路线正在重塑全球的竞争格局,美国将 AI 视为核武器,走封锁与垄断的路线,中国将 AI 视为核能,走普惠产业化的开放路线,以低成本服务国内企业,并赋能海外尤其是南方国家的发展。
随后,本次会议发表蒋涛撰写的《OpenAI 一线实录》的文章:
OpenAI 一线实录:AI 写代码的速度,人类已经检查不过来了
蒋涛 2026.8.2
Every 的记者 Laura Entis 上周走进 OpenAI 总部,写下一篇报道,名字叫《Before the Deluge》——洪水之前。
报道里说,旧金山满城的广告牌都在承诺同一个未来:Agent 时代已经到来,人类工程师的编程工作会被自动化掉。楼里的实况,和广告牌只差一个字:工作确实被自动化了——但它没有掉,它涨了,涨成了洪水。
文章从一个深夜开始。
00 · 半夜,Agent 在自己修故障
一个跑在研究员笔记本上的编码 Agent,在 Slack 里报告:数据导出失败了。
研究员睡了。当晚值班的基础设施工程师Katz 也睡了。
Agent 没睡。它有权限,有工具,就自己动手:排查故障、验证猜想、换思路重来,一路在频道里记录进展。到早上,研究员拿到了数据。Katz 和他的团队,一步都没介入。
单看这一幕,广告牌说得没错。
但这篇报道真正的主角,不是半夜干活的 Agent——是白天收拾烂摊子的人。
01 · 代码洪水从哪里来
几个数字:
GPT-5.5 发布几周内,Codex 桌面端在 OpenAI 内部的采用率接近 100%。数据平台团队的 PR 量,一年涨了 5 到 10 倍。5000 多名员工在用内部数据分析 Agent 直接查数据仓库。员工不限 token,一批 UI bug 扔出去,多个 Agent 并行写修复、跑测试、在浏览器里自己点一遍受影响的页面。
洪水里相当一部分,来自不写代码的人。运营在生成Flink 数据流任务。数据平台负责人 Emma Tang 说:「我们有用户在生成 Flink 作业,但他们根本不懂 Flink。」以前想要个内部小工具,得排队等工程师;现在,任何人都能「周一早上抱着周末做好的原型来上班」。
02 · 没人认领这些代码了
代价在另一头:
出了问题,作者自己讲不清自己交付了什么。一个vibe coding 出来的应用可能每几秒刷新一次数据,而它依赖的分析系统一天才更新一次。要真接上生产系统,「跑在哪」「谁维护」这些问题,写它的人根本看不见。
Tang说:「Nobody owns it anymore except us.」
没人认领这些代码了——除了我们。
不要以为这是“用了 AI 但没用好”的故事。恰恰相反,越用得好,洪水越大。Katz 的团队给 Codex 加了个技能,让它代员工查内部数据导出系统,不用再写 SQL。两周之内,这个技能占了整个导出系统一半以上的用量。然后所有的边缘情况、所有没人写过文档的角落,全落回 Katz 头上。他的团队「资源受限」,「积压的活,永远比人多」。
Tang 说得更直接:「如果有人说他有完整的解决方案,那他多半只是没看到全貌。」
这里藏着一个要害:AI 把代码的生产权分发给了所有人,却没有把责任一起分发出去。生产权扩散了,维护责任还沉积在原来那几个人身上。真正淹没 OpenAI 的不只是代码——是无人认领的责任。
03 · 验收系统,是按人类手速设计的
应用基础设施VP Venkat Venkataramani 给了全篇最重的判断:今天的洪水,回头看只是毛毛雨。不远的将来,过去一年的事故量,可能压进一周发生。
危险不在水量。高质量代码多了,只是软件多了。危险在洪水夹带的东西——bug、安全漏洞、藏在海量变更里的隐患。水量放大 10 倍、100 倍,哪怕污染比例不变,绝对量就是灾难。
现有的两道闸口:CI(持续集成)在代码合入前测试它,CD(持续部署)把过检的代码发进生产。这套关卡是前 Agent 时代建的——按人类写代码的速度设计的。
那把CI/CD 扩容行不行?他的反问是:「你只是让每天多灌进来 100 倍的代码——then what?」
扩容管道,不会让水变干净。
因为“验收”从来不只是测试资源的问题。它至少是三件事:确认代码做的是不是原本想做的事,确认它不会伤害别的系统,确认出了问题谁负责。三件事,对应三层天花板。
吞吐量天花板:代码涨十倍,reviewer 不可能涨十倍。
理解力天花板:审查者面对的,不再是作者想清楚才提交的代码,而是作者自己也没消化的生成物。
责任天花板:测试全绿、上线出事,后果算谁的——生成者、提示者、审查 Agent,还是模型供应商?
AI 可以把一行代码复制一千份,却不能把理解和责任复制一千份。
代码可以并行生成,责任却仍然串行结算。
图1 · 验收的三层天花板
代码产量在起飞,验收撞上三层天花板。来源:Every《Before the Deluge》
04 · 判断力下沉,责任向上集中
这位VP 的方案像现代城市的雨洪管理:不靠一个下游闸口,在多个位置分层过滤。「你加 10 层这样的过滤,最后总能拿到干净的水。」报道里已经能看到四层的雏形——
源头立下规矩。数据平台团队的工程师现在就这么干:修完一个故障,顺手把经验写进公司共享的Codex 指令,让它下次自己不犯。
专职审查Agent。写代码的 Agent 只管写,审查 Agent 按系统属主团队的规矩审;大变更要过十几个子 Agent 的完整流程。
全天候监控Agent。不看代码,看行为:盯着运行中的系统,在问题扩散前隔离它。
基础设施自带判断。最激进的一层:哪怕前面所有关卡都亮了绿灯,基础设施本身可以拒绝执行不安全的操作。Tang 说它要有「自己的智能,像一个人类操作员坐在那个服务里」。
图2 · 四层过滤:判断力的分层迁移
可复制的判断下沉进系统,必须负责的判断向人上移。来源:OpenAI 应用基础设施团队
但判断力没有消失,它在做一次双向迁移:重复、稳定、说得清规则的判断,被写进Skill、审查 Agent 和基础设施,往下沉;模糊、冲突、要担后果的判断,往人身上移。那位 VP 还有一个预判:code review 会让位给 prompt review,再让位给 plan review。工程师最终审的不是代码,是意图:先是需求规格,再是架构文档,最后是业务问题本身。
机器接管的是可复制的判断,人保留的是必须负责的判断。
有个细节:即便已经上了生成Agent、审查 Agent、十几个子 Agent,受访的这支团队至今仍然让人工 reviewer 看过每一个 PR。这不是流程惯性,它说明四层过滤扩容了验证,唯独没能扩容责任。
所以人的门槛在涨。Tang 描述她的团队:过去的砖瓦工,现在是施工经理:「开着 10 个 Codex 线程,只盯它有没有干对。」有主见、强 ownership、自驱,这些过去的加分项,现在是硬条件。「我们现在只招这样的人。」
这话我有体感。这几个月天天带着Agent 写代码,最费劲的一件事,是把项目的背景、边界、规矩都喂给 AI,让它别跑偏。审它写的代码也不轻松:没有架构功底,看不出它埋的雷——关键 bug 实在不少。AI 时代对程序员的要求,只会比以前更高。
05 · 一份已经在跑的答卷:两个人四年,一个人两个月
Tang 说没人有完整解法。但6月份在我们 CSDN 主办的 GOSIM 全球开源创新汇的Agentic SoftwareEngineering会场里,我看到了一份答卷,来自 dora-rs 的 maintainer 何勇。何勇是位多年的资深架构师,有小二十年没怎么亲手写代码了;2026 年模型编码能力的大进展,把他重新拉回了一线。
dora-rs 是一个开源的机器人数据流框架。此前的账本是:两位顶尖工程师,四年半,写出约 4 万行 Rust。2026 年 2 月起,一个人带着一队 Agent,用两个月把代码库翻倍重写到 8 万行,打出 1.0 的候选版本。这活原本雇两个工程师干 2 到 3 年。重写类工作压缩了一个数量级;
但何勇整场分享反复强调的不是快。他的原话:
「速度本身证明不了什么——谁都能快速生成代码。关键是可信度。」
可信度是怎么工程出来的?三件事,每一件都对着前面那三层天花板。
第一件,Agent 进场之前,先修了一年验收基础设施。分层 QA、变异测试(故意往代码里塞错,看测试网能不能兜住)、覆盖率闸口,都是 2025 年铺的,冲着吞吐量天花板去的。他的结论就一句:真正承重的是基础设施,不是模型。
第二件,把测试写成Agent 的合同。TDD 直接写进 AGENTS.md:先写挂掉的测试,再写最小实现。结果是,这个仓库里非示例代码的 28% 是测试——用他的话说,Agent 写的大部分代码,是让其余代码可信的测试。测试不再和功能抢预算,因为它们以同一个吞吐被生产出来。
第三件,让两个模型家族互相咬。Claude 和 Codex 对抗式互查:模型家族不同,盲点就不同,缺陷很难同时逃过两边。他给了一个具体样本,一个 PR 三轮迭代,抓出三个真实 bug,每一个都是被“另一家”抓到的。理解力天花板就这么拆:你没法逐行读 Agent 写的测试,那就让另一个 Agent 去读。这条路线不孤单—《代码整洁之道》的作者、写了六十年代码的 Uncle Bob,上月底也公开说他完全不读 Agent 写的代码,靠一整套测试约束兜底。
那责任呢?收敛成闸口。稳态下的一天:11 个 PR 合入,约 5000 行代码被审,人只做 5 到 10 个决策——merge 权限和一切不可逆动作,始终在人手里。调度自动化了;权力没有。
同一道“人守哪道闸”的题,OpenAI 受访团队的答案是人仍看每个 PR,何勇的答案是每天只做 5 到 10 个决策——两个答案把闸口画在了完全不同的层级上。这条线画在哪,行业还远没有共识。
何勇的收束句,值得原样抄下来:「拿掉任何一根支柱,工厂就退化成高速技术债。」
图3 · dora 的三根支柱
三根支柱各对一层天花板,拿掉任何一根都退化成技术债。来源:何勇· GOSIM 分享
06 · 代码变便宜之后,最贵的是验收
四个月前,Box CEO Aaron Levie 判断:企业里的 Agent 数量,最终会是员工的 100 倍甚至 1000 倍,Agent 将成为软件最主要的用户。Every 的报道补上了另一半:当 Agent 同时成了软件的主要生产者,最先扛不住的是验收、基础设施和责任系统,而不是产品界面。预言讨论的是 Agent 会有多少;OpenAI 的现场讲的是,它们来了之后,谁收拾它们留下的东西。
收拾这件事,市场已经开始标价了。
三个资深工程师最近成立了一家叫Slopfix 的公司,专做一件事:删 AI 生成的代码。一周 1 万美元,先承诺一个减量目标,按达成比例收钱:承诺删一半、只删掉两成,客户就只付四成的钱。行数按非空非注释行统计,合同里明文禁止 code golf,防止靠压缩注释凑数。创始人描述的典型客户是:打电话来说要做个“简单的重构”,然后发来十万行 AI 生成的代码。前 30% 好删;难的是往下的 30%——定价就定在“做别人做不到的事”上。
两个细节最有意思。一,他们自己用的工具就是Claude Code,但“拴着短绳”,他们的原话是:Agent 没有投票权。二,交付物除了瘦身后的代码库,还有一套防止再胖回去的护栏:CLAUDE.md 指令文件、lint 规则、CI 检查。名义上卖的是删除,实际交付的是过滤器。
图4 · Slopfix 价目表
删除已经有了市场定价。来源:odra.dev/slopfix
这不是孤例撑起来的段子。代码分析公司GitClear 统计了 6.23 亿次代码变更:重复代码块的出现率创下其纪录以来的最高值,比 2023 年涨了 81%;而重构占变更行数的比例,从 2022 年的 21% 跌到 2026 年的不足 4%。Slopfix 只是给这个缺口开出了第一张价目表。
代码成了负债,删除成了产品。
这接回我自己的两条旧线。
一条,我在《代码变便宜,信任变昂贵》里推过:代码的生产成本趋零之后,稀缺的不再是产能,是信任。OpenAI 的报道和何勇的实践,把那个推演坐实到了工程层。信任有了具体形态:过滤器。
另一条,第三章里我写过,硅基时间的消费主体不再是人——API 不再是人调用,而是 Agent 自动调用。当时说的是生产那一侧。现在验收这一侧的答案也出来了:硅基时间可以无限并发,碳基验收不能。旧秩序里最后失效的,不是生产环节,是验收环节。
07 · 造过滤器的人
OpenAI 之外,中国的代码平台也撞上了同一个瓶颈。AtomGit 的代码审计已经上线,现在每周有将近 1 万条 PR 被它检视一遍,一周的 token 消耗接近 60 亿。过去我们把代码审计理解为开发平台的一项能力;跑起来之后再看,它正在变成 Agent 时代的基础设施——当代码生产权向每个人开放,代码平台就不能只在一边帮人生产,还得在另一边建起过滤、追踪和责任机制。审计只是过滤层的一小块,生成前约束、多 Agent 互查、运行时监控、责任追踪,这条线上每一格都还空着。
AI Coding 发展的三个阶段:第一阶段,AI 消灭了代码的生产瓶颈;第二阶段——也就是现在——它暴露出验证瓶颈;第三阶段,企业得把判断和验收本身,也变成可调度的硅基能力。何勇的软件工厂,已经把一只脚踩进了第三阶段:连测试都由 Agent 生产,人只守着最后那几个判断闸口。
第三阶段,所谓Harness Engineering(围绕大模型搭建工具、约束和反馈回路的工程)正在快速演化,后续会出现面向大模型开发的新工具和新方法论,但现在还不成熟。连 OpenAI 和 Anthropic,都在自己身上边摸索边迭代。
给IT公司CEO:鼓励 AI 编程,但先掂量自己有没有控制质量和产出的能力——尤其是往老系统里放 Agent 的时候。OpenAI 的洪水,就是从最核心的基础设施淹起的。一个自测:如果一段 AI 生成的代码今晚出事故,你能不能在十分钟内答出——谁提出,谁验收,谁维护,谁有权回滚?答不出,缺的就不是更强的模型,是责任的基础设施。
给刚上手vibe coding 的人:别一开始就奔着复杂系统去。先拿自用小工具练手,从第一天起让 AI 连测试一起写。你能生成它,不等于你能为它规模化负责—周一早上快速生成的原型,和能接进生产的软件,中间差的就是那几道闸。
给程序员:学会造那三道闸——先修验收基础设施,让不同的模型互相咬,merge 权限攥在自己手里。
所以这篇报道读完,我的判断浓缩成一句——
洪水时代最值钱的人,不是写代码的,是造过滤器的。
参会人员:陆首群、蒋涛、谭中意、宋可为、袁怿、张侃、安泱、陈道清、何苗、刘明(线上)、胡宇(线上)、靳虹博(线上)、王珊(线上)、陈越(线上)、韩宪平(线上)