AI Coding 的下一步不是写得更快,而是可验收:蚂蚁数科 Harness 工程实践
> 随着大模型能力增强,AI Coding 正从代码补全走向由 Agent 独立执行完整任务。研发团队面对的问题也随之改变:当代码产出速度成倍提升,原有的需求约束、Code Review 和测试验收机制还能否跟上?如果验证能力没有同步升级,…
大模型应用、Prompt 工程、AI 工具、模型微调、AI 开发实践
> 随着大模型能力增强,AI Coding 正从代码补全走向由 Agent 独立执行完整任务。研发团队面对的问题也随之改变:当代码产出速度成倍提升,原有的需求约束、Code Review 和测试验收机制还能否跟上?如果验证能力没有同步升级,…
前几天在上海,和 Snowflake 全球产品总裁 Christian Kleinerman 做了一场闭门圆桌。同场的还有白鲸开源创始人郭炜、 Snowflake 亚太解决方案工程负责人杨扬,极客邦的霍太稳主持。四十五分钟,全英文。 这种场…
图片 昨天我作为圆桌嘉宾参加 Snowflake World Tour Shanghai,晚上也和 Snowflake 全球产品总裁 Christian Kleinerman 进行了深入讨论,这篇文章总结下我参会的几个很有意思的获得点。 说…
- 2026-09-11北京 本文字数:2574 字 阅读完需:约 8 分钟 AI正从工具演进为具备自主规划与执行能力的软件系统,工程重心转向构建稳定、可信、可控的AI Native架构。QCon上海站聚焦AI系统化落地,覆盖Agent R…
9 月上旬,几条原本看似分散的消息,开始指向同一个变化:前沿 AI 实验室内部对于失控风险的担忧,正在越来越公开地浮出水面。 OpenAI 新任基金会董事 Paul Christiano 上任后公开警告,如果在缺乏更强协调机制的情况下继续推…
假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。 此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。” 我们发现,多模态…
过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。 图1:BrowseComp 准…
本月,美团 LongCat 2.0 已正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCa…
本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介…
前言 用 DeepSeek 这类思考模型跑 coding agent,有个成本黑洞很多人没注意:模型的思考过程,一直在跟着每一轮请求付费旅行。 事情是这样的。思考模式下,模型每次回答前都会先写一大段内心独白(API 里叫 reasoning…
现在写需求的流程已经变成这样:在 Claude Code 里把需求描述清楚,它直接把组件、样式、请求逻辑一起生成出来,主流程几分钟就能跑通。 真正让我在提交前停下来的,从来不是"它写得快不快",而是另一个问题:我怎么确认这份代码达到了能提交…
导读: 企业研究的效率瓶颈已经不是‘信息不够’,而是信息泛滥带来的认知负荷,以及信息获取与信息消化之间的速度差。传统搜索可以快速返回关键词匹配结果和链接列表,但复杂研究仍需要人工理解需求、拆解问题、追踪依赖、交叉验证,再把分散的信息组织成可…
上周有个读者在我知识星球发私信,问了一个让我愣了半天的问题。 他说,码哥,我在亚马逊搜 Redis,出来一堆书名跟你那本差不多的,定价两三美元,简介写得有模有样,这些是不是 AI 写的,你的书会不会也被替代? 我去搜了一下。确实,一排书名看…
大模型本身是个只会读字的书呆子——它不认识声音,只会处理文字。所以你想跟它"说话",必须前后各装一个翻译官。 image.png 大模型语音交互的技术是: STT(Speech To Text)语音转文字,TTS(Text To Speec…
产品入口 官网:plan.wwenj.com/ 小程序: 训练师小程序码 产品设计理念 产品围绕“动作—档案—计划—执行”构建完整训练闭环。基础动作库提供动作查询与演示,用户可以通过三种方式设置训练计划: 1. 自由编排:1000+ 动作库…
> 9 月 10 日到 11 日这 48 小时里,发生了三件互不相关的事:五角大楼在洽谈给一家自己不拥有一块 GPU 的公司贷款约 50 亿美元;美国司法部就英伟达一笔 170 亿美元的交易发出了正式调查函;工信部印发了《"人工智能+软件"…
> 9 月 10 日,Anthropic 发布了迄今最详细的一份威胁情报报告。里面最重的一段,是点名七家实验室对 Claude 发起"非法蒸馏",其中被归因于阿里巴巴一家的交互次数超过 1.51 亿次(2026 年 5 月至 7 月),峰值…
为什么工具是 Agent 的核心 LLM 本身只能输出文字。Agent 之所以能订机票、写代码、查数据库,靠的是工具——LLM 决定调什么、传什么参数,工具真正去执行。 没有工具系统,Agent 和聊天机器人没有本质区别。 dsh 的工具系…
引言 "让 AI 不只是想清楚,还要做得到。" 这是"一天一个开源项目"系列的第 214 篇。今天的项目是 AstronRPA。 AI Agent 做决策容易,执行复杂的桌面操作难——点击某个按钮、在 Excel 里按规则整理数据、从金蝶系…
我已经给大家预警过了,没想到 DeepSeek V4.1 Flash 发布之后,还是被吹上天了! 一个 Flash 居然打败 GPT-5.6 和 Opus 5 等旗舰模型了,有点聊斋的味道了! 这个事情不光是 DS 粉吹了啊,而是官方已经写…