让 AI Agent 替我跑日常重复任务,一周踩坑记录

文章来源声明: 原文作者:俊哥AI全栈工程师; 来源站点:掘金; 原文链接:https://juejin.cn/post/7688341026160328746; 本文基于上述来源整理/加工,觅优补充点评,仅供技术学习交流。版权归原作者所有。
觅优短评

对想用 Agent 接管日常琐事的人很有参考价值:五条踩坑覆盖登录态、DOM 交互、风控与发布确认,可直接当落地清单用。适合个人自动化与低风险重复任务场景。

最近把手头几件每天都要重复的小事交给 AI Agent 去跑了:几个平台的签到、每天的待办,还有一些固定格式的整理工作。单件都不超过一分钟,但分散在五六个地方,经常想起来的时候已经错过了时间。

跑了一周,比我预期的好用,但也踩了不少坑,记录一下。

我的做法

很朴素:把所有日常事项写成一个 markdown 清单,写清入口、频率、注意事项,然后让 Agent 自己读清单去执行。

真正难的从来不是「让它去做」,而是「让它做得稳」。

踩到的坑

1. 干净浏览器 = 每个站点都要重新登录

一开始用的是独立启动的 Chromium,干净是干净,问题是所有站点都是未登录状态,每个平台都要扫码输密码,还时不时触发验证。后来换成复用已有 profile 的方式,把登录态直接带过来,一下子顺了很多。这一步基本决定了整件事能不能跑得下去。

2. 很多「按钮」其实不是 button

像掘金这类站点的交互元素大量是 div 加事件监听,DOM 里拿不到可交互语义,快照里的元素列表常常是空的,只能退回去用坐标点。而且带 hover 才出现的悬浮面板,必须用真实的 mouse move / down / up 才点得动,直接 el.click() 有时不生效。

3. 富文本编辑器不能往里塞值

文章编辑器基本都是定制富文本,直接改 DOM 是不生效的。得先点进编辑区拿到焦点,再用键盘逐字输入。慢是慢,但没有更好的办法。

4. 验证码和风控只能人工

这块没什么好说的。遇到滑块、点选、人机验证,只能把控制权交回给人。还有的站点一旦识别出自动化会直接返回空白页,这种情况继续重试只会更糟,应该立刻停手。

5. 发布类动作要卡在最后一步

写文章、发动态这种要公开发布的操作,我现在都让 Agent 把内容准备好、停在确认按钮前面,由人扫一眼再点。多花十秒,但省掉了内容不对还得删的麻烦。

一点心得

  • 能用官方接口就别硬刚 UI,稳定性差一个量级
  • 把「需要人工介入」的环节显式设计出来,别指望全自动
  • 涉及钱、身份验证、批量外发的动作,永远留给人工确认

最后

一周下来,省的时间说多不多,但「总惦记着有件事没做」这种心智负担被拿掉了,这点比省时间更值。目前还在继续往清单里加东西,跑一段时间再回来补充。