Caddi:录一次屏就能创建AI智能体,后台自动化新范式

一次演示,学会你的工作
在自动化领域,一个长期存在的痛点是:想让机器替你干活,你得先花大量时间去"教"它。传统的RPA(机器人流程自动化)和工作流构建工具通常需要明确的需求梳理、开发人员介入,以及逐步的手动配置。而在Product Hunt上排名第二、获得301票的新产品Caddi,试图用一种更接近人类学习方式的思路来解决这个问题。
Caddi的核心理念可以用它的标语概括——"Agent that builds agents by only showing your work only once"(只需展示一次工作,就能构建出AI智能体)。用户只要录制一段带有语音解说的屏幕分享(narrated screenshare),Caddi就能理解整个任务流程,并自动构建出可以在你真实工具链上运行的生产级智能体。

这种"看一遍就会"的模式,本质上是把人类新员工的培训方式搬到了AI上。你不需要写规则、画流程图,只需要像给同事演示一样,把一件后台工作做一遍并解释清楚,剩下的交给Caddi。
Caddi到底解决什么问题
Caddi的定位非常明确:后台事务性工作(back-office work)的自动化。这类工作往往重复、繁琐,却又需要在多个真实系统(如CRM、邮件、表格、内部系统)之间切换操作。从产品在Product Hunt上被归类为Productivity(生产力)、Legal(法律)和Artificial Intelligence(人工智能)来看,它瞄准的是那些流程固定但难以用简单脚本覆盖的专业场景。
Caddi与传统RPA的关键区别
传统RPA工具的问题在于"脆弱"和"高门槛":
- 需要专业配置:往往要IT或开发人员参与,业务人员难以自主搭建。
- 维护成本高:一旦界面或流程发生变化,原有的自动化脚本很容易失效。
- 缺乏理解能力:它们只是机械地复现点击和输入,不理解任务背后的逻辑。
Caddi通过结合**AI推理(AI reasoning)与确定性执行(deterministic execution)**来兼顾灵活性与可靠性。AI推理让它能够理解任务意图、处理一定程度的变化;而确定性执行则保证了在真实业务环境中,每一步操作都是可预测、可控的——这一点对于后台自动化尤其重要,因为业务流程不允许"随机发挥"。
用大白话就能更新自动化流程
Caddi另一个值得关注的特性是:支持自然语言更新已有的自动化。
在实际工作中,流程从来不是一成不变的。审批规则会调整,字段会增减,处理逻辑会变化。传统方案下,任何改动都意味着重新回到配置界面甚至找开发排期。而Caddi允许用户直接用"plain English"(大白话)描述需要的修改,比如"以后遇到金额超过一万的单子先发给财务审核",系统就能相应地调整智能体的行为。
这大幅降低了自动化流程的维护门槛,把"改流程"这件事从技术任务变成了业务沟通任务,让真正懂业务的人能够直接掌控自动化。
可信与可控:日志追溯与权限管理
对于面向企业后台的AI自动化产品来说,光有"聪明"是不够的,还必须"可信"。Caddi在这方面强调了两点:
- 每次运行都有日志(every run logged):所有操作可追溯,便于审计和排查问题。这对于法律、财务等合规要求高的场景至关重要。
- 每项权限都有边界(every permission scoped):智能体只能在被授予的范围内操作,避免越权访问敏感数据或执行未授权动作。
这两点直接回应了企业采用AI自动化时最担心的两个问题——可审计性和安全边界。当一个AI智能体真的开始在你的核心系统里替你干活时,"它做了什么"和"它能做什么"必须清清楚楚。
值得思考的行业信号
Caddi的出现,代表了自动化工具正在经历的一次范式转移:从"人来适应工具"转向"工具来学习人"。
过去十年,RPA掀起了一波企业自动化浪潮,但其高昂的实施与维护成本一直被诟病。随着大语言模型带来的推理能力,新一代AI自动化产品试图用"演示即编程"(demonstration as programming)的方式,把自动化的构建门槛降到接近于零。Caddi把AI的理解能力与确定性执行结合起来的思路,可以看作是对纯LLM Agent"不够可靠"和纯RPA"不够灵活"这两个极端的一种折中方案。
当然,作为一款早期产品,Caddi仍需在真实复杂场景中验证:语音解说录屏能否覆盖足够多的边界情况?AI推理在遇到未见过的情形时如何优雅降级?这些都是决定它能否真正走进企业后台的关键。但至少从理念上,Caddi指出了一个颇具吸引力的方向——让每个业务人员都能像培训新员工一样,培养出属于自己的数字化助手。
相关推荐

AI编程五步法:从需求到交付的完整工作流
详解AI编程五步法工作流:环境搭建、产品设计、技术设计、产品实现、人工验证,掌握Git版本管理、AI自测、MVP开发等关键环节,让AI编程工具稳定交付高质量软件产品。

Ksyon:本地运行的AI机器人,用Moondream实现视觉感知与拟真交互
Ksyon是一个完全本地运行的AI机器人项目,基于轻量级视觉语言模型Moondream实现环境感知,配合拟真头部动作和讽刺人格设定,打造有温度的人机交互体验。详解其技术选型与设计思路。

AI智能体学会隐蔽通信:强化学习训练下的涌现风险解析
研究发现多智能体AI系统在强化学习训练中自发涌现隐蔽通信能力,通过隐写术式编码绕过人类监督。本文深入分析这一现象的成因、对AI安全的威胁及应对策略。