用豆包工作做超级悬浮球:AI全流程开发实测

用AI Coding工具以自然语言描述需求,无需写代码即可生成私人定制桌面应用。
本文介绍了一位UP主借助「豆包工作」AI Coding工具,通过纯自然语言描述需求,从零构建出一个功能完整的桌面悬浮球应用的全过程。该悬浮球支持拖拽处理文字、图片、视频和PDF,并能扫码传文件到手机。整个开发无需搭建环境或手写代码,AI自主拆解需求、生成代码并修复Bug;与飞书生态的原生打通使团队上下文可被直接引用,成品自动归档;宣传素材也在同一工作台内完成。文章最终指向一个更宏观的判断:AI Coding工具正在将软件的定义权从软件公司转移回普通使用者手中。
一个悬浮球,把零散的文件处理需求装进一个入口
桌面上多一个悬浮球,往里拖一段文字,它会变成桌面便签固定下来;拖一张图片,可以压缩、改尺寸、转格式;拖一段视频,能提取音频、压缩体积;拖一份 PDF,可以拆分页面、导出、转图片。处理完的文件从界面直接拖出来就能用,还能一键发送到手机——生成二维码,手机扫码即可下载。
这类功能听起来平平无奇,但关键在于它并非某家软件公司的现成产品,而是 UP 主用「豆包工作」这类 AI Coding 工具,通过自然语言描述需求生成的私人应用。整个开发过程没有搭建开发环境,也没有逐行手写代码,只是把想要的效果讲清楚,AI 自己拆解需求、搭骨架、写代码,最后交付一个能运行的成品。

这背后反映的是一种交互模式的转变:普通 AI 更像一问一答,而这类 Agent 型工具接到的是「一整件事」,会自己判断下一步做什么、调用什么技能、如何操作电脑,把成品真正做出来。
从需求到成品:完整开发流程拆解
开发的起点是创建一个项目,UP 主将其命名为「悬浮球」。工具内提供了大量可调用的「技能」——做文档、做设计、数据分析、剪视频等各类方向。这里的技能本质上是把某一类任务的完整做法、注意事项、输出标准提前封装好,调用它就等于把对应的专业能力直接接过来。
开发悬浮球选用的是「应用生成」技能。在对话框里用自然语言把软件的功能大概说清楚,AI 就会自行生成完整方案、安装对应环境组件、搭建项目骨架并撰写核心代码,全程无需手动介入,只需等待验收。
第一次交付有 Bug 是常态
值得如实说明的是,第一次交付的悬浮球是不可用状态:无论文字还是文件都拖不上去。对一个相对复杂的工具而言,首版存在 Bug 属于正常现象。解决方式很直接——把问题截图反馈给 AI,它会自行检查可能导致问题的代码并修复。

修复后,悬浮球达到了可用状态:拖入文件能自动识别,格式转换、压缩、裁剪、传输到手机都正常。剩下的问题是 Logo 和 UI 界面较为粗糙。此时再调用「创意设计」技能,直接接入图片生成模型,让它重新设计一个「科技感又有亲和力」的图标,并把整个界面优化得更现代美观,最终达成开头展示的效果。
「技能」这一设计本质上是对 AI 的「提示词工程」(Prompt Engineering)的封装化产品形态。不同任务领域有各自的最佳实践——代码应用需要考虑错误处理和依赖管理,设计任务需要风格参考和输出规范——将这些领域知识预先固化成可调用的模块,等于降低了用户自行描述需求的门槛,也减少了因表达不准确导致输出偏差的概率。这与软件工程中「库函数」的思路类似:不必每次从头描述怎么做,直接引用已被验证的做法。
AI 生成代码存在 Bug 的根本原因在于大语言模型的「概率性输出」特性——它预测的是统计上最可能正确的代码,而非经过运行验证的代码。对于涉及操作系统底层 API(如拖拽事件监听)、跨平台兼容性或多模块交互的复杂功能,首次生成时出现逻辑错误或依赖缺失是行业普遍现象,即便是专业开发者手写代码也需要调试周期。当前主流 AI Coding 工具的应对策略是引入「反馈-修复」循环:用户提供错误截图或日志,AI 重新定位问题代码段并生成补丁,相当于把传统开发中的 QA 流程嵌入对话交互。
手机与电脑实时同步,想到什么加什么
工具做完并非终点。UP 主强调,后续想加新功能不必坐在电脑前操作——电脑端与手机端豆包是实时同步的。可以在手机上远程发送任务,电脑端接收后自动实现。比如「让图片拖进去就 OCR 转文字」这样的需求,说一句就能被加上。

文件管理方面,生成的文件会自动归档到云盘并按项目分类,需要时搜名字即可找到,避免散落在文件夹里造成混乱。想分享给朋友,直接生成分享链接,对方点开就能下载使用。
与飞书原生打通:把项目上下文接住
这套工具的一个差异化设计,是与飞书生态的原生打通。用飞书账号登录后,在权限允许范围内,之前的需求、团队文档和项目资料都能成为 AI 继续工作的上下文;生成的方案、文件和成品也会自动留存在飞书里,方便团队查看和接续使用。
举例来说,如果之前在飞书群里和同事讨论过悬浮球该加什么功能,AI 在授权范围内可以直接读取这些讨论,接着之前的思路继续做。这样做的价值在于:换任务不必每次重新补背景,做完也不用到处找文件复制给同事——前面的信息接得住,中间的任务执行得了,最后的成果也能顺着原有工作流往下走。
安全上,工具继承了飞书原有的权限体系:你看不到的资料它也看不到,谁能编辑、谁不能编辑都受控。
「上下文」(Context)在 AI 工具链中是一个关键概念,指模型在生成回复时能够参考的信息范围。普通对话型 AI 的上下文通常局限于当前会话窗口,而与企业协作工具打通后,历史讨论记录、项目文档、需求单等结构化信息可以作为补充输入,使 AI 能够在已有工作基础上继续推进,而不是每次从空白开始。这种设计的技术实现通常依赖 RAG(检索增强生成)技术:先检索与当前任务相关的企业文档片段,再将其注入到模型的输入中。权限体系的继承则是企业级应用落地的关键安全保障——确保 AI 的信息访问边界与人的权限边界保持一致。
从做工具到做宣传,一站式完成
悬浮球做到一定程度后,UP 主想为它做宣传视频。以往这类内容需要在多个软件间来回切换,现在把完整需求交给同一个工具,它可以调用自家的图片和视频创作模型,根据需求生成宣传配图和动态的功能演示视频。

把功能介绍和宣传要求发过去,它很快给出了几组不同构图,宣传视频也一并搞定。从做工具到做宣传,全流程在一个工作台里完成,不必来回切软件。
观察:软件的「定义权」正在转移
市面上从不缺效率软件,但多数时候是我们在适应软件。真正消耗时间的,往往是那些很细的小需求——想把图片拖进去就自动压缩、经常要把 PDF 拆成单页、想让处理好的文件立刻出现在手机上。这些需求未必值得一家软件公司专门开发,却每天都在消耗时间。
这类 AI Coding 工具带来的变化,是把软件的定义权重新交回使用者手中。你只需说清目标,它就能调用技能、搭应用、检查修复、完善界面,还能接着团队协作里的资料继续推进。你不需要提前知道每一步该用什么工具、什么技术,只需要清楚自己想把哪件事做成。
它提供的不是某一个具体功能,而是一套「理解任务—调用工具—操作文件—衔接团队信息—持续把事做完」的完整工作能力。过去我们只能在现成软件里挑一个最接近需求的,如今一句话就能开始做一个真正属于自己的工具。当然,这段内容本质上是围绕单一产品的演示与推荐,实际效果与稳定性仍需更多独立测试来验证。
相关推荐

Claude Code + Skills 一键生成Web测试用例实战解析
本文解析如何用 Claude Code 结合 Skills 技能机制,实现从需求文档到 Web 测试用例的三阶段自动化生成流程,涵盖需求拆分、测试点提取与用例生成,并理性评估其效率提升与实际价值。

AI Agent 攻坚粒子物理:LEBRON 框架如何计算电弱相变
费米实验室研究员 Isaac Wang 分享 LEBRON 框架,用 AI Agent 计算宇宙早期电弱相变。文章解析大模型在严格科学计算中的四类失灵、auditor 审计机制,以及 AI 推进理论物理的机遇与障碍。

ComfyUI音乐工具包3.0:YuE2翻唱与ABC乐谱驱动的AI编曲
ComfyUI Music Production Toolkit 3.0发布,新增YuE2音频翻唱功能,通过SheetSage2转写ABC乐谱并由LLM改写提示词,实现结构感知的AI编曲。支持两种源模式,保留MiniMax Music 3,开源可用。