欢迎来到Xaiver的空间

加载中...

Writing2025-07-30

一个普通人的AI工作流

很喜欢《权力的游戏》中的一句话:“混乱就是阶梯”。崭新时代的开始是混乱的,在这混乱之中,总有人会找到攀升的阶梯。

喜欢 0阅读 5

第1章 引言|在信息洪流中寻找秩序

我们这一代人,或许比以往任何时候都更早地面对“信息密度”的压迫感,面临着更深层次的自我焦虑。时代似乎跑得太快了,AI和Agent每天都在信息上轰炸我的生活,但我们除了同AI聊聊天写写方案外,似乎也别无其他。

打开手机,标签不断闪烁;刷新网页,推送源源不绝;浏览器标签越开越多,读书笔记写了一半,灵感便已被下一个弹窗打断。信息不是稀缺品,而是过载的海啸。它吞没我们的注意力,也稀释了我们的判断力。

而作为一名商科背景、非技术出身的普通学生,我也曾对“AI”“Agent”“命令行”这类词汇感到陌生与抗拒。不是不感兴趣,而是那道技术门槛仿佛天生就竖在那里——冷漠、复杂、只属于“搞技术的人”。但后来我逐渐意识到,问题的根源不在于工具难用,而在于我们缺乏结构性地使用工具的方式。

与其说我们不会用,不如说我们没有一套能够将工具串联起来的“工作流”系统。

要做到“串联”其实是需要系统性的建立认知,尤其是需要主动地去学习,我和许多人一样,从“B站大学”开始,一点点摸索教程、搭建逻辑、试错迭代。如下是我的B站收藏夹的分类,我个人“博而不精”,广泛地搜罗同时也让收藏夹吃上了不少的灰。当然,在不断的收藏中,我的认知系统在悄然建立。

Image

进入大学,我对信息获取和使用的需求逐渐上升,开始寻求为每一种工具找到自己的“位置”,让它们不再是孤岛,而是有机协作的节点。不是为了炫技,也不是为了拥抱潮流,而是因为我发现:当我拥有一套属于自己的工作流时,我就有了在信息混乱中重新获得秩序的权利。

在这篇文章中,我将分享一些我亲自实践过的方式——如何用 Obsidian 管理知识、用命令行生成排版模板、用智能浏览器跨页整合信息,甚至如何让 AI 参与我的内容创作与数据分析,甚至作为一个只会基础代码的人,开始拥有构建自己完整前后端应用的能力,成为vibe coding的“全栈工程师”。

我并不是技术专家,也不代表任何标准答案。我只是一个普通人,试图用自己能掌握的方式,在喧哗中寻一条清晰的路径。

如果我也曾对“如何开始”感到困惑,那么也许,我的这条路径,能给我一点启发。

如何获取和学习我提到的下列工具?

部分工具的下载需要配置安全科学的学术网络环境,例如Github的开源工具、Gemini、Chat GPT等等;通义听悟、视频解析这类则可以直接使用。部分工具在Windows上配置相对麻烦,如Claude Code和Gemini CLI等。但只要想去使用,总能在B站或者说其他平台上找到方式。

第2章 知识管理工作流

信息过载的年代,知识管理不再只是一个“提高效率”的选择,而是一种抵抗混乱的方式。

我很早就意识到,光靠记忆和搜索引擎,根本无法应对每天涌入的成百上千条知识碎片。我们需要一套系统——一个可以把零散认知组织起来、沉淀下来、流动起来的系统。

我的选择是 Obsidian。

这不是一个美观到能在朋友圈炫耀的产品,它甚至在刚打开时显得有些冷峻。但它的力量在于结构,在于它的“连接性”。

2.1

Obsidian:用来存知识,也用来长出知识的

Image

Obsidian 是一款强调本地存储的笔记软件。它最具代表性的特征之一是“双链”机制。

所谓双链,并不只是把某个关键词高亮标记那么简单,而是在我的笔记世界里,让所有主题和概念之间建立真实的、可视化的关系。当然目前我也技艺不精,还在自我迭代。

Image

比如我在阅读关于 Agent 的资料时,会在笔记中加入 [[Agent]],它便自动连接到我过往所有关于 Agent 的笔记。当我持续这样积累,我会看到一个庞大的知识图谱悄然生长出来——它不是静态的数据库,而是我的“认知地图”。

这种地图让我意识到,学习不是线性输入的过程,而是网络状的联结;知识的价值,不在孤立的定义,而在彼此之间的关联性。

Obsidian 最令人惊喜的,可能不是它本身的功能,而是它开放的插件生态。社区里有成百上千个插件,我可以根据自己的需求拼出一套专属的知识工作台:

比如彩虹文件夹:为笔记分类带来色彩标识与视觉层级;PDF 导出插件:将整理好的内容输出成可分享的文档;Mermaid 与 Charts 插件:用代码生成结构图、流程图、数据图;还有日记、白板、知识图谱等——我可以随时调整和试验,像建造房子一样建造思维的边界。

Image

2.2

不乏优秀的知识管理产品

还有一些好的笔记产品,比如Notion 和 OneNote。

它们无疑是优秀的产品,前者界面友好、模板丰富,适合团队协作;后者结构直观、手写流畅,适合信息归档。但我最后还是选择了使用 Obsidian。

区别的核心,不在功能,而在哲学。

Notion是一块共享的白板,强调协同、展示、信息组织,它适合“团队里的我”;

OneNote是一本结构化的活页本,适合“记录型的我”;

Obsidian则是一套我可以亲手布线的“思维地图”,它服务的是“构建系统的我”。

它的本地化存储意味着我完全掌控自己的知识资产,不依赖云端,不担心数据丢失;它的文本驱动方式让我能以极低的干扰专注于结构和内容本身;它不预设结构,而是让我在使用中逐步生成自己的信息体系。

这种“自我中心化”的使用体验,是我选择它的原因,也是它最适合我“结构导向思维方式”的理由。

除了 Obsidian,我也在一些更轻量的场景下使用飞书文档,特别是在处理 AI 生成内容、转存格式化文件的过程中,它的作用不可忽视。

我常常会这样操作:

先把 ChatGPT、Claude 等输出的内容粘贴进飞书文档;飞书自动识别 Markdown 语法,将标题、列表准确分层;下载为 Word 文件后,这些结构依然完整保留,粘贴进我设置好的样式集中,就自动转换为对应的格式,无需再手动调格式。

by the way,每个人都可以有自己的word样式集,详见B站视频:BV1YQ4y1M73G

Image

相比之下,Obsidian 更适合长期构建,而飞书在工作文档流转中的表现则高效、顺手,是我处理“AI生成内容 → 输出规范文档”流程中的理想中转站。当然, 飞书个人版完全可以用来搭建个人知识库,本身也可以作为一款非常不错的笔记软件。

2.3

Markdown:所见即所得

与 Obsidian 搭配的,是一种叫做 Markdown 的标记语言。

它不像 Word 那样鼓励视觉修饰,而是鼓励用结构组织内容:

一级标题用 #,二级标题用 ##,列表用 - 或 *,粗体、引用、代码块……一切都是可见结构。

最初我可能会觉得“有点麻烦”,但当我习惯了这种方式之后,我写下的每一段文字,不只是表达,更是设计。

更重要的是,Markdown 已经成为大多数 AI 工具的默认语言标准。不管是 ChatGPT、Claude、还是 DeepSeek,我在它们那儿生成的内容几乎都可以无缝粘贴进 Obsidian——标题、列表、加粗、引用,全都自动识别。

2.4

用draw.io画流程图

还有一款我常用的可视化工具叫做 draw.io

很多时候,我会把 AI 生成的mermaid流程结构、要点提示,通过 draw.io 转换成可以自由编辑的图形结构,特别适合做一些具有模块感的工具图、路径图或业务模型图。

它不是华丽,但非常实用,几乎成了我每次讲解中“补图思维”的延展工具。

graphTD

A[引言:在信息洪流中寻找秩序]

B[知识管理<br>Obsidian + Markdown]

C[格式排版<br>命令行 + Claude + Gemini CLI]

D[浏览器工作流<br>DIA / Fellou / Agent]

E[自动化与 Agent<br>构建工具链 + 趋势洞察]

F[结语:从使用工具到拥有系统]

A-->B B-->C C-->D D-->E E-->F

Image

第3章 浏览器工作流

在互联网成为我们日常信息主要入口的今天,“浏览器”这个词听起来已经稀松平常。但正因为它如此日常,我们往往忽略了它的潜能。

绝大多数人仍然停留在“浏览网页”的层面上,用它搜索、跳转、查看。但在我逐步构建起自己的 AI 工作流后,我开始意识到:浏览器也可以成为一个主动的信息中介,一种交互性的认知前台。

3.1

DIA 浏览器:从静态阅读到实时对话

DIA 浏览器是我使用频率最高的智能型浏览器之一。它最特别之处,在于它并不只是展示网页,而是能与我共同理解网页内容。

我可以选中网页中的一段文字,直接提问它:“这段话是什么意思?”它会立刻进行语义解释,甚至引申背景知识;

我可以不读完整篇内容,而是问它:“这篇文章的核心观点是什么?”它会自动总结、压缩、提炼出主线信息;

它还能自动识别当前页面结构、关键词,并生成小结或逻辑树,帮助我更高效把握阅读节奏。

在我阅读文档、学习框架资料时,DIA 已逐渐成为我与内容之间的对话代理人。我不再孤立地面对知识,而是有了一个可询问、可质疑、可推演的伙伴。

Image

浏览器真正强大的场景,是信息密集与多源并存。

比如我在选购设备时,常常需要在知乎、B 站、小红书之间反复切换、比对观点。而 DIA 的“跨页整合”能力允许我将这些散落在不同页面的信息提取出来,进行横向对比、观点总结、决策辅助。

这种体验从根本上改变了“资料查找”的流程:我不再是打开多个标签页、人肉记忆内容差异;而是把任务交给浏览器,让它提取核心信息,生成比对表或观点清单;最终我只需决策,而非耗在搜索和记忆之间。

3.2

Fellou 浏览器:从浏览到行动

Fellou 更进一步。它不仅能帮我理解和整合信息,还内置了 Agent 执行链条。

我只需要输入一个目标,比如“帮我写一篇关于小红书种草机制的调研报告”,它就会自动:

拆解任务;设定检索路径;打开对应网页;爬取相关数据;输出一份精美的报告。

相比于 DIA 更注重交互性,Fellou 更像是一个可以托付任务的助手型浏览器。我不是在看网页,而是在指挥一个数字角色完成任务。

比如我试过让它自动下载 B 站某条视频的弹幕,并以 CSV 格式导出,方便后续做文本分析。这种能力过去需要写爬虫、调接口,现在,只需要一句 Prompt。

Image

Image 3-1

3.3

一个“转文本”的工作流

除了网页和图文信息的处理,我在工作流中也高度依赖视频内容的转写机制,尤其是播客、讲座、课程录播这类“音频主导型”的资料。

我最常使用的方式是这样:

找到目标视频(如 B 站上的某条长视频或播客);

将视频链接复制,粘贴到一个公开的视频解析网站中,获取其下载

Image

将下载地址粘贴进通义听悟,它支持通过 RSS 订阅或粘贴方式直接接收视频音轨;等待自动转写完成后,再进入编辑页面进行人工精修与重点提取。

通过这一流程,我可以将原本需要1 小时听完的内容,在10 分钟内抓住主线、15 分钟内整理出一版结构化笔记。

这种方式,我主要用于播客节目(获取不同领域的思考密度);老师上课的复习资料(录音后转写,系统回看);B 站教程视频(只取干货内容,形成自己的操作笔记); 这个过程的核心优势在于:它不是简单的“听写”,而是一次深度的理解转译,让不好处理的音频知识输入沉淀下来。

3.4

浏览器的边界,被 AI 再次拓宽

除了 DIA 和 Fellou,我也了解过一些其他探索型浏览器:Comet,甚至是直接插入ai插件而非agentic的浏览器。它们还未完全成熟,但已让我感受到一种趋势:信息不再是我被动接收的内容,而是我可以操控的材料,碎片化的食材经过处理之后可以内化为自身的骨肉。

当浏览器具备了“理解能力”“操作能力”和“任务规划能力”之后,我们与信息之间的关系就发生了转变:从被动地接受庞大松散的信息流,到主动式的整理获取和沉淀。

3.5

ChatGPT 与 Prompt 工程:

不是问答,而是“思维模板化”

最初接触 ChatGPT 时,我像大多数人一样,把它当作“问答机器人”使用。但我很快意识到,它真正的力量在于“Prompt 工程”。

当我不断打磨自己的提问方式,逐步沉淀出一批通用提问结构,比如:

“请用结构化方式总结以下内容”;

“将这段话整理成二级标题笔记”;

“对照目标输出格式,转化以下输入”;

我就会发现,Prompt 本身就是一种思维方式的抽象表达。

它把我对问题的理解,压缩成一句话,而 AI 将它解压还原为一套有逻辑的输出和表达方式。

我为此专门建立了一套 Prompt 文档库,按任务类型和项目(写作、摘要、转录、分析)归类,在小红书、github平台上广泛搜罗好用的prompt,像模版一样重复调用。这不只是为了提效,更是为了减少情绪干扰与注意力切换成本。

顺带推荐一个prompt库,Github项目名为:system-prompts-and-models-of-ai-tools

Image

这一切带给我的最大感悟是:输入质量的提升,是所有深度思考的前提。

当我不再浪费时间在无效搜索、重复阅读、人工对比、重复定义之间,我的注意力才得以集中在真正值得思考的问题上。而这,正是我搭建这套 AI 浏览器工作流的初衷。

第4章 基于AI Coding的自动化工作流

很多人一听到“命令行”就下意识地想象出满屏代码、黑底绿字的骇客画面。

但其实,它远比想象中温和。

Visual Studio Code 是我最早接触的“工程型编辑器”,搭配命令行终端,它几乎可以处理所有文本、排版和自动化需求。对理科生来说这也许是日常配置,但对我这样一名商科背景的学生而言,起初也只是从“复制粘贴命令”开始,一点点向内渗透。

4.1

latex+VS+CLI=自动化排版

比如说,我需要为一份学校论文建立严格符合规范的排版结构,而学校只提供了一份晦涩的说明文档。我将说明内容喂给 Claude Code,它帮我自动生成了一个 LaTeX 模板。格式精确,结构清晰,完全可复用。

Image

Image 4-1

如果我愿意打开终端,打开命令行,那我将打开新的世界。

使用过的命令行工具中,Gemini CLI是一个极具代表性的存在。它是开源的、免费的,每日调用额度较高,对个人用户极为友好。B站教程:BV1LL3LzmE36

它的使用方式非常直觉:安装好基础依赖(如 Node.js),将一个本地文件夹“喂给它”,可以让它:

Image

Image 4-2

1.自动列出该目录下的文件与结构;

2.生成目录总结、提取笔记内容;

3.按规则重命名文件、归档;

4.甚至帮我用自然语言回溯内容脉络。

换句话说:我把“杂”交给它,它可以给我一个“有条理”的世界,当然请注意不要让它随便删除我的文件。

Image

Image 4-3

它让“整理”不再是一件机械的事,而是一次信息“再加工”的过程。尤其当我处理那些临时笔记、会议纪要、课程 PDF 时,它帮我节省了大量重复劳动,也让我能更快把重心拉回到“理解”而不是“摆放”。

4.2

终端+IDE:编程、数据分析,我们都能做

结构化不止于视觉或文档整理。

在 Claude Code 的帮助下,我还开始探索将数据处理纳入自动化工作流的可能。

比如,我将一份原始 CSV 数据集上传,我可以让Claude 会识别字段含义,自动清洗、重排;它生成的 Python 脚本不仅能跑通数据,还能调用 Seaborn 或 Matplotlib 直接输出图表。

我只需给出“我想分析什么”这一句提示,它就能反馈出“我可以怎么做”的逻辑步骤。

对于一个不具备完整编程能力的非技术背景者而言,这种协作简直令人兴奋。我不再需要成为“会写代码的人”,我只需要成为“能让 AI 理解我的人”。

Image

Image 4-4

Image

Image 4-5

上面这些都是用claude code + kimi k2/sonnet/opus跑出来的数据分析。

4.3

用自然语言搭建一个应用

我用 Claude Code 搭建的第一个完整项目,名为AI GALAXY,是一个AI产品介绍与体验平台。它涵盖后端管理系统和前端响应式界面,扫码反馈,实时状态更新。

Image

Image 4-6

Image

Image 4-7

这个项目并不庞大,但它让我第一次真正完成了从“构思”到“构建”的闭环。我不用自己写完所有代码,而是和 AI 一起“对话式开发”——它负责实现,我负责逻辑。

在这个过程中我意识到,AI 并不会替代我思考,它只是帮我把思考变得“可以落地”。

整个 Agent 工具链的演化趋势,也越来越清晰地浮现在我面前:

Chatbot 阶段:我们习惯把 AI 当作“可以聊天的百科全书”;

Copilot 阶段:AI 成为我每一个任务流中的副驾驶,写代码、写摘要、生成内容;

Agent 阶段:我将目标交给 AI,它自己计划、拆解、执行,最终给出结果。

今天的 Claude Code、Gemini CLI、MiniMax、Manus 等,都已经迈入“行动智能”的范畴。它们不是在等我输入命令,而是在调度我尚未定义的路径。

它们帮助我把潜意识中的“我要做这件事”转化为“它已经帮我做完了这件事”。我越来越确信,未来不一定会是“AI 懂技术的人赢”,技术平权的时代终将到来,会让“懂如何利用 AI 的普通人”,拥有新的超能力:

我可以不怎么会写代码,但我能做出我定义的产品;我不做分析,但我能输出洞察;我不会画图,但我能调动模型表达我的结构化思维。这一切的前提是:我愿不愿意跳出舒适区,去学习和拥抱这个崭新的时代。

第5章 在混乱中开辟秩序

回顾这条从信息焦虑到认知秩序的探索之路,我清晰地看到:最大的转变,不在于掌握了多少酷炫的工具,而在于思维方式的重塑。

我们这一代人面对的,从来不是工具的匮乏,而是工具的泛滥与孤立。AI 的浪潮、Agent 的涌现、层出不穷的软件,它们本应是助力,却常常因缺乏联结而成为新的负担,制造出更深的碎片化漩涡。

我走过的路径,本质上是一次从“被动使用者”向“主动架构师”的蜕变:

不再盲目追逐新潮,也不怕跳出现有行动和思维框架带来的成本,而是为 Obsidian、命令行、智能浏览器、AI Agent 找到各自在认知版图中的专属坐标,能用来做什么,就用起来,有了定位之后自然会逐步长出图谱来。

用知识库管理软件构建起知识的骨架,让浏览器从“看”变成“问”和“做”,让命令行驱动自动化,让 AI 成为思考的协作者而非简单的问答机。这套工作流并非标准答案,它是在无数次试错、收藏、迭代中,从我的需求、我的思维习惯里“长”出来的。它属于我,也服务于我。

技术的门槛正在前所未有地降低。曾经需要专业编程能力的自动化、数据分析、甚至前后端搭建,如今通过 Claude Code、Kimi K2 等工具,借助清晰的 Prompt 和自然语言协作,变得触手可及。这并非意味着“技术不值钱”,而是宣告了一个新可能:“理解问题”和“设计流程”的能力,其价值正超越“编写代码”本身。

我们不再需要成为所有工具的精通者,而是要成为那个懂得如何让工具彼此对话、协同作战的“连接者”和“指挥官”。Agent 的兴起,正是这一趋势的明证——我定义目标,它规划路径、调用工具、交付结果,这是新的人机交互范式。

所以,如果我们在信息的洪流中感到窒息,在技术的门前感到踌躇,那么需要记住的是:

首先,起点不必完美,从一个困扰我的具体痛点开始(比如管理收藏夹、整理读书笔记、快速总结网页),选择一个核心工具(如 Obsidian 或一个智能浏览器),深挖下去;其次,拥抱“博而不精”,广泛了解是构建连接的基础。收藏夹吃灰不可怕,它正是我认知地图的雏形。重要的是在需要时,知道去哪里寻找那块拼图。 注意,迭代而非颠覆,系统是在使用中生长、修正的。没有一劳永逸的“最佳实践”,只有不断适配我当下状态的“更好方案”。

最后的核心是掌控感,我构建这套系统的终极目标,是夺回对信息、对时间、对注意力的主导权。当工具流畅协作,我便能从重复劳动和低效搜索中解放出来,将宝贵的认知资源投入到真正需要深度思考、创造与决策的领域。

我们一定且必须记住一点,谨防思维惰性。AI可以称为我们的第二、第三大脑,但绝不可以替代我们本身的思考。AI理应是人类涌现出创造力的良药,却也可能成为使人丧失思考能力的毒药。

我们无法阻止信息的奔涌,但我们可以为自己在信息的洪流当中建造方舟。这艘方舟不是由某个神器打造,而是由我们亲手设计、连接、并持续优化的工具链与工作流系统,人与动物之间最重要的区别是使用工具,那么现在走向下一个阶段的时候,新时代与旧时代的人的区别可能在于使用工具的能力。

我们应当赋予自己在混沌中开辟自我航道的能力。

很喜欢《权力的游戏》中的一句话:“混乱就是阶梯”。

崭新时代的开始是混乱的,在这混乱之中,总有人会找到攀升的阶梯。

我的AI手记 · 目录


剪藏来源:原文链接

一个普通人的AI工作流
  • 发布于

    2025-07-30

  • 更新于

    2026-07-26

  • 类目

  • 作者

    邓湘雷

  • 版权协议

Developed & Design by Xaiver
已经发电运行了 0 天,我会继续努力
Copyright © 2024-2029 Xaiver's Space
CC BY-NC-SA 4.0
湘ICP备2026026942号-1