AI 工程
AI Engineering:大模型应用、Agent 与 RAG 实践
-
两天、60 美元、第一课仍未交付:一次 Codex 教学任务失控复盘
我原本只想让 Codex 根据当前进度,用 teach Skill 带我系统学习 RAG;两天后额度消耗接近 60 美元,第一节课却仍未按时交付。复盘发现根因不是 high reasoning 的过度思考,而是一套曾经很好用、如今却与强模型发生错配的重型流程:teach → brainstorming → writing-plans → subagent-driven-development,层层升级最终拖垮了交付。文章附完整时间线、Skill 触发记录、21 次子代理派发和 159 次 wait 的四组证据。
-
RAG 系列(九):从代码到完整评测实验
前五篇建立了指标和设计。本篇把它们映射到真实代码、命令和产物,并用`stage2-20260824-final`解释一次完整实验应该怎样复现、审计和转化为优化任务。
-
RAG 系列(六):无答案判断与 Context 评测
Retriever总会返回“最相似”的内容,但最相似不等于足以回答。本篇先建立无答案决策,再检查TopK进入LLM之前是否丢失、重复或污染了证据。
-
RAG 系列(三):Embedding 检索评测与 Benchmark
本篇回答一个工程问题:两个Embedding模型都能运行,怎样判断谁更适合当前真实知识库?重点评测Retriever,不把LLM的语言风格和随机性混进实验。
-
私人执行助理:一套运行在 Hermes 之上、以飞书为真相的自组织 Agent 系统
更新于:从 13 个子 skill 收敛为 4 核心 skill、以飞书 Base 为唯一真相源、hermes cron 为唯一调度器的私人执行助理完整设计:四层架构、数据模型、三层记忆、技能路由、执行约束与数据流转。
-
私人执行助理的两轮迭代:从 13 个细粒度技能收敛到 4 个核心技能
用两轮迭代打磨一个高自主的『私人执行助理』Agent Skill:从 V0.1 的 13 个细粒度技能,收敛到 V1 的 4 个核心技能 + 渐进披露 + 评测闭环。记录产品目标、架构取舍、代码落点与评测数据。