Archive / Notes
文章索引
关于 AI 应用、Agent 工程与产品质量的持续记录:把实践中形成的判断,整理成可以复用的文字。
AI 写完了,也说修好了:测试人员如何验收编码 Agent?
代码改了、测试绿了、Agent 也说修好了,为什么仍然不能直接验收?从一个系统实现案例出发,把修复声明拆成原始失败样本、系统不变量、真实操作和可复查证据,建立编码 Agent 的交付验收流程。
别再迷信 LLM 裁判:做 AI 问答评测,为什么必须先知道正确答案?
AI 的回答听起来合理,不等于它真的答对;换一个更强模型当裁判,也不等于评测可靠。结合一次真实问答测试和 AgentJudgeBench,拆解如何建立评测集、0~5 分评分锚点、分层裁判与可追因的质量闭环。
5 个 AI Agent 各自失忆,我用 Git 和 Markdown 做了一个共享记忆中枢
Claude Code、OpenCode、Hermes 各自保存记忆,换工具或换设备就要重新解释背景。我用一个 Git 仓库、Markdown 和指针文件做了 agent-memory-hub,也重新想清楚了轻量记忆层能解决什么、不能解决什么。
AI 把 Bug 修好了,却悄悄引入了漏洞:什么是代码编辑中的安全漂移?
功能测试通过,不代表一次 AI 代码修改没有改变安全风险。结合 WeSCE 的 400 个可执行样本,讲清安全漂移是什么、为什么会被普通回归漏掉,以及团队如何建立可落地的 Security Diff Gate。
AI 点完“成功”不算成功:GUI Agent 为什么必须做原子性测试
从 LegacyWorld 的 28 个 Windows 工作流实验出发,解释为什么 GUI Agent 的测试不能只看任务完成率,并给出任务契约、状态验证器、故障注入和四象限指标组成的原子性测试方法。
DeepSeek Harness给软件测试工程师的启发:从生成用例走向可验证闭环
把 DeepSeek Harness 当成一个观察样本:当 AI 不再只是“给建议”,而是被装进一个能观察、能执行、能校验、能安全停止的系统之后,软件测试的玩法会怎么变。测试工程师的设计对象,正从“生成用例”走向“设计可验证闭环”。
AI Agent 真能当 QA 工程师吗?从一次零配置实测看清能力边界
从一个真实的 Grok Bot QA 实验出发,拆解 Agent 为什么能快速发现路由问题,却会产生误报并遗漏业务逻辑;再给出一套可复用的 Frame → Verify → Build 评估与落地框架。
测试工程师如何练成需求分析能力:从复杂业务到测试用例的五步法
用一个优惠券下单案例,完整演示如何澄清范围、画业务模型、拆规则与风险、设计测试点,再把结果落成可执行、可追溯的测试用例。
AI生成了100条测试用例,我是如何人工审核并筛出有效用例的
把100条AI候选用例做成可审计样本:先机器Check,再人工逐项裁决,记录错误分类、修订证据、回流规则和版本指标。
你的网站部署后会遭遇哪些攻击?专业测试工程师应该如何应对
网站部署到公网后,会面临哪些攻击?从 DDoS、SQL 注入到越权和 API 篡改,测试工程师如何在上线前把风险挡住。
AI Agents + 微调 LLM + RAG + YOLO:端到端测试的实际架构详解
拆解 AI Agents、微调 LLM、RAG、YOLO 与 Playwright 如何协作,构建可控、可审计的端到端测试闭环。
从快手生成式推荐到测试范式变革:推荐系统的终局,是测试系统的起点?
快手用 OneRec 把推荐从‘多阶段漏斗’变成‘端到端生成’。同样的范式迁移,会不会发生在测试领域?
AI如何改造不良资产处置?3个关键环节正在被颠覆
不良资产处置是一个万亿级市场,但长期依赖人工、效率低下。AI正在改变游戏规则——从资产定价到催收到法律流程,三个环节正在被颠覆。
用AI维护十年老项目:从摸底到迭代的完整方法论
十年老项目最大的敌人不是技术债,是上下文丢失。AI最大的价值不是帮你写代码,是帮你重建上下文。从项目体检到文档沉淀,完整拆解七步法。
Dify:零代码搭建AI应用的开源平台,从入门到实战
当大模型不再稀缺,如何让普通人也能用上AI?Dify让AI应用开发从精英化走向平民化。
AI+测试的三个阶段:Prompt→Skill→Agent(2026版)
企业AI测试已经从「写好提示词」演进到「让AI自主干活」。这篇文章拆解三个阶段的真实差异,以及2026年最成熟的落地方式。
AI中转站科普:国内开发者如何调用海外大模型API
想用GPT-4、Claude、Gemini,却发现需要海外手机号、外币信用卡、科学上网……这些门槛把大部分国内开发者挡在了门外。AI中转站,就是为了解决这些问题而生的。
用 TDD 思维调 Prompt:测试工程师转型 AI 开发的秘密武器
大多数人调 Prompt 靠感觉,我靠测试用例。从测试工程师转型 AI 开发,我把 TDD 的方法论搬到了 Prompt 调优上,效果出奇地好。
企业级软件产品图谱:8大类别主流产品一览
企业级软件涵盖ERP、CRM、OA、HRM等多个领域,本文梳理8大主流类别及其代表性产品,帮你快速建立全景认知。
AI+数字化在企业中到底是什么?一篇讲透
AI和数字化到底是什么关系?企业为什么要同时做这两件事?用最直白的方式,把这几个问题讲清楚。
AI+跨境电商:一个人能干一个团队的活,到底是怎么做到的?
2024到2026年,跨境电商圈出现了一批“超级个体”——以3-5人团队做到传统10人团队的销售规模。选品、Listing、客服、投流、数据分析,每个环节AI到底放大了什么、放大了多少?用可对照的数据逐项拆解。
AI+外贸:语言壁垒正在消失,下一个竞争焦点是什么?
2026年,AI翻译延迟降到2秒以内,AI营销内容回复率超过人工。语言已不再是外贸的门槛——选品洞察、信任建立速度、内容获客正在成为新决胜点。AI没有取代外贸人,但正在重新定义什么叫一个厉害的外贸人。
39.9元就能篡改AI答案?315晚会曝光的「GEO」到底是什么
今年315晚会带火了一个词——GEO(生成式引擎优化)。不是黑进AI系统,而是通过大量发软文「喂」给AI,让它在回答里优先推荐你。这到底是什么操作?普通人会被影响吗?
AI-SEO与品牌大模型声誉管理:搜索时代的下一个战场
当用户不再问百度,而是问AI——你的品牌还能被「推荐」吗?AI-SEO正在重新定义品牌触达用户的方式。
为什么说2026年,是搭建个人网站最好的时候
AI编程工具能用了、部署成本趋近于零、平台算法在恶化、AI内容泛滥——四个条件同时成熟,2026年搭个人网站,门槛最低、成本最低、价值却最高。
AI智能体搭建:从概念到落地,一共五步
拆开来看,一个最小可用的智能体核心逻辑并不复杂。从定义边界到评估迭代,五步讲清AI Agent搭建的全流程。
航采通:给机场采购部做了一套AI核验工具,从30分钟到30秒
大部分人以为做B端产品要堆功能。但一个老板真正想看的,只是一份能让他5分钟理解这玩意值不值的演示报告。
AI在企业怎么落地?探索、应用、推广、沉淀四步法
90%的企业还停在看看别人怎么做的阶段,真正落地的不到15%。探索、应用、推广、沉淀四步法,从痛点到资产的实战路径。
专项测试:90%测试工程师都忽略的领域
功能测试只是及格线,专项测试才是天花板。性能、安全、兼容性、弱网、稳定性——这些才是测试工程师的护城河。
独立站和SaaS建站到底是什么?别被这些词唬住了
独立站、SaaS建站、自建站……这些词听起来都很厉害,但到底什么意思?用大白话把这些概念讲清楚。
AI Agent与知识库建设:从Embedding到RAG的完整指南
大模型很强,但它不知道你的业务。从Embedding、向量数据库到RAG,用实战经验讲明白AI Agent和知识库是怎么运作的。
提示词工程实战指南:如何让AI真正听懂你的话
90%的人跟AI沟通的方式,就像跟实习生说「帮我把那个弄一下」——然后怪实习生不行。RTACE框架+4个进阶技巧+即用模板。
2026主流大模型横评:9个模型的真实能力边界
ChatGPT、Claude、Gemini、DeepSeek、Kimi、GLM、千问、豆包、文心一言——哪个最适合你?从测试转型AI开发这大半年的真实体验。
别光写代码不写 meta 标签:我给博客做了 SEO 和 GEO 优化的全过程
花一小时补齐 sitemap、robots、Open Graph、JSON-LD、canonical URL,覆盖 Google + Bing 双引擎。不花钱、不影响用户体验。
从软件测试到AI测试,一个测试人的认知重启
传统测试的尽头不是更高级的自动化,而是一次彻底的认知重建。
测试质量体系从0到1:策略制定到落地执行的全流程
质量体系不是一份文档,是一套让bug无处藏身的运转机制。从风险评估到自动化落地,讲你能明天就开始干的实操路径。
AI如何重塑测试工作:从辅助工具到自动化体系的构建
AI不是在帮你做测试,是在重新定义测试这件事本身。从GitHub 258个开源项目到实战提效数据,全景拆解AI测试自动化体系。
MCP协议:让AI从聊天变成动手的那把钥匙
MCP是AI世界的USB-C接口。搞了3个月AI,我发现这才是真正的效率拐点。
用了半年AI后,我总结出5条最反常识的真相
半年密集使用AI,从编程到写作到做产品,发现了这些「以为是这样,其实是那样」的认知差。
我用AI编程大半年,总结出这10条提示词
每一条都是真金白银换来的教训。不是AI不行,是你没给它搭好脚手架。
对抗AI焦虑的唯一办法
焦虑的解药不是更多信息,而是一次真实的上手。