- 解析知识管理系统在企业研发中的四层价值模型,对比文档管理与知识图谱差异,梳理与 DevOps 融合路径、常见陷阱及选型治理模式,附 FAQ 与落地实践参考。 解析知识管理系统在企业研发中的四层价值模型,对比文档管理与知识图谱差异,梳理与 DevOps 融合路径、常见陷阱及选型治理模式,附 FAQ 与落地实践参考。
- Google提出Agent质量飞轮核心原则:**优化器不可自评**。若同一AI既修改Prompt又评分,易“游戏化指标”,而非真实提升体验。需严格解耦Optimizer与Evaluator,冻结测试集、Rubric和基线版本,实施盲测与多维验证(如保留集、硬指标、人工盲评、失败类型迁移),确保分数上涨反映真实改进。 Google提出Agent质量飞轮核心原则:**优化器不可自评**。若同一AI既修改Prompt又评分,易“游戏化指标”,而非真实提升体验。需严格解耦Optimizer与Evaluator,冻结测试集、Rubric和基线版本,实施盲测与多维验证(如保留集、硬指标、人工盲评、失败类型迁移),确保分数上涨反映真实改进。
- OpenAI旧Evals进入退役倒计时:Agent测评别再押在一个平台按钮上 真正会丢的不是一个界面很多团队说“我们做过几十条 Agent Eval”,实际资产只存在某个平台的网页按钮里:案例是谁写的、标准答案是什么、评分器怎么判、失败时调用了哪些工具,全靠系统内部保存。平台一迁,留下的可能只是一张总分截图。OpenAI 已公布旧 Evals 的只读与关闭时间。无论是否使用该平台,这都是一个... OpenAI旧Evals进入退役倒计时:Agent测评别再押在一个平台按钮上 真正会丢的不是一个界面很多团队说“我们做过几十条 Agent Eval”,实际资产只存在某个平台的网页按钮里:案例是谁写的、标准答案是什么、评分器怎么判、失败时调用了哪些工具,全靠系统内部保存。平台一迁,留下的可能只是一张总分截图。OpenAI 已公布旧 Evals 的只读与关闭时间。无论是否使用该平台,这都是一个...
- 评审会上把质量报告投出来。总监三秒划到最后一行:『所以能不能上?』开发盯着自己模块那三条红,其余一眼不看。测试同行从头核对附录里的分母和区间,眉头越皱越紧。三类人读的是同一份文档,问的却是三个完全不同的问题——而你只准备了一份答案。这份报告大概率会收获一串『收到』。低回应率不是因为你数据不全,恰恰相反,是因为你把一份报告当成了面向所有人的通用件。 为什么你的报告只换来一堆『收到』一份为所有读... 评审会上把质量报告投出来。总监三秒划到最后一行:『所以能不能上?』开发盯着自己模块那三条红,其余一眼不看。测试同行从头核对附录里的分母和区间,眉头越皱越紧。三类人读的是同一份文档,问的却是三个完全不同的问题——而你只准备了一份答案。这份报告大概率会收获一串『收到』。低回应率不是因为你数据不全,恰恰相反,是因为你把一份报告当成了面向所有人的通用件。 为什么你的报告只换来一堆『收到』一份为所有读...
- 本文提出AI质量报告的可复现性设计:通过模型、prompt、数据集、随机种子、运行标识五要素脚注,确保每条结论自带“配方”。纯标准库实现自动采集、校验与标注,杜绝配置漂移导致的误判,让报告从备忘录升级为可验证证据。 本文提出AI质量报告的可复现性设计:通过模型、prompt、数据集、随机种子、运行标识五要素脚注,确保每条结论自带“配方”。纯标准库实现自动采集、校验与标注,杜绝配置漂移导致的误判,让报告从备忘录升级为可验证证据。
- 同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% 这次,没人记得它统共就跑了十七八条。数字没撒谎,你只是从一摞结果里挑了最顺眼的那一颗珠子。AI 应用的通过率、稳定性,天生是一个分布,不是一个点。模型输出的随机性、用例里那一两条边界抖动,都会让『同一次改动』每次跑出来的通过率在一个带... 同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% 这次,没人记得它统共就跑了十七八条。数字没撒谎,你只是从一摞结果里挑了最顺眼的那一颗珠子。AI 应用的通过率、稳定性,天生是一个分布,不是一个点。模型输出的随机性、用例里那一两条边界抖动,都会让『同一次改动』每次跑出来的通过率在一个带...
- 周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例的手感快了。但总监问的不是手感,是测量口径。效率倍数这种东西,进质量报告的那一刻起,规矩就只有一条:数字本身不值钱,口径才是全部。这个话题最近又被推了一把:据媒体报道,今年服贸会期间公布的『2026 AI+软件「银弹」优秀实践』名单(... 周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例的手感快了。但总监问的不是手感,是测量口径。效率倍数这种东西,进质量报告的那一刻起,规矩就只有一条:数字本身不值钱,口径才是全部。这个话题最近又被推了一把:据媒体报道,今年服贸会期间公布的『2026 AI+软件「银弹」优秀实践』名单(...
- 本文揭示覆盖率的三大分母陷阱:行覆盖易被生成代码虚高,分支覆盖难捕业务组合逻辑,需求覆盖最真实却常被省略。提出“三层分母并列报告”法——剔除样板重算行覆盖、按真值表补全分支用例、绑定需求条目审计覆盖,让93.4%不再掩盖81.0%的窟窿,让复盘从归因转向可对账。 本文揭示覆盖率的三大分母陷阱:行覆盖易被生成代码虚高,分支覆盖难捕业务组合逻辑,需求覆盖最真实却常被省略。提出“三层分母并列报告”法——剔除样板重算行覆盖、按真值表补全分支用例、绑定需求条目审计覆盖,让93.4%不再掩盖81.0%的窟窿,让复盘从归因转向可对账。
- 本文介绍AI Agent事故复盘的“十维度归因法”:基于AgentAudit论文(arXiv:2609.09875),从指令完整性、规划器、记忆等10个可审计维度逐层定位根因,每维均产出可回归测试用例,彻底告别“模型理解偏差”式模糊结论,实现事故闭环与持续防御。 本文介绍AI Agent事故复盘的“十维度归因法”:基于AgentAudit论文(arXiv:2609.09875),从指令完整性、规划器、记忆等10个可审计维度逐层定位根因,每维均产出可回归测试用例,彻底告别“模型理解偏差”式模糊结论,实现事故闭环与持续防御。
- Prompt作为AI应用的“事实源代码”,却长期缺乏代码级发布管理。本文提出三段式发布报告(变更台账+回归结论+回滚阈值),通过Git版本化、CI自动校验、相对指标比对与强制回滚锚点,将Prompt变更纳入可追溯、可回滚、可复盘的工程闭环,终结靠记忆复盘的裸奔时代。 Prompt作为AI应用的“事实源代码”,却长期缺乏代码级发布管理。本文提出三段式发布报告(变更台账+回归结论+回滚阈值),通过Git版本化、CI自动校验、相对指标比对与强制回滚锚点,将Prompt变更纳入可追溯、可回滚、可复盘的工程闭环,终结靠记忆复盘的裸奔时代。
- 一、AI知识库系统的技术演进与行业价值在生成式AI技术深度渗透企业运营的当下,AI知识库系统已从传统文档管理工具升级为企业数字化转型的核心基础设施。根据行业研究显示,超过三分之二的企业将智能知识库视为提升组织效率的关键抓手,其价值不仅体现在知识的集中管理,更在于通过检索增强生成(RAG)技术实现知识的智能应用,推动业务流程自动化与决策智能化。现代AI知识库系统的核心特征在于"知识操作系统"属... 一、AI知识库系统的技术演进与行业价值在生成式AI技术深度渗透企业运营的当下,AI知识库系统已从传统文档管理工具升级为企业数字化转型的核心基础设施。根据行业研究显示,超过三分之二的企业将智能知识库视为提升组织效率的关键抓手,其价值不仅体现在知识的集中管理,更在于通过检索增强生成(RAG)技术实现知识的智能应用,推动业务流程自动化与决策智能化。现代AI知识库系统的核心特征在于"知识操作系统"属...
- 本文拆解NVIDIA Blackwell机密推理实验,强调复现实验需严控变量、同步评估吞吐/TPOT/安全状态与输出质量。指出性能数字不可直接外推,提出四维发布门禁(安全、质量、性能、稳定性),倡导测试工程师构建可复现的差分评测体系。 本文拆解NVIDIA Blackwell机密推理实验,强调复现实验需严控变量、同步评估吞吐/TPOT/安全状态与输出质量。指出性能数字不可直接外推,提出四维发布门禁(安全、质量、性能、稳定性),倡导测试工程师构建可复现的差分评测体系。
- NVIDIA用AI Coding Agent迁移ROS 2节点至CUDA Buffer,实现GPU零拷贝通信。本文强调:功能正确≠优化生效,测试需验证四大维度——语义等价性、CUDA Backend协商、无Payload级CPU拷贝、可靠CPU回退,方为可信迁移。 NVIDIA用AI Coding Agent迁移ROS 2节点至CUDA Buffer,实现GPU零拷贝通信。本文强调:功能正确≠优化生效,测试需验证四大维度——语义等价性、CUDA Backend协商、无Payload级CPU拷贝、可靠CPU回退,方为可信迁移。
- 假设你团队里的AI编码搭档干了一整夜:第二天一早,四十多个PR同时挤进流水线,CI从提交到出结果排起三个小时的队。数字是打的比方,但方向不是危言耸听——当写代码的不再只有人,“每条PR跑全量测试”这条CI铁律,正在以肉眼可见的速度失效。真实的样本来了。Anthropic工程师Sachin Malhotra在2026年9月14日的官方博客里公开了一组数字:Claude编写了公司80%的合并代码... 假设你团队里的AI编码搭档干了一整夜:第二天一早,四十多个PR同时挤进流水线,CI从提交到出结果排起三个小时的队。数字是打的比方,但方向不是危言耸听——当写代码的不再只有人,“每条PR跑全量测试”这条CI铁律,正在以肉眼可见的速度失效。真实的样本来了。Anthropic工程师Sachin Malhotra在2026年9月14日的官方博客里公开了一组数字:Claude编写了公司80%的合并代码...
- 本文探讨AI编程助手时代下测试新范式:将“知识新鲜度”转化为可量化、可回归、可进CI的测试项。通过借鉴Google为Gemini设计的117条Prompt评测框架,提出四维断言(版本/必需接口/禁用接口/来源可溯)、Skill版本化管理及三个轻量落地切入点,助力测试团队构建面向AI代码的可信质量防线。 本文探讨AI编程助手时代下测试新范式:将“知识新鲜度”转化为可量化、可回归、可进CI的测试项。通过借鉴Google为Gemini设计的117条Prompt评测框架,提出四维断言(版本/必需接口/禁用接口/来源可溯)、Skill版本化管理及三个轻量落地切入点,助力测试团队构建面向AI代码的可信质量防线。
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签