- 同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% 这次,没人记得它统共就跑了十七八条。数字没撒谎,你只是从一摞结果里挑了最顺眼的那一颗珠子。AI 应用的通过率、稳定性,天生是一个分布,不是一个点。模型输出的随机性、用例里那一两条边界抖动,都会让『同一次改动』每次跑出来的通过率在一个带... 同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% 这次,没人记得它统共就跑了十七八条。数字没撒谎,你只是从一摞结果里挑了最顺眼的那一颗珠子。AI 应用的通过率、稳定性,天生是一个分布,不是一个点。模型输出的随机性、用例里那一两条边界抖动,都会让『同一次改动』每次跑出来的通过率在一个带...
- 周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例的手感快了。但总监问的不是手感,是测量口径。效率倍数这种东西,进质量报告的那一刻起,规矩就只有一条:数字本身不值钱,口径才是全部。这个话题最近又被推了一把:据媒体报道,今年服贸会期间公布的『2026 AI+软件「银弹」优秀实践』名单(... 周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例的手感快了。但总监问的不是手感,是测量口径。效率倍数这种东西,进质量报告的那一刻起,规矩就只有一条:数字本身不值钱,口径才是全部。这个话题最近又被推了一把:据媒体报道,今年服贸会期间公布的『2026 AI+软件「银弹」优秀实践』名单(...
- 本文揭示覆盖率的三大分母陷阱:行覆盖易被生成代码虚高,分支覆盖难捕业务组合逻辑,需求覆盖最真实却常被省略。提出“三层分母并列报告”法——剔除样板重算行覆盖、按真值表补全分支用例、绑定需求条目审计覆盖,让93.4%不再掩盖81.0%的窟窿,让复盘从归因转向可对账。 本文揭示覆盖率的三大分母陷阱:行覆盖易被生成代码虚高,分支覆盖难捕业务组合逻辑,需求覆盖最真实却常被省略。提出“三层分母并列报告”法——剔除样板重算行覆盖、按真值表补全分支用例、绑定需求条目审计覆盖,让93.4%不再掩盖81.0%的窟窿,让复盘从归因转向可对账。
- 本文介绍AI Agent事故复盘的“十维度归因法”:基于AgentAudit论文(arXiv:2609.09875),从指令完整性、规划器、记忆等10个可审计维度逐层定位根因,每维均产出可回归测试用例,彻底告别“模型理解偏差”式模糊结论,实现事故闭环与持续防御。 本文介绍AI Agent事故复盘的“十维度归因法”:基于AgentAudit论文(arXiv:2609.09875),从指令完整性、规划器、记忆等10个可审计维度逐层定位根因,每维均产出可回归测试用例,彻底告别“模型理解偏差”式模糊结论,实现事故闭环与持续防御。
- Prompt作为AI应用的“事实源代码”,却长期缺乏代码级发布管理。本文提出三段式发布报告(变更台账+回归结论+回滚阈值),通过Git版本化、CI自动校验、相对指标比对与强制回滚锚点,将Prompt变更纳入可追溯、可回滚、可复盘的工程闭环,终结靠记忆复盘的裸奔时代。 Prompt作为AI应用的“事实源代码”,却长期缺乏代码级发布管理。本文提出三段式发布报告(变更台账+回归结论+回滚阈值),通过Git版本化、CI自动校验、相对指标比对与强制回滚锚点,将Prompt变更纳入可追溯、可回滚、可复盘的工程闭环,终结靠记忆复盘的裸奔时代。
- 本文拆解NVIDIA Blackwell机密推理实验,强调复现实验需严控变量、同步评估吞吐/TPOT/安全状态与输出质量。指出性能数字不可直接外推,提出四维发布门禁(安全、质量、性能、稳定性),倡导测试工程师构建可复现的差分评测体系。 本文拆解NVIDIA Blackwell机密推理实验,强调复现实验需严控变量、同步评估吞吐/TPOT/安全状态与输出质量。指出性能数字不可直接外推,提出四维发布门禁(安全、质量、性能、稳定性),倡导测试工程师构建可复现的差分评测体系。
- NVIDIA用AI Coding Agent迁移ROS 2节点至CUDA Buffer,实现GPU零拷贝通信。本文强调:功能正确≠优化生效,测试需验证四大维度——语义等价性、CUDA Backend协商、无Payload级CPU拷贝、可靠CPU回退,方为可信迁移。 NVIDIA用AI Coding Agent迁移ROS 2节点至CUDA Buffer,实现GPU零拷贝通信。本文强调:功能正确≠优化生效,测试需验证四大维度——语义等价性、CUDA Backend协商、无Payload级CPU拷贝、可靠CPU回退,方为可信迁移。
- 假设你团队里的AI编码搭档干了一整夜:第二天一早,四十多个PR同时挤进流水线,CI从提交到出结果排起三个小时的队。数字是打的比方,但方向不是危言耸听——当写代码的不再只有人,“每条PR跑全量测试”这条CI铁律,正在以肉眼可见的速度失效。真实的样本来了。Anthropic工程师Sachin Malhotra在2026年9月14日的官方博客里公开了一组数字:Claude编写了公司80%的合并代码... 假设你团队里的AI编码搭档干了一整夜:第二天一早,四十多个PR同时挤进流水线,CI从提交到出结果排起三个小时的队。数字是打的比方,但方向不是危言耸听——当写代码的不再只有人,“每条PR跑全量测试”这条CI铁律,正在以肉眼可见的速度失效。真实的样本来了。Anthropic工程师Sachin Malhotra在2026年9月14日的官方博客里公开了一组数字:Claude编写了公司80%的合并代码...
- 本文探讨AI编程助手时代下测试新范式:将“知识新鲜度”转化为可量化、可回归、可进CI的测试项。通过借鉴Google为Gemini设计的117条Prompt评测框架,提出四维断言(版本/必需接口/禁用接口/来源可溯)、Skill版本化管理及三个轻量落地切入点,助力测试团队构建面向AI代码的可信质量防线。 本文探讨AI编程助手时代下测试新范式:将“知识新鲜度”转化为可量化、可回归、可进CI的测试项。通过借鉴Google为Gemini设计的117条Prompt评测框架,提出四维断言(版本/必需接口/禁用接口/来源可溯)、Skill版本化管理及三个轻量落地切入点,助力测试团队构建面向AI代码的可信质量防线。
- 本文揭示Agent测试核心痛点:答案“看似正确”不等于行为可靠。AWS Agent-EvalKit提出Plan/ Data/ Trace/ Run/ Eval/ Report六阶段评测法,强调基于完整执行轨迹(而非仅最终输出)验证工具调用、参数准确性与事实忠实性,助力测试团队从“测结果”转向“测过程”。 本文揭示Agent测试核心痛点:答案“看似正确”不等于行为可靠。AWS Agent-EvalKit提出Plan/ Data/ Trace/ Run/ Eval/ Report六阶段评测法,强调基于完整执行轨迹(而非仅最终输出)验证工具调用、参数准确性与事实忠实性,助力测试团队从“测结果”转向“测过程”。
- 模型接入开发工具后,最容易出现一种错觉:代码通过测试,模型就升级成功了。实际上,模型变化可能影响工具选择、修改范围、重试次数、解释方式和成本。GitHub在9月21日宣布Grok 4.7可用于Copilot。本文不评价模型强弱,而是讨论测试团队面对模型切换时,怎样把“能力变化”变成可观察的质量差异。 先做任务分层解释代码、生成单元测试、修改支付逻辑、更新依赖和调用部署工具,不应混成一个总分。... 模型接入开发工具后,最容易出现一种错觉:代码通过测试,模型就升级成功了。实际上,模型变化可能影响工具选择、修改范围、重试次数、解释方式和成本。GitHub在9月21日宣布Grok 4.7可用于Copilot。本文不评价模型强弱,而是讨论测试团队面对模型切换时,怎样把“能力变化”变成可观察的质量差异。 先做任务分层解释代码、生成单元测试、修改支付逻辑、更新依赖和调用部署工具,不应混成一个总分。...
- 本文探讨GitHub凭据治理的实战难点:旧Token潜藏于CI变量、脚本或缓存中,贸然删除易中断发布。提出以“使用证明”替代主观判断,构建“发现—确认—轮换—撤销—验证”可回归流程,并强调测试需覆盖权限边界、失效验证与Agent最小权限行为,推动凭据治理从清单管理升级为行为可证、过程可溯的质量工程。 本文探讨GitHub凭据治理的实战难点:旧Token潜藏于CI变量、脚本或缓存中,贸然删除易中断发布。提出以“使用证明”替代主观判断,构建“发现—确认—轮换—撤销—验证”可回归流程,并强调测试需覆盖权限边界、失效验证与Agent最小权限行为,推动凭据治理从清单管理升级为行为可证、过程可溯的质量工程。
- GitHub 9月更新AI Scan,无需启用CodeQL默认配置即可覆盖更多仓库。本文聚焦覆盖扩大后的关键挑战:构建可解释漏洞样本、设计误报门禁、开展仓库级回归测试,确保AI扫描结果可信、可控、可度量。 GitHub 9月更新AI Scan,无需启用CodeQL默认配置即可覆盖更多仓库。本文聚焦覆盖扩大后的关键挑战:构建可解释漏洞样本、设计误报门禁、开展仓库级回归测试,确保AI扫描结果可信、可控、可度量。
- GitHub 9月18日推出Agent会话自动清理预览功能:PR合并后标记Done,宽限期后删除。但清理本质是审计生命周期管理,需覆盖多状态(如Legal Hold、回滚)、幂等删除、脱敏归档与可恢复验证,确保证据不丢、隐私不留。 GitHub 9月18日推出Agent会话自动清理预览功能:PR合并后标记Done,宽限期后删除。但清理本质是审计生命周期管理,需覆盖多状态(如Legal Hold、回滚)、幂等删除、脱敏归档与可恢复验证,确保证据不丢、隐私不留。
- GitHub Copilot 新增 efficiency/balance/intelligence 三档自动路由,按任务风险分层管控模型选择、成本与行为可靠性。测试需聚焦路由契约、故障转移、档位门禁及多维断言,而非仅看平均成功率。 GitHub Copilot 新增 efficiency/balance/intelligence 三档自动路由,按任务风险分层管控模型选择、成本与行为可靠性。测试需聚焦路由契约、故障转移、档位门禁及多维断言,而非仅看平均成功率。
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签