- 本文介绍如何将Kev——一种类型化决策AI模型——作为可测试服务进行验证。它不生成文本,而是针对结构化问题(noul/choice/score)返回概率化答案。重点在于:建立本地HTTP服务、编写接口契约测试、验证多题隔离与选项顺序稳定性、开展概率校准,并构建可回归的冻结样本集。核心理念:把AI当被测对象,而非黑盒顾问。 本文介绍如何将Kev——一种类型化决策AI模型——作为可测试服务进行验证。它不生成文本,而是针对结构化问题(noul/choice/score)返回概率化答案。重点在于:建立本地HTTP服务、编写接口契约测试、验证多题隔离与选项顺序稳定性、开展概率校准,并构建可回归的冻结样本集。核心理念:把AI当被测对象,而非黑盒顾问。
- 摘要:Google最新为Antigravity SDK加入本地模型支持。本文不做功能新闻复述,而是拆解本地Agent真正需要验证的四件事:数据是否离机、工具权限是否收敛、云端与本地行为是否一致、资源不足时能否安全降级。 月23日,Google宣布Antigravity SDK支持本地模型,首批重点适配Gemma 4 26B A4B和LiteRT。官方给出的吸引力很直接:不付API调用费、代码... 摘要:Google最新为Antigravity SDK加入本地模型支持。本文不做功能新闻复述,而是拆解本地Agent真正需要验证的四件事:数据是否离机、工具权限是否收敛、云端与本地行为是否一致、资源不足时能否安全降级。 月23日,Google宣布Antigravity SDK支持本地模型,首批重点适配Gemma 4 26B A4B和LiteRT。官方给出的吸引力很直接:不付API调用费、代码...
- Google提出Agent质量飞轮核心原则:**优化器不可自评**。若同一AI既修改Prompt又评分,易“游戏化指标”,而非真实提升体验。需严格解耦Optimizer与Evaluator,冻结测试集、Rubric和基线版本,实施盲测与多维验证(如保留集、硬指标、人工盲评、失败类型迁移),确保分数上涨反映真实改进。 Google提出Agent质量飞轮核心原则:**优化器不可自评**。若同一AI既修改Prompt又评分,易“游戏化指标”,而非真实提升体验。需严格解耦Optimizer与Evaluator,冻结测试集、Rubric和基线版本,实施盲测与多维验证(如保留集、硬指标、人工盲评、失败类型迁移),确保分数上涨反映真实改进。
- 第一个给得更高一些,工作内容写得很清楚:负责某业务模块的功能测试,按需求文档执行用例,提交缺陷,跟进回归。你把它读第二遍的时候会发现,整段描述里没有一个技术词。第二个数字略低,JD 里却零零散散提到接口测试、自动化脚本、持续集成,还有一句「参与测试效率提升」。你现在纠结的是两件事:这两个机会到底该选哪个,以及——那个数字略低的,能不能开口谈一谈。先说一个可能反直觉的结论:第一次选机会时,数字... 第一个给得更高一些,工作内容写得很清楚:负责某业务模块的功能测试,按需求文档执行用例,提交缺陷,跟进回归。你把它读第二遍的时候会发现,整段描述里没有一个技术词。第二个数字略低,JD 里却零零散散提到接口测试、自动化脚本、持续集成,还有一句「参与测试效率提升」。你现在纠结的是两件事:这两个机会到底该选哪个,以及——那个数字略低的,能不能开口谈一谈。先说一个可能反直觉的结论:第一次选机会时,数字...
- OpenAI旧Evals进入退役倒计时:Agent测评别再押在一个平台按钮上 真正会丢的不是一个界面很多团队说“我们做过几十条 Agent Eval”,实际资产只存在某个平台的网页按钮里:案例是谁写的、标准答案是什么、评分器怎么判、失败时调用了哪些工具,全靠系统内部保存。平台一迁,留下的可能只是一张总分截图。OpenAI 已公布旧 Evals 的只读与关闭时间。无论是否使用该平台,这都是一个... OpenAI旧Evals进入退役倒计时:Agent测评别再押在一个平台按钮上 真正会丢的不是一个界面很多团队说“我们做过几十条 Agent Eval”,实际资产只存在某个平台的网页按钮里:案例是谁写的、标准答案是什么、评分器怎么判、失败时调用了哪些工具,全靠系统内部保存。平台一迁,留下的可能只是一张总分截图。OpenAI 已公布旧 Evals 的只读与关闭时间。无论是否使用该平台,这都是一个...
- 评审会上把质量报告投出来。总监三秒划到最后一行:『所以能不能上?』开发盯着自己模块那三条红,其余一眼不看。测试同行从头核对附录里的分母和区间,眉头越皱越紧。三类人读的是同一份文档,问的却是三个完全不同的问题——而你只准备了一份答案。这份报告大概率会收获一串『收到』。低回应率不是因为你数据不全,恰恰相反,是因为你把一份报告当成了面向所有人的通用件。 为什么你的报告只换来一堆『收到』一份为所有读... 评审会上把质量报告投出来。总监三秒划到最后一行:『所以能不能上?』开发盯着自己模块那三条红,其余一眼不看。测试同行从头核对附录里的分母和区间,眉头越皱越紧。三类人读的是同一份文档,问的却是三个完全不同的问题——而你只准备了一份答案。这份报告大概率会收获一串『收到』。低回应率不是因为你数据不全,恰恰相反,是因为你把一份报告当成了面向所有人的通用件。 为什么你的报告只换来一堆『收到』一份为所有读...
- 本文提出AI质量报告的可复现性设计:通过模型、prompt、数据集、随机种子、运行标识五要素脚注,确保每条结论自带“配方”。纯标准库实现自动采集、校验与标注,杜绝配置漂移导致的误判,让报告从备忘录升级为可验证证据。 本文提出AI质量报告的可复现性设计:通过模型、prompt、数据集、随机种子、运行标识五要素脚注,确保每条结论自带“配方”。纯标准库实现自动采集、校验与标注,杜绝配置漂移导致的误判,让报告从备忘录升级为可验证证据。
- 同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% 这次,没人记得它统共就跑了十七八条。数字没撒谎,你只是从一摞结果里挑了最顺眼的那一颗珠子。AI 应用的通过率、稳定性,天生是一个分布,不是一个点。模型输出的随机性、用例里那一两条边界抖动,都会让『同一次改动』每次跑出来的通过率在一个带... 同一套回归用例,周一早上跑完是 88%,你不放心又跑了一次,变成 94%。周报你贴了 94%——贴 88% 那次,评审会上要被人追问『怎么又掉了』;贴 94% 这次,没人记得它统共就跑了十七八条。数字没撒谎,你只是从一摞结果里挑了最顺眼的那一颗珠子。AI 应用的通过率、稳定性,天生是一个分布,不是一个点。模型输出的随机性、用例里那一两条边界抖动,都会让『同一次改动』每次跑出来的通过率在一个带...
- 周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例的手感快了。但总监问的不是手感,是测量口径。效率倍数这种东西,进质量报告的那一刻起,规矩就只有一条:数字本身不值钱,口径才是全部。这个话题最近又被推了一把:据媒体报道,今年服贸会期间公布的『2026 AI+软件「银弹」优秀实践』名单(... 周报里那行『测试效率提升 3 倍』,在会上被总监问了一句:分子是什么,分母是什么?办公室安静了下来。写这行的人并不心虚——他是真觉得,用 AI 辅助之后,写用例的手感快了。但总监问的不是手感,是测量口径。效率倍数这种东西,进质量报告的那一刻起,规矩就只有一条:数字本身不值钱,口径才是全部。这个话题最近又被推了一把:据媒体报道,今年服贸会期间公布的『2026 AI+软件「银弹」优秀实践』名单(...
- 本文揭示覆盖率的三大分母陷阱:行覆盖易被生成代码虚高,分支覆盖难捕业务组合逻辑,需求覆盖最真实却常被省略。提出“三层分母并列报告”法——剔除样板重算行覆盖、按真值表补全分支用例、绑定需求条目审计覆盖,让93.4%不再掩盖81.0%的窟窿,让复盘从归因转向可对账。 本文揭示覆盖率的三大分母陷阱:行覆盖易被生成代码虚高,分支覆盖难捕业务组合逻辑,需求覆盖最真实却常被省略。提出“三层分母并列报告”法——剔除样板重算行覆盖、按真值表补全分支用例、绑定需求条目审计覆盖,让93.4%不再掩盖81.0%的窟窿,让复盘从归因转向可对账。
- 本文介绍AI Agent事故复盘的“十维度归因法”:基于AgentAudit论文(arXiv:2609.09875),从指令完整性、规划器、记忆等10个可审计维度逐层定位根因,每维均产出可回归测试用例,彻底告别“模型理解偏差”式模糊结论,实现事故闭环与持续防御。 本文介绍AI Agent事故复盘的“十维度归因法”:基于AgentAudit论文(arXiv:2609.09875),从指令完整性、规划器、记忆等10个可审计维度逐层定位根因,每维均产出可回归测试用例,彻底告别“模型理解偏差”式模糊结论,实现事故闭环与持续防御。
- Prompt作为AI应用的“事实源代码”,却长期缺乏代码级发布管理。本文提出三段式发布报告(变更台账+回归结论+回滚阈值),通过Git版本化、CI自动校验、相对指标比对与强制回滚锚点,将Prompt变更纳入可追溯、可回滚、可复盘的工程闭环,终结靠记忆复盘的裸奔时代。 Prompt作为AI应用的“事实源代码”,却长期缺乏代码级发布管理。本文提出三段式发布报告(变更台账+回归结论+回滚阈值),通过Git版本化、CI自动校验、相对指标比对与强制回滚锚点,将Prompt变更纳入可追溯、可回滚、可复盘的工程闭环,终结靠记忆复盘的裸奔时代。
- 摘要:2026 年百度职级体系已经正式调整。从 5 月 1 日开始,中管层以下统一使用 5—12 级数字职级,过去大家熟悉的 T、P、E、Band、M 等字母标签不再沿用。([界面新闻][2])这篇不绕旧职级,直接看三个大家最关心的问题:百度现在怎么分级、技术岗薪资大概多少,以及 2026 年百度测试开发到底在面什么。2026 年 4 月,百度宣布调整职级体系;从 5 月 1 日开始,中管层... 摘要:2026 年百度职级体系已经正式调整。从 5 月 1 日开始,中管层以下统一使用 5—12 级数字职级,过去大家熟悉的 T、P、E、Band、M 等字母标签不再沿用。([界面新闻][2])这篇不绕旧职级,直接看三个大家最关心的问题:百度现在怎么分级、技术岗薪资大概多少,以及 2026 年百度测试开发到底在面什么。2026 年 4 月,百度宣布调整职级体系;从 5 月 1 日开始,中管层...
- 从需求追溯到缺陷根因分析,系统梳理软件测试管理系统选型的5大核心维度与4阶段建设路径,并对比Jira+Zephyr、qTest、TestRail、嘉为蓝鲸CTest等主流平台能力,帮助企业构建从需求到发布的全生命周期质量闭环。 从需求追溯到缺陷根因分析,系统梳理软件测试管理系统选型的5大核心维度与4阶段建设路径,并对比Jira+Zephyr、qTest、TestRail、嘉为蓝鲸CTest等主流平台能力,帮助企业构建从需求到发布的全生命周期质量闭环。
- 摘要Agent 越来越容易搭,但真正进入生产环境之后,难点很快就从“能不能跑”变成了“跑得对不对”。模型升级以后效果有没有提升? Prompt 改完会不会引入退化? Tool 调用成功了,为什么最终结果还是错的? 线上出现 Bad Case,到底是模型、Prompt、Skill、RAG 还是工具出了问题?这些问题,本质上已经进入软件质量保障的范畴。对测试开发来说,Agent 评测并不是一套完... 摘要Agent 越来越容易搭,但真正进入生产环境之后,难点很快就从“能不能跑”变成了“跑得对不对”。模型升级以后效果有没有提升? Prompt 改完会不会引入退化? Tool 调用成功了,为什么最终结果还是错的? 线上出现 Bad Case,到底是模型、Prompt、Skill、RAG 还是工具出了问题?这些问题,本质上已经进入软件质量保障的范畴。对测试开发来说,Agent 评测并不是一套完...
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签