- 摘要Agent 越来越容易搭,但真正进入生产环境之后,难点很快就从“能不能跑”变成了“跑得对不对”。模型升级以后效果有没有提升? Prompt 改完会不会引入退化? Tool 调用成功了,为什么最终结果还是错的? 线上出现 Bad Case,到底是模型、Prompt、Skill、RAG 还是工具出了问题?这些问题,本质上已经进入软件质量保障的范畴。对测试开发来说,Agent 评测并不是一套完... 摘要Agent 越来越容易搭,但真正进入生产环境之后,难点很快就从“能不能跑”变成了“跑得对不对”。模型升级以后效果有没有提升? Prompt 改完会不会引入退化? Tool 调用成功了,为什么最终结果还是错的? 线上出现 Bad Case,到底是模型、Prompt、Skill、RAG 还是工具出了问题?这些问题,本质上已经进入软件质量保障的范畴。对测试开发来说,Agent 评测并不是一套完...
- 最近跟几个做测试开发的朋友聊天,发现一个挺有意思的现象:大家都在用 Claude Code、Cursor 这类工具辅助写测试,但用着用着就发现不对劲。有人说他的 Agent 跑个登录测试,在登录页卡了二十分钟——验证码图片识别不了,等了三秒就以为登录失败,直接 abort。还有人让 Agent 从 Jira 拉 bug 列表去验证,生成的代码看起来挺完整,跑起来才发现它不知道 Jira 的字... 最近跟几个做测试开发的朋友聊天,发现一个挺有意思的现象:大家都在用 Claude Code、Cursor 这类工具辅助写测试,但用着用着就发现不对劲。有人说他的 Agent 跑个登录测试,在登录页卡了二十分钟——验证码图片识别不了,等了三秒就以为登录失败,直接 abort。还有人让 Agent 从 Jira 拉 bug 列表去验证,生成的代码看起来挺完整,跑起来才发现它不知道 Jira 的字...
- 去年有段时间,我每天花在写 Prompt 上的时间比写测试代码还多。为了让 AI 帮我生成一批接口测试用例,我得在对话框里反复描述:先调登录接口拿 token,再调业务接口,断言 code=0,data 不能为空,token 字段得是非空字符串……写第一版的时候觉得挺新鲜,写到第五个接口的时候就开始烦了。每次都得把同样的规则重述一遍,稍不留神漏掉一个约束条件,生成的用例就跑偏。更让人头疼的是... 去年有段时间,我每天花在写 Prompt 上的时间比写测试代码还多。为了让 AI 帮我生成一批接口测试用例,我得在对话框里反复描述:先调登录接口拿 token,再调业务接口,断言 code=0,data 不能为空,token 字段得是非空字符串……写第一版的时候觉得挺新鲜,写到第五个接口的时候就开始烦了。每次都得把同样的规则重述一遍,稍不留神漏掉一个约束条件,生成的用例就跑偏。更让人头疼的是...
- 本文拆解NVIDIA Blackwell机密推理实验,强调复现实验需严控变量、同步评估吞吐/TPOT/安全状态与输出质量。指出性能数字不可直接外推,提出四维发布门禁(安全、质量、性能、稳定性),倡导测试工程师构建可复现的差分评测体系。 本文拆解NVIDIA Blackwell机密推理实验,强调复现实验需严控变量、同步评估吞吐/TPOT/安全状态与输出质量。指出性能数字不可直接外推,提出四维发布门禁(安全、质量、性能、稳定性),倡导测试工程师构建可复现的差分评测体系。
- NVIDIA用AI Coding Agent迁移ROS 2节点至CUDA Buffer,实现GPU零拷贝通信。本文强调:功能正确≠优化生效,测试需验证四大维度——语义等价性、CUDA Backend协商、无Payload级CPU拷贝、可靠CPU回退,方为可信迁移。 NVIDIA用AI Coding Agent迁移ROS 2节点至CUDA Buffer,实现GPU零拷贝通信。本文强调:功能正确≠优化生效,测试需验证四大维度——语义等价性、CUDA Backend协商、无Payload级CPU拷贝、可靠CPU回退,方为可信迁移。
- 假设你团队里的AI编码搭档干了一整夜:第二天一早,四十多个PR同时挤进流水线,CI从提交到出结果排起三个小时的队。数字是打的比方,但方向不是危言耸听——当写代码的不再只有人,“每条PR跑全量测试”这条CI铁律,正在以肉眼可见的速度失效。真实的样本来了。Anthropic工程师Sachin Malhotra在2026年9月14日的官方博客里公开了一组数字:Claude编写了公司80%的合并代码... 假设你团队里的AI编码搭档干了一整夜:第二天一早,四十多个PR同时挤进流水线,CI从提交到出结果排起三个小时的队。数字是打的比方,但方向不是危言耸听——当写代码的不再只有人,“每条PR跑全量测试”这条CI铁律,正在以肉眼可见的速度失效。真实的样本来了。Anthropic工程师Sachin Malhotra在2026年9月14日的官方博客里公开了一组数字:Claude编写了公司80%的合并代码...
- 本文探讨AI编程助手时代下测试新范式:将“知识新鲜度”转化为可量化、可回归、可进CI的测试项。通过借鉴Google为Gemini设计的117条Prompt评测框架,提出四维断言(版本/必需接口/禁用接口/来源可溯)、Skill版本化管理及三个轻量落地切入点,助力测试团队构建面向AI代码的可信质量防线。 本文探讨AI编程助手时代下测试新范式:将“知识新鲜度”转化为可量化、可回归、可进CI的测试项。通过借鉴Google为Gemini设计的117条Prompt评测框架,提出四维断言(版本/必需接口/禁用接口/来源可溯)、Skill版本化管理及三个轻量落地切入点,助力测试团队构建面向AI代码的可信质量防线。
- 本文揭示Agent测试核心痛点:答案“看似正确”不等于行为可靠。AWS Agent-EvalKit提出Plan/ Data/ Trace/ Run/ Eval/ Report六阶段评测法,强调基于完整执行轨迹(而非仅最终输出)验证工具调用、参数准确性与事实忠实性,助力测试团队从“测结果”转向“测过程”。 本文揭示Agent测试核心痛点:答案“看似正确”不等于行为可靠。AWS Agent-EvalKit提出Plan/ Data/ Trace/ Run/ Eval/ Report六阶段评测法,强调基于完整执行轨迹(而非仅最终输出)验证工具调用、参数准确性与事实忠实性,助力测试团队从“测结果”转向“测过程”。
- 当前国内移动终端生态已形成 Android、iOS、鸿蒙三大系统并立的格局,移动端设备碎片化不再局限于机型数量,而是演变为“机型×系统版本×硬件配置×厂商定制”的立体化组合难题。屏幕尺寸从4.7英寸到7.6英寸折叠屏,宽高比涵盖16:9、18:9、19.5:9、20:9等多种规格,进一步加剧了APP兼容性问题频发。 当前国内移动终端生态已形成 Android、iOS、鸿蒙三大系统并立的格局,移动端设备碎片化不再局限于机型数量,而是演变为“机型×系统版本×硬件配置×厂商定制”的立体化组合难题。屏幕尺寸从4.7英寸到7.6英寸折叠屏,宽高比涵盖16:9、18:9、19.5:9、20:9等多种规格,进一步加剧了APP兼容性问题频发。
- 模型接入开发工具后,最容易出现一种错觉:代码通过测试,模型就升级成功了。实际上,模型变化可能影响工具选择、修改范围、重试次数、解释方式和成本。GitHub在9月21日宣布Grok 4.7可用于Copilot。本文不评价模型强弱,而是讨论测试团队面对模型切换时,怎样把“能力变化”变成可观察的质量差异。 先做任务分层解释代码、生成单元测试、修改支付逻辑、更新依赖和调用部署工具,不应混成一个总分。... 模型接入开发工具后,最容易出现一种错觉:代码通过测试,模型就升级成功了。实际上,模型变化可能影响工具选择、修改范围、重试次数、解释方式和成本。GitHub在9月21日宣布Grok 4.7可用于Copilot。本文不评价模型强弱,而是讨论测试团队面对模型切换时,怎样把“能力变化”变成可观察的质量差异。 先做任务分层解释代码、生成单元测试、修改支付逻辑、更新依赖和调用部署工具,不应混成一个总分。...
- 本文探讨GitHub凭据治理的实战难点:旧Token潜藏于CI变量、脚本或缓存中,贸然删除易中断发布。提出以“使用证明”替代主观判断,构建“发现—确认—轮换—撤销—验证”可回归流程,并强调测试需覆盖权限边界、失效验证与Agent最小权限行为,推动凭据治理从清单管理升级为行为可证、过程可溯的质量工程。 本文探讨GitHub凭据治理的实战难点:旧Token潜藏于CI变量、脚本或缓存中,贸然删除易中断发布。提出以“使用证明”替代主观判断,构建“发现—确认—轮换—撤销—验证”可回归流程,并强调测试需覆盖权限边界、失效验证与Agent最小权限行为,推动凭据治理从清单管理升级为行为可证、过程可溯的质量工程。
- GitHub 9月更新AI Scan,无需启用CodeQL默认配置即可覆盖更多仓库。本文聚焦覆盖扩大后的关键挑战:构建可解释漏洞样本、设计误报门禁、开展仓库级回归测试,确保AI扫描结果可信、可控、可度量。 GitHub 9月更新AI Scan,无需启用CodeQL默认配置即可覆盖更多仓库。本文聚焦覆盖扩大后的关键挑战:构建可解释漏洞样本、设计误报门禁、开展仓库级回归测试,确保AI扫描结果可信、可控、可度量。
- GitHub 9月18日推出Agent会话自动清理预览功能:PR合并后标记Done,宽限期后删除。但清理本质是审计生命周期管理,需覆盖多状态(如Legal Hold、回滚)、幂等删除、脱敏归档与可恢复验证,确保证据不丢、隐私不留。 GitHub 9月18日推出Agent会话自动清理预览功能:PR合并后标记Done,宽限期后删除。但清理本质是审计生命周期管理,需覆盖多状态(如Legal Hold、回滚)、幂等删除、脱敏归档与可恢复验证,确保证据不丢、隐私不留。
- GitHub Copilot 新增 efficiency/balance/intelligence 三档自动路由,按任务风险分层管控模型选择、成本与行为可靠性。测试需聚焦路由契约、故障转移、档位门禁及多维断言,而非仅看平均成功率。 GitHub Copilot 新增 efficiency/balance/intelligence 三档自动路由,按任务风险分层管控模型选择、成本与行为可靠性。测试需聚焦路由契约、故障转移、档位门禁及多维断言,而非仅看平均成功率。
- 摘要:Agent 能力越来越多以后,一个很现实的问题开始出现:到底该调用哪个 Tool、加载哪个 Skill、连接哪个 MCP?5 个工具时,让 LLM 自己选可能没什么问题。但当能力数量变成 50 个、100 个甚至更多,路由本身就开始成为 Agent Harness 的核心问题。而 Jev 这类 Decision Model,正在尝试接管其中一部分工作。一、Agent 的问题,开始从“没... 摘要:Agent 能力越来越多以后,一个很现实的问题开始出现:到底该调用哪个 Tool、加载哪个 Skill、连接哪个 MCP?5 个工具时,让 LLM 自己选可能没什么问题。但当能力数量变成 50 个、100 个甚至更多,路由本身就开始成为 Agent Harness 的核心问题。而 Jev 这类 Decision Model,正在尝试接管其中一部分工作。一、Agent 的问题,开始从“没...
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签