- Gensim 简介Gensim (Generate Similar) 是一个功能强大且高效的Python库,专门用于处理原始的、非结构化的纯文本文档。它内置了多种主流的词向量和主题模型算法,如 Word2Vec、TF-IDF、LSA、LDA 等。 核心概念语料库:这是 Gensim 处理的主要对象,可以简单理解为训练数据集。分词后的文档通常表示为 list[list[str]];用于 TF... Gensim 简介Gensim (Generate Similar) 是一个功能强大且高效的Python库,专门用于处理原始的、非结构化的纯文本文档。它内置了多种主流的词向量和主题模型算法,如 Word2Vec、TF-IDF、LSA、LDA 等。 核心概念语料库:这是 Gensim 处理的主要对象,可以简单理解为训练数据集。分词后的文档通常表示为 list[list[str]];用于 TF...
- 概述Word2Vec 通常被认为是一种浅层神经网络模型(Shallow Neural Network)。其"浅层"体现在网络结构的简单性上,它移除了传统神经概率语言模型(NNLM)中计算昂贵的非线性隐藏层,直接将投影层与输出层相连。这种简洁的设计使得 Word2Vec 的计算非常高效,从而能够在大规模语料库上进行训练。 目标与手段分离理解Word2Vec的关键在于区分其最终目标与实现手段。... 概述Word2Vec 通常被认为是一种浅层神经网络模型(Shallow Neural Network)。其"浅层"体现在网络结构的简单性上,它移除了传统神经概率语言模型(NNLM)中计算昂贵的非线性隐藏层,直接将投影层与输出层相连。这种简洁的设计使得 Word2Vec 的计算非常高效,从而能够在大规模语料库上进行训练。 目标与手段分离理解Word2Vec的关键在于区分其最终目标与实现手段。...
- 引言机器学习和深度学习模型,无论结构多么复杂,其处理的输入都必须是数值形式——具体来说,是由数字组成的特征向量或矩阵。因此,在分词之后,必须将这些词元转换为模型可以"消化"的数字形式。这个过程称为词向量表示 (Word Representation) 。词嵌入 (Word Embedding) 通常特指通过神经网络学习得到的稠密向量表示,是词向量表示的一个重要子集。 为什么需要模型无法直接... 引言机器学习和深度学习模型,无论结构多么复杂,其处理的输入都必须是数值形式——具体来说,是由数字组成的特征向量或矩阵。因此,在分词之后,必须将这些词元转换为模型可以"消化"的数字形式。这个过程称为词向量表示 (Word Representation) 。词嵌入 (Word Embedding) 通常特指通过神经网络学习得到的稠密向量表示,是词向量表示的一个重要子集。 为什么需要模型无法直接...
- 本文阐述了AI时代测试工程师的能力模型转型。AI测试的核心不是验证功能,而是保障不确定系统的确定性,重点关注输出稳定性、行为可预测性和风险兜底能力。测试人员需具备看懂模型、以数据为用例、构建智能化自动化平台三大核心能力,形成完整工程闭环,从功能执行者转变为保障AI系统可靠的工程架构师,这正是新时代测试工程师的核心价值。 本文阐述了AI时代测试工程师的能力模型转型。AI测试的核心不是验证功能,而是保障不确定系统的确定性,重点关注输出稳定性、行为可预测性和风险兜底能力。测试人员需具备看懂模型、以数据为用例、构建智能化自动化平台三大核心能力,形成完整工程闭环,从功能执行者转变为保障AI系统可靠的工程架构师,这正是新时代测试工程师的核心价值。
- GLM-4.7的发布标志着大模型竞争进入工程化落地新阶段。其核心突破并非单纯参数增长,而是通过交织式思考等机制,显著提升了代码生成与多步任务执行(Agent)的稳定性和可交付性。智谱采用“先验证再上桌”的严谨数据筛选策略,并配套开源强化学习框架Slime,将模型训练打造成系统工程。这预示着未来竞争焦点将从“模型更聪明”转向“体系更可靠、更能干活”。 GLM-4.7的发布标志着大模型竞争进入工程化落地新阶段。其核心突破并非单纯参数增长,而是通过交织式思考等机制,显著提升了代码生成与多步任务执行(Agent)的稳定性和可交付性。智谱采用“先验证再上桌”的严谨数据筛选策略,并配套开源强化学习框架Slime,将模型训练打造成系统工程。这预示着未来竞争焦点将从“模型更聪明”转向“体系更可靠、更能干活”。
- GLM-4.7的发布标志着大模型竞争进入工程化落地新阶段。其核心突破并非单纯参数增长,而是通过交织式思考等机制,显著提升了代码生成与多步任务执行(Agent)的稳定性和可交付性。智谱采用“先验证再上桌”的严谨数据筛选策略,并配套开源强化学习框架Slime,将模型训练打造成系统工程。这预示着未来竞争焦点将从“模型更聪明”转向“体系更可靠、更能干活” GLM-4.7的发布标志着大模型竞争进入工程化落地新阶段。其核心突破并非单纯参数增长,而是通过交织式思考等机制,显著提升了代码生成与多步任务执行(Agent)的稳定性和可交付性。智谱采用“先验证再上桌”的严谨数据筛选策略,并配套开源强化学习框架Slime,将模型训练打造成系统工程。这预示着未来竞争焦点将从“模型更聪明”转向“体系更可靠、更能干活”
- 本文阐述了AI时代测试工程师的能力模型转型。AI测试的核心不是验证功能,而是保障不确定系统的确定性,重点关注输出稳定性、行为可预测性和风险兜底能力。测试人员需具备看懂模型、以数据为用例、构建智能化自动化平台三大核心能力,形成完整工程闭环,从功能执行者转变为保障AI系统可靠的工程架构师,这正是新时代测试工程师的核心价值。 本文阐述了AI时代测试工程师的能力模型转型。AI测试的核心不是验证功能,而是保障不确定系统的确定性,重点关注输出稳定性、行为可预测性和风险兜底能力。测试人员需具备看懂模型、以数据为用例、构建智能化自动化平台三大核心能力,形成完整工程闭环,从功能执行者转变为保障AI系统可靠的工程架构师,这正是新时代测试工程师的核心价值。
- RAG实战指南:三招突破“幻觉”瓶颈,让你的LLM比ChatGPT更懂你的业务数据摘要(198字)作为拥有10年NLP经验的AI架构师,我上周在某大型商业银行项目中遭遇了35.7%的LLM幻觉率危机——系统竟将"贷款利率"错误生成为"存款利率"。本文基于真实企业级落地经验,深度剖析RAG技术中"幻觉"问题的三大根源,并提出三招突破性解决方案:混合检索增强、上下文感知重构和动态验证机制。通过... RAG实战指南:三招突破“幻觉”瓶颈,让你的LLM比ChatGPT更懂你的业务数据摘要(198字)作为拥有10年NLP经验的AI架构师,我上周在某大型商业银行项目中遭遇了35.7%的LLM幻觉率危机——系统竟将"贷款利率"错误生成为"存款利率"。本文基于真实企业级落地经验,深度剖析RAG技术中"幻觉"问题的三大根源,并提出三招突破性解决方案:混合检索增强、上下文感知重构和动态验证机制。通过...
- 厌倦了冗长又主观的MBTI选择题?我们开发了一个只需回答8个问题的AI模型,通过自然对话分析你的语言风格与思维模式,即可判断你的真实MBTI人格类型,准确率达99%。无需自我评价、不受情绪干扰,在轻松聊天中就能看清你的性格底色。 厌倦了冗长又主观的MBTI选择题?我们开发了一个只需回答8个问题的AI模型,通过自然对话分析你的语言风格与思维模式,即可判断你的真实MBTI人格类型,准确率达99%。无需自我评价、不受情绪干扰,在轻松聊天中就能看清你的性格底色。
- 1. 项目介绍 ProPainter是一个去掉视频里的静止和移动水印图像的AI项目。ProPainter项目地址:https://github.com/sczhou/ProPainter。 经过改写的资源包propainter_ascend20251029.zip支持使用昇腾910B显卡训练ProPainter,里面包含改写后的代码,已标注的训练数据(包括训练集和验证集)。 2. 安装训练环... 1. 项目介绍 ProPainter是一个去掉视频里的静止和移动水印图像的AI项目。ProPainter项目地址:https://github.com/sczhou/ProPainter。 经过改写的资源包propainter_ascend20251029.zip支持使用昇腾910B显卡训练ProPainter,里面包含改写后的代码,已标注的训练数据(包括训练集和验证集)。 2. 安装训练环...
- 检查环境1、SSH登录机器后,检查NPU设备状态。运行如下命令,返回NPU设备信息。npu-smi info # 在每个实例节点上运行此命令可以看到NPU卡状态npu-smi info -l | grep Total # 在每个实例节点上运行此命令可以看到总卡数,用来确认对应卡数已经挂载npu-smi info -t board -i 1 | eg... 检查环境1、SSH登录机器后,检查NPU设备状态。运行如下命令,返回NPU设备信息。npu-smi info # 在每个实例节点上运行此命令可以看到NPU卡状态npu-smi info -l | grep Total # 在每个实例节点上运行此命令可以看到总卡数,用来确认对应卡数已经挂载npu-smi info -t board -i 1 | eg...
- 如果我要学习大模型技术,按照原来的学习方式,我需要先读谷歌的论文《Attention is all you need》,然后学习Transformer原理,然后上网搜demo,运行,到最后理解,整个过程大约需要2周,前提是还得懂得机器学习、深度学习的基本原理和实操代码。 我尝试用AI来学习大模型,大约前后用了两天时间。首先直接问通义千问,让其中英文对照并详细解释论文《Attenti... 如果我要学习大模型技术,按照原来的学习方式,我需要先读谷歌的论文《Attention is all you need》,然后学习Transformer原理,然后上网搜demo,运行,到最后理解,整个过程大约需要2周,前提是还得懂得机器学习、深度学习的基本原理和实操代码。 我尝试用AI来学习大模型,大约前后用了两天时间。首先直接问通义千问,让其中英文对照并详细解释论文《Attenti...
- 基于 YOLOv8 的学生课堂行为检测-完整项目源码 一、问题背景:为什么要做“课堂行为识别”在智慧校园和数字化教学逐步落地的过程中,课堂行为数据正在从“不可量化”走向“可分析、可追溯、可评估”。在真实教学场景中,教师和管理者往往关注以下问题:学生是否专注听讲?是否存在频繁低头、趴桌、玩手机等行为?课堂互动(举手、回答问题)是否足够积极?不同时间段、不同课程的学习状态差异如何?传统方式主要... 基于 YOLOv8 的学生课堂行为检测-完整项目源码 一、问题背景:为什么要做“课堂行为识别”在智慧校园和数字化教学逐步落地的过程中,课堂行为数据正在从“不可量化”走向“可分析、可追溯、可评估”。在真实教学场景中,教师和管理者往往关注以下问题:学生是否专注听讲?是否存在频繁低头、趴桌、玩手机等行为?课堂互动(举手、回答问题)是否足够积极?不同时间段、不同课程的学习状态差异如何?传统方式主要...
- 实现 千人千面 功能的过程中,涉及到多种机器学习算法,这些算法可以根据用户的历史行为、偏好、社交网络等多维度数据来预测用户可能感兴趣的内容或商品。以下是一些常见的机器学习算法,它们在构建个性化推荐系统中扮演重要角色: 1. 协同过滤(Collaborative Filtering)协同过滤是推荐系统中最常用的技术之一,主要分为两类:用户基于(User-Based)和物品基于(Item-Bas... 实现 千人千面 功能的过程中,涉及到多种机器学习算法,这些算法可以根据用户的历史行为、偏好、社交网络等多维度数据来预测用户可能感兴趣的内容或商品。以下是一些常见的机器学习算法,它们在构建个性化推荐系统中扮演重要角色: 1. 协同过滤(Collaborative Filtering)协同过滤是推荐系统中最常用的技术之一,主要分为两类:用户基于(User-Based)和物品基于(Item-Bas...
- NPP Temperate Forest: Humboldt Redwoods State Park, California, USA, 1972-2001, R1简介该数据集包含加利福尼亚州洪堡红杉州立公园布尔溪一片老龄红杉林的立地特征、林分描述符,以及实测和计算的地上生物量、地上净初级生产力(ANPP)和木质碎屑输入数据。该数据集包含一个数据文件(.csv 格式)。通过树木重测(19... NPP Temperate Forest: Humboldt Redwoods State Park, California, USA, 1972-2001, R1简介该数据集包含加利福尼亚州洪堡红杉州立公园布尔溪一片老龄红杉林的立地特征、林分描述符,以及实测和计算的地上生物量、地上净初级生产力(ANPP)和木质碎屑输入数据。该数据集包含一个数据文件(.csv 格式)。通过树木重测(19...
上滑加载中
推荐直播
-
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
华为云开发者AI素养直播课·第五期2026/09/04 周五 16:00-18:00
林华鼎-华为云AI开发者运营负责人;蒋春阳-华为云AI开发者案例开发专家
本期直播内容: AI工具体验营 · 第5-8课连讲。Agent-Team 多智能体协作完成毕业设计实践
回顾中 -
华为云开发者AI素养ClassRoom·第六期2026/09/08 周二 19:00-20:00
樊渊-2026华为软件挑战赛冠军
高手来了:看软挑高手解析二维排样问题—从工业难题到算法突破
回顾中
热门标签