- Qwen3-4B分布式全参微调实践 Qwen3-4B分布式全参微调实践
- Qwen/Qwen3-0.6B 全参数微调需要的显卡内存接近30GB,无法在RTX3060显卡上面进行微调。所以本文基于 TRL 中用于监督微调的 SFT Trainer 和 Unsloth(QLoRA)工具,在RTX3060显卡上面实现 Qwen/Qwen3-0.6B 的参数高效微调。 Qwen/Qwen3-0.6B 全参数微调需要的显卡内存接近30GB,无法在RTX3060显卡上面进行微调。所以本文基于 TRL 中用于监督微调的 SFT Trainer 和 Unsloth(QLoRA)工具,在RTX3060显卡上面实现 Qwen/Qwen3-0.6B 的参数高效微调。
- Qwen/Qwen3-0.6B 全参数微调需要的显卡内存接近30GB,无法在RTX3060显卡上面进行微调。所以本文基于 TRL 中用于监督微调的 SFT Trainer 和 PEFT(QLoRA)工具,在RTX3060显卡上面实现 Qwen/Qwen3-0.6B 的参数高效微调。 Qwen/Qwen3-0.6B 全参数微调需要的显卡内存接近30GB,无法在RTX3060显卡上面进行微调。所以本文基于 TRL 中用于监督微调的 SFT Trainer 和 PEFT(QLoRA)工具,在RTX3060显卡上面实现 Qwen/Qwen3-0.6B 的参数高效微调。
- Qwen/Qwen3-0.6B 全参数微调需要的显卡内存接近30GB,无法在RTX3060显卡上面进行微调。所以本文基于 TRL 中用于监督微调的 SFT Trainer 和 PEFT(LoRA) 工具,在RTX3060显卡上面实现 Qwen/Qwen3-0.6B 的参数高效微调。 Qwen/Qwen3-0.6B 全参数微调需要的显卡内存接近30GB,无法在RTX3060显卡上面进行微调。所以本文基于 TRL 中用于监督微调的 SFT Trainer 和 PEFT(LoRA) 工具,在RTX3060显卡上面实现 Qwen/Qwen3-0.6B 的参数高效微调。
- 本文基于 TRL 中用于监督微调的 SFT Trainer 工具,实现 Qwen/Qwen3-0.6B 的全参微调。 本文基于 TRL 中用于监督微调的 SFT Trainer 工具,实现 Qwen/Qwen3-0.6B 的全参微调。
- TRL提供的用于监督微调的 SFT Trainer 工具,可以实现全参数微调和参数高效微调。 TRL提供的用于监督微调的 SFT Trainer 工具,可以实现全参数微调和参数高效微调。
- “混合”精度的精髓在于:用高精度(FP32)保证关键信息的准确性,用低精度(FP16/BF16)加速大部分运算和节省显存。 “混合”精度的精髓在于:用高精度(FP32)保证关键信息的准确性,用低精度(FP16/BF16)加速大部分运算和节省显存。
- 优化器(Optimizer)是一种用于调整神经网络参数(权重和偏置),用来最小化目标函数(如损失函数)的迭代优化算法。它决定了模型如何根据计算出的梯度来更新参数,是模型训练的核心组件。 优化器(Optimizer)是一种用于调整神经网络参数(权重和偏置),用来最小化目标函数(如损失函数)的迭代优化算法。它决定了模型如何根据计算出的梯度来更新参数,是模型训练的核心组件。
- 在标准数据并行中,每个设备都保存完整的模型状态,导致跨设备的冗余存储,并严重限制了可训练模型的规模(模型的规模受到显卡的限制,无法训练大规模参数的模型)。ZeRO的主要是为解决在标准数据并行中跨设备的冗余存储的问题。 在标准数据并行中,每个设备都保存完整的模型状态,导致跨设备的冗余存储,并严重限制了可训练模型的规模(模型的规模受到显卡的限制,无法训练大规模参数的模型)。ZeRO的主要是为解决在标准数据并行中跨设备的冗余存储的问题。
- MindSpore 强化学习实战 一、引言强化学习(Reinforcement Learning,RL)是机器学习领域三大分支之一,与监督学习和无监督学习并列。与监督学习不同,强化学习强调智能体(Agent)通过与环境(Environment)的持续交互来学习最优策略。在每一轮交互中,智能体根据当前状态(State)选择动作(Action),环境随后返回新的状态和奖励(Reward),智能... MindSpore 强化学习实战 一、引言强化学习(Reinforcement Learning,RL)是机器学习领域三大分支之一,与监督学习和无监督学习并列。与监督学习不同,强化学习强调智能体(Agent)通过与环境(Environment)的持续交互来学习最优策略。在每一轮交互中,智能体根据当前状态(State)选择动作(Action),环境随后返回新的状态和奖励(Reward),智能...
- 显存的消耗主要由以下五部分组成:模型参数(Model Weights)、梯度(Gradients)、优化器状态(Optimizer States)、激活值(Activations) 以及 其他运行时开销(Runtime Overhead)。 显存的消耗主要由以下五部分组成:模型参数(Model Weights)、梯度(Gradients)、优化器状态(Optimizer States)、激活值(Activations) 以及 其他运行时开销(Runtime Overhead)。
- 通过各种形式的切分,将模型以及数据分配到其他GPU硬件,从而突破单设备在模型容量上的限制,使训练超大规模模型成为可能。 通过各种形式的切分,将模型以及数据分配到其他GPU硬件,从而突破单设备在模型容量上的限制,使训练超大规模模型成为可能。
- 数据并行通过将需要训练的数据分摊给其他的GPU硬件,从而加快整体训练速度。 数据并行通过将需要训练的数据分摊给其他的GPU硬件,从而加快整体训练速度。
- 当前大语言模型虽然在通用场景下展现出强大的语言理解与生成能力。但是当应用于特定行业、专业任务或独特语境时,其表现可能无法直接满足实际需求。为了提升模型在具体业务场景中的适用性、稳定性与输出质量,需要对其进行针对性的调整与增强。 当前大语言模型虽然在通用场景下展现出强大的语言理解与生成能力。但是当应用于特定行业、专业任务或独特语境时,其表现可能无法直接满足实际需求。为了提升模型在具体业务场景中的适用性、稳定性与输出质量,需要对其进行针对性的调整与增强。
- 残差结构与归一化机制是Transformer稳定训练的基础。 残差结构与归一化机制是Transformer稳定训练的基础。
上滑加载中
推荐直播
-
用码道,让你的AI作品三步上朋友圈2026/08/04 周二 19:00-20:00
林华鼎-华为云AI开发者运营负责人
从入门 · 到做AI应用 · 到企业级开发。不教编程,只教用AI · 零代码、有产出、能带走、可炫耀 · 每课人人动手实操
回顾中 -
华为云码道Agent集成与鸿蒙实战2026/08/11 周二 19:00-21:00
王一男-华为云码道产品规划专家;李炎-华为云码道产品专家;彭江敏-华为云鸿蒙端云一体化开发专家
本次直播带你解读华为云码道7月份产品新特性、新功能。更有专家演示码道Agent Space × 钉钉机器集成实战,从0到1打通消息通道;码道鸿蒙端云一体化实战,快速搭建员工签到系统。
回顾中 -
基于华为云码道,构建你的定制化AI搭子2026/08/14 周五 09:00-11:30
明亮-华为云开发者发展与支持部部长
本期直播将向您全面介绍华为云码道产品,并基于码道手把手教你部署自己的定制化AI陪伴搭子。
回顾中
热门标签