登录社区云,与社区用户共同成长
邀请您加入社区
我们使用 GRPO 算法在 Qwen3-8B-Base 模型上运行结果,在部署中应用 FP8,在训练中应用 BF16。虽然对复合错误引起的 KV 缓存和注意力进行量化时,不匹配 KL 差异稍高一些,但我们的方法可以减轻不稳定性。通过启用词元-level 截断重要性采样,用于线性* KV 缓存* 注意力的 FP8 可实现与 BF16 基准和线性层 (W8A8) 的 FP8 的验证准确性对齐。图 6.
AI 和 AR 通过提供超个性化的数字体验 (从虚拟尝试到 AI 驱动的造型) ,正在改变美感和时尚。Perfect Corp. 是 AI 和 AR 美颜技术的全球领导者,利用 NVIDIA 解决方案提高其应用程序的真实感、准确性和性能。Perfect Corp. 使用通过 NVIDIA TensorRT 优化的 AI 模型,能够实现高精度的实时皮肤护理分析和 AI 生成的发型。此外,NVENC
联邦学习 (FL) 不再是研究的好奇心,而是对棘手限制的实际回应:最有价值的数据通常是最不可动的数据。监管边界、数据主权规则和组织风险承受能力通常会阻止集中式聚合。与此同时,纯粹的数据引力使得即使是允许的大规模传输也会变得缓慢、昂贵且脆弱。最新版本的通过联邦计算运行时解决了这一问题,该运行时可将训练逻辑迁移至数据所在位置,而原始数据无需移动。在高风险环境中,集中式数据聚合通常不可行或不现实,因此现
DeepSeek 刚刚发布了第四代旗舰模型,推出和两款产品,均致力于实现高效的百万词元上下文推理。DeepSeek-V4-Pro 是该系列中最大的型号,拥有 1.6 T 的总参数和 49B 的活动参数。DeepSeek-V4-Flash 是一款包含 304B 参数的小型模型,具有 130 亿个活动参数,专为高速、高效的工作负载而设计。这两种模型最高支持 1M-词元上下文窗口,为长上下文编码、文档分
DeepSeek-OCR是深度求索推出的多模态OCR模型,采用上下文光学压缩技术,通过端到端视觉语言架构实现高压缩率(10倍)和高信息保真度(97%)。模型包含DeepEncoder编码器和DeepSeek-3B-MoE解码器,支持多分辨率适配,处理速度快(8.2页/秒),显存占用低(4.5GB)。在多种语言识别、文档解析、结构化数据提取等领域表现优异,适用于法律、金融、物流等场景,显著提升文档处
生成式人工智能(GenAI)作为AI的重要分支,通过GAN和Transformer等深度学习模型实现了内容生成能力。GAN通过生成器与鉴别器的对抗训练生成逼真数据,广泛应用于图像合成等领域;Transformer则利用注意力机制处理序列数据,推动了自然语言处理的突破。当前GenAI已在文本、图像、音频生成方面取得显著成果,但其发展仍面临推理能力不足、跨领域适应性有限等挑战。尽管GenAI展现出强大
多模态AI模型正成为技术新趋势,通过整合文本、图像、音频等数据实现跨模态智能交互。本文系统解析了多模态模型的技术演进(从早期融合到统一Transformer架构)、核心原理(对比学习、跨模态注意力等)和主流模型对比(GPT-4o、Gemini 2.0等)。重点介绍了训练方法与优化策略,包括数据对齐、对比学习和知识蒸馏技术,并提供了电商跨模态检索的实战案例。多模态模型在参数效率、推理速度和应用场景上
当5G网络将工厂设备的振动、温度数据实时传输至云端,当边缘计算节点在50毫秒内完成数据清洗,当AI算法推演设备退化曲线并生成维护指令——物理世界的状态变化即刻触发虚拟模型的同步响应,虚拟空间的决策指令又反向调节物理实体运行参数。数字孪生是物理实体的动态虚拟映射系统,通过物联网传感器实时采集数据,在虚拟空间构建同步演进的数字模型,并借助AI算法实现状态推演与决策优化。与单纯的三维可视化不同,真正的数
随着大模型的迅猛发展,LLM 作为人工智能的核心力量,正以前所未有的方式重塑着我们的生活、学习和工作。无论是智能语音助手、自动驾驶汽车,还是智能决策系统,大模型都是幕后英雄,让这些看似不可思议的事情变为可能。1. LLM基础知识3. RAG的应用4. Agent的应用5. 多模态模型1. LLM基础知识1.1 LLM基本概念从字面意思来讲,LLM 是 Large Language Model 这三
本文深入剖析英伟达H100/H200/H20系列GPU架构设计。H100采用Hopper架构,包含132/114个SM单元(SXM/PCIe版本),每个SM含128个CUDA核心和4个Tensor核心。关键创新包括:900GB/s的NVLink4.0互连、4.8TB/s的HBM显存带宽,以及提升Tensor核心效率的TMA技术。文章详细解析了GPC(GPU处理集群)、TPC(纹理处理集群)和SM(
**摘要:**人工智能正引领农业数字化革命,从传统经验耕作转向数据驱动的精准农业。约68%的美国大型农场已采用数字技术,通过传感器和AI系统优化水肥管理,减少人力依赖的同时提升产量。AI不仅能预测天气和病虫害风险,还可模拟数百万种植方案,开发新型种植模式。全球粮食损失达13亿吨/年,AI技术有望减少浪费并创造千亿美元价值。这场变革不仅构建智能粮食体系,更致力于打造可持续的农业生态,为全球粮食安全提
然而,在目前已经发布的模型中,进行这种直接比较的寥寥无几。文中介绍在多数视觉领域测试中, Molmo 表现更优,Llama 3.2 V 在 MMMU 等文本相关任务中表现更好,目前多模态模型的开源定义仍需进一步探讨和完善,但 Molmo 是目前最接近开源的视觉模型。Ai2 推出了基于 Qwen 2 72B 打造的 Molmo 72B,基于 Qwen 2 7B 的 Molmo-7B-D,即将问世的基
《多模态大语言模型(MLLM)技术综述》 本文系统梳理了多模态大模型的架构、训练与评估方法,适合具备NLP基础的开发者快速入门。核心内容包含: 1️⃣ 模型架构:主流方法分两类——基于统一Embedding拼接的Token级融合(如CLIP+LLM)和跨模态Attention的特征级融合(如交叉注意力机制),二者本质均为对齐多模态表征空间。 2️⃣ 训练策略:三阶段流程(预训练→指令调优→对齐调优
在人工智能和深度学习的快速发展浪潮中,GPU计算能力的提升一直是推动整个行业前进的核心动力。NVIDIA的Tensor Core技术作为现代AI计算的基石,从Volta架构首次引入到最新的Blackwell架构,经历了一场深刻的技术革命。本文将深入探讨这一演进过程,揭示其背后的技术原理、设计哲学和未来发展方向。