登录社区云,与社区用户共同成长
邀请您加入社区
NVIDIA 深度学习培训中心(DLI)提供的《构建基于大语言模型的应用》 AI 培训班即将开课,由 NVIDIA 认证讲师全天实时中文授课和答疑,配合云端实验环境的动手实操帮助每位学员深入理解 LLM 应用开发并积累实践经验,从而快速投入实际开发工作。无论是个人技能跃升还是团队能力建设,NVIDIA 深度学习培训中心(DLI)的生成式 AI 认证学习路径都能为您提供系统支撑 —— 从认证科目选择
NVIDIA 深度学习培训中心(DLI)提供的《利用提示工程构建大语言模型应用》AI 培训班即将开课,由 NVIDIA 认证讲师全天实时中文授课和答疑,配合云端实验环境的动手实操,系统讲解并实践提示工程一系列基本技能,用于高效构建基于 LLM 的应用。使用由 Llama-3.1 LLM 驱动的 NVIDIA NIM,和当前流行的 LangChain 库,学习使用提示工程一系列基本技能,用于构建基于
官方文档:https://developer.download.nvidia.cn/compute/DCGM/docs/nvidia-smi-367.38.pdfNVIDIA-SMI系列命令总结
CLIP(Contrastive Language-Image Pre-Training)模型是一种多模态预训练神经网络,由OpenAI在2021年发布,是从自然语言监督中学习的一种有效且可扩展的方法。CLIP在预训练期间学习执行广泛的任务,包括OCR,地理定位,动作识别,并且在计算效率更高的同时优于公开可用的最佳ImageNet模型。该模型的核心思想是使用大量图像和文本的配对数据进行预训练,以学
【1】 ArtRAG: Retrieval-Augmented Generation with Structured Context for Visual Art Understanding标题: ArtRAG:具有结构化上下文的检索增强生成,用于视觉艺术理解链接:https://arxiv.org/abs/2505.06020作者: Shuai Wang, Ivona Najdenkoska,
**RAG-Anything**是一个综合性多模态文档处理RAG系统。该系统能够无缝处理和查询包含文本、图像、表格、公式等多模态内容的复杂文档,提供完整的检索增强(RAG)生成解决方案。
去年年初LLM刚起步的时候,大模型的部署方案还不是很成熟,如今仅仅过了一年多,LLM部署方案已经遍地都是了。而多模态模型相比大语言模型来说,发展的还没有很“特别”成熟,不过由于两者结构很相似,LLMs的经验还是可以很好地利用到VLMs中。本篇文章中提到的多模态指的是视觉多模态,即VLM(Vision Language Models)。以下用一张图展示下简单多模态模型的运行流程:Text Embed
万字解析:一文读懂当下最火的多模态技术,看这一篇就够了!
1. **提出SHIP范式**:论文提出了协同高阶交互范式(SHIP),创新性地在空间和通道维度引入高阶交互作用,系统地研究多模态图像在空间细粒度和全局统计方面的协作关系,从而全面探索多模态间的协同效应。
watch -n 1 -d nvidia-smi# 每隔1秒刷新一次
美团。阿里关于多模态召回的应用实践
过去一年,多模态大型语言模型(MLLMs)在视觉问答、视觉理解和推理等任务上表现出了显著的性能。然而,庞大的模型大小和高昂的训练和推理成本阻碍了MLLMs在学术界和工业界的广泛应用。因此,研究高效和轻量级的MLLMs具有巨大的潜力,尤其是在边缘计算场景中。在本调查中对高效MLLMs的现状进行了全面而系统的回顾。具体而言,作者。
传统上,AI研究被划分为不同的领域:自然语言处理(NLP)、计算机视觉(CV)、机器人学、人机交互(HCI)等。然而,无数实际任务需要整合这些不同的研究领域,例如自动驾驶汽车(CV + 机器人学)、AI代理(NLP + CV + HCI)、个性化学习(NLP + HCI)等。尽管这些领域旨在解决不同的问题并处理不同的数据类型,但它们都共享一个基本过程。即生成现实世界现象的有用数值表示。历史上,这是
生成式大语言模型的性能评估是模型优化与应用落地的关键环节。通过系统化评估,可精准量化模型在多维能力指标上的表现,为技术迭代提供数据支撑。OpenCompass作为专业的评估平台,集成了完备的评估指标体系与大规模开源数据集,能够全面满足生成式大语言模型的多样化测评需求。本文将基于OpenCompass框架,详细解析生成式大语言模型的标准化评估方法论。
NewBeeNLP原创出品公众号专栏作者@上杉翔二悠闲会·信息检索推荐已经成为许多在线内容共享服务的核心组成部分,从图像、博客公众号、音乐推荐、短视频推荐等等。与传统推荐不...
论文主要提出Q-Former(Lightweight Querying Transformer)用于连接模态之间的gap。BLIP-2整体架构包括三个模块:视觉编码器、视觉和LLM的Adapter(Q-Former)、LLM。其中Q-Former是BLIP-2模型训练过程中主要更新的参数,视觉Encoder和大语言模型LLM在训练过程中冻结参数。
导读近日北航在论文《LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding》介绍了新型多模态大语言模型LLaVA-ST,专门用于处理细粒度的时空理解任务,通过引入语言对齐的位置嵌入(LAPE)和时空打包器(STP),以及一个包含430 万样本的训练数据集ST-Align,
随着多模态大语言模型(Multimodal Large Language Model, MLLM)的迅速发展,基于 MLLM 的多模态智能代理(agent)正在逐步应用于各种实际场景。这种技术的进步让利用多模态 agent 作为手机操作助手成为了现实,通过视觉感知和多模态交互,智能化地完成复杂任务。本文将为您解读一项最新研究——,该研究展示了如何借助多模态 agent 实现 AI 自动操作手机的技
如何解决标准Transformer模型在处理超出训练上下文长度的序列时出现性能衰退?论文提出了一种新的SWAN架构,通过结合不同类型的注意力机制,实现了对长上下文的有效处理,而无需额外的长上下文特定训练。
采用新一代 Blackwell 架构,支持 PCIe 5.0 和 NVLink 5.0,但显存从 H20 的 96GB HBM3(带宽 4.0TB/s)缩水为 GDDR7(带宽 1.8TB/s),计算性能持平或略低于 H20(FP16 算力约 148TFLOPS)。主打大模型轻量推理、中小规模训练等场景。
计划研究多模态知识图谱方向,利用多模态信息:文本+图像+知识图谱+视频+时间序列。。。,来进行一些应用。第一步先进行相关文献的阅读。
***当前市场参与者的发展进展。
Neural4D 2o 是 DreamTech 推出的全球首个支持多模态交互的 3D 大模型。该模型基于文本、图像、3D 和运动数据的联合训练,能够实现3D生成的上下文一致性、高精准局部编辑、角色ID保持等复杂功能。模型原生支持 MCP 协议,通过 Neural4D Agent 提供智能交互体验,让用户通过自然语言指令即可完成高质量的3D内容创作,大幅降低专业3D设计门槛。
Cohere发布开源视觉语言模型Command A Vision(112B参数),在多模态任务中表现卓越,超越GPT-4.1等主流模型。该模型基于Command A构建,采用SigLIP2视觉编码器和三阶段训练流程(对齐、微调、强化学习),在图表分析、文档OCR等企业场景中表现突出。支持低资源部署(2块A100或单张H100),提供Hugging Face和Cohere平台体验入口,赋能企业自动化
未来,NVIDIA 技术专家团队将继续跟进混元模型的演进,探索更极致的推理加速技术(如新一代量化、更精细的算子融合、对 Blackwell 新特性的支持),不断刷新性能天花板。同时还将持续推动 TensorRT-LLM 与腾讯云 TI 平台、Hunyuan API 服务等生态的深度集成,提供更便捷的一站式混元模型部署与管理体验。