登录社区云,与社区用户共同成长
邀请您加入社区
NVIDIA 深度学习培训中心(DLI)提供的《构建基于大语言模型的应用》 AI 培训班即将开课,由 NVIDIA 认证讲师全天实时中文授课和答疑,配合云端实验环境的动手实操帮助每位学员深入理解 LLM 应用开发并积累实践经验,从而快速投入实际开发工作。无论是个人技能跃升还是团队能力建设,NVIDIA 深度学习培训中心(DLI)的生成式 AI 认证学习路径都能为您提供系统支撑 —— 从认证科目选择
NVIDIA 深度学习培训中心(DLI)提供的《利用提示工程构建大语言模型应用》AI 培训班即将开课,由 NVIDIA 认证讲师全天实时中文授课和答疑,配合云端实验环境的动手实操,系统讲解并实践提示工程一系列基本技能,用于高效构建基于 LLM 的应用。使用由 Llama-3.1 LLM 驱动的 NVIDIA NIM,和当前流行的 LangChain 库,学习使用提示工程一系列基本技能,用于构建基于
大模型如火如荼,研究者们已经不再满足于基本文本的大语言模型(LLM, Large Language Model),AI领域的热点正逐步向多模态转移,具备多模态能力的多模态大型语言模型(MM(Multi-Modal)-LLM)就成了一个备受关注的研究主题。
24年12月来自清华的论文“Doe-1: Closed-Loop Autonomous Driving with Large World Model”。端到端自动驾驶因其从大量数据中学习的潜力而受到越来越多的关注。然而,大多数现有方法仍然是开环的,并且存在可扩展性弱、缺乏高阶交互和决策效率低下的问题。本文探索自动驾驶的闭环框架,并提出一个大型驾驶世界模型(Doe-1)用于统一感知、预测和规划。将自
多模态大型语言模型(Multimodal Large Language Models, MLLM)的出现是建立在大型语言模型(Large Language Models, LLM)和大型视觉模型(Large Vision Models, LVM)领域不断突破的基础上的。随着 LLM 在语言理解和推理能力上的逐步增强,指令微调、上下文学习和思维链工具的应用愈加广泛。然而,尽管 LLM 在处理语言任务
如果需要安装额外的依赖,可以参考。请确保使用 Dockerfile 制作镜像时在 Xinference 项目的根目录下。
在实际的测试过程中,我根据今年工创赛智能救援赛题小球识别进行测试,在Jetson Orin Nano 4GB 推理 qwen2:1.5b,通过TensorRT加速YoloV5,已检测图像中的小球,返回小球中心点的信息(包括坐标、类别),在通过TensorRT LLM 解析目标信息,根据赛题需求,根据小球与安全区的相对位置,给出最终决策。通过结合视觉理解(YOLO)和语言生成(LLM),可以实现更复
TensorRTLLM 1.0 实战
**RAG-Anything**是一个综合性多模态文档处理RAG系统。该系统能够无缝处理和查询包含文本、图像、表格、公式等多模态内容的复杂文档,提供完整的检索增强(RAG)生成解决方案。
万字解析:一文读懂当下最火的多模态技术,看这一篇就够了!
一款综合多模态文档处理RAG系统:RAG-Anything,可以无缝处理/查询文本、图像、表格、公式等复杂文档。
1. **提出SHIP范式**:论文提出了协同高阶交互范式(SHIP),创新性地在空间和通道维度引入高阶交互作用,系统地研究多模态图像在空间细粒度和全局统计方面的协作关系,从而全面探索多模态间的协同效应。
文章链接:https://arxiv.org/pdf/2502.19854项目链接:https://github.com/AWCXV/GIFNet图像融合范式通常可以定义为:其中, 和 是输入图像, 表示图像融合方法, 是融合后的图像。最近的方法通常结合高层次视觉任务的语义信息来进行多模态图像融合(IVIF)模型,旨在提高性能。然而,这种范式可能会带来图像质量下降、计算成本增加和泛化能力有限的风险
过去一年,多模态大型语言模型(MLLMs)在视觉问答、视觉理解和推理等任务上表现出了显著的性能。然而,庞大的模型大小和高昂的训练和推理成本阻碍了MLLMs在学术界和工业界的广泛应用。因此,研究高效和轻量级的MLLMs具有巨大的潜力,尤其是在边缘计算场景中。在本调查中对高效MLLMs的现状进行了全面而系统的回顾。具体而言,作者。
AI大模型与仿真测试契合度非常高,从某种意义上来讲,仿真本身就是在做生成数据的事情。当然也有业内仿真专家持不同意见,他们认为,使用大模型的核心目的不是为了生成新的数据,而是帮助用户更快捷地通过自然语言的方式提高场景制作的效率。仿真测试基本都是建立在物理学的基础之上,现在AI也开始逐渐渗透并融入到仿真测试之中。“AI和物理科学其实就是描述世界本质的两种不同方式:一种是用近似的方式;另外一种是用抽象的
生成式大语言模型的性能评估是模型优化与应用落地的关键环节。通过系统化评估,可精准量化模型在多维能力指标上的表现,为技术迭代提供数据支撑。OpenCompass作为专业的评估平台,集成了完备的评估指标体系与大规模开源数据集,能够全面满足生成式大语言模型的多样化测评需求。本文将基于OpenCompass框架,详细解析生成式大语言模型的标准化评估方法论。
论文主要提出Q-Former(Lightweight Querying Transformer)用于连接模态之间的gap。BLIP-2整体架构包括三个模块:视觉编码器、视觉和LLM的Adapter(Q-Former)、LLM。其中Q-Former是BLIP-2模型训练过程中主要更新的参数,视觉Encoder和大语言模型LLM在训练过程中冻结参数。
25年3月来自慕尼黑工大和慕尼黑大学的论文“OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model”。OpenDriveVLA,一种专为端到端自动驾驶而设计的视觉-语言-动作 (VLA) 模型。OpenDriveVLA 以开源预训练大型视觉-语言模型 (VLM) 为基础,
Retrieval Augmented Generation,检索增强生成。是一种结合了信息检索技术和大型语言模型提示功能的框架。它通过从数据源检索信息来辅助LLM生成答案,提高了模型在知识密集型任务中的准确性和可信度。
导读近日北航在论文《LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding》介绍了新型多模态大语言模型LLaVA-ST,专门用于处理细粒度的时空理解任务,通过引入语言对齐的位置嵌入(LAPE)和时空打包器(STP),以及一个包含430 万样本的训练数据集ST-Align,
随着多模态大语言模型(Multimodal Large Language Model, MLLM)的迅速发展,基于 MLLM 的多模态智能代理(agent)正在逐步应用于各种实际场景。这种技术的进步让利用多模态 agent 作为手机操作助手成为了现实,通过视觉感知和多模态交互,智能化地完成复杂任务。本文将为您解读一项最新研究——,该研究展示了如何借助多模态 agent 实现 AI 自动操作手机的技
前段时间,李沐在上交大演讲谈到,多模态是AI领域的下一个趋势,其中尤其值得关注!实际上,不仅李沐看好,北大高文院士团队、微软亚洲研究院等也都在争先研究!各大顶会自然也少不了其身影。比如最新公布的NeurIPS24便有多篇成果!其中模型CMG,更是在跨模态事件定位任务中,实现了准确率提升47.7%的拔群效果!主要在于,其能够利用文本、图像、音频等多种类型的数据模态,在海量无标注的数据上进行预训练。从
如何解决标准Transformer模型在处理超出训练上下文长度的序列时出现性能衰退?论文提出了一种新的SWAN架构,通过结合不同类型的注意力机制,实现了对长上下文的有效处理,而无需额外的长上下文特定训练。
最近多模态模型特别火,从头开始学习!在前面写的几篇里面学习了MiniCPM-V、ViT、CLIP和BLIP之后,今天学习一下BLIP-2模型,记录学习过程,主要是模型架构、训练方式和相关源代码的理解。欢迎批评指正,一起学习~~
知识最终应用于聊天机器人、智能客服、数据分析、情绪感知、智能推荐、可视化图表、深度思考等场景,实现多模态 AI 的实际价值。
在我们深入讨论多模 RAG 之前,让我们简要地回顾一下传统的检索增强生成(RAG)。基本上,RAG 的理念是找到与用户查询相关的信息,然后将该信息注入到提示中,并将其传递给语言模型。RAG 系统的检索通常是语义相关的,因为使用了“嵌入”。基本上,embedding嵌入使我们可以将 AI 模型将信息转换为某种表示该信息的向量。这个过程是通过一组参考文档以及用户的查询来完成的。可以计算这些向量之间的距
人类的沟通交流充满了多模态的信息。为了与他人进行有效沟通,我们既使用言语语言,也使用身体语言,比如手势、面部表情、身体姿势和情绪表达。因此,为了理解和生成人类动作,理解这些多模态的行为至关重要,而且这一研究方向最近受到的关注也越来越多。而多模态语言模型看起来颇具潜力,可将多种模态的不同任务统一在一个框架下。近日,斯坦福大学李飞飞、Gordon Wetzstein 和 Ehsan Adeli领导的一
摘要:CLIP是由OpenAI开发的多模态预训练模型,通过对比学习将图像和文本映射到共享的嵌入空间,使语义相近的内容向量距离更近。它由图像编码器(ResNet/ViT)和文本编码器(Transformer)组成,使用InfoNCE损失优化图文匹配。CLIP可直接应用于图文检索、零样本分类,或作为特征提取器支持扩散模型(如Stable Diffusion)和多模态大模型(如LLaVA)。其训练基于4
半自动生成的细胞核实例分割和分类数据集,包含 19 种不同组织类型的详尽细胞核标签。该数据集由 481 个视野组成,其中 312 个视野是从多个数据源的 20K 多个不同放大倍率的整张幻灯片图像中随机采样的。该数据集总共包含 205,343 个标记的核,每个核都有一个实例分割掩码。数据集里有1万份来自实际生产中有瑕疵的铝型材监测影像数据,每个影像包含一个或多种瑕疵。从4个数据集收集8366样本,涵
本文介绍了如何利用Dify平台部署开源多模态模型LLaVA。LLaVA是由微软与威斯康星大学联合开发的支持文本和图像理解的多模态AI,其特点包括:基于Vicuna/LLaMA2等开源模型、支持图像描述/视觉问答等任务、可在消费级GPU运行。部署步骤包含:1)通过Ollama拉取LLaVA-7B模型;2)在Dify中配置支持视觉的模型参数;3)创建工作流时启用文件上传功能,直接连接LLM节点处理图像
多模态大语言模型(MLLMs)的快速进步展示了它们在各个应用领域中的显著能力。然而,多图像理解场景仍然是一个重要但尚未充分探索的方面。特别是,将 MLLMs 的应用场景扩展到理解更长的视频、更高分辨率的图像以及基于更多历史信息的决策,对于提升用户体验和进一步拓展 MLLMs 的应用范围至关重要。然而,将 MLLM 的上下文长度扩展以提高其可用性,面临着处理更多图像时性能下降和计算成本高昂的挑战。一
***当前市场参与者的发展进展。
《InternVid:大规模视频-文本数据集助力多模态理解与生成》 摘要:本文介绍了大规模视频-文本数据集InternVid,包含700万视频(76万小时)和2.34亿个片段,配有41亿词的详细描述。针对现有数据集视频文本相关性不足的问题,研究者创新性地利用LLM构建高质量数据集。通过场景变化修剪和多尺度字幕生成策略,确保了数据的时间动态性和语义丰富性。基于此数据集开发的ViCLIP模型在多项基准
工作空间区则是AI协作的战术执行层。这里汇聚了文件管理、知识库增强(RAG)、工具链扩展(Tools/Pipes)等核心模块,支持多模态作战、团队沙盒、流程工业化;通过提示词工业化、知识库动态化、工具链原子化、函数协同化、模型场景化五大核心模块的深度配置,你的团队将实现从“人机对话”到“人-机-知识三元融合”的质变升级。
刚建成的算力服务,看看有没有需要的
本文适合有NLP、大模型知识基础,又想入门了解多模态大模型的同学。主要包括:多模态大模型的模型结构、训练数据、训练方法、评估方法等,侧重于模型结构和算法逻辑。
Cohere发布开源视觉语言模型Command A Vision(112B参数),在多模态任务中表现卓越,超越GPT-4.1等主流模型。该模型基于Command A构建,采用SigLIP2视觉编码器和三阶段训练流程(对齐、微调、强化学习),在图表分析、文档OCR等企业场景中表现突出。支持低资源部署(2块A100或单张H100),提供Hugging Face和Cohere平台体验入口,赋能企业自动化
英伟达(NVIDIA)H800性能及算力应用场景
在打下坚实评估基础之后,您将学习一系列强大的定制技术,包括使用持续预训练注入新知识、通过监督微调教授新技能,以及使用直接偏好优化(DPO)使模型行为更符合人类偏好。最后,您将学习如何通过量化、剪枝和知识蒸馏等优化技术(基于 TensorRT-LLM 和 NeMo 框架)让您的定制模型在实际部署中高效运行。NVIDIA 深度学习培训中心(DLI)发布新课《为大语言模型添加知识》,提供了一个全面、实践
未来,NVIDIA 技术专家团队将继续跟进混元模型的演进,探索更极致的推理加速技术(如新一代量化、更精细的算子融合、对 Blackwell 新特性的支持),不断刷新性能天花板。同时还将持续推动 TensorRT-LLM 与腾讯云 TI 平台、Hunyuan API 服务等生态的深度集成,提供更便捷的一站式混元模型部署与管理体验。