登录社区云,与社区用户共同成长
邀请您加入社区
在训练方面,Newton 提供基于张量的 API,将物理状态以兼容 PyTorch 和 NumPy 的数组形式呈现,支持高效批处理,并能与 Isaac Lab 等机器人学习框架无缝集成。慕尼黑工业大学利用 Newton 在仿真环境中重新运行已在实体机器人上验证过的灵巧操作策略,这是实现“仿真—现实”闭环的重要第一步。由于采用了通用接口和共享数据模型,无论运行的是 MuJoCo Warp、Disne
端到端学习已成为自动驾驶领域的一项变革性范式。然而,驾驶行为固有的多模态特性以及长尾场景中的泛化挑战仍然是稳健部署的关键障碍。作者提出了DiffE2E,一个基于扩散的端到端自动驾驶框架。该框架首先通过分层双向交叉注意力机制对多传感器感知特征进行多尺度对齐。
万字解析:一文读懂当下最火的多模态技术,看这一篇就够了!
1999 年,英伟达发明了 GPU(graphics processing unit),本节将介绍英伟达 GPU 从 Fermi 到 Blackwell 共 9 代架构,时间跨度从 2010 年至 2024 年,具体包括费米(Feimi)、开普勒(Kepler)、麦克斯韦(Maxwell)、帕斯卡(Pashcal)、伏特(Volt)、图灵(Turing)、安培(Ampere)和赫柏(Hopper)
由李飞飞等人著作的《AGENT AI: SURVEYING THE HORIZONS OF MULTIMODAL INTERACTION》是一篇关于多模态交互和Agent AI最全面的论文以及未来展望,这份报告可能代表着未来 AI 商业化最有价值的方向之一,分享给大家!Agent AI是一类交互系统,能够感知视觉刺激、语言输入和其他环境基础数据,并产生有意义的具体行动。Agent AI被视为实现人
本文系统阐述了端到端自动驾驶系统的完整实现链路,从Comma.ai架构解析到PyTorch模型训练,再到TensorRT部署优化,最后实现安全接管机制。多模态传感器时空融合算法;3D卷积+LSTM的时空特征提取网络;基于风险预测的动态接管机制;混合精度推理加速方案。引入Transformer架构提升全局感知能力;结合强化学习实现自适应驾驶策略;开发车路协同感知模块;构建形式化验证安全框架。原创作者
多模态AI模型正成为技术新趋势,通过整合文本、图像、音频等数据实现跨模态智能交互。本文系统解析了多模态模型的技术演进(从早期融合到统一Transformer架构)、核心原理(对比学习、跨模态注意力等)和主流模型对比(GPT-4o、Gemini 2.0等)。重点介绍了训练方法与优化策略,包括数据对齐、对比学习和知识蒸馏技术,并提供了电商跨模态检索的实战案例。多模态模型在参数效率、推理速度和应用场景上
图文混合问答是当前AI领域的一个热门研究方向,能够让机器更好地理解和回应包含视觉信息的用户查询。本文详细介绍了一种嵌入型图文混合问答系统的实现原理与技术架构。我们将探讨如何从Markdown文档中提取图片信息,利用视觉语言模型(VLM)对图片内容进行智能分析和描述生成,并将这些视觉信息与文本内容有效融合。通过异步批量处理、正则表达式图片链接提取、AI描述增强等技术,系统能够高效处理图文混合内容。最
虽然 Blackwell 的功率比与大型 GCN 芯片相同,但它拥有更高的时钟速度,并且很可能拥有更高的波发射率,以匹配每个 GPU 核心的吞吐量。使用 Vulkan 的测试结果表明,较小的 RTX 5070 也具有比 RTX 4090 更高的 L2 延迟(122 纳秒),即使 5070 具有更少的 SM 和更小的 L2。有趣的是,Nvidia 之前的Ada Lovelace 和 Ampere 架
多模态大语言模型(MLLMs)的快速进步展示了它们在各个应用领域中的显著能力。然而,多图像理解场景仍然是一个重要但尚未充分探索的方面。特别是,将 MLLMs 的应用场景扩展到理解更长的视频、更高分辨率的图像以及基于更多历史信息的决策,对于提升用户体验和进一步拓展 MLLMs 的应用范围至关重要。然而,将 MLLM 的上下文长度扩展以提高其可用性,面临着处理更多图像时性能下降和计算成本高昂的挑战。一
通过上述架构与技术,我们解决了多模态文档处理中的三大核心问题:解析复杂性(工具选型)、索引低效性(差异化处理)、生成准确性(递归检索)。工具链适配:根据文档类型选择解析工具 —— 扫描件优先 Open-Parse(OCR 支持),结构化报告优先 LlamaParse(自动摘要),复杂文档优先 Unstructured(深度解析)分阶段测试:先验证单模态处理流程(如纯文本 / 纯表格文档),再逐步集
自动驾驶领域的传统方法多依赖于数据驱动模型,通过大量标注数据训练实现路径规划和控制。然而,现实世界中道路临时施工、突发障碍物等极端场景难以完全涵盖,导致系统在特殊情况下表现不佳。与此同时,大语言模型在自然语言处理领域展现出强大的理解和推理能力,能够处理复杂指令和丰富知识推理。将LLM引入自动驾驶,尤其是本地端部署,既能利用其认知智能,又能避免云端延迟、隐私和安全隐患。图1:所提出的增强型大型语言模
本文提出了一个数字孪生平台建设方案,包含平台架构设计、功能建设和服务能力。平台采用六层架构体系,重点建设模型库管理、孪生场景编排等7大功能组件,提供镜像映射、可视化等6项核心服务。方案列举了精准投资规划、电网全景监控等典型应用场景,并配套提供了完整的软件工程文档清单(包括需求分析、设计开发、测试验收等全周期文档)以及涵盖智慧城市、医疗信息化等多个领域的建设方案资料库。该方案为构建数字孪生系统提供了
每个模型总参数规模达 800 亿,但凭借其稀疏 MoE 结构,每个 Token 仅激活 30 亿参数,从而以小模型的效率实现了大模型的强大性能。在 Open Router 上体验:Qwen3-Next-80B-A3B-Thinking 和 Qwen3-Next-80B-A3B-Instruct,或者从 Hugging Face 下载:Qwen3-Next-80B-A3B-Thinking 和 Qw
随着技术的持续发展,代理式 AI 与 AI 智能体正从概念走向更广泛的产业实践。从智能客服的高效响应到零售场景的个性化服务,从逻辑推理辅助决策到数字虚拟形象的沉浸式交互,其核心价值始终围绕“解决实际问题”。对企业而言,针对业务场景中的实际需求,依托现有技术栈逐步搭建适配的代理式 AI 应用框架,是技术落地的路径,更是把握 AI 能力向自主执行跃迁机遇的关键。扫描下方二维码或复制链接至浏览器获取电子
在上述已实现的各项优化特性之外,针对 Qwen3 系列模型,TensorRT-LLM 还在不断研发和探索新的优化方法,包括 kernel 层面的持续优化、算子融合、基于 sparse attention 的超长文本支持、基于 Eagle-3 的投机性采样、MoE 模型的 expert 负载均衡、新的量化精度(W4AFP8/NVFP4)等等,期待您紧密关注。Qwen 系列开源模型因其突出的模型能力、
NVLink Fusion 包含 NVLink 芯片,可通过相同的 NVIDIA 机架级扩展架构来纵向扩展 NVIDIA 和半定制 ASIC 的混合基础设施,并与 NVIDIA CPU、NVIDIA NVLink 交换机、NVIDIA ConnectX Ethernet SuperNIC、NVIDIA BlueField DPU 以及用于横向扩展解决方案的 NVIDIA Quantum 和 NVI