登录社区云,与社区用户共同成长
邀请您加入社区
我在英伟达独立显卡上运行OpenCL代码,且在此之前已经配置过CUDA编程环境,因此,环境配置的过程会比较简单。:配置好CUDA环境后,在CUDA的相关资源中,通常会包含OpenCL所需的头文件!这样,基本的运行环境就搭建完成,下一章节,将会讲一下OpenCL的工作流程和相关注意事项。中的包含目录和库目录先添加相关路径,并在。:做好以上准备后,输入以下代码,编译运行。使用OpenCL时,只需要在在
大模型如火如荼,研究者们已经不再满足于基本文本的大语言模型(LLM, Large Language Model),AI领域的热点正逐步向多模态转移,具备多模态能力的多模态大型语言模型(MM(Multi-Modal)-LLM)就成了一个备受关注的研究主题。
通用知识训练:4096序列长度,30T总token,119种语言和方言;该阶段主要聚焦于语言结构、语法、常识与通用世界知识的学习,为后续阶段提供强大的多语言理解与生成能力支撑。
本文介绍了自动驾驶中基于几何模型的路径跟踪算法:Stanley算法
多模态大型语言模型(Multimodal Large Language Models, MLLM)的出现是建立在大型语言模型(Large Language Models, LLM)和大型视觉模型(Large Vision Models, LVM)领域不断突破的基础上的。随着 LLM 在语言理解和推理能力上的逐步增强,指令微调、上下文学习和思维链工具的应用愈加广泛。然而,尽管 LLM 在处理语言任务
本文主要介绍了自动驾驶横向控制的车辆模型
自动驾驶泊车算法是自动驾驶技术中的重要组成部分,主要用于实现车辆在复杂场景下的自动泊车功能(如垂直泊车、侧方位泊车、斜列泊车等)。将泊车问题转化为约束优化问题(如最小化路径长度或转向次数),使用A*、RRT(快速随机树)、MPC(模型预测控制)等算法。利用摄像头、超声波雷达、激光雷达(LiDAR)、毫米波雷达等多模态传感器,实时检测停车位、障碍物、行人等目标。基于车辆运动学模型(如阿克曼转向几何)
提问:最近在学习Attention和Transformer相关的技术,看到很多资料说Transformer适合做多模态任务,看了模型结构中不知道哪里体现出了这一点?蜡笔小熊猫(复旦大学计...
**RAG-Anything**是一个综合性多模态文档处理RAG系统。该系统能够无缝处理和查询包含文本、图像、表格、公式等多模态内容的复杂文档,提供完整的检索增强(RAG)生成解决方案。
端到端学习已成为自动驾驶领域的一项变革性范式。然而,驾驶行为固有的多模态特性以及长尾场景中的泛化挑战仍然是稳健部署的关键障碍。作者提出了DiffE2E,一个基于扩散的端到端自动驾驶框架。该框架首先通过分层双向交叉注意力机制对多传感器感知特征进行多尺度对齐。
1.背景介绍推荐系统是现代互联网企业的核心业务之一,它通过分析用户行为、内容特征等多种数据源,为用户推荐个性化的内容或产品。随着数据的多样性和复杂性不断增加,传统的单模态推荐系统已经无法满足现实中复杂多样的需求。因此,多模态数据在推荐系统中的应用和研究成为了热门话题。本文将从以下几个方面进行阐述:背景介绍核心概念与联系核心算法原理和具体操作步骤以及数学模型公式详细讲解具体代码实...
多模态检索的三个关键组件包括:检索器(retriever)、重排序器(reranker)和精炼器(refiner)。可分为单/双流结构和生成式结构,每种结构都涉及单模态(例如,文本、图像)和跨模态信息检索。稀疏文本检索密集文本检索例如:BERT、RoBERTa、Poly-encoder、ColBERT等文本-图像检索例如:基于视觉语言预训练(VLP)模型,利用大规模视觉语言数据集进行联合预训练。T
导语Lichee是一个多模态内容理解算法框架项目,其中包含数据增强、预训练引擎、常见模型以及推理加速等模块。由腾讯看点内容算法研发中心研发。并于2021年在腾讯看点、腾讯视频、内容管线、Q...
陌讯推出多模态融合算法v3.2,显著提升智慧交通场景安全带识别准确率。针对施工车辆34.7%漏检率痛点,该方案采用双流时空特征融合和动态决策机制,有效解决动态遮挡和光照突变问题。实测显示在JetsonNano平台实现38ms响应延迟,误检率从22.3%降至3.9%,漏检率下降81.8%。方案支持INT8量化和光影模拟增强,已在港口运输项目中成功落地,日均误报警减少82%。
【大模型基础篇】知识图谱和 AI 多模态推理是什么?一篇文章讲透所有要点
无需先验知识,只需要一张图,即可实现端到端的细致抠图。
基于多模态滤波与统计分析的fNIRS运动伪影自适应去除算法(Python)
今天,我们来了解一下谷歌的自动驾驶汽车Waymo是怎么做的。Waymo在超过25个城市的公共道路上行驶了超过2000万英里。他们还在模拟环境中行驶了数百亿英里(文章后面会介绍)。此外,Wa...
NVIDIA 驱动是一种专门为 NVIDIA GPU(图形处理单元)设计的软件,它是计算机系统与 NVIDIA GPU 之间的桥梁。NVIDIA 驱动使操作系统能够识别并与 GPU 通信,从而发挥 GPU 的全部功能和性能。它包含了控制 GPU 运行、优化图形性能、提供 API 支持等关键组件。没有合适的驱动程序,GPU 就无法正常工作。nvidia-smi 是 NVIDIA 官方提供的一个命令行
生成式大语言模型的性能评估是模型优化与应用落地的关键环节。通过系统化评估,可精准量化模型在多维能力指标上的表现,为技术迭代提供数据支撑。OpenCompass作为专业的评估平台,集成了完备的评估指标体系与大规模开源数据集,能够全面满足生成式大语言模型的多样化测评需求。本文将基于OpenCompass框架,详细解析生成式大语言模型的标准化评估方法论。
陌讯多模态算法破解智慧油站识别难题,通过可见光+红外+激光多源融合,实现全天候精准检测。其核心技术包括光照不变性变换(夜间mAP提升32.6%)、时空注意力机制和轻量化部署(模型体积仅15MB)。某沿海油站实测显示,车牌识别准确率从78%提升至99.1%,年运维成本降低120万元。相比主流框架,陌讯v3.2在低光照性能和雨雾场景下优势显著(误检率仅4.2%)。方案支持动态照明补偿和模型热切换,有效
互相取代:TPU在深度学习任务中表现优异,但在其他任务(如通用计算和图形处理)中,GPU更具灵活性和适应性。设计目的:CPU是计算机的核心处理器,设计用于执行广泛的计算任务。设计目的:GPU最初设计用于处理图形和图像渲染任务,但由于其高度并行的架构,已被广泛用于加速计算密集型任务,如深度学习和科学计算。TPU:专门优化的处理器,适合深度学习任务,但不适合替代CPU和GPU在通用计算或其他任务中的应
作者:西安交通大学,香港城市大学刘启东来自:机器学习与推荐算法进NLP群—>加入NLP交流群TLDR:今天跟大家分享一篇来自于香港城市大学、西安交通大学总结的多模态推荐系统综述,该文章总结了64篇多模态推荐系统相关的文献。具体的,该文根据统一的范式概括了多模态推荐的三个步骤,并从三个技术技术角度总结了现有的研究。另外,还总结了多模态推荐系统常用的数据集。作者希望通过总结的文章为该领域的学者.
无人驾驶中的视觉里程计视觉技术的发展加快,现在已经被充分应用于汽车行业的运动估计范畴。而随着无人驾驶车的出现,这项技术也会有新的发挥平台。点击进入看图评论里程计的概念在里程计问题中,我们希望测量一个运动物体的轨迹。这可以通过许多不同的手段来实现。例如,我们在汽车轮胎上安装计数码盘,就可以得到轮胎转动的距离,从而得到汽车的估计。或者,也可以测量汽车的速度、加速度,通过时间积分来计算它的位移。完成这种
你遇到的 nvcc -V 和 nvidia-smi 显示CUDA版本不一致的情况很常见,这通常不是错误,而是因为它们代表了CUDA不同层面的版本信息。•Linux/macOS:修改 ~/.bashrc 或 ~/.zshrc 等配置文件中的 PATH 和 LD_LIBRARY_PATH 环境变量,将其指向你希望使用的CUDA安装路径(例如 /usr/local/cuda-11.8)。显示版本 CUD
测试环境:Jetson Xavier NX,分辨率1920×1080@30fps。图1:安全带检测遮挡示例(来源:Cityscapes驾驶数据集)其中 R 为姿态矫正函数,α,β,γ 为环境自适应权重。据《智慧交通安全年报2023》统计,。
作者|PerceptionX 编辑|汽车人原文链接:https://zhuanlan.zhihu.com/p/544387122点击下方卡片,关注“自动驾驶之心”公众号ADAS巨卷干货,即可获取论文地址: https://arxiv.org/abs/2207.07601项目地址: https://github.com/OpenPerceptionX/ST-P37...
摘要:陌讯多模态融合算法显著提升静电服识别性能,在复杂工业场景中实现误报率↓75%。针对传统系统35%的误报率、28%漏检率及100ms+延迟等痛点,该架构融合可见光与红外特征,采用GCN处理遮挡问题,实测mAP达0.913,误报率仅7.3%,推理延迟42ms。某晶圆厂部署后误报率从35.2%降至7.3%,单路功耗5.8W。支持INT8量化(精度损失<1%)和光影模拟增强,有效解决工业场景的
《高密度场景漏检率↓82.7%!陌讯多模态融合算法优化聚众识别》摘要:针对公共安防场景中人群密度检测漏报率高(峰值达35%)的痛点,陌讯提出基于时空特征聚合的多模态融合算法。通过动态权值机制(光照突变时热力特征权重提升至0.83)和三级置信度分级,在Jetson Xavier设备实现mAP@0.5达0.882、推理延迟47ms。实际部署显示,地铁场景高峰漏检率从38.2%降至6.6%,RK3588
这里给大家推荐三个国内具有影响力的3D视觉方向平台!
摘要:陌讯多模态融合算法有效提升大件垃圾识别准确率32%,解决传统方案在环境干扰、形态不规则和边缘部署上的痛点。该算法采用"环境感知→特征增强→动态决策"三阶流程,融合RGB视觉与深度信息,实现动态阈值调整。在RK3588边缘设备上实测显示,误报率从38.2%降至6.2%,推理延迟低于45ms,12类目标平均识别准确率达91.3%。文章还提供了量化部署和数据增强的优化建议,并探
点击上方“小白学视觉”,选择加"星标"或“置顶”重磅干货,第一时间送达作者 |Ethon来源|决策智能与机器学习车道识别是自动驾驶领域的一个重要问题,今天介绍一个利用摄像头图像进行车道识别的实用算法。该算法利用了OpenCV库和Udacity自动驾驶汽车数据库的相关内容。该算法包含以下步骤:摄像头校准,以移除镜头畸变(Lens distortion)的影响图像前处理,用于识别车道线道路视角变...
《多模态算法革新车站安防:漏报率骤降75%》摘要:针对车站等高密度场景聚众识别难题,陌讯提出光流-姿态多模态融合方案,通过三阶处理流程实现精准检测。实测显示,该算法在Jetson Nano平台达到mAP@0.5=87.6%,漏报率从42.1%降至7.3%,延迟仅48ms。方案包含INT8量化等工业级优化,使模型体积缩减65%同时保持精度损失<1%。该技术有效解决了传统方案在高密度遮挡、行为误
本文系统梳理了多模态视频理解领域的核心基准测试(Benchmark)和排行榜(Leaderboard),为研究者提供评估模型性能的参考框架。重点介绍了7个具有代表性的Benchmark,包括MMBench-Video、Video-MMMU等,涵盖通用视频理解、教育知识获取、3D空间推理等多样化任务。同时整理了4个主要Leaderboard,如OpenCompass司南榜单和SuperCLUE中文评
核范数平等的正则化每一个奇异值,限制了处理实际问题的能力,在实际情况中,奇异值具有明确的物理意义,应该用不同的方式对待,更大的奇异值通常与主要投影元素有关,因此最好缩小得更少。(1)低秩矩阵分解,找到一个矩阵X尽可能的接近Y—非凸优化,同时分解成两个低秩矩阵的乘积(2)NNM,用X来近似Y,同时令X的核范数最小化—最紧密的凸松弛,可以通过软阈值轻松的解决。1、NNM方法的缺点:平等的正则化每一个奇
本文为原创技术解析,核心技术参数与架构设计引用自《陌讯技术白皮书》,禁止任何形式的未经授权转载。
在我们深入讨论多模 RAG 之前,让我们简要地回顾一下传统的检索增强生成(RAG)。基本上,RAG 的理念是找到与用户查询相关的信息,然后将该信息注入到提示中,并将其传递给语言模型。RAG 系统的检索通常是语义相关的,因为使用了“嵌入”。基本上,embedding嵌入使我们可以将 AI 模型将信息转换为某种表示该信息的向量。这个过程是通过一组参考文档以及用户的查询来完成的。可以计算这些向量之间的距
小鹏汽车小鹏汽车成立于2014年,总部位于广州,中国领先的智能电动汽车公司。是广州橙行智动汽车科技有限公司旗下的互联网电动汽车品牌,由何小鹏、夏珩、何涛等人发起,团队主要成员来自广汽、福特、宝马、特斯拉、德尔福、法雷奥等知名整车与大型零部件公司,以及阿里巴巴、腾讯、小米、三星、华为等知名互联网科技企业。小鹏汽车今年将招聘4,000名新员工,并投资数百万美元用于人工智能领域。以寻求在其所称的全球最大
四篇Occ论文方法整理和详细解读:GaussianFormer[ECCV2024], OSP[ECCV2024], ViewFormer[ECCV2024], OPUS[NIPS2024]
摘要:本文基于CiteSpace软件对中国知网2010-2024年人工智能领域深度学习研究的3040篇核心期刊文献进行可视化分析。研究发现:2016年后发文量快速增长;研究机构呈现"一超多强"格局,以中国科学院大学为核心的合作网络最为紧密;研究热点集中于人工智能、深度学习等基础技术,未来将向预测、隐私保护等方向拓展。研究表明深度学习正从技术突破转向"算法-场景-伦理&
之前做了一个公式识别软件 FreeTex,但遗留了一些问题。因此,本次将软件从v0.3.0更新到v1.0.0视频演示:FreeTex更新:让公式识别更简单高效开源地址:https://github.com/zstar1003/FreeTex。
来源:小白学视觉新机器视觉本文约5700字,建议阅读11分钟本文将围绕着环境感知中关键的视觉感知算法进行介绍。自动驾驶视觉感知算法(一)环境感知是自动驾驶的第一环,是车辆和环境交互的纽带。一个自动驾驶系统整体表现的好坏,很大程度上都取决于感知系统的好坏。目前,环境感知技术有两大主流技术路线:①以视觉为主导的多传感器融合方案,典型代表是特斯拉;②以激光雷达为主导,其他传感器为辅助的技术方案,...
提出新型融合算法**:论文提出了一种新的基于混合结构的图像融合算法**TUFusion**,其核心结构包括编码器、融合层和解码器。该算法创新性地将Transformer与CNN相结合,既能利用Transformer强大的全局提取能力,又能发挥CNN出色的局部图像信息感知能力,提升了多模态图像融合的通用性。
做了这么多年的技术工作,也正好赶上了这一波的人工智能浪潮,有时候我总是不免在想,人工智能如何真正地融入到我们的日常工作和生活中,实现它应有的价值。大家可能不知道,人工智能其实最早在上个世...
Winner() 函数用来检测当前棋局是否有玩家获胜,它的检测方式为:检查每一行、每一列、对角线是否有三个同样的棋子,如果有,则返回对应位置的字符(举个例子:如果对角线(0,0)(1,1)(2,2)有三个同样的棋子 ' # ' ,则返回字符 ' # ');极小极大算法是一种用于决策过程的算法,它假设双方都是理性的,且都采取最优策略。你可以在程序中加入常量或打印出变量的数值,这样你可以清晰的看到变量
【复杂场景精准识别】针对电动车头盔检测中的雨雾干扰、误报率高等痛点,陌讯视觉算法通过多模态融合架构与动态稀疏卷积技术,实现mAP@0.5达94.7%的精度突破。实测某市交警系统落地中,误报率降低82%,边缘端推理时延仅13ms。
gpu矩阵乘法
本文解析了陌讯水文感知架构的创新方案,针对传统水位监测存在的强反射干扰(夜间误报率35%)、暴雨遮挡(漏报率28%)等痛点问题。该方案采用三阶融合处理流程,通过多模态特征聚合公式实现光照自适应补偿,核心算法在Jetson边缘设备上实现mAP0.903、功耗仅6.3W的优异表现。某流域实测显示暴雨误报率降低82.5%,水位标定精度提升82.4%。文章还提供了INT8量化(模型体积缩减73%)和水文数
作者丨大兵小将@知乎来源丨https://zhuanlan.zhihu.com/p/607917968编辑丨3D视觉工坊点击进入—>3D视觉工坊学习交流群自动驾驶建图定位中常使用ICP、NDT等配准算法,本文主要介绍这两者的基本概念及区别联系。一、ICP配准1、基本概念ICP通过迭代的方式,通过优化相对位姿,不断减小两帧点云之间点到点的距离,直到迭代收敛,最终计算出两帧点云的相对位姿。2、I
数字孪生技术就像是一个神奇的“魔法棒”,通过强大的感知能力、精准的模拟与预测以及高效的决策支持,让物理世界在虚拟空间中“活”起来。虽然它在技术复杂性、数据安全和成本投入等方面存在一些挑战,但随着技术的不断发展和应用的不断深入,数字孪生有望成为未来物理世界与虚拟世界融合的核心驱动力,为我们的生活和工作带来更多的便利和惊喜。