本人将从以下3个方面进行介绍:

7月31日Cohere发布 Command A Vision:具有开放权重的尖端视觉语言模型。该模型在多模态视觉任务中展现卓越性能,同时保持了 Command A 强大的文本能力。作为 Cohere 的最新旗舰模型,Command A Vision 是基于 Command A 构建的 112B 稠密模型。
在这里插入图片描述

开源其权重 :command-a-vision-07-2025

Command A Vision 赋能企业自动化繁琐任务,从视觉数据中挖掘价值洞察,并通过文档光学字符识别(OCR)和图像分析实现高精度数据驱动决策。无论是解析含复杂图表的产品手册,还是分析现实场景照片以进行风险检测,Command A Vision 都能出色应对最具挑战性的企业视觉需求。

性能指标

Command A Vision 在多模态性能上领先,在标准视觉基准测试中超越 GPT 4.1、Llama 4 Maverick、Mistral Medium 和 Pixtral Large 等模型。我们选取了九项多样化基准测试,涵盖典型企业用例和通用学术评估。Command A Vision 在图表、文档和 OCR 分析方面表现尤为突出,同时在数学/原推理评估(如 MathVista 73.5%)中表现优异。如下表所示,其综合表现超越了领先的非思维(non-thinking)视觉语言模型。(注:当其他供应商报告或公开排行榜数据缺失时,通过 VLMEvalKit 进行最大努力内部复现评估)

模型 ChartQA InfoVQA AI2D MMMU (CoT) MathVista DocVQA TextVQA OCRBench RealWorldQA 平均
Command A Vision 90.9% 82.9% 94.0% 65.3% 73.5% 95.9% 84.8% 86.9% 73.6% 83.1%
GPT-4.1 (2025-04-14) 82.7% 70.0% 86.5% 74.8% 72.2% 88.6% 71.1% 83.4% 78.0% 78.6%
Pixtral Large 88.1% 59.9% 93.8% 64.0% 69.4% 93.3% 79.3% 74.1% 69.3% 76.8%
Mistral Medium 3 82.6% 71.5% 93.7% 65.0% 70.5% 95.3% 83.5% 75.7% 67.2% 78.3%
Llama 3.2V 90B 85.8% 56.8% 92.3% 60.6% 57.3% 90.1% 83.4% 78.3% 69.8% 74.9%
Llama 4 Maverick 90.0% 77.1% 84.4% 73.4% 73.7% 94.4% 81.6% 80.0% 70.4% 80.5%

训练流程与架构细节

本模型采用 Llava 架构,即通过 MLP 连接器将 SigLIP2-patch16-512 视觉编码器的特征转换为(软)视觉标记(soft vision tokens)。每张图像根据尺寸被分割为最多 12 个图块(tiles)(目标接近长宽比),每个分辨率 512x512,并额外包含一个 512x512 的全局摘要缩略图。经过 MLP 和 像素洗牌(pixel shuffle)处理后(确保每个图块对应 256 个 tokens),特征被输入 Command A 文本塔——一个稠密的 111B 参数文本 LLM。单张图像最多消耗 3328 个 tokens。
在这里插入图片描述

训练分为三阶段:
视觉语言对齐(vision-language alignment)、监督微调(SFT)和强化学习(RL)后训练。

  • 对齐阶段冻结视觉编码器和语言模型权重,仅训练图像特征到语言模型嵌入空间的映射。
  • SFT 阶段联合训练视觉编码器、视觉适配器(vision adapter)和语言模型。随后进行类似 Command A 的多模态模型专家合并(model merging over experts),以平衡数据混合比例并反映企业用例优先级。
  • 后训练阶段采用正则化方法和在线 对比策略梯度(Contrastive Policy Gradient) 等 RLHF 算法,在满足企业需求与安全性的同时进一步提升性能。

面向企业的能力与效率

Command A Vision 专为核心企业需求打造:在保留 Command A 文本能力的基础上,集成了企业级关键特性,如高级检索增强生成(RAG)和多种商业语言的多语言支持。部署仅需 ≤2 块 GPU,两片 A100 或单张 H100(4-bit 量化)即可私有化部署。

快速开始

通过 Hugging Face SpaceCohere 平台 体验 Command A Vision。

本地运行需安装 transformers:

# pip install "transformers[dev-torch]@git+https://github.com/huggingface/transformers.git"

import torch
from transformers import AutoProcessor, AutoModelForImageTextToText

model_id = "CohereLabs/command-a-vision-07-2025"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(
    model_id, device_map="auto", torch_dtype=torch.float16
)

# 使用Command-A-Vision聊天模板格式化消息
messages = [{
    "role": "user",
    "content": [
        {"type": "image", "url": "https://images.pexels.com/photos/1108099/pexels-photo-1108099.jpeg"},
        {"type": "text", "text": "图片内容是什么?"}
    ]
}]

inputs = processor.apply_chat_template(
    messages,
    padding=True,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)

gen_tokens = model.generate(**inputs, max_new_tokens=300)
print(processor.tokenizer.decode(gen_tokens[0][inputs.input_ids.shape[1]:], skip_special_tokens=True)

通过Hugging Face Inference Providers使用该模型:

import os
from huggingface_hub import InferenceClient

client = InferenceClient(
    provider="cohere",
    api_key=os.environ["HF_TOKEN"],
)

completion = client.chat.completions.create(
    model="CohereLabs/command-a-vision-07-2025",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Describe this image in one sentence."
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg"
                    }
                }
            ]
        }
    ],
)

print(completion.choices[0].message)

Logo

分享最新的 NVIDIA AI Software 资源以及活动/会议信息,精选收录AI相关技术内容,欢迎大家加入社区并参与讨论。

更多推荐