Cohere发布Command A Vision视觉多模态模型,评分超过GPT4.1
本人将从以下3个方面进行介绍:
7月31日Cohere发布 Command A Vision:具有开放权重的尖端视觉语言模型。该模型在多模态视觉任务中展现卓越性能,同时保持了 Command A 强大的文本能力。作为 Cohere 的最新旗舰模型,Command A Vision 是基于 Command A 构建的 112B 稠密模型。
开源其权重 :command-a-vision-07-2025。
Command A Vision 赋能企业自动化繁琐任务,从视觉数据中挖掘价值洞察,并通过文档光学字符识别(OCR)和图像分析实现高精度数据驱动决策。无论是解析含复杂图表的产品手册,还是分析现实场景照片以进行风险检测,Command A Vision 都能出色应对最具挑战性的企业视觉需求。
性能指标
Command A Vision 在多模态性能上领先,在标准视觉基准测试中超越 GPT 4.1、Llama 4 Maverick、Mistral Medium 和 Pixtral Large 等模型。我们选取了九项多样化基准测试,涵盖典型企业用例和通用学术评估。Command A Vision 在图表、文档和 OCR 分析方面表现尤为突出,同时在数学/原推理评估(如 MathVista 73.5%)中表现优异。如下表所示,其综合表现超越了领先的非思维(non-thinking)视觉语言模型。(注:当其他供应商报告或公开排行榜数据缺失时,通过 VLMEvalKit 进行最大努力内部复现评估)
| 模型 | ChartQA | InfoVQA | AI2D | MMMU (CoT) | MathVista | DocVQA | TextVQA | OCRBench | RealWorldQA | 平均 |
|---|---|---|---|---|---|---|---|---|---|---|
| Command A Vision | 90.9% | 82.9% | 94.0% | 65.3% | 73.5% | 95.9% | 84.8% | 86.9% | 73.6% | 83.1% |
| GPT-4.1 (2025-04-14) | 82.7% | 70.0% | 86.5% | 74.8% | 72.2% | 88.6% | 71.1% | 83.4% | 78.0% | 78.6% |
| Pixtral Large | 88.1% | 59.9% | 93.8% | 64.0% | 69.4% | 93.3% | 79.3% | 74.1% | 69.3% | 76.8% |
| Mistral Medium 3 | 82.6% | 71.5% | 93.7% | 65.0% | 70.5% | 95.3% | 83.5% | 75.7% | 67.2% | 78.3% |
| Llama 3.2V 90B | 85.8% | 56.8% | 92.3% | 60.6% | 57.3% | 90.1% | 83.4% | 78.3% | 69.8% | 74.9% |
| Llama 4 Maverick | 90.0% | 77.1% | 84.4% | 73.4% | 73.7% | 94.4% | 81.6% | 80.0% | 70.4% | 80.5% |
训练流程与架构细节
本模型采用 Llava 架构,即通过 MLP 连接器将 SigLIP2-patch16-512 视觉编码器的特征转换为(软)视觉标记(soft vision tokens)。每张图像根据尺寸被分割为最多 12 个图块(tiles)(目标接近长宽比),每个分辨率 512x512,并额外包含一个 512x512 的全局摘要缩略图。经过 MLP 和 像素洗牌(pixel shuffle)处理后(确保每个图块对应 256 个 tokens),特征被输入 Command A 文本塔——一个稠密的 111B 参数文本 LLM。单张图像最多消耗 3328 个 tokens。
训练分为三阶段:
视觉语言对齐(vision-language alignment)、监督微调(SFT)和强化学习(RL)后训练。
- 对齐阶段冻结视觉编码器和语言模型权重,仅训练图像特征到语言模型嵌入空间的映射。
- SFT 阶段联合训练视觉编码器、视觉适配器(vision adapter)和语言模型。随后进行类似 Command A 的多模态模型专家合并(model merging over experts),以平衡数据混合比例并反映企业用例优先级。
- 后训练阶段采用正则化方法和在线 对比策略梯度(Contrastive Policy Gradient) 等 RLHF 算法,在满足企业需求与安全性的同时进一步提升性能。
面向企业的能力与效率
Command A Vision 专为核心企业需求打造:在保留 Command A 文本能力的基础上,集成了企业级关键特性,如高级检索增强生成(RAG)和多种商业语言的多语言支持。部署仅需 ≤2 块 GPU,两片 A100 或单张 H100(4-bit 量化)即可私有化部署。
快速开始
通过 Hugging Face Space 或 Cohere 平台 体验 Command A Vision。
本地运行需安装 transformers:
# pip install "transformers[dev-torch]@git+https://github.com/huggingface/transformers.git"
import torch
from transformers import AutoProcessor, AutoModelForImageTextToText
model_id = "CohereLabs/command-a-vision-07-2025"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForImageTextToText.from_pretrained(
model_id, device_map="auto", torch_dtype=torch.float16
)
# 使用Command-A-Vision聊天模板格式化消息
messages = [{
"role": "user",
"content": [
{"type": "image", "url": "https://images.pexels.com/photos/1108099/pexels-photo-1108099.jpeg"},
{"type": "text", "text": "图片内容是什么?"}
]
}]
inputs = processor.apply_chat_template(
messages,
padding=True,
add_generation_prompt=True,
tokenize=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
gen_tokens = model.generate(**inputs, max_new_tokens=300)
print(processor.tokenizer.decode(gen_tokens[0][inputs.input_ids.shape[1]:], skip_special_tokens=True)
通过Hugging Face Inference Providers使用该模型:
import os
from huggingface_hub import InferenceClient
client = InferenceClient(
provider="cohere",
api_key=os.environ["HF_TOKEN"],
)
completion = client.chat.completions.create(
model="CohereLabs/command-a-vision-07-2025",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": "Describe this image in one sentence."
},
{
"type": "image_url",
"image_url": {
"url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg"
}
}
]
}
],
)
print(completion.choices[0].message)
更多推荐




所有评论(0)