本地 AI 算力 · 实测能力大屏

单卡工作站 · 多模态大模型本地推理 · 性能实测报告(对内)
测试日期 2026-08-30 · 环境 本机部署 数据不出网全本地
生成速度(解码)
0tok/s
两次实测 59.7 ~ 61.6 tok/s
上下文处理(预填充)
0tok/s
含图像视觉编码,冷启动
端到端响应
0s
160 token 视觉问答总耗时
首字延迟
0s
预填充完成即开始输出
显存占用
0/16.4 GB
占用率约 73%
并发会话
0
多会话并行,显存仍有余量

硬件与部署配置

处理器
NVIDIA RTX A4000 · 16GB GDDR6
显存带宽
448 GB/s
推理模型
自部署多模态大模型
模型规模
12B 参数 · 4-bit 量化
模型体积
约 7.4 GB 显存驻留
上下文窗口
8192 tokens
推理方式
本地推理 · 全离线
文本理解 图像理解 视频理解 音频理解 投机解码加速 Prompt 缓存

显存与加速

73%显存占用
显存占用 12.0 / 16.4 GB
剩余约 4.4 GB 用于 KV 缓存与图像临时张量,当前 4 路并发 + 8192 上下文属「刚好跑满但有余量」。
62%投机接受率
投机解码接受率 62.4%
草稿模型提前生成候选 token,主模型校验,约六成被采纳,有效拉高整体吞吐。

端到端时间构成

预填充
0.40 s
生成
2.58 s
合计
3.02 s
一次图片问答(160 token)的总耗时中,模型推理约占 99%,网络传输可忽略(本机回环)。首字在 0.4 秒内开始输出,后续按约 16 ms/token 稳定流式生成。

能力矩阵

🖼️
图像理解
图文问答、识别、描述
🎬
视频理解
视频帧内容解析
🎙️
音频理解
语音内容转写分析
🔒
数据不出网
全离线、可审计

适用场景

本地编码助手 代码补全、解释与审查,全本地不泄密
文档与图像问答 内部文档、图片的智能检索与摘要
轻量 Agent 工作流 多轮任务编排、工具调用推理
敏感数据离线处理 合规要求下不能出网的数据分析