本地 AI 算力 · 实测能力大屏
单卡工作站 · 多模态大模型本地推理 · 性能实测报告(对内)
测试日期 2026-08-30 · 环境 本机部署
数据不出网
全本地
生成速度(解码)
0
tok/s
两次实测 59.7 ~ 61.6 tok/s
上下文处理(预填充)
0
tok/s
含图像视觉编码,冷启动
端到端响应
0
s
160 token 视觉问答总耗时
首字延迟
0
s
预填充完成即开始输出
显存占用
0
/16.4 GB
占用率约 73%
并发会话
0
路
多会话并行,显存仍有余量
硬件与部署配置
处理器
NVIDIA RTX
A4000
· 16GB GDDR6
显存带宽
约
448 GB/s
推理模型
自部署多模态大模型
模型规模
约
12B
参数 ·
4-bit
量化
模型体积
约 7.4 GB 显存驻留
上下文窗口
8192 tokens
推理方式
本地推理 · 全离线
文本理解
图像理解
视频理解
音频理解
投机解码加速
Prompt 缓存
显存与加速
73%
显存占用
显存占用 12.0 / 16.4 GB
剩余约 4.4 GB 用于 KV 缓存与图像临时张量,当前 4 路并发 + 8192 上下文属「刚好跑满但有余量」。
62%
投机接受率
投机解码接受率 62.4%
草稿模型提前生成候选 token,主模型校验,约六成被采纳,有效拉高整体吞吐。
端到端时间构成
预填充
0.40 s
生成
2.58 s
合计
3.02 s
一次图片问答(160 token)的总耗时中,模型推理约占 99%,网络传输可忽略(本机回环)。首字在 0.4 秒内开始输出,后续按约 16 ms/token 稳定流式生成。
能力矩阵
🖼️
图像理解
图文问答、识别、描述
🎬
视频理解
视频帧内容解析
🎙️
音频理解
语音内容转写分析
🔒
数据不出网
全离线、可审计
适用场景
本地编码助手
代码补全、解释与审查,全本地不泄密
文档与图像问答
内部文档、图片的智能检索与摘要
轻量 Agent 工作流
多轮任务编排、工具调用推理
敏感数据离线处理
合规要求下不能出网的数据分析