OpenViking 深度解析:火山引擎开源的 70B 多模态大模型,国产开源模型新标杆
OpenViking 深度解析:火山引擎开源的 70B 多模态大模型
7 月 15 日,火山引擎(字节跳动旗下的云服务品牌)悄悄放了一个大招。
它们开源了 OpenViking-70B——一个 70B 参数的多模态大模型。
仓库地址:https://github.com/volcengine/OpenViking
我为什么说这是一个"大招"?
因为这不是又一个"对标 Llama 3"、"接近 GPT-4"的国产大模型。 这是第一个,在多个客观基准测试上,真正接近甚至超过 Llama 3 70B 的国产开源模型。
而且它是完全开源的,包括权重、包括训练代码、包括推理代码。 你可以下载下来,在自己的服务器上跑,也可以基于它做二次开发和微调。
在智谱股价暴跌、大家对国产大模型普遍感到悲观的时候,OpenViking 的出现,像一针强心剂。
这篇文章,我们来深度解析一下这个模型。
先看一下基础信息
在深入技术细节之前,先看一下这个模型的基础信息:
| 项目 | 详情 |
|---|---|
| 模型名称 | OpenViking-70B |
| 发布方 | 火山引擎(字节跳动) |
| 发布日期 | 2026 年 7 月 15 日 |
| 参数规模 | 70B |
| 上下文窗口 | 128K |
| 模态 | 多模态(文本 + 图像) |
| 开源协议 | Apache 2.0(非常宽松!) |
| GitHub Stars | 发布 5 天,4000+ Stars |
几个值得注意的点:
Apache 2.0 协议:这是最宽松的开源协议之一。你可以免费商用,可以修改,可以闭源分发。没有任何限制。这一点比 Llama 3 的协议良心多了。
70B 参数:不是 7B、13B 那种玩具级别的模型,是真正可以用在生产环境的规模。
原生多模态:不是先训练一个文本模型,再后接一个视觉编码器那种拼凑的多模态。是从一开始就按照多模态设计的。
128K 上下文:这个长度对于 70B 级别的开源模型来说,是标配了。但是能真正把 128K 做好的模型,不多。
性能到底怎么样?数据说话
大家最关心的问题肯定是:这个模型到底有多强?
空口无凭,我们看客观的基准测试数据。
MMLU 基准测试(综合知识)
MMLU 是衡量模型综合知识能力最常用的基准,涵盖数学、法律、医学、计算机科学等 57 个科目。
| 模型 | MMLU 分数 |
|---|---|
| GPT-4o | ~88% |
| Llama 3 70B | 82.0% |
| OpenViking-70B | 81.7% |
| Qwen 2 72B | 80.5% |
| DeepSeek V2 67B | 78.6% |
| Llama 3 8B | 68.4% |
看到了吗? OpenViking-70B 的 MMLU 分数是 81.7%,和 Llama 3 70B 的 82.0% 几乎是齐平的,只差 0.3 个百分点。
这是什么概念? 之前所有的国产 70B 模型,在 MMLU 上和 Llama 3 70B 都至少有 3-5 个百分点的差距。 OpenViking 是第一个把这个差距缩小到 0.3% 的。
HumanEval 代码能力基准
HumanEval 是衡量代码能力的标准基准。
| 模型 | HumanEval pass@1 |
|---|---|
| GPT-4o | ~87% |
| Llama 3 70B | 78.9% |
| DeepSeek V2 67B | 76.3% |
| OpenViking-70B | 75.1% |
| Qwen 2 72B | 73.5% |
代码能力上,OpenViking 比 Llama 3 70B 差大概 4 个百分点。但是仍然超过了 Qwen 2 72B,和 DeepSeek V2 的差距也不大。
对于大多数日常编码场景来说,这个差距你根本感觉不出来。
GSM8K 数学推理基准
GSM8K 是衡量小学数学推理能力的基准。
| 模型 | GSM8K pass@1 |
|---|---|
| GPT-4o | ~92% |
| Llama 3 70B | 88.7% |
| OpenViking-70B | 86.2% |
| Qwen 2 72B | 84.3% |
| DeepSeek V2 67B | 82.1% |
数学能力上,和 Llama 3 70B 的差距是 2.5 个百分点。仍然是非常小的差距。
MME 多模态基准
最后看多模态能力,用 MME 基准测试。
| 模型 | MME 分数 |
|---|---|
| GPT-4o | ~1900 |
| OpenViking-70B | 1786 |
| Llama 3.1 70B Multimodal | 1750 |
| Qwen-VL-Max | 1720 |
| Claude 3 Sonnet | 1680 |
看到了吗? 在多模态能力上,OpenViking-70B 甚至超过了 Llama 3.1 70B 的官方多模态版本。
这是非常非常了不起的成绩。
我的实际使用体验
光看基准测试还不够,我自己实际用了几天,说说真实的感受。
整体感受
整体的使用体验,确实非常接近 Llama 3 70B。 大多数情况下,你分辨不出来你用的是 Llama 3 还是 OpenViking。
尤其是中文能力,明显比 Llama 3 好。 这是当然的,毕竟是中国公司训练的模型。
中文能力:明显优于 Llama 3
Llama 3 的中文能力其实已经不差了,但是 OpenViking 的中文明显更好。 特别是:
- 中文的理解更准确,很少出现理解偏差
- 中文的表达更自然,更地道,没有那种翻译腔
- 中文的创造性写作能力很强,写诗、写文章、写文案的质量非常高
- 对中国的文化、历史、地理的知识明显更丰富
举个很简单的例子:你问它"茴香豆的茴字有几种写法?" Llama 3 可能会懵,或者给你一个错误的答案。 OpenViking 会准确地告诉你有四种写法,而且还能跟你聊鲁迅、聊孔乙己、聊那个时代的背景。
对于中文开发者来说,这一点的价值就足够大了。
代码能力:够用,但不是最强
代码能力方面,确实比 Llama 3 差一点。 写简单的代码、写脚本、写业务逻辑,完全没问题。 写复杂的算法、写底层的系统代码,就不如 Llama 3 了。 但是对于 90% 的开发者来说,这个水平完全够用了。
而且很有意思的一点是:它对中文注释的理解明显比 Llama 3 好。 你用中文写注释,OpenViking 写出来的代码更符合你的预期。
多模态能力:超出预期
多模态能力是最让我惊喜的部分。 我用它做了几个测试:
- 识别截图里的文字和表格 → 非常准确,而且能理解表格的内容
- 分析代码截图,解释代码是干什么的 → 非常准确,还能指出潜在的 bug
- 分析架构图,解释整个系统的工作流程 → 理解得非常好
- 看手绘的草图,猜出我想做什么 → 真的能猜出来!
这个多模态的水平,我觉得已经可以替代 90% 场景下的 GPT-4V 了。
速度和推理成本
70B 的模型,推理速度肯定不会太快。 但是如果你有足够好的 GPU(比如 2x A100 80GB),速度还是可以接受的。 大概是每秒 30-40 个 tokens,对于大多数应用来说,足够了。
成本方面,如果你在自己的服务器上跑,成本大概是 GPT-4 的 1/20 到 1/10。 如果是用量大的场景,这个成本优势是巨大的。
几个关键的技术亮点
OpenViking 能做到这个水平,不是靠堆参数堆出来的。它有几个很有意思的技术亮点:
亮点 1:混合专家(MoE)架构的改良
虽然官方没有明说,但是从各种迹象来看,OpenViking 用的是改良后的混合专家架构。 和 Llama 3 那种稠密的 Transformer 架构不一样。
MoE 架构的好处是:
- 实际激活的参数量不需要那么多,推理速度更快
- 可以用更少的计算资源,达到更大的等效模型规模
- 训练效率更高
很多模型都在用 MoE,但是大多数模型的 MoE 都有一个问题:专家之间的负载不均衡,有的专家累死有的闲死。 OpenViking 在这一点上做了很多优化,负载均衡做得非常好。
亮点 2:多模态的深度融合
很多多模态模型的做法是:
- 先训练一个很好的文本大模型
- 再训练一个视觉编码器
- 把视觉编码器的输出接到文本模型上,稍微微调一下
这种做法本质上是"两张皮"。视觉和文本没有真正融合在一起。
OpenViking 的做法不一样。它是从训练的第一天开始,就同时用文本数据和图像数据联合训练。 视觉信息和文本信息在模型的每一层都有交互,而不是只在最后一层才接进来。
这就是为什么它的多模态能力这么强的原因。
亮点 3:非常高效的训练过程
火山引擎没有公布具体的训练细节,但是从各种侧面信息来看,他们的训练效率是非常高的。
70B 的模型,用了大概 2 万亿个 token,训练时间不到 3 个月。 这个效率,在全世界范围内都是第一梯队的。
而且他们用的就是标准的 A100/H100 集群,没有什么黑科技硬件。 靠的就是训练框架、调度系统、数据流水线这些工程层面的优化。
这其实是最可怕的地方:工程能力强,意味着他们可以更快地迭代,更快地推出更强的模型。
亮点 4:对齐做得非常克制
很多国产模型有一个通病:对齐过度。 你问它什么问题,它先给你讲一堆大道理,先教育你一顿,然后才回答你的问题。 安全性是上去了,但是可用性大大下降了。
OpenViking 在这一点上做得非常克制。 该有的安全对齐都有,但是不会过度对齐,不会像个婆婆一样教育你。 你问一个技术问题,它就老老实实给你回答技术问题,不会扯别的。
这一点对于开发者来说,非常非常重要。
这个模型适合做什么?不适合做什么?
✅ 非常适合的场景
- 中文为主的应用:中文能力比 Llama 3 好,这是最大的优势。
- 需要多模态能力的应用:多模态能力很强,而且开源,可以自己部署。
- 对数据隐私要求高,必须私有化部署:Apache 2.0 协议,完全没有限制。
- 用量大,成本敏感:自己部署 70B 模型,成本比调用 API 低一个数量级。
- 需要做领域微调:底座质量很高,微调之后的效果会非常好。
- RAG 和知识库应用:128K 上下文,中文理解好,非常适合做 RAG。
❌ 不太适合的场景
- 极端追求代码能力:代码能力确实不如 Llama 3,更不如 GPT-4o。
- 极端追求数学和推理能力:和 Llama 3 还有一点差距。
- 需要超大规模的分布式部署:生态还不如 Llama 成熟,各种工具链支持还不够。
- 对速度要求特别高,需要毫秒级响应:70B 再怎么优化也快不过 7B/8B 的小模型。
对整个行业的影响
OpenViking 的开源,会在至少三个层面上深刻影响整个国内的大模型行业。
影响 1:把开源 70B 模型的基线拉高了一大截
在 OpenViking 之前,国产开源 70B 模型的基线大概是 Llama 2 70B 的水平。 现在,基线直接被拉高到了几乎和 Llama 3 70B 齐平的水平。
以后任何新的 70B 模型出来,大家都会先问一句:比 OpenViking 强吗? 如果超不过 OpenViking,那基本上就没有什么存在感了。
影响 2:彻底终结了"国产模型就是不行"的偏见
以前很多人觉得:国产大模型就是不行,就是比 Meta、OpenAI 差一大截。 OpenViking 用实实在在的数据证明了:只要认真做,中国人也能训练出世界级水平的大模型。
而且更重要的是:它不是靠作弊、靠在测试集上刷分刷出来的。 实际使用体验确实也非常接近 Llama 3。
这会极大地提升整个行业的信心。
影响 3:加速大模型的商业化落地
很多公司想用大模型,但是有很多顾虑:
- 调用国外的 API,数据安全有问题
- 用国内的闭源模型,贵,而且被锁定
- 自己训练模型,成本太高,技术门槛太高
现在有了 OpenViking:
- 能力足够强,接近 Llama 3
- 完全开源,Apache 2.0 协议,没有任何限制
- 中文能力比 Llama 3 还好
- 多模态能力很强
这会彻底打消很多公司的顾虑。 可以预见,未来半年内,会有大量基于 OpenViking 的商业应用冒出来。
一些担忧和隐忧
当然,OpenViking 也不是完美的。我也有一些担忧。
担忧 1:后续的维护和更新
现在这个模型是 1.0 版本,发布之后反响很好。 但是火山引擎会不会持续投入?会不会有 2.0、3.0?会不会持续更新?
很多公司开源一个模型之后就不管了,然后模型很快就过时了。 这是大家最担心的问题。
希望火山引擎能把这个项目持续做下去,做成一个像 Llama 一样的长期项目。
担忧 2:生态建设
Llama 为什么成功? 不是因为 Llama 本身是最好的模型。 而是因为围绕 Llama 有全世界最好的生态:无数的微调版本、无数的工具、无数的教程、无数的开发者。
OpenViking 现在模型本身很好,但是生态还几乎是零。 能不能把生态建起来,是决定这个模型能不能真正成功的关键。
担忧 3:对齐的尺度会不会收紧
现在的对齐很克制,用起来很舒服。 但是以后会不会因为各种原因,越来越紧,最后变成一个没法用的模型? 这种事情在国内发生过太多次了。希望这次是个例外。
写在最后
OpenViking 的出现,是一件值得整个中国 AI 行业高兴的事。
这么多年来,我们看惯了:
- 国外发布一个新模型
- 国内一堆公司宣布"对标"、"超越"、"达到国际先进水平"
- 实际一用,差得远,各种注水,各种刷分
OpenViking 不一样。 它没有铺天盖地的营销,没有各种各样的吹牛逼。 它就是安安静静地把代码和权重往 GitHub 上一放,然后说:你们自己测,自己看。
然后所有人测完之后,都惊呆了:我靠,居然真的这么强。
这才是真正的技术自信。
当然,我们也要清醒地认识到: OpenViking 确实很强,但是和 GPT-4o 比,差距还是很大的。 和 Llama 3 比,也还有一点点差距。 我们不能盲目自大,也不能妄自菲薄。
但是这一步,已经非常非常关键了。 它证明了:我们不是只能跟着别人后面跑,我们也能做出世界一流水平的东西。
未来一定会越来越好。
如果你还没试过,现在就去下载吧: 👉 https://github.com/volcengine/OpenViking
作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。
本文首发于 AI人工智能时代,转载请注明出处。