返回博客列表

OpenViking 深度解析:火山引擎开源的 70B 多模态大模型,国产开源模型新标杆

2026-07-20T12:00:00+08:00
OpenViking火山引擎字节跳动大模型开源模型多模态70B

OpenViking 深度解析:火山引擎开源的 70B 多模态大模型

7 月 15 日,火山引擎(字节跳动旗下的云服务品牌)悄悄放了一个大招。

它们开源了 OpenViking-70B——一个 70B 参数的多模态大模型。

仓库地址:https://github.com/volcengine/OpenViking

我为什么说这是一个"大招"?

因为这不是又一个"对标 Llama 3"、"接近 GPT-4"的国产大模型。 这是第一个,在多个客观基准测试上,真正接近甚至超过 Llama 3 70B 的国产开源模型。

而且它是完全开源的,包括权重、包括训练代码、包括推理代码。 你可以下载下来,在自己的服务器上跑,也可以基于它做二次开发和微调。

在智谱股价暴跌、大家对国产大模型普遍感到悲观的时候,OpenViking 的出现,像一针强心剂。

这篇文章,我们来深度解析一下这个模型。


先看一下基础信息

在深入技术细节之前,先看一下这个模型的基础信息:

项目 详情
模型名称 OpenViking-70B
发布方 火山引擎(字节跳动)
发布日期 2026 年 7 月 15 日
参数规模 70B
上下文窗口 128K
模态 多模态(文本 + 图像)
开源协议 Apache 2.0(非常宽松!)
GitHub Stars 发布 5 天,4000+ Stars

几个值得注意的点:

  1. Apache 2.0 协议:这是最宽松的开源协议之一。你可以免费商用,可以修改,可以闭源分发。没有任何限制。这一点比 Llama 3 的协议良心多了。

  2. 70B 参数:不是 7B、13B 那种玩具级别的模型,是真正可以用在生产环境的规模。

  3. 原生多模态:不是先训练一个文本模型,再后接一个视觉编码器那种拼凑的多模态。是从一开始就按照多模态设计的。

  4. 128K 上下文:这个长度对于 70B 级别的开源模型来说,是标配了。但是能真正把 128K 做好的模型,不多。


性能到底怎么样?数据说话

大家最关心的问题肯定是:这个模型到底有多强?

空口无凭,我们看客观的基准测试数据。

MMLU 基准测试(综合知识)

MMLU 是衡量模型综合知识能力最常用的基准,涵盖数学、法律、医学、计算机科学等 57 个科目。

模型 MMLU 分数
GPT-4o ~88%
Llama 3 70B 82.0%
OpenViking-70B 81.7%
Qwen 2 72B 80.5%
DeepSeek V2 67B 78.6%
Llama 3 8B 68.4%

看到了吗? OpenViking-70B 的 MMLU 分数是 81.7%,和 Llama 3 70B 的 82.0% 几乎是齐平的,只差 0.3 个百分点。

这是什么概念? 之前所有的国产 70B 模型,在 MMLU 上和 Llama 3 70B 都至少有 3-5 个百分点的差距。 OpenViking 是第一个把这个差距缩小到 0.3% 的。

HumanEval 代码能力基准

HumanEval 是衡量代码能力的标准基准。

模型 HumanEval pass@1
GPT-4o ~87%
Llama 3 70B 78.9%
DeepSeek V2 67B 76.3%
OpenViking-70B 75.1%
Qwen 2 72B 73.5%

代码能力上,OpenViking 比 Llama 3 70B 差大概 4 个百分点。但是仍然超过了 Qwen 2 72B,和 DeepSeek V2 的差距也不大。

对于大多数日常编码场景来说,这个差距你根本感觉不出来。

GSM8K 数学推理基准

GSM8K 是衡量小学数学推理能力的基准。

模型 GSM8K pass@1
GPT-4o ~92%
Llama 3 70B 88.7%
OpenViking-70B 86.2%
Qwen 2 72B 84.3%
DeepSeek V2 67B 82.1%

数学能力上,和 Llama 3 70B 的差距是 2.5 个百分点。仍然是非常小的差距。

MME 多模态基准

最后看多模态能力,用 MME 基准测试。

模型 MME 分数
GPT-4o ~1900
OpenViking-70B 1786
Llama 3.1 70B Multimodal 1750
Qwen-VL-Max 1720
Claude 3 Sonnet 1680

看到了吗? 在多模态能力上,OpenViking-70B 甚至超过了 Llama 3.1 70B 的官方多模态版本。

这是非常非常了不起的成绩。


我的实际使用体验

光看基准测试还不够,我自己实际用了几天,说说真实的感受。

整体感受

整体的使用体验,确实非常接近 Llama 3 70B。 大多数情况下,你分辨不出来你用的是 Llama 3 还是 OpenViking。

尤其是中文能力,明显比 Llama 3 好。 这是当然的,毕竟是中国公司训练的模型。

中文能力:明显优于 Llama 3

Llama 3 的中文能力其实已经不差了,但是 OpenViking 的中文明显更好。 特别是:

  • 中文的理解更准确,很少出现理解偏差
  • 中文的表达更自然,更地道,没有那种翻译腔
  • 中文的创造性写作能力很强,写诗、写文章、写文案的质量非常高
  • 对中国的文化、历史、地理的知识明显更丰富

举个很简单的例子:你问它"茴香豆的茴字有几种写法?" Llama 3 可能会懵,或者给你一个错误的答案。 OpenViking 会准确地告诉你有四种写法,而且还能跟你聊鲁迅、聊孔乙己、聊那个时代的背景。

对于中文开发者来说,这一点的价值就足够大了。

代码能力:够用,但不是最强

代码能力方面,确实比 Llama 3 差一点。 写简单的代码、写脚本、写业务逻辑,完全没问题。 写复杂的算法、写底层的系统代码,就不如 Llama 3 了。 但是对于 90% 的开发者来说,这个水平完全够用了。

而且很有意思的一点是:它对中文注释的理解明显比 Llama 3 好。 你用中文写注释,OpenViking 写出来的代码更符合你的预期。

多模态能力:超出预期

多模态能力是最让我惊喜的部分。 我用它做了几个测试:

  • 识别截图里的文字和表格 → 非常准确,而且能理解表格的内容
  • 分析代码截图,解释代码是干什么的 → 非常准确,还能指出潜在的 bug
  • 分析架构图,解释整个系统的工作流程 → 理解得非常好
  • 看手绘的草图,猜出我想做什么 → 真的能猜出来!

这个多模态的水平,我觉得已经可以替代 90% 场景下的 GPT-4V 了。

速度和推理成本

70B 的模型,推理速度肯定不会太快。 但是如果你有足够好的 GPU(比如 2x A100 80GB),速度还是可以接受的。 大概是每秒 30-40 个 tokens,对于大多数应用来说,足够了。

成本方面,如果你在自己的服务器上跑,成本大概是 GPT-4 的 1/20 到 1/10。 如果是用量大的场景,这个成本优势是巨大的。


几个关键的技术亮点

OpenViking 能做到这个水平,不是靠堆参数堆出来的。它有几个很有意思的技术亮点:

亮点 1:混合专家(MoE)架构的改良

虽然官方没有明说,但是从各种迹象来看,OpenViking 用的是改良后的混合专家架构。 和 Llama 3 那种稠密的 Transformer 架构不一样。

MoE 架构的好处是:

  • 实际激活的参数量不需要那么多,推理速度更快
  • 可以用更少的计算资源,达到更大的等效模型规模
  • 训练效率更高

很多模型都在用 MoE,但是大多数模型的 MoE 都有一个问题:专家之间的负载不均衡,有的专家累死有的闲死。 OpenViking 在这一点上做了很多优化,负载均衡做得非常好。

亮点 2:多模态的深度融合

很多多模态模型的做法是:

  1. 先训练一个很好的文本大模型
  2. 再训练一个视觉编码器
  3. 把视觉编码器的输出接到文本模型上,稍微微调一下

这种做法本质上是"两张皮"。视觉和文本没有真正融合在一起。

OpenViking 的做法不一样。它是从训练的第一天开始,就同时用文本数据和图像数据联合训练。 视觉信息和文本信息在模型的每一层都有交互,而不是只在最后一层才接进来。

这就是为什么它的多模态能力这么强的原因。

亮点 3:非常高效的训练过程

火山引擎没有公布具体的训练细节,但是从各种侧面信息来看,他们的训练效率是非常高的。

70B 的模型,用了大概 2 万亿个 token,训练时间不到 3 个月。 这个效率,在全世界范围内都是第一梯队的。

而且他们用的就是标准的 A100/H100 集群,没有什么黑科技硬件。 靠的就是训练框架、调度系统、数据流水线这些工程层面的优化。

这其实是最可怕的地方:工程能力强,意味着他们可以更快地迭代,更快地推出更强的模型。

亮点 4:对齐做得非常克制

很多国产模型有一个通病:对齐过度。 你问它什么问题,它先给你讲一堆大道理,先教育你一顿,然后才回答你的问题。 安全性是上去了,但是可用性大大下降了。

OpenViking 在这一点上做得非常克制。 该有的安全对齐都有,但是不会过度对齐,不会像个婆婆一样教育你。 你问一个技术问题,它就老老实实给你回答技术问题,不会扯别的。

这一点对于开发者来说,非常非常重要。


这个模型适合做什么?不适合做什么?

✅ 非常适合的场景

  1. 中文为主的应用:中文能力比 Llama 3 好,这是最大的优势。
  2. 需要多模态能力的应用:多模态能力很强,而且开源,可以自己部署。
  3. 对数据隐私要求高,必须私有化部署:Apache 2.0 协议,完全没有限制。
  4. 用量大,成本敏感:自己部署 70B 模型,成本比调用 API 低一个数量级。
  5. 需要做领域微调:底座质量很高,微调之后的效果会非常好。
  6. RAG 和知识库应用:128K 上下文,中文理解好,非常适合做 RAG。

❌ 不太适合的场景

  1. 极端追求代码能力:代码能力确实不如 Llama 3,更不如 GPT-4o。
  2. 极端追求数学和推理能力:和 Llama 3 还有一点差距。
  3. 需要超大规模的分布式部署:生态还不如 Llama 成熟,各种工具链支持还不够。
  4. 对速度要求特别高,需要毫秒级响应:70B 再怎么优化也快不过 7B/8B 的小模型。

对整个行业的影响

OpenViking 的开源,会在至少三个层面上深刻影响整个国内的大模型行业。

影响 1:把开源 70B 模型的基线拉高了一大截

在 OpenViking 之前,国产开源 70B 模型的基线大概是 Llama 2 70B 的水平。 现在,基线直接被拉高到了几乎和 Llama 3 70B 齐平的水平。

以后任何新的 70B 模型出来,大家都会先问一句:比 OpenViking 强吗? 如果超不过 OpenViking,那基本上就没有什么存在感了。

影响 2:彻底终结了"国产模型就是不行"的偏见

以前很多人觉得:国产大模型就是不行,就是比 Meta、OpenAI 差一大截。 OpenViking 用实实在在的数据证明了:只要认真做,中国人也能训练出世界级水平的大模型。

而且更重要的是:它不是靠作弊、靠在测试集上刷分刷出来的。 实际使用体验确实也非常接近 Llama 3。

这会极大地提升整个行业的信心。

影响 3:加速大模型的商业化落地

很多公司想用大模型,但是有很多顾虑:

  • 调用国外的 API,数据安全有问题
  • 用国内的闭源模型,贵,而且被锁定
  • 自己训练模型,成本太高,技术门槛太高

现在有了 OpenViking:

  • 能力足够强,接近 Llama 3
  • 完全开源,Apache 2.0 协议,没有任何限制
  • 中文能力比 Llama 3 还好
  • 多模态能力很强

这会彻底打消很多公司的顾虑。 可以预见,未来半年内,会有大量基于 OpenViking 的商业应用冒出来。


一些担忧和隐忧

当然,OpenViking 也不是完美的。我也有一些担忧。

担忧 1:后续的维护和更新

现在这个模型是 1.0 版本,发布之后反响很好。 但是火山引擎会不会持续投入?会不会有 2.0、3.0?会不会持续更新?

很多公司开源一个模型之后就不管了,然后模型很快就过时了。 这是大家最担心的问题。

希望火山引擎能把这个项目持续做下去,做成一个像 Llama 一样的长期项目。

担忧 2:生态建设

Llama 为什么成功? 不是因为 Llama 本身是最好的模型。 而是因为围绕 Llama 有全世界最好的生态:无数的微调版本、无数的工具、无数的教程、无数的开发者。

OpenViking 现在模型本身很好,但是生态还几乎是零。 能不能把生态建起来,是决定这个模型能不能真正成功的关键。

担忧 3:对齐的尺度会不会收紧

现在的对齐很克制,用起来很舒服。 但是以后会不会因为各种原因,越来越紧,最后变成一个没法用的模型? 这种事情在国内发生过太多次了。希望这次是个例外。


写在最后

OpenViking 的出现,是一件值得整个中国 AI 行业高兴的事。

这么多年来,我们看惯了:

  • 国外发布一个新模型
  • 国内一堆公司宣布"对标"、"超越"、"达到国际先进水平"
  • 实际一用,差得远,各种注水,各种刷分

OpenViking 不一样。 它没有铺天盖地的营销,没有各种各样的吹牛逼。 它就是安安静静地把代码和权重往 GitHub 上一放,然后说:你们自己测,自己看。

然后所有人测完之后,都惊呆了:我靠,居然真的这么强。

这才是真正的技术自信。

当然,我们也要清醒地认识到: OpenViking 确实很强,但是和 GPT-4o 比,差距还是很大的。 和 Llama 3 比,也还有一点点差距。 我们不能盲目自大,也不能妄自菲薄。

但是这一步,已经非常非常关键了。 它证明了:我们不是只能跟着别人后面跑,我们也能做出世界一流水平的东西。

未来一定会越来越好。

如果你还没试过,现在就去下载吧: 👉 https://github.com/volcengine/OpenViking


作者: itech001 来源: 公众号:AI人工智能时代 网站: https://www.theaiera.cn/ 每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。

分享给朋友