编程 HuggingFace Transformers v5.14.0 发布:支持 Inkling 多模态大模型(975B 参数)

2026-09-05 20:44:56

HuggingFace Transformers v5.14.0 发布:支持 Inkling 多模态大模型(975B 参数)

HuggingFace 发布 Transformers 库 v5.14.0 版本。本次更新最引人注目的是新增了对 Inkling 模型的支持——这是一个来自 Thinking Machines 的通用多模态模型,总参数 975B,激活参数 41B,支持文本、图像和音频输入,生成文本输出。

Inkling 模型详解

Inkling 是 Thinking Machines 公司推出的旗舰多模态大模型,在 Transformers v5.14.0 中正式获得支持。

模型架构

Inkling 采用了 MoE(Mixture of Experts,混合专家)架构:

  • 总参数:975B(十亿)
  • 激活参数:41B(每次推理只激活约 4.2% 的参数)
  • 多模态输入:支持文本、图像和音频三种输入模态
  • 输出:文本生成

MoE 架构的优势在于,在保持大规模参数容量的同时,推理成本只与激活参数相关。41B 的激活参数意味着推理速度和成本接近 41B 稠密模型,但模型的知识容量和表达能力接近千亿级模型。

多模态能力

Inkling 是一个真正的通用多模态模型,能够同时处理多种输入模态:

  • 文本理解和生成:具备强大的自然语言理解和生成能力
  • 图像理解:能够分析图像内容,回答关于图像的问题
  • 音频理解:能够处理音频输入,包括语音识别和音频内容理解
  • 跨模态推理:能够结合多种模态的信息进行推理,例如根据图像和音频回答问题

这种多模态能力使得 Inkling 在内容创作、智能助手、多媒体分析等场景中有广泛的应用潜力。

在 Transformers 中的使用

在 Transformers 库中使用 Inkling 非常简单:

from transformers import AutoModelForCausalLM, AutoProcessor

model = AutoModelForCausalLM.from_pretrained(
    "ThinkingMachines/Inkling",
    torch_dtype="auto",
    device_map="auto"
)
processor = AutoProcessor.from_pretrained("ThinkingMachines/Inkling")

# 文本输入
inputs = processor(text="Hello, how are you?", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=100)

# 多模态输入(文本 + 图像)
inputs = processor(
    text="Describe this image:",
    images=image,
    return_tensors="pt"
)

由于模型参数量巨大(975B),完整部署需要多 GPU 环境。但通过 MoE 架构和量化技术,可以在相对有限的硬件上运行。

v5.14.0 的其他更新

除了 Inkling 模型,v5.14.0 还包含了多项其他改进:

新模型支持

  • Inkling:如上所述,Thinking Machines 的多模态 MoE 模型
  • 其他小模型和架构的新增支持

性能优化

  • 推理速度提升:多个模型的推理路径优化,特别是长文本生成场景
  • 内存占用优化:改进了 KV cache 的管理,减少长文本生成时的内存峰值
  • 量化支持改进:对 4-bit/8-bit 量化的支持更加完善,量化后的精度损失更小

Bug 修复

  • 修复了多个模型在特定输入下的数值不稳定问题
  • 修复了分布式训练中的一些同步问题
  • 改进了错误信息和异常处理

Transformers 库的发展

HuggingFace Transformers 是目前最流行的深度学习模型库之一,支持数千个预训练模型,涵盖自然语言处理、计算机视觉、语音处理等多个领域。

v5.x 系列是 Transformers 的大版本升级,在架构设计、性能优化和模型支持方面都有重大改进。从 v5.13.0 到 v5.14.0,每个版本都在持续增加新模型支持和改进现有功能。

Transformers 库的核心优势包括:

  • 统一的 APIAutoModelAutoTokenizer 等统一接口,让切换模型变得简单
  • 广泛的模型支持:支持几乎所有主流的预训练模型
  • 多框架兼容:同时支持 PyTorch、TensorFlow 和 JAX
  • 活跃的社区:每周都有新模型和新功能加入

对 AI 开发者的意义

Transformers v5.14.0 的发布对 AI 开发者有以下意义:

前沿模型即时可用:Inkling 这样的前沿多模态模型在发布后很快就能通过 Transformers 库使用,降低了使用门槛。

多模态开发更便捷:统一的 AutoProcessor 接口让处理多模态输入变得简单,不需要为不同模态编写不同的预处理代码。

MoE 模型的普及:Inkling 这样的 MoE 模型获得官方支持,意味着 MoE 架构正在成为大模型的主流设计之一。

开源生态的活力:Transformers 库的快速迭代体现了开源 AI 生态的活力,新模型从发布到广泛使用的时间越来越短。

注意事项

使用 Inkling 模型时需要注意:

  1. 硬件要求:975B 参数的模型需要多 GPU 环境,建议至少 8x A100/H100 或等效配置
  2. 量化部署:对于资源有限的场景,可以使用 4-bit/8-bit 量化减少显存需求
  3. 许可协议:使用前请仔细阅读 Inkling 模型的许可协议,确认商用权限
  4. 版本兼容性:确保 Transformers 版本 >= 5.14.0,以及相关依赖(torch、accelerate 等)的版本兼容

项目地址:https://github.com/huggingface/transformers
发布说明:https://github.com/huggingface/transformers/releases/tag/v5.14.0

推荐文章

程序员茄子在线接单