跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

33条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 21–33 条 · 共 33 条
6月11日周四
6月9日周二
  1. Google DeepMind77

    Google DeepMind 发布 Gemma 4 12B 无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款无编码器的多模态模型,可在笔记本本地运行。该模型把视觉输入改为单次矩阵乘法的轻量嵌入模块,并去掉音频编码器,将原始音频信号投影到与文本 token 相同的维度,是 Gemma 4 系列首款支持原生音频输入的中等规模模型。

    推荐理由:Gemma 4 12B 用无编码器架构让视觉和音频直接进入 LLM,性能接近 26B MoE 而内存占用不到一半。

5月22日周五
4月3日周五
3月24日周二
  1. Mistral AI66

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数支持 9 种语言

    Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,已通过 API 提供,定价 $0.016 / 1k 字符。

    推荐理由:官方给出了 4B 模型在 9 种语言上的延迟、单价以及和 ElevenLabs 的人评对比口径,便于判断语音 Agent 的选型与成本。

3月17日周二
  1. Mistral AI73

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码智能体能力

    Mistral AI 发布 Mistral Small 4,称其是首个把 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力统一进单一模型的 Mistral 模型,以 Apache 2.0 许可开源。

    推荐理由:Mistral Small 4 把推理、多模态与编码能力合进一个开源模型,读者可据此评估单模型替代多模型组合的部署取舍。

2月5日周四
  1. Mistral AI63

    Mistral 发布 Voxtral Transcribe 2,推出实时与批处理两款语音转写模型

    Mistral 发布 Voxtral Transcribe 2 系列两款语音转写模型,包括用于批处理的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,后者以 Apache 2.0 权重在 Hugging Face 开源。

    推荐理由:Realtime 以 sub-200ms 延迟和 Apache 2.0 权重开源,读者可据此比较实时语音应用的端侧落地成本。

12月9日周二
12月3日周三
7月11日周五
6月10日周二
5月21日周三
  1. Mistral AI70

    Mistral AI 与 All Hands AI 开源编码智能体模型 Devstral

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SoTA 6 个百分点以上。

    推荐理由:给出同框架模型对比数据、单卡部署门槛与 API 价格,可帮助判断开源编码智能体当前的能力水位与落地条件。

3月17日周一