跳到正文
热点事件持续更新

开源实验把 Qwen3-VL-4B 训成自回归图像生成器

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月1日,AGI Hunt 报道了一项开源实践:开发者 ostrisai 将 Qwen3-VL-4B-Instruct 训练成自回归(AR)图像生成器,做法是采用 Cosmos-1-DI16x16 作为图像 tokenizer,把图像转成 token 后交由该视觉语言模型自回归生成。报道称,目前模型在 256 分辨率下已经能够使用默认的 AI Toolkit 提示词出图,作者同时展示了当前训练状态下的生成效果图。报道的结论是这一方向可行,但整体仍处于早期阶段。除该篇报道外,暂无其他来源补充训练数据规模、耗时或后续计划等信息。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. AGI Hunt
    开源实践:把 Qwen3-VL-4B 训成自回归图像生成器

    ostrisai 用 Nvidia 的 Cosmos-0.1-Tokenizer-DI16x16 作图像 tokenizer,把 Qwen3-VL-4B-Instruct 训练成自回归(AR)图像生成器。目前 256 分辨率下已能用默认 AI Toolkit 提示词出图,作者展示了当前训练状态的效果图,表明方向可行但仍处早期阶段。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。