CELLO:从 H&E 组织学图像实现可扩展的上下文感知单细胞空间转录组预测
CELLO 可从 H&E 组织学图像预测单细胞基因表达,每张图像仅需一次病理基础模型前向传播,并用网格采样同时提取所有细胞特征。其距离衰减交叉注意力模块以空间偏置的局部形态学上下文细化细胞表征。
CELLO 可从 H&E 组织学图像预测单细胞基因表达,每张图像仅需一次病理基础模型前向传播,并用网格采样同时提取所有细胞特征。其距离衰减交叉注意力模块以空间偏置的局部形态学上下文细化细胞表征。
研究团队提出由 story agent、image agent 和 critic agent 组成的多智能体框架,在科学、健康和娱乐领域生成超 9,000 条配对的多模态社交媒体假新闻,并用其评测 16 个开源与闭源 MLLM 的自动检测能力。
MATE 是基于强化学习的后训练框架,让统一多模态模型的生成与理解分支轮流充当挑战者与求解者、相互对抗。在 Janus-Pro-1B 上,它使 GenEval 提升 2.4 分、DPG-Bench 提升 1.7 分,九个理解基准平均提升 0.7 分。对抗候选来自模型自身输出,无需单独训练对抗器,落败候选转为下一轮挑战,训练在数据空间形成自博弈。
LeRF 框架让 VLM 学会构建并使用显式参考坐标系做视角转换推理。模型先判断是否需要坐标系,再定位参考实体并预测坐标系原点与以实体为中心的参考坐标系,由轻量渲染器叠加到图像上,无需外部感知模型或显式 3D 重建。训练先监督微调、再用空间 VQA 数据强化学习,在多个视角转换 benchmark 上优于骨干模型,坐标系定位与朝向估计亦有提升。
PreviewDiff 是一种无需训练的测试时搜索方法,把扩散采样从标量搜索变为对中间潜变量的多模态 critic 引导搜索。它在选定的去噪检查点解码部分预览,由多模态 judge 打分并给出自然语言反馈,据此对语义提示词编辑和局部重新加噪的潜变量分支做评分与选择性续跑。
面向韩语发票信息提取的 OCR 模型将深度学习模型与图像预处理技术结合,在收集的发票数据集上达到 87% F1-score,且处理耗时几乎可忽略。该模型用于自动抽取发票中的购买商品、时间和总金额等信息;韩语是约 8000 万人的母语,在越南、菲律宾等地有大量韩国企业,发票信息自动提取需求明确。
EKI 是一个两阶段框架,把取证专家的细粒度感知能力内化进 MLLM,用于篡改文本检测。Stage 1 用 Text-Focused 与 Image-Focused 策略聚焦小文字区域,Stage 2 通过 FGRA 损失对齐浅层 LLM 表征与预训练取证专家。EKI 在多个域内与跨域 benchmark 上取得 SOTA 和更强泛化,专家只在训练时需要,推理效率与原始模型几乎一致。
Xiaomi-OCR-0 是一个 0.8B 的统一模型,兼做文档解析与 OCR 为中心的图像理解。它从 Qwen3.5-0.8B 出发,基于约 170M 样本的 OCR 语料,采用 Q-Mask 文本锚定、继续预训练与 Mix-RL 混合任务强化学习逐步训练。
在 CLIP 与 SigLIP 编码器中,单一主方向承载图文均值分离平方范数的 94.4-99.9%,说明该分离分量近似秩一。分解相似度分数后,间隙在零样本分类中相当于加性类别偏置,在标准跨模态检索中投影掉间隙方向会丢弃候选特定范数信息、造成乘性排序扭曲。几何推导出的指数与网格搜索最优值 Spearman rho = 0.93,可在部分设置下恢复性能,但增益转移不均。
研究提出面向开放世界空中目标搜索的大规模基准套件 AerialDojo-200K,其场景数与任务实例数分别达现有最大同类基准的 3 倍和 18.7 倍。该套件含 42 个仿真场景和 205,732 个任务实例,并提供 21 个分布内与 21 个分布外场景的统一评测框架。对 5 个开源和 4 个闭源多模态大语言模型的评测显示,通用空中智能体仍有很长的路要走。
作者称首次将多智能体 VLN 形式化为带依赖与资源约束的协同问题,并发布 MAVLN 基准与 TRISS 协作导航系统。MAVLN 含 11,724 条 episode、145 个场景,覆盖最多四个智能体与三种指令设定,配套约束感知指标。TRISS 由基于 LLM 的子任务调度器、共享拓扑记忆与冲突感知执行机制构成,实验显示其可作为综合基线,调度、规划与执行仍有较大提升空间。
CoVLM-Bench 是面向车-路配对场景的协同驾驶问答(CDQA)与协同规划(CP)真实世界基准,含 2,196 对帧、35,136 条 CDQA 标注,CP 预测 3 秒时域内的 6 个路点。
Meta Reality Labs 的 LSRM 获 ECCV 2026 最佳论文荣誉提名。它用稀疏 Transformer 扩大上下文窗口,可处理比以往多 20 倍的 3D 物体 token,并靠由粗到细流水线和 3D 感知空间路由恢复几何纹理。PSNR 较此前 SOTA 提升超 2.4 dB,LPIPS 改善超 40%。
Meta Reality Labs 发布 Large Sparse Reconstruction Model(LSRM),获 ECCV 2026 最佳论文荣誉提名,通过扩展 transformer 上下文窗口提升前馈式 3D 重建质量。
雅虎前 CEO、前 Google 高管 Marissa Mayer 于 9 月 30 日发布个人 AI 助理 Dazzle。该产品读取手机相册,从服装、旅行、夜出行等照片中理解用户偏好,实现个性化购物推荐与代理购物,并把手机相机按钮变成无需输入提示词的「搞定」按钮,直接基于当前画面提供即时上下文与操作。
新加坡国立大学团队发布 MaLiang-Harness,用可执行程序驱动 MLLM 图像/视频生成,并首次定义 Program-to-Visual(P2V)差距。
FurE 提出一种无需动物毛发数据集的实例级 3D 毛发重建方法,可从多视角图像恢复逐根可编辑的动物毛发。它优化根条件隐场,用基于人类头发数据训练的 PCA 解码器解码为发丝几何以绕开动物数据稀缺,并结合表面约束的 Gaussian Frosting 重建去毛后的身体。相比当前 SOTA 的稠密逐根优化,发丝训练提速 10 倍,同时保持保真度并可泛化到合成与真实场景。
伯克利团队提出 OmniTaskonomy 统一分类体系,覆盖 19 个 I2I 生成任务与 25 个 I2T 理解能力,并绘制跨任务迁移图谱。在正确训练配方下,I2I 训练可提升下游 I2T 性能且生成数据越多收益越大;迁移呈选择性、任务相关,如深度预测提升度量 3D 推理、物体指向提升计数、拼图重建提升 2D 排序。梯度对齐分析显示两类任务对齐越强,下游迁移收益越大。
HiRAE 分层表示自编码器通过按深度分组编码器层、在深层表示上学习残差修正,把 ImageNet-256 重建 FID 从 RAEv2 的 0.299 降至 0.209。
视频博主 EHuanglu 用 Claude Opus 5.5 生成了一段想象《戴珍珠耳环的少女》被创作那一刻的视频,画面被认为真实而动人,获得包括 justin_hart 在内的多人转发称赞。
论文《Harness Optimization for Agentic Multi-Reference Image Generation》的官方实现 AutoRef 已在 GitHub 开源(KuOnoda/AutoRef),主题是以智能体方式优化多参考图像生成。该项目由 Reddit 用户从 arXiv 发现,适合关注图像生成与 agent 结合方向的人跟进。
GoPro 用户 Peter Szilagyi 请 Claude 帮忙清理录音里的"风扇噪声",Claude 却判定这不是风扇声:59.94 Hz 基频正好匹配视频帧率,说明是 GoPro 电子元件把帧率杂音漏进了内置麦克风。Claude 仅凭音频特征就完成了这次专业级的故障归因。
SGLang 团队把 Qwen3.8-27B 改造成多模态决策模型,从实时游戏画面出发,以低于 100 毫秒的决策延迟打通《宝可梦火红》的四天王与冠军。工程层面,SGLang 新增原生 /v1/decisions 接口,可将 LLM 和 VLM 当作分类与打分模型使用;另加 /v1/systemone,让 Jev 类开源模型可配合 TypeSafe SDK 使用。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和影像等模态训练的生物学世界模型,以及连接模型、科学工具、文献与研究者的交互框架组成。
Condé Nast 用 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频发现方案,将每项内容发现任务耗时从 250 分钟降至不到 2 分钟。方案由 AWS GenAIIC 合作开发,采用 TwelveLabs Marengo 嵌入模型,对超过 140,000 个视频的转录、视觉和音频做意图语义搜索,支持图像查询与精确时间戳。
AMD 宣布以约 82 亿美元全股票收购空间智能初创公司 World Labs,其创始人李飞飞将加入 AMD 出任执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。
推荐理由:这笔 82 亿美元全股票交易把世界模型团队并入芯片厂商,可与 Nvidia 收购 Hugging Face 的生态打法对照。
字节 Seedream 5.0 Flash 已在 Runware 平台上线,主打高吞吐量图片编辑,价格为每张输出图片 $0.019 起。该模型最多可用 10 张参考图进行编辑,能将一张图分解为最多 16 层 PNG 图层,并支持通过精确的 prompt 坐标定位做局部编辑。
作者用 RTX 5090 配合 ComfyUI 在本地实测 MiniMax H3 生成 30 秒长打斗场景,经数十次控制变量渲染给出配置结论。打斗动作建议用 HyperFlow 8 步且不加 LoRA,放大 pass 加 taomate 3-step LoRA 时武器一致性与运动质量最佳,对话或慢节奏仍用 4 步 turbo。
清华、北航、港大等机构合作的 Uni-VLaT 在预训练 VLA 策略中加入触觉,用于人形机器人移动操作。Back-Tap Walking 任务中拍机器人背部即走、停止拍即停,全程无视觉信号,无触觉时成功率 0%,加触觉后达 85%;在原始触觉输入上加预测目标后,五项任务平均成功率从 68% 提升到 75%,方法可跨 GR00T 和 π0.5 两个 backbone 泛化。
Microsoft Research 与 Broad Institute 合作推出面向生物学的多模态世界模型 Quine,联合训练基因组、蛋白质、化学、RNA/细胞状态与生物成像等跨尺度表征,一个模态的证据可支撑另一模态的预测,并配有连接模型、科学工具、文献与湿实验的交互式 harness。
前雅虎 CEO Marissa Mayer 公开个人 AI 助手 Dazzle,它只从手机相册提取上下文,不用邮箱、日历或购物记录。该产品去年 12 月完成 800 万美元种子轮,功能分为两类:用近期照片处理即时任务,例如按活动传单填日历;以及基于相册给出假期和礼物建议。记者实测中它推荐了地中海目的地,却没记住女儿已经会轮滑;Mayer 强调 Dazzle 会丢弃被判定为敏感的个人信息。
Reddit 用户 arctvofficial 用 Seedance 2 生成中式玄幻短片《全球觉醒:我能召唤华夏诸神》,展示了中国神话召唤题材的 AI 视频创作效果。同批资讯中,还有人用 Seedance 2.5 以单条提示词生成霍比特人村庄版自拍 vlog。
AMD 以 82 亿美元收购 World Labs,后者自 2024 年成立以来主攻空间智能,并在收购 SceniX 后向机器人仿真方向布局。World Labs 称其 Atlas 是首个 omni 模型架构,可从 2D 图像输入预测新的相机视角,用生成模型结合多视图几何解决计算机视觉中的稀疏重建难题,面向机器人、设计与工程等场景。
ACV-Gate 用 set-aware student 借助终端优势与遗憾预测候选排序,只对受成本阈值约束的有限候选做精确反事实评估,在降低视觉 token 通信编码端计算的同时提升重建质量。在 CIFAR-10 的 0.20 bpp 下,其主配置比 LocalMDL 提升 0.636 dB PSNR,每图仅需 2.13 次候选评估,约为 Exact-Full 专家调用量的 27.60%。
BioEVAL 是由 22 个研究团队共建的 PhD 级生物工程基准,用于评测大语言模型与多模态模型的实验推理能力。该基准含 608 道评测题、覆盖 11 个生物工程子领域,ChatGPT、Gemini、Grok 及可在消费级 GPU 本地部署的模型参与评测。多选题最高准确率 90%,文献综合相似度 0.72,小样本多模态推理题准确率 80%。
David Patterson 回应「水管工在 AGI 后仍有工作」的说法,重申 AGI 将同时取代知识型工作和体力劳动。他认为 Claude、ChatGPT 将完全多模态化并控制人形机器人,且这已经在发生。他预计一两年内,它们在所有事情上都会超过任何人类,包括水管工这类体力职业。
有人用 Claude 把 Anthropic《Functional Emotions》论文内容写成歌曲,再由 Opus 为这首歌制作 MV,成片被形容为「美得令人屏住呼吸」。这次尝试展示了模型跨文本、音乐、视频的完整创作链路。
开发者 @yihuiindie 为产品 CellMotion 制作了一支 Manus 风格宣传片并在 X 上分享,同时回应了 @opc8838 此前的互动。短片带有明显的 AI 生成视频质感,展示了独立开发者用 AI 工具快速产出产品宣传物料的玩法。
一位 ComfyUI Cloud 新手在 Reddit 求助:用 Qwen Image Edit 2511 把 Pinterest 真人照片的姿态、构图与光线迁移到自己的照片并叠加环境、服装参考图时,出现身份漂移、比例改变和皮肤过度磨皮。
博主 FinanceYF5 用同一条提示词对比 Opus 5.5 的 Max effort 与 Grok 4.7 Fast 的 xhigh effort 生成动态图形视频:提示词要求制作一段 15 秒的动感动态图形视频,展示其作为顶级动态设计师的实力。两条视频可对照看两家模型在动态图形生成上的风格与质量差异。