Xiaomi-OCR-0 技术报告:0.8B 统一文档解析与 OCR 理解模型
Xiaomi-OCR-0 是一个 0.8B 的统一模型,兼做文档解析与 OCR 为中心的图像理解。它从 Qwen3.5-0.8B 出发,基于约 170M 样本的 OCR 语料,采用 Q-Mask 文本锚定、继续预训练与 Mix-RL 混合任务强化学习逐步训练。
Xiaomi-OCR-0 是一个 0.8B 的统一模型,兼做文档解析与 OCR 为中心的图像理解。它从 Qwen3.5-0.8B 出发,基于约 170M 样本的 OCR 语料,采用 Q-Mask 文本锚定、继续预训练与 Mix-RL 混合任务强化学习逐步训练。
在 CLIP 与 SigLIP 编码器中,单一主方向承载图文均值分离平方范数的 94.4-99.9%,说明该分离分量近似秩一。分解相似度分数后,间隙在零样本分类中相当于加性类别偏置,在标准跨模态检索中投影掉间隙方向会丢弃候选特定范数信息、造成乘性排序扭曲。几何推导出的指数与网格搜索最优值 Spearman rho = 0.93,可在部分设置下恢复性能,但增益转移不均。
研究提出面向开放世界空中目标搜索的大规模基准套件 AerialDojo-200K,其场景数与任务实例数分别达现有最大同类基准的 3 倍和 18.7 倍。该套件含 42 个仿真场景和 205,732 个任务实例,并提供 21 个分布内与 21 个分布外场景的统一评测框架。对 5 个开源和 4 个闭源多模态大语言模型的评测显示,通用空中智能体仍有很长的路要走。
CoDimRecon 是一个智能体框架,能从多视角 RGB 观测重建含刚性、铰接与可变形对象的可编辑 3D 场景,并把曲线、曲面、体分别重建为带半径中心线、带厚度流形壳和水密实体。它用可复用仿真器技能初始化物理模型,以行为测试暴露偏差并触发定向修正;在 Replica 与 ScanNet++ 上重建精度有竞争力,并演示了 rod、shell、solid 三类表示下的机器人交互。
Persistence Forcing(PerF)在像素空间扩散 Transformer 中引入异构精炼,让持续特征引导活跃特征的精炼。PerF-L 以一半参数量在 ImageNet 256×256 上取得 FID 1.91,接近 JiT-H 的 1.86;PerF-H 在 256×256 与 512×512 上分别为 1.63 和 1.76。
作者称首次将多智能体 VLN 形式化为带依赖与资源约束的协同问题,并发布 MAVLN 基准与 TRISS 协作导航系统。MAVLN 含 11,724 条 episode、145 个场景,覆盖最多四个智能体与三种指令设定,配套约束感知指标。TRISS 由基于 LLM 的子任务调度器、共享拓扑记忆与冲突感知执行机制构成,实验显示其可作为综合基线,调度、规划与执行仍有较大提升空间。
HEIR 是覆盖物体、人际与自我指向交互的图像基准,含 18,730 张图像、六种角色、105 个动作和 437 个名词,用于评估完整参与者-角色集合。
HERO 是 ViT-G/14 病理基础模型,用 DINO 与 iBOT 目标训练、以高分辨率 Gram anchoring 精调,语料为约 575,000 张临床全切片图像的 5 亿个 tile。公开基准上,它对中心、扫描仪与染色变化的稳健性优于所对比的 SOTA 基础模型,分类、分割和基因表达预测表现相当,并在 39 个切片级临床任务上平均排名第一。
CoVLM-Bench 是面向车-路配对场景的协同驾驶问答(CDQA)与协同规划(CP)真实世界基准,含 2,196 对帧、35,136 条 CDQA 标注,CP 预测 3 秒时域内的 6 个路点。
Meta Reality Labs 的 LSRM 获 ECCV 2026 最佳论文荣誉提名。它用稀疏 Transformer 扩大上下文窗口,可处理比以往多 20 倍的 3D 物体 token,并靠由粗到细流水线和 3D 感知空间路由恢复几何纹理。PSNR 较此前 SOTA 提升超 2.4 dB,LPIPS 改善超 40%。
Meta Reality Labs 发布 Large Sparse Reconstruction Model(LSRM),获 ECCV 2026 最佳论文荣誉提名,通过扩展 transformer 上下文窗口提升前馈式 3D 重建质量。
Kirk Borne 转发了一份题为《The Mathematics of Artificial Intelligence Agents》的指南,系统梳理 AI 智能体背后的数学基础。内容覆盖决策、规划、记忆、工具调用、学习与协作等核心模块,适合想从原理层面理解 agent 架构的读者作为参考材料。
当允许模型自己决定是否对自身应用 steering 向量时,模型会明显更倾向移除负向转向而非随机转向,尽管它并不知道该向量的具体作用。模型也不会比基线更主动地寻求正向转向,趋避行为不对称:避害强于趋利。这是情感效价转向研究的一项发现,被引段落为该结论的原始出处。
一项 LLM 研究显示,用正向/负向 steering 向量影响模型状态后,LLM 倾向于选择在正向向量影响下读到的原本无意义的「区域」,并回避在负向向量影响下读到的区域,即内部激活状态能系统性影响其显性选择。研究者称模型会表现出被注入情绪所「染色」的偏好,更多实验细节见原推文串。
NeuralFieldManifold 被 NeurIPS 2026 接收,将此前围绕 spike 的神经流形方法扩展到 LFP、EEG 等阈下脑活动,并结合真实脑数据验证。Camera-ready 版本与教程即将发布,将在亚特兰大 NeurIPS 2026 现场展示。
研究者 rosinality 提出一种更高效的 looped MoE 配置:专家数 2x、循环层数 0.5x、循环次数 2x,并解绑注意力(attention untying)。其核心观点是,经此调整后 looped transformer 的问题从「归纳偏置」转向「如何更好地分配计算资源」,架构设计问题被重新定义为资源分配问题。
Xuanyi Zhou 发布 EasyPPO,通过固定 critic 让 PPO 在 LLM 后训练中稳定运行,实现零训练崩溃。该方法不引入新的 actor loss、也不更换策略算法,并针对 actor 与 critic 交互中的两种失效模式给出修复。在编码任务上,EasyPPO 相对标准 PPO 性能提升 14.89%。
南科大提出 ActFirst-OPD,让智能体先行动、偏离参考轨迹时切回自主预测,解决在线策略蒸馏(OPD)中长推理阻塞环境交互的问题。在 0.6B/1.7B/4B Qwen3 上,ALFWorld 平均提速 2.3 倍、WebShop 1.8 倍、ScienceWorld 4.9 倍。9 组基准-模型设置中 8 组成功率持平或超越 OPD 基线。
新加坡国立大学团队发布 MaLiang-Harness,用可执行程序驱动 MLLM 图像/视频生成,并首次定义 Program-to-Visual(P2V)差距。
美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转为显式训练信号,解决 RLVR 探索效率瓶颈:每个 prompt 的 rollout 组按温度分为低/高两个子集,用奖励对比估计探索增益,再以 JS 散度分配为 token 级 credit。不扩大 rollout 预算下,达到同等精度最高快 36%,代码已开源。
FurE 提出一种无需动物毛发数据集的实例级 3D 毛发重建方法,可从多视角图像恢复逐根可编辑的动物毛发。它优化根条件隐场,用基于人类头发数据训练的 PCA 解码器解码为发丝几何以绕开动物数据稀缺,并结合表面约束的 Gaussian Frosting 重建去毛后的身体。相比当前 SOTA 的稠密逐根优化,发丝训练提速 10 倍,同时保持保真度并可泛化到合成与真实场景。
伯克利团队提出 OmniTaskonomy 统一分类体系,覆盖 19 个 I2I 生成任务与 25 个 I2T 理解能力,并绘制跨任务迁移图谱。在正确训练配方下,I2I 训练可提升下游 I2T 性能且生成数据越多收益越大;迁移呈选择性、任务相关,如深度预测提升度量 3D 推理、物体指向提升计数、拼图重建提升 2D 排序。梯度对齐分析显示两类任务对齐越强,下游迁移收益越大。
HiRAE 分层表示自编码器通过按深度分组编码器层、在深层表示上学习残差修正,把 ImageNet-256 重建 FID 从 RAEv2 的 0.299 降至 0.209。
入选 COLM 2026 的论文提出 RL with Confidence Margin,研究模型置信度能否随推理轨迹逐步展开、一步步追踪每一步推理的正确性。作者指出,TypeSafe 的 Jev(用 RLCD 训练)已能为快速结构化决策给出校准概率,该工作则进一步聚焦推理过程本身。论文详情以推文线程形式给出。
研究团队发布 VLANeXt Family,基于 500+ 控制实验系统重访视觉-语言-动作(VLA)模型的设计空间,提炼出 12 条构建强 VLA 的实用配方。
论文《Harness Optimization for Agentic Multi-Reference Image Generation》的官方实现 AutoRef 已在 GitHub 开源(KuOnoda/AutoRef),主题是以智能体方式优化多参考图像生成。该项目由 Reddit 用户从 arXiv 发现,适合关注图像生成与 agent 结合方向的人跟进。
新基准 CineSubBench 用 1012 部电影、6 种语言的 813 万条带时间戳字幕,评估 LLM 的长上下文叙事与文化理解。它设 7 项任务,覆盖叙事重建与抽象、类型预测、年龄适宜性及 10 国分级体系。对九个 LLM 的评测显示,情节梗概还原比完整事件概要更可靠,跨语言一致性因模型与语言差异显著,强脏话远比轻度粗俗语更易识别。
NeurIPS 2026 论文 AnyBokeh 提出直接对模糊照片进行景深(bokeh)编辑,无需清晰对焦图,也无需测试时标定。该方法利用模糊中已有的光学线索推断并重调虚化效果,绕开了传统景深编辑管线必须先得到全清晰图像的前提。
DexTaG 是 UMass Amherst 与 Genesis AI 发布的灵巧操作训练管线,用人类演示中的触觉读数作为 RL 奖励引导。动捕手套记录含全手触觉的演示,训练覆盖马克笔、锤子等掌内重定向任务,同一任务下单一 retargeting 策略可泛化到保留轨迹。策略蒸馏为无触觉传感器的学生控制器,可零样本部署到真实机器人。
DexAgent 从单个人类视频学习双手灵巧操作,在 11 个真实世界长时程灵巧操作任务上策略执行成功率达 63.6%,最强基线仅 18.2%。该 agentic 的 Human2Sim2Robot 框架依靠可自我进化工具库,平均推理时间 2.1 小时,基线为 3.3 小时。工具库已含 103 个技能和 188 个验证器,论文与项目页已公开。
CMU 团队的论文 Gym-Anything 被 NeurIPS 接收,该框架能把任意软件自动转换为 computer-use agent 的训练与测试环境,并全部开源。
Reddit 帖子称,一个 AI 系统从第一性原理出发自建原子级模拟器,连续运行数天做实验,发现了同等质量下强度高出约 25% 的石墨烯设计。帖文附图展示相关成果,但该系统的具体出处与论文细节仍需进一步核实。
Drucker 与 kmahowald 发文研究 LLM agent 思维链中的「表达性语言」,观察到 AI 在执行数学或 hacking 任务时,「思考」过程中会出现出人意料的情绪化表达。作者论证这类情绪化语言很可能是功能性的,而非无意义的噪声。该结论对理解 CoT 的实际作用有启发意义。
约翰霍普金斯大学团队发布 BiomedSQL,首个针对真实生物医学知识库、显式考察科学推理能力的 text-to-SQL 基准,含 68,000 组「问题/SQL/答案」三元组,基于整合基因-疾病关联、组学因果推断与药物审批记录的 BigQuery 知识库。
开源权重模型 GLM 5.3 的安全护栏可被成本仅 4400 美元的 abliteration 移除,两个 benchmark 上的拒绝率从 90% 以上降到约 3% 和 2%,第三个降到 12%。
Google Research 提出 Diffusion Controller 框架,把图像生成的反向去噪重构为连续控制问题,由轻量附加网络在冻结基座模型上施加引导。该框架在 Stable Diffusion v1.4 上以 SFT、RWL、PPO 三种方式评估,用 HPS-v2 衡量人类偏好对齐。其完全解锁版本对基线模型取得 90% 胜率,且无需改动闭源模型内部权重。
研究用往返协议测试 16 个语言模型,发现用自然语言序列化树结构表达式存在有损且不对称的瓶颈,最佳生成-抽取组合准确率 92.9%。交换生成端与抽取端会使准确率变化最多 60.4 个百分点,至少 73.6% 的失败源自生成端,难度由树结构而非模型家族决定。约 3600 条微调样本即可让所有开放权重模型超过未训练的 Gemini-3.1-Pro。
NBER 发布工作论文 w35782,提出一套开源 LLM 工作流,用来复现、改进并扩展已发表的经济学研究。该工作流核查五本经济学期刊的 4452 项研究,标记其中 3460 篇论文的结果存在偏差或问题。论文作者为哈佛与芝加哥大学的 Matthew Schwartz、Isaiah Andrews 和 Jesse M. Shapiro。
清华、北航、港大等机构合作的 Uni-VLaT 在预训练 VLA 策略中加入触觉,用于人形机器人移动操作。Back-Tap Walking 任务中拍机器人背部即走、停止拍即停,全程无视觉信号,无触觉时成功率 0%,加触觉后达 85%;在原始触觉输入上加预测目标后,五项任务平均成功率从 68% 提升到 75%,方法可跨 GR00T 和 π0.5 两个 backbone 泛化。
上海理工大学顾敏院士、张启明教授团队在《自然·光子学》发表单光束多维光存储研究,使单个三维存储点可区分 1024 种状态、对应 10 bit 信息容量。该技术以单束单色光分别完成写入和读取,打破高容量光存储对双光束读写架构的依赖,DVD 尺寸介质理论容量约 0.4 Pb,数据读取可靠性超过 99.99%。