ehartford 推出面向人类与智能体的 With 编程语言
开发者 ehartford(QuixiAI)向 aallan 的 agentlanguages 仓库提交 PR,收录其编程语言 With(withlang.org),定位为面向 LLM/智能体编写程序的语言。With 既追求对智能体高效,也强调对人类友好,`with init` 命令会在项目中生成 CLAUDE.md 和 AGENTS.md 等文件,以兼顾人与智能体的协作需求。
开发者 ehartford(QuixiAI)向 aallan 的 agentlanguages 仓库提交 PR,收录其编程语言 With(withlang.org),定位为面向 LLM/智能体编写程序的语言。With 既追求对智能体高效,也强调对人类友好,`with init` 命令会在项目中生成 CLAUDE.md 和 AGENTS.md 等文件,以兼顾人与智能体的协作需求。
PrismQuant 提出量化器感知的旋转框架,将激活主特征空间与非对称分组 INT4 的常量组子空间对齐。在 W4A4KV4 下 Llama-3.2-3B 达到 SOTA,Llama-3.1-70B 困惑度 3.85、平均零样本准确率 72.46%,仅比全精度低 0.22 个百分点。
KAIST 提出面向开放词汇语义分割(OVSS)的偏好引导适配框架,用不同提示模板间的「提示分歧」取代像素级标注,从跨模板不确定性高的区域挖掘局部偏好查询。方法采用 Region-Localized Preference Optimization(RLPO)配合区域外一致性正则,在 MESS 基准上让多种 OVSS 骨干获得一致提升,无需任何像素级标注,且在偏好噪声下依然有效。代码已开源。
CrossTimeEdit 将历史街景生成重构为编辑任务,以 FLUX.2 [Klein] 4B 为起点经 SFT 与在线 RL 训练,整体性能较预训练基线提升 17.12%。其配套 VIGOR-his 数据集覆盖三大洲 11 座城市,含 43,653 个位置级四元组。模型以 Flow-GRPO 与 GDPO 优化 IA、BP、QP 三项奖励,代码、数据集与模型权重已公开。
开源 Agent 框架 Omnigent 发布 v0.16.0,Linux Agent 新增 copyonwrite: true 沙盒写入,编辑只留在一次性层、不改动底层文件。
OTT3R 是一个知识蒸馏框架,把 959M 参数的 π³ 蒸馏成 102M 参数的学生模型,压缩 9.4×、推理最高快 7×,训练算力仅为 VGGT 的 1.6%。
PowerZooJax 是基于 JAX 的电力系统强化学习基准,覆盖发电、输电、配电、分布式能源与数据中心微电网 5 个约束马尔可夫决策过程任务。它把潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使训练与评估全程留在 GPU 上,相比 CPU 仿真显著加速。该开源基准还对策略回报、安全违规和分布外压力场景提供标准化评估。
DeepSeek 批量更新其大部分开源库,新增对华为昇腾(Huawei Ascend)的支持。eliebakouch 指出了这一更新,yacineMTB 以夸张的戏剧化反应转发,暗示这一 NVIDIA 生态替代信号值得关注。
开发者 matchaman11 推出 OpenAI Dots 的开源复刻项目 Open-Dots,上线不到 24 小时即斩获 4500+ GitHub 星,一度达 4.3k star。该项目定位为 OpenAI Dots 的开源替代品,是可自托管、本地优先的 AI 工作台,整合聊天、工具调用与操作审计功能,因满足社区对自主可控 AI 工作区的需求而迅速走红。
新加坡国立大学团队发布 MaLiang-Harness,用可执行程序驱动 MLLM 图像/视频生成,并首次定义 Program-to-Visual(P2V)差距。
研究团队发布 VLANeXt Family,基于 500+ 控制实验系统重访视觉-语言-动作(VLA)模型的设计空间,提炼出 12 条构建强 VLA 的实用配方。
论文《Harness Optimization for Agentic Multi-Reference Image Generation》的官方实现 AutoRef 已在 GitHub 开源(KuOnoda/AutoRef),主题是以智能体方式优化多参考图像生成。该项目由 Reddit 用户从 arXiv 发现,适合关注图像生成与 agent 结合方向的人跟进。
SGLang 团队把 Qwen3.8-27B 改造成多模态决策模型,从实时游戏画面出发,以低于 100 毫秒的决策延迟打通《宝可梦火红》的四天王与冠军。工程层面,SGLang 新增原生 /v1/decisions 接口,可将 LLM 和 VLM 当作分类与打分模型使用;另加 /v1/systemone,让 Jev 类开源模型可配合 TypeSafe SDK 使用。
SFTMill 开源,通过 OpenAI 兼容端点对任意现有 LLM 做离策略蒸馏,把行为目标转成完整训练数据集。工作流用 YAML 定义课程表,由 LLM 生成任务,教师模型逐题求解产出覆盖微调目标的问答数据集。作者建议任务生成至少用 Qwen 3.8 27B(medium 档),更弱的模型质量不够。
开发者 Ahmed Khaleel 的开源项目 GitDiagram 已获得约 17.4k 星标,用户只需改动 GitHub 仓库链接中的 hub,就能把任意仓库转换成可交互的架构图。该工具因简单易用在开发者社区走红,被用来快速理解项目结构和讲解代码仓库。
GitHub 项目 effective-html(3.3k star)提供一组专注的 agent skills,让模型生成自包含的 HTML 工件,覆盖低保真线框图、可交互原型、系统图表与计划文档。
DWD MCP Server 在 Reddit 的 modelcontextprotocol 板块上线,通过 Bright Sky API 接入德国气象局(DWD)数据,支持实时天气、预报和官方气象预警查询。用户可用城市名或地理坐标查询天气信息并定位气象站。项目地址已收录于 glama.ai/mcp/servers/jimimatt/dwd-mcp-server。
skillry 是一个 Manus 风格的开源 skill,能读懂 CellMotion 网站动效的实现逻辑,做到随意修改而不变形,并基本完整复刻了原站效果。该项目属于 @yihuiindie,由独立开发者 @opc8838 分享,已开源并附带可在线体验的动效库。动效库涵盖文字与图形运动组件,可用于视频创作和网页表达。
开发者发布开源视频编辑智能体 Open Edit,能把视频(包括 Opus 5.5 生成的视频)转换成可在浏览器中编辑的项目,实现「生成即可编辑」。作者称其攻克了视频到可编辑工程转换的关键环节,项目已开源并附有 GitHub 地址。
作者 randal_olson 用开源图表生成 skill evident-charts 对 Artificial Analysis 数据做“一图一问”测试,Intelligence Index 排名最高的是 Anthropic。Anthropic 自 2026 年 4 月以来每天位居榜首。帖子同时演示了该开源 skill 的实际效果。
数据科学家 Randy Olson 开源了面向 AI 编码 agent 的图表 skill evident-charts(GitHub 49 star),让 Claude Code、Codex、Cursor 等在画图时遵循清晰、诚实的原则,并在用户看到之前自动检查每张图。
jacob_posel 在 X 上分享了一条实用贴士:用开源电子签名工具 Docuseal 配合 AI 自动化合同处理。原帖只有一句话,没有展开具体工作流,但为需要批量处理合同、协议签署的个人和小团队指出了一个可直接上手的工具方向。
开发者 LoksaiPalyam 发布开源概念项目 VeriChron AI,用双时态数据、知识图谱与 AI Agent 重建企业任意时点的合规状态,并区分 Valid Time 与 System Time。
开源项目 AutonomousVehicleControlBeginnersGuide(1.7k star)将全部 38 个自动驾驶仿真演示汇总为一个画廊页面,演示描述由对应脚本的 docstring 生成,合并后由 CI 自动更新,无需手工维护文档。
Self-Play Search Distillation(SPSD)通过棋盘游戏自对弈中的 MuZero 类网络搜索生成超人类合成数据,并把搜索记录转成思维链,为大语言模型提供环境接地监督。在 Qwen3-4B-Base 上,六个数学基准的平均分从 24.1 升至 36.6,未见过的游戏胜率从 15% 升至 45%。该方法仅用自对弈搜索记录训练,即可迁移到数学推理。
arXiv 论文《Focusing Condition》提出推理时即插即用的自对比引导方法 SCS,通过遮蔽条件得到无条件嵌入,再用它引导多头自注意力计算,提升 LLM 条件文本嵌入质量。该方法无需额外数据或微调,推理时仅多一次多头自注意力计算。在聚类、语义文本相似度(STS)和三元组对齐数据集上验证,可叠加现有 prompt 方法并全面提升性能,代码已开源。
DealPulse 基于 Vectorize Hindsight 持久记忆构建 B2B 销售助手,用三库分区记忆替代上下文堆砌。记忆分为 episodic 通话记录、赢单 playbook 和竞争对手情报三类,逐字保留客户异议与利益相关者情绪,可在 2 秒内召回此前具体承诺并生成有依据的反制策略。代码已在 GitHub 开源。
作者基于 Unsloth 做微调合并,发布名为 Gmcoder 的 9B 开源编码模型,已在 Hugging Face 上线。据称该模型在 HumanEval+ Mini 上超过 Ornith 1.5 和 Oxcoder,且不靠「过度思考」取胜,回答问题时 token 消耗比对手少 40–68%。这属于个人开发者的开源微调实战成果。
开发者 Jerry 开源确定性 LLM 测试环境 Enclosure,它模拟带 Slack、日历、邮件等工具的办公场景,对话由 AIML 而非真模型驱动,保证完全可复现。首个测试 Disposition 是给模型做的「性格测试」,并非可刷分的 benchmark,而是帮用户找到匹配自己工作风格的模型。项目已放出首批三个模型的结果图,并号召社区用更多模型跑测试提交。
开发者发布基于 llama.cpp 的开源工具 Carla v0.1.0,一个完全本地运行的 loom TUI 与角色实验室。其流程为基座模型加种子文档、分支式续写再到对话式 loom 以涌现 AI 角色,支持 /loom [count] 并行多轮对话,由 Jev 按自定义行为规范评估循环、spiraling 与有害语言。作者称目标是为下一阶段的训练做准备。
Conor Bronsdon 发布社区维护的 GitHub 项目 ai-angels,收录 51 位活跃的 AI 天使投资人,每条记录都附有公开来源和最近验证日期。
研究用一次前向计算读取 argmax p(. | t, t),把语言模型对自身重复 token 的映射画到整个词表。非固定点部分按源 token 配对消除基数混杂后,模型家族归属准确率达 0.8333(12 个模型对 19 个模型池,随机 0.1389),固定点部分为 0.5833。
G²PTQ 提出统一的大语言模型训练后量化框架,在全局监督的块级目标下融合一阶与二阶信息,并在量化每个 Transformer 块前刷新梯度与 Hessian 估计。它引入 trust-region 缩放机制约束梯度步长,防止权重更新爆炸。在多种模型族和位宽上,G²PTQ 与全精度模型的对齐优于 SOTA 基线。
SEA-CLIP-Tiny 是参数量不足 50M 的多语言文本-视觉嵌入模型,面向东南亚语言,用 CLIP-KD 式框架结合区域数据筛选与多语言教师引导。在 7 种东南亚语言上,其平均检索表现在受评学生模型中最佳,R@1、R@5、R@10 分别为 12.9%、31.5%、42.2%。
用 LLM 向英语、荷兰语、中文 BabyBabelLM 语料注入词级与句级语码切换后再预训练小型 decoder-only Transformer,可让平行文本表征(尤其跨书写系统)趋于对齐。按词级语码切换→句级语码切换→单语文档的课程训练,模型在 BabyLM 评测套件上优于未使用该数据的基线。代码、数据与模型已公开。
开发者开源 RecallOps,一个基于 Hindsight 持久记忆框架、采用 MIT 协议的事故响应 Agent。其工作流为「事故→召回→反思→调查→解决→留存」,会召回相关历史事故并按相关性与时间新旧排序证据,区分成功修复与失败尝试。例如 503 故障会回忆起两起相似事故:一起靠扩大连接池解决,另一起同样修复失败、真因是下游服务故障。
Reddit 用户 arturor1990 发布开源节点包 ComfyUI-BubbleText,可自动擦除 AI 生成图片对话气泡内的乱码字母并写入用户指定的真实文本。该节点支持 emoji,兼容 Anima、Illustrious 和 NoobAI 模型,可配合 LoRA Manager 使用。作者坦承项目是 vibe-coded,节点标签为西班牙语,已在 GitHub 开源并征集反馈。
Déjà Review 已在 GitHub 开源,这是一个由 Hindsight 驱动、具备项目级持久记忆的代码审查 Agent。它能记住用户此前的审码偏好,并结合历史上下文进行代码评审,给出更贴合项目习惯的审查意见。团队同时附带演示视频,具体实现细节见配套 LinkedIn 文章。
Simon Willison 于 9 月 24 日发布一条关于 commit-rewriter 0.2 的短记,标签为 git。该短记未给出这一工具的功能说明、版本变化或可用性信息。
Simon Willison 发布 llm-anthropic 0.29,该条目于 9 月 22 日发出,仅标注 llm 与 anthropic 两个标签,未披露具体更新内容。