跳到正文

#开源/仓库

今日 14 条
今天9月30日周三
  1. AGI Hunt34

    ehartford 推出面向人类与智能体的 With 编程语言

    开发者 ehartford(QuixiAI)向 aallan 的 agentlanguages 仓库提交 PR,收录其编程语言 With(withlang.org),定位为面向 LLM/智能体编写程序的语言。With 既追求对智能体高效,也强调对人类友好,`with init` 命令会在项目中生成 CLAUDE.md 和 AGENTS.md 等文件,以兼顾人与智能体的协作需求。

  2. AGI Hunt43

    KAIST 用提示分歧替代像素标注,实现零样本分割免标注适配

    KAIST 提出面向开放词汇语义分割(OVSS)的偏好引导适配框架,用不同提示模板间的「提示分歧」取代像素级标注,从跨模板不确定性高的区域挖掘局部偏好查询。方法采用 Region-Localized Preference Optimization(RLPO)配合区域外一致性正则,在 MESS 基准上让多种 OVSS 骨干获得一致提升,无需任何像素级标注,且在偏好噪声下依然有效。代码已开源。

  3. arXiv cs.CV35

    CrossTimeEdit:面向历史街景生成的十年跨度跨视角数据集与奖励引导编辑

    CrossTimeEdit 将历史街景生成重构为编辑任务,以 FLUX.2 [Klein] 4B 为起点经 SFT 与在线 RL 训练,整体性能较预训练基线提升 17.12%。其配套 VIGOR-his 数据集覆盖三大洲 11 座城市,含 43,653 个位置级四元组。模型以 Flow-GRPO 与 GDPO 优化 IA、BP、QP 三项奖励,代码、数据集与模型权重已公开。

  4. arXiv cs.AI33

    PowerZooJax:面向强化学习的 JAX 电力系统基准

    PowerZooJax 是基于 JAX 的电力系统强化学习基准,覆盖发电、输电、配电、分布式能源与数据中心微电网 5 个约束马尔可夫决策过程任务。它把潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使训练与评估全程留在 GPU 上,相比 CPU 仿真显著加速。该开源基准还对策略回报、安全违规和分布外压力场景提供标准化评估。

  5. AGI Hunt48

    Open-Dots 开源复刻 OpenAI Dots 上线即爆火

    开发者 matchaman11 推出 OpenAI Dots 的开源复刻项目 Open-Dots,上线不到 24 小时即斩获 4500+ GitHub 星,一度达 4.3k star。该项目定位为 OpenAI Dots 的开源替代品,是可自托管、本地优先的 AI 工作台,整合聊天、工具调用与操作审计功能,因满足社区对自主可控 AI 工作区的需求而迅速走红。

  6. AGI Hunt48

    SGLang 把 Qwen3.8-27B 变决策模型,百毫秒内通关《宝可梦火红》

    SGLang 团队把 Qwen3.8-27B 改造成多模态决策模型,从实时游戏画面出发,以低于 100 毫秒的决策延迟打通《宝可梦火红》的四天王与冠军。工程层面,SGLang 新增原生 /v1/decisions 接口,可将 LLM 和 VLM 当作分类与打分模型使用;另加 /v1/systemone,让 Jev 类开源模型可配合 TypeSafe SDK 使用。

9月29日周二
  1. arXiv cs.AI40

    Self-Play Search Distillation:用自对弈搜索蒸馏提升 LLM 推理能力

    Self-Play Search Distillation(SPSD)通过棋盘游戏自对弈中的 MuZero 类网络搜索生成超人类合成数据,并把搜索记录转成思维链,为大语言模型提供环境接地监督。在 Qwen3-4B-Base 上,六个数学基准的平均分从 24.1 升至 36.6,未见过的游戏胜率从 15% 升至 45%。该方法仅用自对弈搜索记录训练,即可迁移到数学推理。

  2. AGI Hunt39

    arXiv 论文《Focusing Condition》提出 SCS:推理时零训练提升 LLM 条件文本嵌入

    arXiv 论文《Focusing Condition》提出推理时即插即用的自对比引导方法 SCS,通过遮蔽条件得到无条件嵌入,再用它引导多头自注意力计算,提升 LLM 条件文本嵌入质量。该方法无需额外数据或微调,推理时仅多一次多头自注意力计算。在聚类、语义文本相似度(STS)和三元组对齐数据集上验证,可叠加现有 prompt 方法并全面提升性能,代码已开源。

  3. AGI Hunt48

    开发者 Jerry 开源 Enclosure:用确定性模拟办公室给 LLM 做性格测试

    开发者 Jerry 开源确定性 LLM 测试环境 Enclosure,它模拟带 Slack、日历、邮件等工具的办公场景,对话由 AIML 而非真模型驱动,保证完全可复现。首个测试 Disposition 是给模型做的「性格测试」,并非可刷分的 benchmark,而是帮用户找到匹配自己工作风格的模型。项目已放出首批三个模型的结果图,并号召社区用更多模型跑测试提交。

  4. AGI Hunt45

    开源工具 Carla:本地跑 llama.cpp 造「AI 角色」的织机实验室

    开发者发布基于 llama.cpp 的开源工具 Carla v0.1.0,一个完全本地运行的 loom TUI 与角色实验室。其流程为基座模型加种子文档、分支式续写再到对话式 loom 以涌现 AI 角色,支持 /loom [count] 并行多轮对话,由 Jev 按自定义行为规范评估循环、spiraling 与有害语言。作者称目标是为下一阶段的训练做准备。

  5. arXiv cs.CL38

    喂 BabyLMs 吃 Macaroni:语码切换课程带来跨语言收敛

    用 LLM 向英语、荷兰语、中文 BabyBabelLM 语料注入词级与句级语码切换后再预训练小型 decoder-only Transformer,可让平行文本表征(尤其跨书写系统)趋于对齐。按词级语码切换→句级语码切换→单语文档的课程训练,模型在 BabyLM 评测套件上优于未使用该数据的基线。代码、数据与模型已公开。

  6. AGI Hunt43

    RecallOps 开源:基于 Hindsight 持久记忆的事故响应 Agent

    开发者开源 RecallOps,一个基于 Hindsight 持久记忆框架、采用 MIT 协议的事故响应 Agent。其工作流为「事故→召回→反思→调查→解决→留存」,会召回相关历史事故并按相关性与时间新旧排序证据,区分成功修复与失败尝试。例如 503 故障会回忆起两起相似事故:一起靠扩大连接池解决,另一起同样修复失败、真因是下游服务故障。

  7. AGI Hunt43

    开发者 vibe-code 出 ComfyUI-BubbleText 节点,自动修复漫画气泡框里的乱码文字

    Reddit 用户 arturor1990 发布开源节点包 ComfyUI-BubbleText,可自动擦除 AI 生成图片对话气泡内的乱码字母并写入用户指定的真实文本。该节点支持 emoji,兼容 Anima、Illustrious 和 NoobAI 模型,可配合 LoRA Manager 使用。作者坦承项目是 vibe-coded,节点标签为西班牙语,已在 GitHub 开源并征集反馈。

9月25日周五
9月23日周三