A personal collection of an AI product manager.
Let's face the future together and embrace the AIGC era.

10/10 开源速递:阿里代码审查、HTML 出视频和把 Agent 上下文压瘦

今天日榜前排还是 rea、AnyPS5、mattpocock/skills、diagram-design、Anthropic 岗位插件这些这周写过或法律灰色的,我都跳了。ArtCraft 继续火,但协议还是非 OSI 的 fair source,也不写。从日榜后排和语言榜里挑了六个:阿里开源的内用代码审查、HeyGen 的 HTML→视频框架、专管压缩 Agent 上下文的 Headroom、一个流式 3D 重建论文仓、微软的不可信代码沙箱,以及一个本地音频转 MIDI 插件。

星数是 10 月 10 日上午 GitHub API 的快照。

1. alibaba/open-code-review:规则先扫一遍,模型再写行级评论

Open Code Review 能力一览

约 4.5 万星,Apache-2.0,Go。阿里把过去两年内部用的 AI 代码审查助手开源了。它不走「整段 diff 丢给模型碰运气」那条路,而是混合架构:确定性流水线先跑多语言规则(空指针、线程安全、XSS、SQL 注入等),LLM Agent 再补精确到行的评论。协议兼容 OpenAI 和 Anthropic,也有 Claude Code、Codex、Cursor、Kimi Code 的插件。

npm install -g @alibaba-group/open-code-review
ocr config provider
ocr review

适合已经有 PR 流程、想在本地或 CI 加一层可复现审查的团队,也适合给编码 Agent 挂一个能调用的 review skill。

坑:默认审查要先配好模型;delegation 模式可以让宿主 Agent 自己审,但规则解析仍靠 OCR。大仓库别一上来 ocr scan 全仓,账单和等待都会很难看,先从工作区 diff 或分支范围试。

2. heygen-com/hyperframes:Agent 会写 HTML,就让它直接出片

HyperFrames 本地应用与工作流

约 6.0 万星,Apache-2.0,TypeScript。HeyGen 开源的视频框架:用 HTML、CSS 和可 seek 的动画描述画面,浏览器预览,无头 Chrome + FFmpeg 渲成确定性 MP4。和 Remotion 的差别主要在作者模型——这边押的是「人和 Agent 都好写的普通 HTML」,不是 React 时间轴。CLI、Agent skills、云端渲染都能接。

npx hyperframes init my-video
npx hyperframes preview

适合会一点前端、想让 Claude Code / Codex 出产品介绍、PR 解说或活动短片的人。

坑:硬性要求 Node 22+ 和本机 FFmpeg。skills 仓库有 21 个发布项,交互安装时别全勾;非交互环境用 npx hyperframes skills update 装 core set 更稳。渲染质量取决于你写的 HTML 是否真的「可 seek」,乱写时间轴会预览和成片对不上。

3. headroomlabs-ai/headroom:进模型前先把工具输出削一刀

Headroom 上下文压缩示意

约 7.5 万星,Apache-2.0,Python / TypeScript。Agent 贵往往贵在工具返回:日志、检索片段、整文件。Headroom 在本机把这些压短再送给 LLM,宣称编码场景大约少 20% token,JSON 类可到 60–95%,FATAL 这类关键行尽量保真。用法三种:库里 compress()、本地 proxy,或 headroom wrap claude 一类一键包住现有 Agent。压缩不把内容送去远端。

pip install "headroom-ai[all]"
headroom wrap claude

适合上下文经常爆、又懒得每次手删的 Claude Code / Codex 用户,也适合自己写 Agent 编排的人。

坑:带 CLI 的是 PyPI 包;npm 的 headroom-ai 只有 SDK。wrap 会起本地代理并改路由,接 DeepSeek、OpenRouter 这类 OpenAI 兼容接口时要显式指定 upstream。别指望它替你做「语义上绝对无损」——极限压缩后个别细节仍可能丢,关键路径先用他们的 dashboard 看节省和召回。

4. Robbyant/lingbot-map:长视频也能流式建三维

LingBot-Map teaser

约 1.8 万星,Apache-2.0,Python。Robbyant 的 Geometric Context Transformer,ECCV 2026 Best Paper Award Candidate。目标是前馈、流式的 3D 重建:锚定几何上下文、位姿参考窗和轨迹记忆放在一个框架里,长序列可以超过一万帧,官方数字是 518×378 大约 20 FPS。仓库带交互 viser demo 和离线渲染流水线,权重在 Hugging Face / ModelScope。

适合做 SLAM、三维重建、机器人建图、想复现论文 demo 的人。它不是「上传一段手机视频就出漂亮 mesh」的消费级 App,是研究代码。

坑:安装绑 CUDA 和特定 PyTorch(文档写推 2.8 + cu128);FlashInfer 推荐但首次会 JIT。显存不够就缩短序列或开 keyframe interval,别对着 13 分钟室内漫游硬上笔记本核显。

5. microsoft/mxc:给模型吐出来的代码找个笼子

microsoft/mxc

约 2400 星,MIT,Rust 为主,另有 .NET / Node SDK。MXC(Microsoft eXecution Container)是嵌进你应用的沙箱依赖:用 JSON 策略描述文件系统、网络、剪贴板/GUI 权限,再挑平台后端跑不可信工作负载——模型生成的代码、插件、工具调用都算。Windows 默认 ProcessContainer,Linux 默认 Bubblewrap,macOS 用 Seatbelt;还有 WSLC、MicroVM、Hyperlight 等选项,不少标了 experimental。

适合要在产品里执行第三方或模型生成代码、又不想「直接在宿主机 eval」的团队。

坑:隔离强度跟后端走,别假设跨平台行为一致。实验后端别直接上生产。从源码编还要匹配文档里的 Rust 版本和各后端前置依赖;更省事的路径是直接装对应语言的 SDK 包。

6. DamRsn/NeuralNote:混音进插件,多轨 MIDI 出来

NeuralNote 界面

约 3100 星,Apache-2.0,C++。VST3 / AU / 独立应用,把音频转成 MIDI,全程本地。v2 用 Kyutai / Mirelo 的 MuScriptor 换掉了 Spotify Basic Pitch,参数量从不到 1.7 万跳到上亿级,支持多乐器识别,并内置合成器按轨试听。模型分 small / medium / large,首次打开再下载。

适合编曲、扒带、想快速把录音变成可编辑 MIDI 的人。

坑:large 大约 2.7GB;中大模型强烈建议 GPU(macOS Metal,Win/Linux Vulkan)。Linux 暂无预编译,要自己编。Windows 安装包未签名,系统可能弹警告。作者也说目前只在少数机器上测过,遇到怪显卡先去 Issues 反馈。

Like(0) 打赏
未经允许不得转载:AIPMClub » 10/10 开源速递:阿里代码审查、HTML 出视频和把 Agent 上下文压瘦

觉得文章有用就打赏一下文章作者

非常感谢你的打赏,我们将继续提供更多优质内容,让我们一起创建更加美好的网络世界!

支付宝扫一扫

微信扫一扫

Verified by MonsterInsights