Browser Use 团队基于最近爆火的 Jev 模型做了个 jev-ultrafast,主打就是快,已经狂揽了 19000+ Star。
官方给的演示案例里,在 Google Flights 上搜苏黎世飞伦敦的航班只用了 7.1 秒。
它把页面上能点的按钮、输入框编成一张带编号的表,Jev 一次请求就同时决定做什么动作、点哪一个元素。
只有需要往框里打字时,才叫一个小模型生成文字。默认流程里也不截图,全靠读页面结构。
GitHub:
作者拿新旧两版各跑了三轮同一个任务,耗时中位数从 9.45 秒降到 7.09 秒,跟浏览器的通信次数从 1092 次降到 101 次。
模型的输出不会直接变成点击坐标或者脚本,只能从页面上真实存在的元素里挑,这个设计挺让人放心。
核心代码就 6 个文件,想弄明白浏览器 Agent 到底怎么跑起来的,感兴趣的开发者可以看看。
显示更多
让小模型看一张图回答一串选择题,常见做法是让它输出 JSON,可问题一多格式就开始出错,代码那头直接解析失败。
jev-visual 换了个思路,参考 TypeSafe 家 Jev 的做法,不让模型生成文字,而是给每个候选答案直接打分,挑分最高的那个。
它是个在 Apple 芯片 Mac 上跑的学习项目,模型用 0.8B 的 Qwen3.5。同一张图一次能问 1 到 64 个问题,选项题、是非题、分等级打分都行。
图片和上下文只算一遍,各个问题共用。作者在 M4 上测了 64 个问题,每个问题单独算要 37.30 秒,共用之后 2.40 秒。
GitHub:
仓库里带了三个小游戏演示,传送带分拣、打砖块、用摄像头手势控制粒子。
打砖块那个挺实在,小模型盯不住球,作者干脆把画面分成五块,只问球在哪一块。
首次运行要下载大约 600 MB 的模型,之后全在本地跑,有网页界面、命令行和接口三种用法,还配了中文说明。
想弄明白视觉模型推理每一步在干什么,照着 README 给的阅读顺序看代码,会顺很多。
显示更多
用 Claude Code 花一个周末做出个小项目,想发帖宣传一下,一到剪演示视频就卡住,配乐、动效、文案都得自己弄。
brag 是一个 Claude Code 的 Skill,在项目里输入 /brag,就能做出一段带音乐和动效的发布短视频,宣传文案也一起写好。
背后的分工是,brag 负责定故事,挑讲哪个卖点、展示哪些画面,再把脚本交给 HeyGen 的 Hyperframes 排时间轴、渲染成片。
GitHub:
跑完会得到一个文件夹,里面有视频脚本、分享文案和成片 MP4。项目主页上那段循环视频,就是 brag 给它自己做的。
本机要装好 Node 22 和 FFmpeg,除了 Claude Code,Codex、Cursor、opencode 这些也能用。做独立项目、要自己宣传的朋友,可以试试。
显示更多
EdenText 是一个开在浏览器里的文字处理器,打开就能用,没有服务器,文档从头到尾都在自己电脑上处理。
能直接打开和保存 .docx、.odt,导出 PDF。作者搭了一套测试,让文档在它、Word、LibreOffice 之间来回打开时保持版式。
写论文那一套基本都备齐了,目录、题注、交叉引用、参考文献、索引、LaTeX 公式,还有修订模式和页边批注。
GitHub:
首次加载不到 2 MB,能装成离线应用,界面有简体中文。在 Chrome 和 Edge 里点保存会直接写回原文件,不用再去下载目录里找。
也支持用 Docker 自己部署一份,服务器上不存任何文档。
显示更多
斯坦福 2025 年秋季,开了一门 CS146S「现代软件开发者」,讲怎么跟编码 Agent 一起写软件,8 周作业全部公开在 GitHub 上。
每周一个主题,从提示词技巧开始,接着给现成的小应用加功能,自己写一个 MCP 服务把外部接口接给模型。
再往后用 Claude Code 搭至少两个自动化流程、用 Semgrep 扫出并修掉至少 3 个安全漏洞,最后一周把同一个应用用 3 套技术栈各做一遍。
GitHub:
第七周的作业我挺喜欢,每个任务只给 AI 一次提示就让它写完,自己逐行审一遍,再拿自己的审查意见跟 AI 审查的结果对比。
不少作业带现成的起步项目和测试,第一周还用 Ollama 在本地跑模型。没机会上这类课的,照着 8 周作业自己过一遍,能补上不少。
显示更多
看到 Jev 模型一个挺实用的用法,给 zsh 做历史命令补全,像 fish 那样在光标后面显示灰色建议。
每敲一个字,jev-shell-history 就把最近 100 条不重复的历史命令交给 Jev,让它挑出我们最可能想敲的那条,按右方向键接受。
我觉得最好用的是模糊匹配,敲一句 last 5 commits,历史里没有哪条命令是这么开头的。
它照样能把查最近 5 次提交的那条 git log 翻出来,后面还带一个分数,表示有多大把握。
GitHub:
Jev 不生成文字,只回答「选哪个」「对不对」这类问题并给出概率。前缀匹配、去重这些规则写在代码里,模型只负责拿主意。
每次请求大概 0.7 到 0.9 秒,需要 TypeSafe 的 API Key。经常按上方向键翻半天找长命令的,可以装上试试。
显示更多
大学生到了投简历的时候,几年里做过的项目、竞赛、实习分散在各处,证书截图在手机里,项目报告在旧电脑上,临时凑一版简历只能靠回忆。
RUCareer 是一个给大学生用的本地经历档案工具,先把做过的事一条条存下来,再针对具体的岗位或保研项目挑材料生成简历。
每条经历按科研、项目、竞赛、实习、志愿服务这些分类记录,有自己的文件夹,可以挂上报告、证书、代码说明这些附件,TXT、Markdown、DOCX、PDF 都收。
GitHub:
AI 那部分填自己的 OpenAI 兼容接口和密钥,让它结合原始叙述和附件把经历写顺,或者按申请要求分析该选哪几条经历。
提示词里明确禁止编数字、职责和奖项,缺的信息显示待补充,这条对简历工具挺关键,AI 给简历造经历的事见过不少。
档案就是一个普通文件夹,不用注册账号,每天自动备份一次保留最近 7 份,内置 5 套模板,导出 DOCX 和 PDF。
现在有 Windows 安装版,从 Release 页下载就能装。在校生想把经历一条条存下来慢慢整理的,可以先用着。
显示更多
用 Claude Code 改一个大项目,每开一个新任务它都要重新翻文件、认一遍代码结构,上次弄明白的东西全忘了,token 就这么烧掉。
repowise 的思路是把这些活提前做一次,给仓库建一个本地索引,代码依赖关系、git 历史、测试、文档、架构决策都放进去,Agent 和人都能直接来查。
它给 Claude Code、Codex、Cursor 提供 10 个按任务设计的 MCP 工具,问「改了这个文件会影响谁」直接给出带引用的答案。
作者在 django 仓库上跑了 43 个问题做对比,Agent 的工具调用从 7.2 次降到 3.8 次,输出少了 31.6%。样本、方法和输掉的行都公开在仓库里。
GitHub:
改代码前能算一份 0 到 10 的风险分,按仓库自己近期提交的分布来排,还列出哪些调用方会被波及、哪些测试该跑、以往总一起改的文件这次有没有漏。
代码健康那块有 51 个检测器,把缺陷风险、可维护性、性能分开打分,找出最容易出问题的文件,还会给出可以直接丢给 Agent 执行的重构方案。
支持 26 种语言,建图、算风险、查健康度、找死代码都不调用大模型,不用 API Key,索引留在自己机器上。一条命令装好,也有免费的 PR 机器人。
显示更多
CLAUDE.md 里写了一堆规则,Claude Code 照样有一半当没看见,这事很多人都碰到过。
HumanLayer 团队开源的 skills 仓库里有个 improve-claude-md,给出的解释挺有意思。
Claude Code 每次注入 CLAUDE.md 时会附一句系统提醒,说这些内容可能与当前任务无关,不相关就别理。
所以规则越多越杂,模型越容易连要紧的那几条也一起忽略掉。
而它的做法,把只在特定场景才用的规则包进一个叫 important if 的标签里,标签上写清触发条件,通用的项目背景照旧裸放在最上面。
GitHub:
仓库里一共 6 个 Skill。show-me 是让 Claude 用伪代码、调用树、组件树、Mermaid 图这些最省字的形式把当前话题画出来,不写长篇解释。
visual-pr 用同一套画法给 PR 写说明,改动用结构图和 diff 摆出来,方便审代码的人看。
design-control-loop 借的是控制论的思路,先访谈我们想把代码库的哪个指标推到什么目标,再搭一个定时跑的 Agent 循环,每次只改一小步开一个 PR。
显示更多
耶鲁一位计算机博士生,把自己发论文用的画图脚本全开源了,项目叫 figures4papers。
支持柱状、雷达、折线趋势、三维球体示意、概念等类型图,8 个论文项目各一个文件夹,脚本、数据、成图放在一起,照着改数据就能出自己的图。
他还把这套画图风格整理成了一个 Skill,接进 Cursor、Claude Code 或 Codex,让 Agent 按这套规范帮我们写画图脚本。
GitHub:
规范写得挺细,去掉上边和右边的坐标轴线,柱子加黑边,配色固定一套语义,蓝色给自己的方法,绿色系给改进项,红色系给对比基线,默认 300 DPI 导出。
不装也能用,把仓库在 Agent 里打开,提示词里让它照 SKILL.md 和设计原则文件来写就行,README 里给了现成的提示词模板。
前几天分享的 vivid-figures-skill 是让 AI 选图画图,这个更像拿一位常年投顶会的作者的审美当模板,写论文要出图的可以两个都看看。
显示更多
mac-computer-use 给 Agent 配了一套可直接操作 Mac 的工具,打开关闭窗口、输入、点击、截图都支持。
装成一个 Skill 就能接进 Claude Code、Codex、Cursor、豆包等 Agent 工具使用。
给一张参考照片,Agent 自己建出一个能在浏览器里转着看的 3D 展区,还带能编辑的 Blender 源文件。
3388 个三角面,117 个网格,全程 12 分钟没人碰过鼠标。
GitHub:
它比一般的操控电脑工具多做的是核对这一步。每个写操作能先预演一遍不真点,操作后再读回结果验证。
结果拿不准就停,不会瞎重试。
要用前台时也讲规矩,等我们手停下 2 秒以上才动,最多等 15 秒,我们一动键盘它就让开,做完把焦点还回来。
工具全在本机跑,不用起服务不用密钥。要 macOS 14 以上,第一次得授一下辅助功能和录屏权限。
显示更多
盘后复盘想让 AI 帮着看看图上几个指标,只能截图丢过去,它看不到具体数值,想让它改一下指标脚本还得自己复制粘贴回来。
tradingview-mcp 把本机跑着的 TradingView 桌面版接给 Claude Code,AI 直接读图上的指标值、价格位、标注,也能换标的、换周期、加指标、画线。
写 Pine Script 这块最实用,让它写好脚本自动填进编辑器、编译、读报错、改了再来,这个来回不用人手搬。
GitHub:
回放模式也能用,让它从某天开始一根一根 K 线往后走,练进出场。还能设价格提醒、排四格多图布局、截图给它做视觉分析。
一共 78 个工具,每个也都有对应的命令行版本,输出格式统一方便接自己的脚本。返回默认精简过,分析一次图表大概只吃 5 到 10 KB 上下文。
显示更多
Claude Code、Codex 这些 Agent 工具的干活方式,现在被搬到机器人身上了。
刚刚,一套专为机器人打造的基础设施 RPent,开源了。
它没有让某一个通用模型变得无所不能,而是将具身智能拆解为不同层次的能力,让不同模型各自承担最擅长的事情。
分工明确,GPT-6 Astra 这类通用大模型负责理解任务、做计划,而抓取、插拔这类精细动作则交给专门的操作模型去执行。
GitHub:
成功且验证过的任务经验会沉淀下来,再次执行时可以直接复用,不用每一步都重新调用大模型。
在官方的 200 次评测里,平均执行时间从 283.6 秒降到 40.9 秒,端到端任务加速约 7 倍。
搭配 GPT-6 Astra,在 LIBERO-PRO 基准测试里任务成功率达到 92.6%。
还有一套记忆机制,引入之后,机器人在面对物体被调换位置的任务时,成功率从 31% 提到 87%。
兼容多个仿真环境,以及 Franka、YAM、SO101 等真机,想了解大模型走进物理世界能干到什么程度的,可以看看。
显示更多
网页截图比文本更适合喂给大模型检索,这个结论我第一眼是不信的。看完伯克利这个团队的 README,觉得他们有道理。
给模型喂网页,常规做法是先解析成文字再切块,表格、图表、版式在这一步就丢了,后面模型答不上来是因为它根本没看见。
PixelRAG 反过来,把网页、PDF 直接渲染成一张张截图,在图上做检索,答案在表格里就把那块截图原样递给模型读。
已斩获 10000+ GitHub Star!
GitHub:
他们把整个维基百科 828 万个页面建好了索引挂在线上,不用配置不用密钥,可以直接调,拿一张图当查询条件也行。
还顺手出了一个 Claude Code 插件,叫 pixelbrowse,Claude 看网页时截一张图自己读,不去抓源码,图表和布局跟人看到的一样。
想给自己的文档建索引也行,Mac 的 M 系列芯片上一份 PDF 三分钟左右建完,不用显卡。
显示更多
前几天明明看过一篇讲某个配置的文章,只记得里面一句话,浏览器历史只能搜标题,翻了半小时也没找回来。
于是找到一个给自己用的搜索引擎:Hister,把访问过的网页和电脑里的文件整个正文建成索引,以后按内容里的任何一句话搜。
装个 Firefox 或 Chrome 扩展,打开过的页面自动存进去。存量的也能补,浏览器历史、书签、本地目录都能导入。
GitHub:
搜索支持字段过滤、短语、通配符、排除词,配一个向量接口还能按意思搜,记不清原话也找得到。
入口有 3 个,网页界面、终端,还有 MCP,接上 AI 助手就能让它在我看过的东西里查资料。
不偷偷上传数据,不强制云服务,内容都在自己那台机器上。下载一个文件就能跑,也有 Homebrew 和 Docker。
显示更多
让 Agent 操作浏览器实现自动化,经常会遇到各种问题,每个站都得重复登录,若碰到人机验证基本卡死。
最近腾讯团队开源了一个技能 BrowserSkill,可让 Agent 直接用我们电脑 Chrome 或 Edge 浏览器上已经登录好的状态。
它另开一个可见的 Agent 窗口干活,我们手头的标签页照常用。真要碰已经打开的某个标签,得明确借走,用完还回来。
GitHub:
碰到验证码、登录、确认弹窗这种只能人来做的步骤,Agent 会停下来请我们接手,点完它接着往下跑。
想要使用非常简单,把仓库里那句安装说明丢给 Agent,它自己装命令行工具和 Skill,再引导装浏览器扩展。
支持 Cursor、Claude Code、Codex、OpenClaw、CodeBuddy 等 9 款 Agent,其实凡是能调命令行的都能用,另外 macOS、Linux、Windows 系统也都支持。
显示更多
做一条两分钟的科普类短视频,写脚本、拆分镜、配图、配音、剪辑五道工序,一个人从头做到尾,大半天就没了。
PRINTFILM 把这套工序做成了一条流水线,主题或剧本丢进去,分镜、生图、生视频到合成成片自动往下走,开源的。
内置 20 多套模板,剪纸、绘本、粉笔、拼贴、像素、水墨、真人、电影感都有,同一段文案换个模板就是另一种画风。
GitHub:
口播是 Seedance 出片时一起生成的,省掉了单独配音再合进去这一步,我觉得这是整条链路里最省事的一处。
漫剧那条线是从大纲到资产库再到分集分镜,角色、场景、道具存在资产库里各集复用,人物不会换一集就变脸。
分镜工作台里能单张重绘、单镜重新生成视频。另有文生图、图生图、文生视频这些单点工具,还带按量计费、管理后台和开放 API。
支持 Docker 一键部署,模型统一走 TokenFree 的接口,填一把 Key 就行。科普号、漫剧号想上量的,这套流水线搭起来比一个个工具串省心。
显示更多
跟领导谈加薪,开口前想好了先提问再摆事实,真到他那聊的时候,三言两语就咽回去了。道理 大家都懂,缺少的是实战。
SocialCoach 是个练这个的开源应用,46 个中英双语场景,覆盖职场、家人、朋友、恋爱、学校、陌生人、社交场合 7 类。
里面的角色不会顺着我们说,每个人有自己的目的,还藏着一件没告诉我们的事,回合数有限,谈崩了就是输。
GitHub:
练完出一份复盘,每条判断都引我们自己说的原话。它还会分清是压根不知道怎么接,还是知道但没扛住,两种补法不一样。
建议都带出处,从 42 条策略和 30 个案例的库里取,末了再问两个反思问题。有真要谈的事也能描述一下,15 秒左右生成一个定制场景。
不用注册没有后台,数据全在自己设备上,能导出。有在线版可以直接试,也能接自己的模型 Key。
背后有一篇论文撑着,把「知道该怎么说」和「说得出口」拆开算,这个思路我觉得比一般的 AI 陪聊准。
显示更多
Codex 在家里的 Mac 上跑着一个长任务,人出门了,跑到要审批的那一步就停在那儿等,回来才发现半天没动。
CodexBoard 给本机的 Codex 配了一块任务看板,在手机浏览器或者飞书里就能派任务、看进度、点审批。
项目从 Codex Desktop 同步过来,有仪表盘、看板和列表 3 种视图,状态、优先级、标签、评论、附件都能挂,从一条任务上直接发起或者接着跑 Codex。
GitHub:
手机端的 Remote 能新开或者接着 Codex 的对话,流式看结果,发图片和附件补充信息,代码改动也能在手机上一条条审。
手机上能点审批这一点我觉得最实在,Codex 那种动不动要确认的性子,不用再守着电脑。
看板数据都留在 Mac 上,还配了个 Skill 让 Codex 自己通过内置命令行查任务改任务。
显示更多
前几天分享的 no-ai-slop 能去掉生成文案的 AI 味,今天又发现一个工具 SlopMonster 可以给文案打分,分不够就不让上线。
它把 AI 味拆成 5 组模式,每中一组扣 1 分,满分 5 分。低于 5 分命令直接报红,接进 GitHub Actions 就能把构建拦下来。
5 组分别是 AI 高频词、「不只是 X,更是 Y」这类 17 种固定句型、一句里塞两个破折号,还有三个形容词连着排。
第 5 组管的是编数据,「10000 多位满意用户」这种数字挨着人的写法一律标出来,没证据的数字宁可空着。
GitHub:
最有意思的是清洗那步,Claude 写的稿交给 GPT 改,反过来也一样,它拒绝把稿子送回同一家模型,作者的说法是模型听不出自己的口音。
改完再打一遍分,5 分才算过。README 里拿 Jasper 官网首页 7 句话实测,原文 3 分,过一遍 5 分,长度变化控制在 10% 以内。
词表是英文的,管的是英文文案。纯标准库 Python 没有依赖,也能当 Claude Code 的 Skill 装,写英文落地页、README 和邮件的可以拿它当最后一道关。
显示更多