註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

GitHubDaily
@GitHub_Daily
💡 挖掘开源的价值 🧑🏻‍💻 坚持分享 GitHub 上高质量、有趣、实用的教程、AI工具、前沿 AI 技术 🧐 A list cool, interesting projects of GitHub. ✏️ 公众号:GitHubDaily
加入 May 2023
206 正在關注    85.4K 粉絲
让小模型看一张图回答一串选择题,常见做法是让它输出 JSON,可问题一多格式就开始出错,代码那头直接解析失败。 jev-visual 换了个思路,参考 TypeSafe 家 Jev 的做法,不让模型生成文字,而是给每个候选答案直接打分,挑分最高的那个。 它是个在 Apple 芯片 Mac 上跑的学习项目,模型用 0.8B 的 Qwen3.5。同一张图一次能问 1 到 64 个问题,选项题、是非题、分等级打分都行。 图片和上下文只算一遍,各个问题共用。作者在 M4 上测了 64 个问题,每个问题单独算要 37.30 秒,共用之后 2.40 秒。 GitHub: 仓库里带了三个小游戏演示,传送带分拣、打砖块、用摄像头手势控制粒子。 打砖块那个挺实在,小模型盯不住球,作者干脆把画面分成五块,只问球在哪一块。 首次运行要下载大约 600 MB 的模型,之后全在本地跑,有网页界面、命令行和接口三种用法,还配了中文说明。 想弄明白视觉模型推理每一步在干什么,照着 README 给的阅读顺序看代码,会顺很多。
顯示更多