注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 CodingAgents
CodingAgents 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 CodingAgents 的推特
AI 视频剪辑 Skill 分享「video-use」 @browser_use 团队推出的开源 Skill,定位为面向 AI Coding Agents(Codex、Claude Code、Cursor、Hermes Agent 等)的视频剪辑 Skill。它不做传统意义上的 Premiere / CapCut 替代品,它是一套让 LLM 通过 “阅读转写文本 + 按需可视化” 来理解视频、并调用 ffmpeg 等工具完成剪辑的 prompt-engineering + 工具脚本集合。 # 核心思想:LLM 不“看”视频,它“读”视频 第一层:音频转写文本(always loaded) 通过 ElevenLabs Scribe 获得逐词时间戳、说话人分离、音频事件标记(如笑声、叹息、掌声),打包成约 12KB 的 takes_packed.md。这是 LLM 的主要“阅读材料”。 第二层:视觉时间线视图(on demand) 仅在决策点(歧义停顿、重拍对比、切点校验)调用 timeline_view.py 生成胶片帧 + 波形 + 字幕的 PNG 复合图。 对比朴素方案“30000 帧 × 1500 tokens = 4500 万 tokens 噪声”,项目走的是 “12KB 文本 + 少量 PNG” 的轻量化路径。这与 Browser Use 让 LLM 读结构化 DOM 而非直接看截图的思路一致。 # 技术流水线:Transcribe → Pack → Reason → EDL → Render → Self-Eval 1. 转写 - transcribe. py / transcribe_batch.py 提取 16kHz 单声道音频,调用 ElevenLabs Scribe,缓存为 transcripts/.json 2. 打包 - pack_transcripts.py 将逐词 JSON 合并为按 0.5s 静音或说话人切换断句的 takes_packed.md 3. 决策 - LLM 自身 阅读 packed transcript,必要时用 timeline_view.py 可视化 4. 生成 EDL - subagents 输出 JSON 格式 edl.json,包含源文件、切点、节奏标签、引用、原因 5. 渲染 - render. py 分段提取 → 无损 concat → 叠动画 → 压字幕 → 响度标准化 6. 自评估 - timeline_view.py + LLM 在输出文件的每个切点 ±1.5s 检查跳帧、爆音、字幕遮挡,最多 3 轮 # 关键工程细节: ffmpeg 为主的剪辑实现 1. 分段提取 + -c copy 拼接(避免叠 overlay 时二次编码) 2. 每段边界 30ms 音频淡入淡出(消除切点爆音) 3. overlay 使用 setpts=PTS-STARTPTS+T/TB 进行时移,确保动画第 0 帧对齐输出时间线 4. 字幕始终最后叠加(防止被动画遮挡) 5. Master SRT 使用输出时间轴偏移:output_time = word.start - segment_start + segment_offset 6. 切点必须落在词边界,并加 30–200ms 填充以吸收 Scribe 50–100ms 的时间戳漂移 7. HDR 源自动 tone-map(HLG/PQ → Rec.709 SDR) 8. 竖屏源自动按高度缩放 9. 两-pass loudnorm:-14 LUFS / -1 dBTP / LRA 11,符合主流社交平台标准 # 动画与包装:多引擎并行 1. HyperFrames:HTML/CSS/GSAP compositions,适合产品 UI、网页转视频、动态排版 2. Remotion:React 组件化 compositions 3. Manim:数学/技术/3Blue1Brown 风格解释动画 4. PIL + PNG sequence + ffmpeg:简单卡片、计数器、打字效果 # SKILL.md 的 12 条“铁律”:生产正确性优先 1. 必须遵守的 12 条硬规则:字幕最后、分段提取再拼接、30ms 淡入淡出、PTS 时移、SRT 输出时间偏移、不切在词中、切点填充、逐词 ASR、缓存转写、并行动画、先确认策略再执行、输出在 /edit/ 2. 其余全部是可调整的“worked example”:调色风格、字幕分块、动画时长、节奏等都可按材料和用户品牌定制
显示更多
0
4
80
20
转发到社区
最新趋势总结(跨HN、PH、GitHub、X、Reddit等) • Agentic Everything:AI coding agents(Claude Code、Codex、Cursor、Bionic等)主导讨论,本地/开源代理(LM Studio Bionic、OpenClaw、herdr multiplexer)爆发。重点从“prompt聊天”转向“持久内存、技能库(skills)、知识图谱、sandbox执行、multi-agent orchestration”。 • 本地优先 + 隐私:LM Studio Bionic(Mac/Windows本地代理,支持open models如GLM/Kimi)、Rust本地工具(Meetily会议助手)火热。独立开发者痛点:数据泄露、订阅费、硬件限制 → 机会巨大。 • Skills & MCP生态:大量GitHub trending项目是“skills”(taste-skill、cybersecurity-skills、academic-research-skills等),用于增强代理的特定能力。MCP(Model Context Protocol)成为连接代理与工具的标准。 • Workflow自动化:n8n/Zapier + AI pipelines(TikTok内容、Reddit机会挖掘)、agentic video(OpenMontage、MoneyPrinterTurbo)、Chrome插件/扩展生成器。 • 部署/Infra:Vercel/Netlify无缝集成新模型(GPT-5.6 Sol/Terra/Luna),Coolify自托管支持。独立开发者易部署SaaS/插件。 • 商业化信号:PH上AI代理/助手、Chrome扩展、local tools快速上榜;YC launches聚焦agent平台;Indie Hackers讨论“可靠workflow vs 酷功能”。 Google Trends相关未见剧烈新峰值,但“AI agent workflow”、“local AI coding”持续高关注。 最具潜力商业机会(针对独立开发者) 1. 本地/开源AI Coding Agent增强工具(最高优先): • 构建Bionic-like wrapper或skills marketplace:打包常见skills(设计、cyber、research)成一键安装模板,支持LM Studio/Cursor/Claude Code。 • Chrome插件:AI selector forge、context passer(指向UI传精确上下文给代理)。PH类似产品已获高票。 • 变现:Gumroad模板/$9-49一次性 + 付费skills订阅,或SaaS监控代理性能。 2. Agent Workflow模板站 / n8n兼容市场: • 预打包可靠的自动化(如Reddit→客户挖掘、TikTok内容pipeline、代码审查multi-agent)。重点解决edge cases、JSON稳定、memory。 • Indie Hackers痛点验证:用户买“能立刻跑”的东西,而非实验品。 • 机会:per-run monetization(类似n8n beta),或模板+托管SaaS。部署到Vercel/Netlify/Coolify一键。 3. 隐私/本地SaaS & Chrome插件: • 知识图谱工具(codebase → queryable graph)、meeting summarizer、voice keyboard扩展。 • 针对solo devs:sandboxed knowledge work(PDF/deck处理)、persistent memory vault。 • 低竞争:本地优先卖点强,结合Ollama/vLLM。 4. Video/Content Agent工具: • 扩展OpenMontage/MoneyPrinterTurbo式一键短视频/白板解释器(Simi等PH热门)。 • 独立开发者可做垂直模板(营销、教程)+ Vercel部署前端。 5. Security & Observability for Agents: • Prompt injection防护、runtime monitoring(Heron Wireshark for agents)、permission governance。 • HN热议AI coding agents安全bug,机会明显。
显示更多
再次推荐 Google Engineering & DevRel Leader @addyosmani 重磅开源的 Agent Skills (69.7✨),把资深工程师的生产级工程纪律,固化为 AI Agent 可机械执行、强制验证、跨工具复用的工作流 Agent Skills: Production-grade engineering skills for AI coding agents. 它要解决什么问题? AI Coding Agent 的默认行为是"走最短路径"——跳过规格、跳过测试、跳过安全评审,给出能跑但不可靠的代码。Agent Skills 的立论是:质量不靠提醒出来的,要靠强制流程托底的。它把"什么时候写规格、测什么、怎么评审、何时发布"这类隐性工程判断,固化成 Agent 必须遵循的步骤。 顶层架构:六阶段生命周期 DEFINE → PLAN → BUILD → VERIFY → REVIEW → SHIP /spec /plan /build /test /review /ship 8 个 slash 命令作为入口,分别对应一个阶段,自动激活对应 Skills。Skills 也会按上下文自动触发(写 API → api-and-interface-design,写 UI → frontend-ui-engineering)。/build auto 在一次批准后自动跑完计划与实现,但每个任务仍独立测试、独立提交、遇险即停。 24 个 Skills 的分布 1. Meta - 1 个 using-agent-skills(路由,决定该用哪个技能) 2. Define - 3 个 interview-me、idea-refine、spec-driven-development 3. Plan - 1 个 planning-and-task-breakdown 4. Build - 7 个 incremental-implementation、test-driven-development、context-engineering、source-driven-development、doubt-driven-development、frontend-ui-engineering、api-and-interface-design 5. Verify - 2 个 browser-testing-with-devtools、debugging-and-error-recovery 6. Review - 4 个 code-review-and-quality、code-simplification、security-and-hardening、performance-optimization 7. Ship - 6 个 git-workflow-and-versioning、ci-cd-and-automation、deprecation-and-migration、documentation-and-adrs、observability-and-instrumentation、shipping-and-launch 几个值得点名的设计取向 · doubt-driven-development:对抗性"新上下文复盘",CLAIM → EXTRACT → DOUBT → RECONCILE → STOP,可选跨模型升级。这是该仓库比较有原创性的一项,针对高代价/不可逆决策。 · source-driven-development:框架决策必须挂在官方文档上,要引源、要标注未验证项。直接对治 LLM 编造 API。 · deprecation-and-migration 把"代码即负债"单列为技能,配套强制 vs 建议性弃用模式与僵尸代码清除——很少见但有工程味。 · Google 工程文化底蕴:Hyrum's Law(API)、Beyonce Rule 与测试金字塔(测试)、变更尺寸约 100 行 + 评审速度规范(评审)、Chesterton's Fence(简化)、主干开发(git)、Shift Left 与 feature flag(CI/CD)。来源明确标注自《Software Engineering at Google》与 Google 工程实践指南。
显示更多
本周 GitHub 飙升的 10 大 AI 开源项目: 1. mattpocock/skills 本周增长最快的项目,新增 10,651 Star。 它把 TDD、调试、需求梳理、代码评审等工程经验做成了可组合的 Agent Skills,可以装进 Claude Code、Codex 等编程 Agent。 链接: 2. hallmark 专门处理 AI 生成网页的“模板味”。 它会从页面结构、配色、字体和布局入手,再经过 57 项检查,减少 Claude Code、Cursor、Codex 生成千篇一律的 SaaS 页面。本周新增 8,948 Star。 链接: 3. orca 一个管理并行 Coding Agents 的开发环境。 你可以同时运行 Claude Code、Codex、OpenCode 等多个 Agent,每个任务使用独立 worktree,还能在手机上查看进度和接管操作。本周新增 5,733 Star。 链接: 4. awesome-llm-apps 收录了 100 多个可以直接运行的 AI Agent、RAG 和语音应用。 里面包含 Claude、Gemini、GPT、DeepSeek、Llama、Qwen 等模型的完整案例,适合找项目思路,也能直接改成自己的产品。本周新增 5,385 Star。 链接: 5. code-review-graph 把本地代码库解析成一张持久化知识图谱。 AI 编程工具不用每次读取整个仓库,可以沿着函数调用、模块依赖和代码变更关系找到相关上下文,减少大项目里的 Token 消耗。本周新增 4,791 Star。 链接: 6. OfficeCLI 一个专门为 AI Agent 开发的 Office 命令行工具。 不需要安装 Microsoft Office,Agent 就能读取、修改和生成 Word、Excel、PowerPoint,还能把结果渲染成 HTML 或图片检查。本周新增 4,047 Star。 链接: 7. Vibe-Trading 输入自然语言,就能让 Agent 完成市场研究、策略回测和交易分析。 项目接入了股票数据、量化因子、券商和消息渠道,也支持自动执行交易。功能很全,但实盘前仍要单独验证数据、回测偏差和风控。本周新增 3,679 Star。 链接: 8. pi 一套轻量、可扩展的 AI Agent 工具箱。 它提供统一的多模型 API、Agent Loop、终端界面和 Coding Agent CLI。开发者可以保留自己的工作流,只替换模型、工具或交互层。本周新增 3,569 Star。 链接: 9. DeepTutor 一个可以自己部署的个性化 AI 导师。 它能读取文档和知识库,围绕学习资料持续答疑、生成课程并跟踪学习过程。最近还加入了推理式文档检索。本周新增 2,908 Star。 链接: 10. Codex OpenAI 开源的终端编程 Agent。 它可以在本地读取和修改代码、运行命令、执行测试,并连接 IDE、桌面端和云端任务。最近一版继续补强了配置迁移、音频输入和 Multi-Agent 能力。本周新增 2,445 Star。 链接: 这 10 个项目一周合计新增 52,156 Star。 本周的热度集中在 Agent 的执行层:技能、调度、上下文管理、代码图谱,以及 Office、教育、交易等具体工作场景。
显示更多
0
61
630
117
转发到社区
最近越看@CNPYNetwork,越觉得它不是在讲一个普通 L1 故事。 过去几年,crypto 一直在堆东西: L2 叠 L1,restaking 叠staking,bridge 叠bridge。 每次都说要扩容,但builder 真正想要的其实很简单: 能不能更快上线? 能不能不用重新学一套复杂语言? 能不能有安全、流动性和用户,而不是链发出来就没人用? Canopy 抓到的点就在这里。 现在 AI coding agents 已经不是只会补全代码了,它们能开 PR、跑测试、甚至自己 ship features。问题是,大多数链上基础设施还是为“人类慢慢写代码”的时代设计的。 Canopy 的思路很直接: 用Templates,把复杂链开发压缩到更清晰、更短的逻辑里。 支持TypeScript、C#、Python# 这些开发者和 AI 都更熟的语言。 让应用不只是部署一个合约,而是拥有自己的sovereign rails。 这对 RWA、DeFi、AI agents,甚至任何需要高性能和独立经济系统的项目都很关键。 因为未来的竞争,可能不是谁会发更多链。 而是谁能让真正有想法的人,用最低摩擦把链跑起来。 $8.5M 融资已经到位,背后有Arrington、Fenbushi、Borderless、SNZ。 Testnet 已经能体验,Mainnet is next。 我喜欢这种方向。 不靠喊“下一代公链”,而是解决builder 真正卡住的地方。 如果AI-native infra 是下一轮叙事,Canopy 值得放进观察名单。🌿 @CNPYNetwork
显示更多
0
94
75
0
转发到社区
🔥 Sam Altman 最新万字长谈精华总结(点赞、转发&收藏) 我们正处于奇点之中! AI时代的创业法则与终局游戏! 这段访谈信息量巨大,Sam Altman 深度分享了关于创业、OpenAI战略以及AI未来的核心洞察。 这份整理非常适合发布在X平台,直接上干货: 1. 奇点已来,这就是决战时刻 🌌 Altman 明确宣告:“我们现在正处于奇点之中”。十年前大家在饭桌上随口聊聊的遥远梦想,如今已成现实。 我们正身处一个决定性的历史转折点,发展曲线随时可能走向完全不同的方向。 目前最大的斗争是:未来究竟是走向“AI专制主义”还是将权力真正下放给全人类。 2. 给AI创业者的忠告:警惕“容易的胜利” 🚀 创业门槛骤降,现在的10周初创团队能做到过去难以想象的事。如果你还沿用10年前的创业模式和思维,注定会被淘汰。 不要只盯着“垂直领域的AI智能体”这种容易的胜利,它们虽然能赚钱,但很难成为定义这个时代的伟大公司。 真正的赢家会内化“缩放定律 (Scaling laws)”,去布局两四年后当模型更聪明、更便宜时才具有经济效益的真正难题。 3. OpenAI 的“残忍”战略:为了核心,杀死爆款 🗡️ 在探索未知领域时,最难的不是关掉失败的项目,而是关掉“表现很好”的项目以绝对聚焦“表现最好”的项目。 为了聚焦 GPT-3,他们关掉了曾寄予厚望的机器人项目。 最近为了全力主攻正在爆发的“代码智能体 (Coding Agents)”,他们甚至叫停了极其成功的视频模型 Sora 以及浏览器的开发。 4. 算力扩张的终极瓶颈与疯狂构想 ⚡ 实现无限智能扩展的最大瓶颈只有两个:第一是晶体管(芯片),第二是电子(能源)。 不要只关注优化算法,未来的核心是“建造能够制造更多数据中心的数据中心”。 在高度自动化的未来,AI将驱动机器人舰队去无限复制、建设更多的数据中心。 5. 人类未来的工作与价值归宿 🕰️ 别幻想AI会带来“每周工作4小时”的悠闲生活。人类的期望永远在升高,在超级智能时代,我们不仅不会无所事事,反而只会比想象中更忙碌。 当AI接管传统的经济价值创造后,社会地位游戏的规则将改变,人类将更看重纯粹的“人性”体验,比如为他人烹饪带来的情感连接,以及人类与生俱来对冒险的渴望。 6. 应对混沌、野心与个人成长 🧠 在混乱中保持镇定的能力是教不会的,只能通过一次次熬过“公司濒临倒闭”的生死危机来亲身习得。 面对大公司出来缺乏野心的人,最好的重建方法是让他们通过一系列“持续的小胜利”来建立自信。 别浪费时间修补弱点,要把所有的精力用来把“优势”发挥到极致。 不要试图从20年后往回倒推规划;应该抱持少数几个强烈的核心信念,立足当下,不断向前规划。 来源:(YouTube Relentless)
显示更多