註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 Serverless
Serverless 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 Serverless 的搜尋結果
OtterHub:基于 Cloudflare 与 Telegram 的 Serverless 私人文件存储工具
2.5GB 冷启动不到 2 分钟………… 我在前厂给大模型 serverless 部署的优化是 8GB 冷启动不到 20 秒。
Avarok Cybersecurity 开源了 Atlas,一个用 Rust + CUDA 从零写的大模型推理引擎。它不依赖 Python 和 PyTorch,项目方称 Docker 镜像约 2.5GB,冷启动不到 2 分钟,目前主要面向 NVIDIA DGX Spark 的 GB10 平台优化。 官网模型矩阵显示,Atlas 在单台 DGX Spark 上跑 Qwen3.5-35B-A3B 可到约 130 tok/s,跑 Qwen3.6-35B-A3B 约 71 tok/s。Atlas 官网和 Hugging Face 页面称,在同硬件下,Qwen3.5-35B 平均约 111 tok/s、峰值 130 tok/s,vLLM 约 37 至 38 tok/s。 这组「3 倍 vLLM」数据来自项目方公开基准。GitHub README 写明,测试使用的是「法国首都是哪」这类短 prompt,生成上限不超过 30 个 token,temperature 为 0.1。这个口径更接近短请求、低并发、快速响应场景,也正好对应 Atlas 想打的卖点:用更小镜像、更少依赖和更快冷启动,把本地大模型服务变得更轻。 Atlas 现在仍是早期项目,真实生产场景还要看后续长文本、高并发和复杂工具调用测试。GitHub 上已有用户反馈输出质量和工具调用稳定性问题,相关 Issue 截至 2026 年 5 月 11 日仍处于 Open 状态。对开发者来说,它更像一个值得关注的新推理底座,而不是已经能全面替代 vLLM 的成熟方案。
顯示更多
Anthropic 发布全新的 MCP 规范:可将 MCP 服务器部署到云上 以前 MCP 服务器有个毛病:客户端得先握手拿一个会话 ID,之后每次请求都必须回到同一台机器 加机器扩容没用,serverless 也跑不了 新规范把这条规矩废了:握手和会话 ID 直接删除,每个请求自带身份信息,哪台机器都能接,挂个最普通的负载均衡器就行。 打个比方: 老 MCP 像打电话,你先拨号(initialize 握手),接线员给你一个分机号(Mcp-Session-Id),之后你每说一句话都靠这个分机号认人。想换个接线员?对不起,只有原来那位记得你刚才说了什么。 新 MCP 像寄快递,每个包裹上都贴着完整的寄件人、收件人和内容说明,谁拿到都能处理,不需要先跟谁打招呼。
顯示更多
0
24
69
15
轉發到社區
不买 VPS,也能搭一个轻量私人文件存储? OtterHub:基于 Cloudflare 与 Telegram 的 Serverless 私人文件存储工具 用 Telegram 的机器人(Bot API)当作实际存储文件的后端仓库,用 Cloudflare 的 KV 数据库来记录文件名、标签等元数据 最后用 Cloudflare Pages 跑一个前端网页 只需配置现有云服务账号,就能以较低维护成本跑起来
顯示更多
推荐这篇公告,一个重量级的开源模型托管合作。 首个 3T 级开源模型通过美国推理基础设施向开发者开放——后续模型同步首发。 Together AI 在 7 月 29 日宣布与 Moonshot AI 达成战略合作:Together AI 成为 Kimi K3 及未来所有 Moonshot 开源模型的美国托管平台。 合作内容 • Kimi K3 已在 Together AI 上线,通过 moonshotai/Kimi-K3 端点访问 • 未来所有 Moonshot 开源模型都将在发布当天同步上线 Together • 支持微调:开发者可以用自己的数据对 Kimi 模型做后训练,同时可选择移除 MIT 许可证中的 attribution 要求 • 三层部署选项:Serverless(按量)、Provisioned Throughput(预留容量 + 99% SLA)、Dedicated Inference(专有实例) 定价 • 输入 $3.00 / 1M token(缓存 $0.30) • 输出 $15.00 / 1M token • FP4 量化推理 战略意义 Together AI 的推理栈已经为 Cursor、Y Combinator 和 Decagon 等公司的 agentic 和编程负载提供生产服务。这次合作意味着开发者可以通过一套 API 同时访问 Kimi K3、LLaMA、GLM 等所有主流开源模型,不需要为每个新模型配置新的 SDK 或账户。 Moonshot 端——Kimi K3 作为首个开源 3T 级模型,在国内已经通过 API 服务广泛部署,但美国开发者此前缺乏一个可靠的托管方案。Together AI 填补了这个空白。 原文: #KimiK3# #TogetherAI# #OpenSource#
顯示更多
反代 灰产 中转 应该都在这里了👇 一、综合型多协议网关 CLIProxyAPI 是这个赛道的标杆,把 Gemini CLI、Antigravity、ChatGPT Codex、Claude Code、Qwen Code、iFlow 包装成 OpenAI/Gemini/Claude/Codex 兼容的 API 服务 AIClient-2-API 是 Node.js 实现,通过模拟 Gemini CLI、Antigravity、Codex、Grok、Kiro 的客户端请求,封装成本地 OpenAI 兼容接口 2026 年初还加了 Grok 的 Cookie/SSO 逆向,是目前对 Grok 支持最完整的 Antigravity-Manager 是桌面客户端路线,Tauri + React 写的,把 Google/Anthropic 的 Web Session 转成标准化 API 接口,带 OAuth 链接生成和账号池调度。这个适合拿来讲"账号管家"这种场景化内容 9router 和它的 TypeScript fork OmniRoute 是"智能路由 + 多档 fallback"的代表,iFlow、Kiro、Qwen 被标为 FREE 的是真免费无限,通过 OAuth 和 device auth 接入 ccproxy-api Python 实现,特点是直接复用 Claude CLI SDK tokens 和 Codex CLI 的 credential store,插件系统做得比较干净 CliGate 带可视化 Dashboard,支持 ChatGPT Account Pool、Claude Account Pool OAuth PKCE login、Antigravity Account Pool,一键配置 CLI 工具 二、Claude 专项 claude-relay-service 是国内最火的 Claude 中转方案,集成 Anthropic 的 OAuth 授权流程,在 Web 界面点击 Add Account 生成授权链接,登录 Claude 账号授权后接入服务。拼车党的基础设施,教程必讲 ClewdR 是 Rust 写的,支持 Claude 网页和 Claude Code,单一静态二进制覆盖 Linux/macOS/Windows/Android,Docker 镜像齐全,带 React 管理界面。性能路线代表 claude-code-proxy 是 Claude Code 转 OpenAI 的经典实现,教程里讲"双向转换"的基础案例 claude-relay(npow)是另一个思路,直接起一个 claude -p 进程来代理,而不是逆向协议 claude-unofficial-api 和 unofficial-claude-api(st1vms)是更早期的纯 Session Key 逆向(前者 JS、后者 Python),适合在教程里讲"历史演进" Claude Code Action with OAuth是官方 Claude Code Action 的 fork,支持 OAuth 认证,让 Claude Max 订阅者在 GitHub Actions 里使用订阅 opencode-claude-auth 走 Keychain 路线,从 macOS Keychain 读取 Claude Code OAuth credentials,支持多账号自动检测 三、ChatGPT/Codex 专项 PawanOsman/ChatGPT 是元老级项目,把逆向成本打到几乎为零 acheong08/ChatGPT(revChatGPT)是逆向 ChatGPT Web 的祖师爷仓库 codexProxy(J1aDong/codexProxy)你自己做的那个方向,类似的还有不少把 Codex 包成 Anthropic Messages 入口的。 四、Gemini 专项 gemini-proxy(KashifKhn)是目前最干净的实现,Bun + Hono + TypeScript,OAuth 2.0 + PKCE 浏览器登录,自动刷新 token,不需要付费 API key,不需要 gcloud CLI gemini-openai-proxy(Brioch)、gemini-cli-proxy(ubaltaci)、geminicli2api(gzzhongqi)是同类的三个竞品,各有侧重。 openai-gemini(PublicAffairs)是 Serverless 路线,可以直接部署到 Vercel/Cloudflare Workers,讲部署那集必备。 五、Copilot 专项 copilot-proxy(hankchiutw)一个简单的 HTTP 代理,把 GitHub Copilot 的免费额度暴露成 OpenAI 兼容 API,思路清晰。 github-copilot-proxy(BjornMelin)做的是反向,让 Cursor 调 Copilot 的后端,绕过 Cursor 的 500 次 premium 限制。 copilot-proxy(lutzleonhardt)是 VS Code 插件路线,通过 Language Model API 暴露,思路很野 六、Kiro / Qwen / Grok 逆向 kiro-gateway(jwadow/kiro-gateway)是 Kiro IDE / Amazon Q Developer 的网关,免费白嫖 Claude 模型的核心姿势。 Qwen-Copilot-Proxy(edwardgj)伪装成 Ollama 接口来对接 Copilot Chat,思路巧妙。 GrokProxy(CNFlyCat)走 Cookie 路线,从开发者工具 Network 面板抓 sso= 开头的 cookie 配置进 cookies.yaml,教程里讲 Cookie 型反代的标本。 七、Cursor 专项 Cursor-To-OpenAI(JiuZ-Chn/Cursor-To-OpenAI)把 Cursor 编辑器的 AI Chat 包成 OpenAPI,从 Cursor 客户端 cookie(user_ 开头)提取认证,网页 cookie 不能用。这个对讲"客户端 Cookie vs 网页 Cookie 差异"是绝佳案例 八、逆向号池 + 商用平台(拓展视野) FakeOAI/tokens(FakeOAI/tokens)是商用级别,轮训号池将各大平台的模型能力转化为 OpenAI、Anthropic、Gemini 等平台的 API 接口标准格式,支持 Claude Code、Codex、GeminiCli 等终端调用。
顯示更多
0
54
1K
172
轉發到社區
腾讯云开源了 AI Agent 沙盒 Cube Sandbox,Rust 编写,Apache 2.0 协议。 Agent 跑模型生成的代码需要一个隔离环境,避免误删文件或越权访问主机。这类服务的接口事实标准是 E2B,OpenAI Agents SDK、Manus、Perplexity、Hugging Face 都接它。Cube 对 E2B 做完全兼容,原本接 E2B 的 Agent 只要改一个环境变量就能切过来。 腾讯云公布了两组性能数据。单并发冷启动低于 60ms,50 并发时平均 67ms、P95 90ms、P99 137ms。单实例常驻内存低于 5MB(沙盒规格不超过 32GB 时测得),一台 96 核服务器可同时跑 2000 多个沙箱。同场景下 Docker 容器启动约 200ms、共享主机内核;传统虚拟机启动以秒计、单实例内存 20MB 起。 Cube 的做法是给每个 Agent 开一套独立的 Guest OS 内核,走硬件级隔离,同时把启动时间压到百毫秒内。加速靠资源池预置、快照克隆、底层锁优化;压内存靠 Rust 重写、CoW 内存复用、reflink 磁盘共享。项目还附带 CubeVS,用 eBPF 做沙盒之间的网络隔离。 规模化验证给了两个案例。Cube 原本跑在腾讯云 Serverless 体系里,承载过百亿级调用。元宝 AI 编程场景迁到 Cube 后,资源核时消耗降了 95.8%。外部客户里,MiniMax 在 Agentic RL 训练中靠 Cube 做到分钟级调度数十万沙箱实例。下一步规划是把事件级快照回滚也开源出去,提供百毫秒级状态回滚。
顯示更多
0
13
409
46
轉發到社區
龙虾的对手来了?我试了一下Hermes Agent 这几天推荐 Hermes Agent 的人突然多了起来。 我自己装了一个跑了两天,说说感受:确实还可以。不是那种「又颠覆了」的程度,但能明显感觉到它的设计思路跟龙虾不是一回事。 先说一下背景,Hermes Agent 是 Nous Research 今年 2 月底开源的 AI 智能体框架。 上线不到两个月,GitHub 星标冲到了三万多。社区里不少人把它称为 OpenClaw 上线以来,第一个真正意义上的竞争对手。 两个项目表面上很像,都是自托管的开源 Agent,都能接 Telegram、Discord、Slack、WhatsApp。都支持多模型切换,都走 MIT 协议。 但骨子里完全不同。 龙虾是网关,Hermes 是引擎 OpenClaw 的核心是一个 Gateway。网关守护进程,负责统一管理会话、路由消息、连接各种聊天平台。 你可以理解成一个调度中心,把所有聊天应用接到 AI Agent 上。 龙虾解决的核心问题是:怎么把消息送到 Agent Hermes 不太关心这个,它更在意的是:Agent 怎么变得越来越强 官方管这叫 closed learning loop,闭环学习循环。整个框架围绕的就是一件事——让 Agent 在使用过程中自我进化。 打个比方,龙虾是个多渠道助理操作系统,什么聊天工具都能接,生态丰富。 Hermes 是一个会自我迭代的执行引擎,刚开始没那么花哨,但越用越能打。 这是最根本的区别,后面所有差异都从这分叉出来。 会自己写技能的 Agent 我觉得这是 Hermes 最有意思的地方 当它完成一个复杂任务——通常涉及五次以上工具调用——它不是做完就算了。 它会把整个过程沉淀成一份结构化的技能文档,存成 Markdown 文件,放在 ~/.hermes/skills/ 目录下。 下次遇到类似任务?直接加载这份技能文档,不用从头解决。 更狠的是,这些技能在使用过程中会自我迭代。Agent 执行某个技能时发现了更好的方法,它会自动更新技能文档。不需要你手动维护。 Reddit 上有用户反馈,他的 Agent 在两小时内自动生成了三份技能文档。之后跑重复性研究任务,速度提升了 40%。 龙虾也有技能系统,但龙虾的 Skill 主要靠人手写,或者从 ClawHub 技能市场安装。Hermes 等于把「写技能」这件事也交给了 Agent 自己。 一个靠人喂,一个自己长。 我试用的时候确实感受到了,让它帮我查了几轮开源项目的信息,第二天让它做类似的事,它明显快了。 不用再教它「先去 GitHub 看 README,再去看 Issues」这种流程。它自己能记住了。 记忆体系:搜索引擎 vs 笔记本 两者都说自己有跨会话记忆。但实现方式差很多。 Hermes 的做法 用 SQLite 数据库配合 FTS5 全文检索,把所有历史对话存下来。需要调用时,先搜索再让模型做摘要,然后塞进上下文 不是把整段对话历史搬过去,Token 不会爆 记忆分两层: 常驻层:MEMORY.md 和 USER.md。存关键偏好和核心信息,每次对话都带上,相当于硬记忆。 检索层:全量历史在 SQLite 里,容量不限,按需调用,相当于一个私人搜索引擎。 龙虾的做法 工作区里的 Markdown 文件,memory.md 记生活细节,向量索引做语义检索。上下文压缩前会静默写入一次记忆,防止压缩丢信息。 简单类比:Hermes 给 Agent 装了个搜索引擎式的大脑。龙虾给了它一个笔记本。 搜索引擎查东西更精准,笔记本翻起来更直觉。但记忆量大了之后,搜索引擎的优势会越来越明显。 安全思路也不一样 Hermes 搞了一套五层纵深防御: 用户授权:白名单 + DM 配对 危险命令审批:rm -rf、chmod 777 这些高风险操作要人工确认。默认 60 秒没批准,自动拒绝 容器隔离:终端命令跑在 Docker 容器里,不在宿主机上裸跑 MCP 凭据过滤:隔离 MCP 子进程的环境变量,防凭据泄露 上下文注入扫描:检测项目文件里的 prompt injection 攻击 这套设计思路是「默认不信任,层层设卡」,龙虾那边更强调信任模型和配置审计 它有个 openclaw security audit 命令,一键扫描网关配置的安全隐患。思路不一样,但也不能说不好。 但龙虾在安全上的历史确实不太好看。今年 2 月曝出一批高危漏洞——CVE-2026-25253 是一键远程代码执行,点个链接就能接管你的机器。 ClawHub 技能市场还出了 ClawHavoc 攻击活动,恶意技能伪装成加密货币追踪器、YouTube 摘要工具,实际在偷浏览器会话和 API 密钥。 这不是小事。你的 Agent 跑在本地,权限很高。安全出了问题,搞不好整台电脑都交代了。 Hermes 的五层防御在架构层面想得更远。当然,有没有自己的坑还得等时间检验。但至少出发点比「先跑起来再说」靠谱。 选哪个?看你要什么 先说最实在的:如果你现在用的 Agent 已经顺手了,别换!换工具的迁移成本远比你想的高。 想要现成生态 → 龙虾 三十多万星标意味着教程多、插件多、问题容易搜到答案。ClawHub 上几千个 Skill 直接装。你想接 QQ、飞书、钉钉,社区里都有人踩过坑。 想要长期进化 → Hermes 它不是装好就一成不变的工具。用得越久,它对你的工作方式理解越深,技能库越厚。如果你是搞 AI 研究的,它还能生成训练轨迹、跑强化学习实验。内建了兼容 OpenAI API 的服务端,直接接 Open WebUI。 部署成本都不高,Hermes 跑在 5 美元一个月的 VPS 上就够。也支持 Docker 和各种 serverless 方案。 安装不复杂,参考官方文档就行: 两个项目我都装过。 龙虾像一个装了一堆 App 的手机。开箱即用,什么都能干,生态成熟。 Hermes 像一个会自己下载 App 的手机。刚开始没那么好用,但用着用着,它变成了你的形状。 喜欢折腾的,两个都试试。不喜欢折腾的,等 Hermes 社区再成熟一阵子再来看也不迟。 #AI# #AIAgent#
顯示更多