註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 GenerativeAI
GenerativeAI 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 GenerativeAI 的搜尋結果
GitHub 上一个 7.4w star 的项目,最近刷屏了。 项目名字叫 generative-ai-for-beginners,是微软官方推出的生成式 AI 入门课程。 我本来以为又是那种“看起来很全、实际全是概念”的合集,结果点进去看了两节,直接被惊艳到。 这不是东拼西凑的博客整理,而是真正按照 「怎么一步步做出 AI 应用」 的逻辑来设计的课程体系。 它从 Prompt Engineering 开始教你怎么和模型高效对话、如何精准控制输出;然后自然过渡到 RAG、向量数据库、Fine-tuning、AI Agent、安全等内容。 顺序特别重要。 很多人学 AI 最大的痛苦不是学不会,而是一上来就被 RAG、MCP、Function Calling、Agent、LoRA 等一堆名词砸懵,完全不知道该先学什么、整个链路怎么串起来。 这个课程最牛的地方就在于,它把「为什么先学这个,后学那个」讲得特别清楚,每一节都有明确的 Learning Goals,不会让你学着学着就迷路。 更关键的是——它极度注重实操。 几乎每节都配了 Jupyter Notebook,打开就能跑。你改几个 Prompt,调一下 temperature、top_p,模型输出立刻变化;RAG 那部分更是手把手带你: • 如何切分本地文档 • 如何生成 Embedding • 如何存入向量数据库 • 如何检索 + 喂给模型生成答案 后面 Fine-tuning 讲 LoRA 轻量微调,Agent 部分演示模型如何调用工具完成多步任务。 刷到后面你会突然明白:现在市面上很多 AI 产品,本质上就是把这些模块聪明地拼在一起而已。 最离谱的是,这套课程完全免费,还有中文翻译。 现在很多人一想学 AI,第一反应就是去报各种付费课。但很多付费课其实也是把官方文档换个说法重新讲一遍。 而微软自己做的这套体系化内容,反而更适合想真正从零构建知识框架的人。 我的建议是: 如果你想系统地学生成式 AI,与其每天刷碎片信息、被各种新名词牵着鼻子走,不如直接把这个仓库从头过一遍。 至少你脑子里会先有一张清晰的地图。 仓库地址: 强烈推荐给正在学 AI 的朋友
顯示更多
兄弟们,今天挖到一个做 AI 短视频连续剧的狠活。 做 AI 女孩最烦的真不是生图,是第二条开始脸就飘了,像换了个演员。 这个 26K 星的 Open Generative AI,可以把正脸、侧脸、穿搭、产品图一起丢进去,最多 14 张参考图,先把人物钉死。 后面接视频,再丢音频做口型,9 套数字人方案都在一个后台。 我自己看完第一反应是,这玩意值钱的不是模型多,是能让一个 AI 女孩连续拍下去。 做矩阵号的,真可以先塞密码库。
顯示更多
现在全网做 AI 产品的,起码有一半的方案都是照着这个清单偷抄的。 这是 GitHub 顶级大神维护的 Generative AI 全景图谱,把全球最顶尖的生成式 AI 项目、开源工具、底模和商用服务全给搜刮干净了。 仓库:steven2358/awesome-generative-ai 协议:CC0 1.0 (完全开源 / 无版权限制) 🔹 从文本、图像到语音、视频 AI,全赛道顶级项目无死角覆盖 🔹 囊括最新的开源模型与商业服务,找工具不用再瞎折腾 🔹 大厂工程和独立开发都在偷偷看的“AI 创业与选型军火库” 🔹 一键直达代码库与 API,省去 90% 筛选和测试成本 👉 链接:
顯示更多
首先众所周知,国内宏观经济正式进入K型曲线,就是科技互联网、AI、GPGPU、NAND和DRAM、新质生产力、高端工业设备、外贸机电产品往上走,社会消费零售往下走,房地产基建土木狠狠往下走, 其次,互联网行业内部也会迎来K型曲线,就是针对社会零售打车的平台经济逐渐饱和,竞争白热化,二手房、二手车 、商业地产的交易信息平台开始猛猛往下走,出海SaaS、游戏、generative AI、AI Agent等全球挣美元或者国资重点扶持+央国企重点采购国产化产业开始猛猛往上走。
顯示更多
0
20
154
16
轉發到社區
ChatGPT 升级之后,我跟它说话基本没有延迟了,最新的实时语音模型延迟大概 200-300ms,人类对话的自然反应间隔也是 200-300ms。是一样的。 但0延迟代价是遗忘。实时语音模型的上下文窗口只有 32k token,是纯文本模型的1/300。低延迟 = 小记忆 + 主动遗忘。既要秒回,又要记住你说过的每句话,目前来说,是两难的问题。 算力一直不够。一张 5090出一张 SDXL 图需要2 秒,FLUX 要9 秒,训练一个人物 LoRA需要10-30 张图,目前得一两个小时。 我租的5090现在价格将近5000 刀,满载 575W ,还不算电费。两三年卡的相对算力就过时了。真的很贵。 我们15年前互相发短信,后来彩信可以传图片,再到发视频,直到现在的毫无延迟的高清实时通话。 一条短信只有 140 字节。从 2G 的9.6kbps 到 5G 峰值 20Gbps,带宽差了 200 万倍。 AI 使用的路经一模一样。一开始是文字 token,到去年可以图像,现在语音,下一步肯定是没有延迟的视频沟通。 其实视频已经开始了,Gemini Live 去年就能开着摄像头实时对话,每秒烧300 个 token,默认上限 2 分钟,但聊完就忘光,昂贵+效果差+各种维度还很原始,导致基本没法用。 现在的 Agent 还是在用文字做规划,在通过文本理解这个世界,整条推理链都是 token,非文字的潜空间推理才刚刚开始尝试。 AI 对时间的理解也停在文本,能拿数学奥赛金牌的模型,读一个模拟时钟的准确率只有 50% 左右。触觉、情绪、具身感知,离成熟还差得非常非常远。 再说存储。我倒是不觉得“永远缺存储”,“永远”这个词太夸张了。 每 GB 存储成本 45 年跌了 99.99%,长期来看当然只会更便宜。 只是现在 AI 把内存吸干了,DRAM 一个季度涨 90%,阶段性的紧俏,不是等于永远会缺货。 那这是不是伪需求呢?伪需求的特征是这个月用了,下个月就不用了。 Google 每月处理的 token 一年涨了 7 倍,到 3200 万亿。ChatGPT 周活是 9 亿。 token 价格每年下降十倍,但所有人都在讨论的是怎么更高效地用 token,而不是咱们怎么不用。 一个 agent 会话烧掉的 token 是单轮对话的 50-200 ,价格如果下降我们只会用得更多。 generative AI 三年做到全球 53% 渗透,互联网用了 7 年,PC 用了 15 年。 所以,我们当然还在 AI 的早期,而且转变不可逆。就像 2G 时代的我们,彩铃还是《浪漫手机》,收件箱满了也舍不得删几条短信。 (图片是我用Fable5做的🎮)
顯示更多
0
81
68
2
轉發到社區
每个人都应该了解的AI 术语名词,你都认识吗? 搞懂这些名词 并了解其实现方式和原理。你基本就入门了。 AGI(类人AI):类似人类思维的AI。 CoT(链式思维):AI一步步思考。 AI Agents(AI代理):自动化决策的程序。 AI Wrapper:简化与AI模型的互动。 AI Alignment(AI对齐):确保AI遵循人类价值观。 Fine-tuning(微调):使用特定训练数据来改进AI。 Hallucination(幻觉):AI编造的信息。 AI Model(AI模型):用于任务的训练AI。 Chatbot(聊天机器人):模拟人类对话的AI。 Compute(计算):AI模型的处理能力。 Computer Vision(计算机视觉):AI理解图像和视频的能力。 Context(上下文):AI为更好响应保留的信息。 Deep Learning(深度学习):通过多层神经网络学习的AI。 Embedding(嵌入):AI的词汇数字化表示。 Explainability(可解释性):理解AI决策背后的逻辑。 Foundation Model(基础模型):可适应任务的大型AI模型。 Generative AI(生成式AI):创建文本、图像等内容。 GPU(图形处理单元):用于快速AI处理的硬件。 Ground Truth(真实数据):AI学习的验证数据。 Inference(推理):AI对新数据做出的预测。 LLM(大型语言模型):用大量文本数据训练的AI。 Machine Learning(机器学习):AI通过数据经验改进。 MCP(模型上下文协议):AI内部数据访问的标准。 NLP(自然语言处理):AI理解人类语言。 Neural Network(神经网络):受大脑启发的AI模型。 Parameters(参数):AI学习的内部变量。 Prompt Engineering(提示工程):创建输入以指导AI输出。 Reasoning Model(推理模型):有逻辑推理能力的AI。 Reinforcement Learning(强化学习):AI通过奖励与惩罚学习。 RAG(检索增强生成):结合搜索与生成的AI。 Supervised Learning(监督学习):在标记数据上训练的AI。 TPU(张量处理单元):AI处理专用芯片。 Tokenization(分词):将文本分割成词片。 Training(训练):通过调整参数教AI。 Transformer(变换器):用于语言理解的AI架构。 Unsupervised Learning(无监督学习):AI在无标签数据上发现模式。 Vibe Coding(情绪编码):通过语言捕捉情绪并预测输出。 Weights(权重):影响AI学习的值。 #AI# #AIAgent#
顯示更多
Bria(Bria AI) 是一家专注于商业级视觉生成式AI的公司, 核心定位 它不是面向普通用户随便玩的文生图工具(比如Midjourney那种),而是做企业/开发者用的视觉AI基础设施, 100% 使用正版授权数据训练(和Getty Images、Alamy、Freepik等合作),不爬图。 生成结果有版权归属追踪和补偿机制,商业使用更安全,不容易踩版权雷。 提供API、SDK,方便直接集成进产品、电商、广告、内容生产流程。 主要能力 文生图 / 图生图 背景移除(图片 + 视频) 产品图生成与编辑(电商常用) 广告素材批量生成 高分辨率放大、精细编辑 支持「品牌定制模型」(Tailored Generation),让AI输出更贴合自己的品牌风格 最新有Fibo模型,用结构化提示(Visual Generative Language)提升可控性和一致性
顯示更多
公司的 SQL 仔和数据分析师要被这个开源神器干失业了!老板直接用自然语言提问,AI 就能自动打通底层数据库生成数据报表,关键是还不会胡乱捏造指标。 这玩意真有人做出来了——GitHub 爆火开源项目 WrenAI,目前已经斩获 16.8k Star,采用 Apache 2.0 协议开源。它是一个专门给 AI Agent 打造的 Generative BI(生成式商业智能)引擎。简单来说,它在你的数据库和 AI 之间塞了一层“业务语义理解”,不管是 PostgreSQL、ClickHouse、Snowflake 还是 BigQuery,连上就能直接让人话变成准到离谱的 SQL 和可视化图表。 🔥 核心卖点: • 通吃 20+ 种主流数据库:大小数据库一键打通,不挑食 • 独家业务上下文层:AI 不再瞎猜表结构,查询零幻觉 • 自动出可视化图表:说句人话直接生成漂亮仪表盘 • 无缝对接 AI Agent:跟 Claude Code、Cursor 秒无缝集成 • 完全开源可私有化:敏感数据不外流,本地部署超省心 🔗 传送门:
顯示更多
0
7
278
71
轉發到社區
装完 Codex 不搞钱?难道等着吃灰? 很多人装完 Codex,只会让它改代码、写脚本。 但我觉得更有想象力的玩法,是让它参与整条视频制作流程。 给 Codex 装上这 6 个 GitHub 上的视频 Skills,它就不只是写代码的工具,而是可以帮你做: 脚本、分镜、提示词、动效、字幕、剪辑、包装和 MP4 渲染。 1. HyperFrames:一句话生成动效视频 2. video-use:让 Agent 帮你剪视频 3. Remotion Skills:用代码批量制作视频 4. Generative Media Skills:AI 视频生成工具箱 5. videocut-skills:中文视频剪辑 Agent 6. seedance2-skill:帮即梦写专业视频提示词 不知道怎么搭配,可以先这样用: 文章、推文转视频:HyperFrames 真人口播、采访剪辑:video-use + HyperFrames 批量制作固定栏目:Remotion Skills + HyperFrames AI 短剧、广告视频:seedance2-skill + 即梦 + video-use 大量测试 AI 视频玩法:Generative Media Skills 真正值钱的不是工具名,而是你能不能把它们串成自己的视频工作流。 建议收藏,后面按自己的视频类型一个个试。
顯示更多
0
11
380
106
轉發到社區