注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 audio
audio 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 audio 的推特
Fish Audio 把自家最强 TTS(S2.1-Pro)放出来 API 目前可以免费使用
通义发布 Qwen-Audio-3.0-TTS 语音模型 一段参考音能说 16 种语言和 20 种方言 首包延迟做到 300 毫秒级 同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。
显示更多
0
34
90
13
转发到社区
视频来源:油管Audiophilesdoteu
发现一个很离谱的开源音频编辑器:#AudioMass# 它几乎就是“网页版 Audacity”,但居然完全在浏览器里运行,不用安装、不用注册、没后端,拖进音频就能直接剪辑、降噪、加混响、EQ、变速、录音。甚至现在还支持多轨编辑。 官方提供了一个实例,可以直接使用: 当然也可以自己部署: #github#
显示更多
尝试一下暗黑料理,味道还不错,嘎嘣脆😄 Seedance 2.0 prompt 👇 【风格】超现实ASMR吃播(Surreal ASMR Mukbang),照片级写实(Photorealistic),奇幻美食大片质感,8K超清,双耳收音ASMR(Binaural Audio),暖橙-暗岩双色调 【时长】15秒 【场景】活火山脚下:背景是冒着橙红岩浆流的黑色火山锥,天空烟灰色带火光反照,空气中飘浮发光余烬颗粒(Floating Embers);前景一张黑色火山岩石桌,桌上摆一只石碗,碗中盛满缓慢流动、发光的橙红岩浆,质感如高温果冻般粘稠光滑 【角色】主角图片1(严格保持参考图容貌、发型、粉色连衣裙与高跟鞋,全程不变;对岩浆高温完全免疫,无任何灼伤或痛苦表现) [00:00-00:03] 镜头1:火山开席(Wide Establishing → Push-in) 广角全景:主角图片1端坐在火山岩石桌前,身后岩浆流缓缓下淌,余烬如萤火漂浮。 她看向镜头轻轻一笑,抬起金属长勺在石碗边缘轻敲两下。 音效:远处火山低频轰鸣、岩浆咕嘟冒泡声、勺子敲碗的清脆"叮叮"声。 [00:03-00:08] 镜头2:第一口岩浆(Macro Close-up / ASMR Bite) 特写:长勺挖起一勺岩浆,橙红色浆体像熔化的麦芽糖一样拉出发光的丝,缓慢垂落,表面翻着细小金色气泡。 她凑近轻轻吹气,勺尖腾起一缕白色蒸汽。 嘴部微距特写:张口咬下,岩浆入口瞬间发出焦糖脆壳般的"咔嚓"碎裂声,随后是绵密的咀嚼声,嘴角逸出一丝细小蒸汽,她满足地眯起眼睛。 音效:吹气声、咔嚓脆响、粘稠咀嚼声、轻微吞咽声,全程双耳ASMR收音。 [00:08-00:12] 镜头3:发光岩石脆块(Crunch Sequence) 她从碗边拈起一块拳头小的发光火山岩脆块,通体橙红半透明、内部有流动光纹,像琉璃糖。 侧面特写:一口咬下,脆块应声碎裂,碎屑边缘闪着细小火星光点(2D贴纸质感,不接触皮肤)。 连续咀嚼特写:脆响层层叠叠由密到疏,她轻晃肩膀露出享受表情,指尖拈起碎屑再补一口。 音效:硬脆碎裂声、密集咀嚼脆响、指尖摩擦声。 [00:12-00:15] 镜头4:岩浆一口闷(Finale + Eruption) 她端起石杯将发光岩浆一饮而尽,喉部特写伴随清晰吞咽声,杯底翻转示空。 放下杯子对镜头甜笑比出OK手势,同一瞬间身后火山口喷起一束橙金色岩浆焰火(远景,不靠近人物),余烬如慢雪飘落。 画面定格在她的笑容与身后火光,不淡出。 音效:连续吞咽声、放杯的石器碰撞声、远处火山喷发的闷响与噼啪余烬声,无音乐无对白。
显示更多
0
12
38
1
转发到社区
家人们,我又挖到一个宝藏AI语音工具!用了它,你会发现以前自己录音简直是在浪费时间。 Fish Audio —— 免费的AI语音克隆+配音神器,完全零门槛,不需要显卡、不用部署,打开浏览器就能用!现在做视频越来越卷,自己声音又不满意,录起来还尴尬?别慌! 在 Fish Audio 上传一段十几秒的录音,就能快速克隆出你的专属声音;或者直接选用他们预设的几十种高质量音色。输入文字就能生成语音,中文发音自然度吊打之前大部分工具。 操作超级简单,三步搞定: 1️⃣打开官网: 2️⃣选择音色 or 上传自己的录音克隆 3️⃣输入文案,点击生成,几秒钟出结果 以后做视频推文、项目介绍、教程剪辑、撸毛干货……全都能用上!再也不用对着麦克风尴尬录半天了 最香的是每天5000字免费额度,日常使用完全够用,强烈推荐大家试试!
显示更多
Claude 确实很牛逼,但他不是神。而且 Anthropic 在语音这块的投入相比于其他家是偏少的。 所以这个博主恰好说反了,现在 GPT 的付费模式还有 Gemini,它们都是原生的语音模式(Audio In, Audio Out)。 Claude 反而是现在这三家里面,还在坚持用 STT、TTT、TTS 三段式 Pipeline 的 AI 。 而且这里的因果关系也有点问题。 Eleven Labs 确实是 Claude 的供应商之一,但是 Eleven Labs 主要做的是 TTS(文字生成语音),它是“嘴巴”。 那博主说的能听出他语速过快的问题,这个是“耳朵”部分,也就是 STT 干的工作。而 STT 并不是 Eleven Labs 的主要工作。 其实,传统的 STT 是能够给句子带有一些标记的。 比方说,她可能用 10 秒就说完了一大长串话,或者是它把长难句中间没有停顿,这些 STT 都会记录,并且给出她语速过快的结论。 真正练英语,我建议还是用 ChatGPT 的付费模式。 虽然它那个语音模式的内核可能还是 GPT-4o,但是原生的那种聊天方式,感受是很好的。
显示更多
看梅西投资基金Play Time的AI投资组合,突然一个熟悉的logo映入眼帘。第一时间以为是大众点评的新项目,但看了下介绍并没有关系,这个项目曾拿到a16z Speedrun支持的种子轮。@intangibleai或许你们需要知道下中国这个互联网大厂😂 Play Time 投资组合中的主要 AI 相关公司👇🏻 World Labs:由“AI教母”李飞飞创立的空间智能与3D世界生成公司,开发有类“上帝模拟器”的3D场景生成工具 Marble。 Field AI:专注于自主机器人和AI具身导航技术的开发商,产品获英伟达等巨头支持。 SuperAnnotate:为计算机视觉和AI大模型提供高质量训练数据的AI数据标注与管理平台。 Perceptron:致力于构建物理世界基础模型的AI前沿科技公司。 Fish Audio:专注于多模态与语音AI生成的服务公司。 Intangible:专注于3D可视化和前沿数字内容的工具平台。
显示更多