MiniMax 语音
Minimax Audio是什么 Minimax Audio是一个AI音频生成与处理工具,它能将输入的文字转换成自然、富有情感的语音,也能根据文本创作音乐。它为需要进行新闻播报、说书、影视配音等音频内容创作的用户提供服务,同时配备了自定义音色设计和人声提取等AI工具。
www.minimaxi.com/audio - 2026-07-04 - 收藏DDSP-SVC – AI声音克隆
DDSP-SVC 是一个新的开源歌声转换项目,致力于开发可以在个人电脑上普及的自由 AI 变声器软件。 相比于著名的 SO-VITS-SVC, 它训练和合成对电脑硬件的要求要低的多,并且训练时长有数量级的缩短,和 RVC 的训练速度接近。 另外在进行实时变声时,本项目的硬件资源消耗显著低于 SO-VITS-SVC , 但可能略高于 RVC 最新版本。 虽然 DDSP 的原始合成质量不是很理想(训练时在 tensorboard 中可以听到原始输出),但在使用基于预训练声码器的增强器(老版本)或使用浅扩散模型(新版本)增强音质后,对于部分数据集可以达到不亚于 SOVITS-SVC 和 RVC 的合成质量。 老版本的模型仍然是兼容的,以下章节是老版本的使用说明。新版本部分操作是相同的,见之前章节。 免责声明:请确保仅使用合法获得的授权数据训练 DDSP-SVC 模型,不要将这些模型及其合成的任何音频用于非法目的。 本库作者不对因使用这些模型检查点和音频而造成的任何侵权,诈骗等违法行为负责。 1.1 更新:支持多说话人和音色混合。 2.0 更新:开始支持实时 vst 插件,并优化了 combsub 模型, 训练速度极大提升。旧的 combsub 模型仍然兼容,可用 combsub-old.yaml 训练,sins 模型不受影响,但由于训练速度远慢于 combsub, 目前版本已经不推荐使用。 3.0 更新:由于作者删库 vst 插件取消支持,转为使用独立的实时变声前端;支持多种编码器,并将 contentvec768l12 作为默认编码器;引入浅扩散模型,合成质量极大提升。 4.0 更新:支持最先进的 RMVPE 音高提取器,联合训练 DDSP 与扩散模型,提升推理与训练速度,进一步提升合成质量。 5.0 更新:支持更快速的 FCPE 音高提取器,改进 DDSP 模型与扩散模型,提升推理与训练速度,进一步提升合成质量。 网址:https://github.com/yxlllc/DDSP-SVC/ https://www.bilibili.com/video/BV1ur42177iP
github.com/yxlllc/DDSP-SVC - 2026-07-04 - 收藏OpenVoice
OpenVoice 是 myshell ai 开源的一款基于人工智能技术的语音克隆工具。 其核心功能是通过提供发言者的短音频片段(参考语音),实现声音的高效克隆。 这意味着您可以使用OpenVoice来克隆任何人的声音,而且不限于特定语言。无论您是想要模仿某位名人的声音,还是需要在不同语言之间进行语音转换,OpenVoice都能够满足您的需求。 项目地址:github.com/myshell-ai/O
github.com/myshell-ai/OpenVoice/ - 2026-07-04 - 收藏GPT-SoVITS
强大的少样本语音转换与语音合成Web用户界面。 功能: 零样本文本到语音(TTS): 输入5秒的声音样本,即刻体验文本到语音转换。 少样本TTS: 仅需1分钟的训练数据即可微调模型,提升声音相似度和真实感。 跨语言支持: 支持与训练数据集不同语言的推理,目前支持英语、日语和中文。 WebUI工具: 集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注,协助初学者创建训练数据集和GPT/SoVITS模型。 介绍视频https://www.bilibili.com/video/BV12g4y1m7Uw/ 来自B站up主:花儿不哭
github.com/RVC-Boss/GPT-SoVITS - 2026-07-04 - 收藏RVC;Retrieval-based-Voice-Conversion-WebUI
一个基于VITS的简单易用的语音转换(变声器)框架,开源变声模型【RVC】 下面是其中的一个人声与AI人声的合作案例 这是up主和自己的AI歌声合唱的视频,其中用到了变声使用框架:RVC和DiffSinger开源项目 标题:中日双语花海!我和自己的ai合唱了! 链接:https://www.bilibili.com/video/BV1QP411X7A6/
github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI - 2026-07-04 - 收藏MiniMax 语音
Minimax Audio是一个AI音频生成与处理工具,它能将输入的文字转换成自然、富有情感的语音,也能根据文本创作音乐。它为需要进行新闻播报、说书、影视配音等音频内容创作的用户提供服务,同时配备了自定义音色设计和人声提取等AI工具。
www.minimaxi.com/audio - 2026-07-04 - 收藏MiniMax 语音
Minimax Audio是一个AI音频生成与处理工具,它能将输入的文字转换成自然、富有情感的语音,也能根据文本创作音乐。它为需要进行新闻播报、说书、影视配音等音频内容创作的用户提供服务,同时配备了自定义音色设计和人声提取等AI工具。
www.minimaxi.com/audio - 2026-07-04 - 收藏
推荐资讯
推荐站点
造点
核心功能与模型 “造点”平台的最大亮点是整合了业界顶尖的AI模型,实现了“强强联合”: 1. AI生视频:率先接入 通义万相 Wan2.5 全球首发/国内首个: 成为国内首个支持音画同步生成的平台。它可以在生成视频画面的同时,自动匹配人声、音效和背景音乐。 高质量输出: 支持生成长达10秒、1080P高清、24帧/秒的视频,画质可满足专业需求。 强指令遵循: 能够理解并执行复杂的指令,如运镜、视角切换等连续变化。 声音驱动: 用户可以在提示词中用引号(“”)来描述声音,实现声音驱动画面生成。 2. AI生图:集成 Midjourney V7与夸克图片1.0 顶级美学: 接入了Midjourney V7模型。 本土化优化与易用性: 无需魔法,中文友好: 国内用户可以直接使用Midjourney V7模型,无需海外网络环境。 UI简化: 将MJ复杂的参数(如风格化、怪异化)做成了直观的滑块控制,方便调节。 辅助功能: 提供“智能润色”和“特征词库”等功能,帮助新手快速上手。 特色能力: 结合夸克自研技术,夸克图片1.0模型在亚洲人像、中文文字生成、国风元素等方面表现出色,适合电商、设计等场景。 产品体验与工作流 一站式创作流: 用户可以在平台内使用Midjourney V7生成高质量图片后,一键调用通义万相Wan2.5将图片转化为动态视频,整个创作流程非常顺畅。 双端体验: PC网页端: 提供功能最全面的专业创作体验,面向专业创作者。 夸克APP移动端: 提供轻量化的创作体验,以对话式交互为主,满足普通用户的趣味玩法和日常修图需求,如“一句话P图”、换发型、换背景、风格转换等。 价格与优惠活动 会员定价: 标准会员: 48元/月,可生成约400张MJ图片。相比Midjourney官方订阅(约70元/月生成200张),价格近乎“腰斩”。 高级会员: 188元/月,可生成约1800张MJ图片。 还有免费套餐,登录可获取每日积分。 限时免费活动: 活动时间: 即日起至9月30日。 活动内容: 所有用户均可享受7天免费体验通义万相Wan2.5的视频生成功能。 综上所述,“造点”是夸克在AIGC领域推出的一个旗舰级产品,它通过集成中外最顶尖的AI模型(通义万相2.5 + Midjourney V7),并辅以出色的本土化优化和极具竞争力的价格,为从专业创作者到普通用户的广泛人群提供了一个强大且易用的一站式AI内容创作平台。
create.qianwen.com百小应
百川智能发布最新一代基座大模型Baichuan 4,并推出成立之后的首款AI助手“百小应”。Baichuan 4相较Baichuan 3 在各项能力上均有极大提升,其中通用能力提升超过10%,数学和代码能力分别提升14%和9%,在国内权威大模型评测机构SuperCLUE的评测中,模型能力国内第一。此外,Baichuan 4还具备行业领先的多模态能力,在各大评测基准上表现优异,领先Gemini Pro、Claude3-sonnet等多模态模型。在Baichuan 4强大能力的基础上,百川智能将搜索技术与大模型深度融合,推出懂搜索、会提问的AI助手“百小应”。
yi.baichuan-ai.com腾讯元宝
腾讯元宝是基于腾讯混元大模型的AI助手应用,集成AI搜索、AI总结、AI写作、AI绘画等能力,同时支持创意绘画生图,帮助用户在工作、学习和生活中提高效率。
yuanbao.tencent.com