您好,欢迎来到 锐星AI网站导航官网 - 国内外1000+AI工具,发现好用AI,为你导航未来!
登录 / 注册 / 找回密码
全新的分类目录站点,点击去提交

数据归档

数据归档

  • sd-webui-faceswaplab

    sd-webui-faceswaplab

    sd-webui-faceswaplab是一个扩展功能强大的面部替换工具,其功能特点如下: 多功能面部替换:sd-webui-faceswaplab可以进行多个面部的替换操作,使用户能够对多个人脸进行替换,实现不同面部的互换。 修复涂鸦:该工具还具有修复功能,可以对图像中的涂鸦进行修复,使图像看起来更加干净和自然。 检查点功能:sd-webui-faceswaplab支持检查点功能,用户可以在进行面部替换操作时保存检查点,方便随时恢复和继续进行操作。 开源许可证:该工具使用AGPL-3.0许可证,这意味着它是开源的,用户可以自由地使用、修改和分发该工具的源代码。

    github.com/glucauze/sd-webui-faceswaplab - 2026-07-05 - 收藏
  • llama2.c

    llama2.c

    llama2.c是一个用纯 C 语言编写的 Llama 2 LLM 架构的推理引擎。 该项目允许用户在 PyTorch 中训练 Llama 2 模型,将权重保存为二进制文件,然后使用 C 文件加载和运行模型。 该项目并非用于生产环境,而是一个周末项目。 评论中讨论了优化性能、在普通 Linux 服务器上运行 LLM、减小 Llama2 模型大小以及在 Web 应用中使用 LLM 的潜力等各种话题。

    github.com/karpathy/llama2.c - 2026-07-05 - 收藏
  • Insanely Fast Whisper

    Insanely Fast Whisper

    一个使用OpenAI的Whisper Large v2进行语音识别的脚本,能够在短短10分钟内转录300分钟的音频。该项目的目标是提供一个简单的入口来运行推理和微调Whisper,用于自动语音识别(ASR)。该项目还提供了一个CLI(命令行界面),可以在终端上进行100多种语言的数据翻译和转录。

    github.com/Vaibhavs10/insanely-fast-whisper - 2026-07-05 - 收藏
  • CodeLlama

    CodeLlama

    CodeLlama是一个用于实施代码的推理模型的项目。它提供了一种简便的方法来使用训练好的模型,以便生成代码。 功能特点: 推理代码:CodeLlama可以通过输入问题、需求或条件,生成与之对应的代码。它是使用训练好的模型来进行代码的推理,从而提供快速而准确的代码生成。 简化开发流程:CodeLlama可以帮助程序员简化开发流程,减少手动编写代码的时间和努力。它可以根据输入的信息生成有效、可靠的代码片段,从而加快开发速度并提高代码质量。 代码自动补全:CodeLlama具有代码自动补全的功能,可以帮助开发人员快速输入代码,并提供可选的代码建议。这可以大大提高编码的效率和准确性。 多语言支持:CodeLlama支持多种编程语言,包括Python、Java、C ++等。这使得开发人员可以使用CodeLlama来生成不同语言的代码,满足不同项目的需求。 开源项目:CodeLlama是一个开源项目,可以在GitHub上找到其代码和相关文档。这意味着开发人员可以参与贡献、改进和定制CodeLlama,使其适应更多的应用场景。

    github.com/meta-llama/codellama - 2026-07-05 - 收藏
  • FreeU

    FreeU

    FreeU是一个开源项目,该项目由ChenyangSi创建。它的目标是在Diffusion U-Net中提供免费的资源。 Diffusion U-Net是一个用于图像分割的深度学习模型。它基于U-Net架构,并通过将扩散过程与传统的卷积神经网络相结合,提供了更好的图像分割结果。 FreeU项目允许开发人员免费访问和使用Diffusion U-Net,无需支付任何费用。这为开发人员提供了方便和实惠的方式来学习和应用图像分割技术。

    github.com/ChenyangSi/FreeU - 2026-07-05 - 收藏
  • Shutter Encoder

    Shutter Encoder

    Shutter Encoder简介 Shutter Encoder是一款视频、音频和图像转换软件,基于FFmpeg和其他优秀工具设计,旨在尽可能方便和高效。它被视频编辑人员设计,目标是尽可能方便和高效。Shutter Encoder支持几乎所有你听过的编解码器,以及许多你没听过的编解码器。 主要功能 Shutter Encoder提供了一系列功能,包括: 无转换:无需重新编码即可进行剪辑,替换音频,重新包装,符合,合并,提取,字幕插入等操作。 声音转换:支持WAV,AIFF,FLAC,ALAC,MP3,AAC,AC3,OPUS,OGG等音频格式的转换。 编辑代码:DNxHD,DNxHR,Apple ProRes,QT Animation,GoPro CineForm,Uncompressed YUV等编辑代码的支持15。 输出代码:H.264,H.265,VP8,VP9,AV1,OGV,MPEG-2等输出代码的支持15。 广播代码:XDCAM HD422,AVC-Intra 100,XAVC,HAP等广播代码的支持15。 旧代码:DV PAL,MJPEG,Xvid,WMV,MPEG-1等旧代码的支持15。 存档代码:FFV1等存档代码的支持15。 图像创建:支持JPEG,Image等图像格式的创建。 烧录与翻录:支持DVD,Blu-ray,DVD RIP等烧录与翻录操作。 音频分析:支持Loudness & True Peak,Audio normalization,Cut detection,Black detection,Media offline detection,VMAF等音频分析工具。 网页视频下载:支持Web视频的下载。

    www.shutterencoder.com - 2026-07-05 - 收藏
  • OpenSaaS

    OpenSaaS

    OpenSaaS是一个免费的、开源的、全栈的SaaS(软件即服务)启动套件,适用于React + NodeJS。它可以帮助开发者快速构建和部署SaaS应用,节省开发时间和成本。

    opensaas.sh - 2026-07-05 - 收藏
  • Video-subtitle-remover

    Video-subtitle-remover

    基于AI的图片/视频硬字幕去除、文本水印去除,无损分辨率生成去字幕、去水印后的图片/视频文件。无需申请第三方API,本地实现 主要功能: * 保证无损分辨率,从视频中移除硬字幕,并生成新的无字幕文件。 * 通过强大的AI算法模型,对移除字幕后的空白区域进行填充,包括非相邻像素填充和马赛克去除。 * 支持自定义字幕位置,只需传入相应的位置信息,即可仅去除该位置的字幕。 * 支持全视频自动去除所有文本,即使未传入位置信息。 目前仅支持Windows和Linux操作系统,并需要NVIDIA显卡。最低配置要求为: * GPU:GTX 1060或更高级别的显卡。 * CPU:支持AVX指令集。

    github.com/YaoFANGUK/video-subtitle-remover - 2026-07-05 - 收藏
  • Segment-Anything

    Segment-Anything

    Segment-Anything是一个模型,它提供了运行推理的代码、训练模型的检查点下载链接以及示例笔记本。以下是Segment-Anything的功能特点总结: 推理功能:Segment-Anything模型通过使用已训练的模型检查点,可以对图像进行分割,并提取出图像中各个区域的感兴趣部分。 模型检查点下载:用户可以从该项目中获取已经训练好的模型检查点,以便在自己的应用中使用或进行二次开发。 示例笔记本:Segment-Anything提供了一些示例笔记本,展示了如何使用该模型进行图像分割的步骤和方法。 开放源代码:Segment-Anything的代码是开放源代码,并使用Apache-2.0许可证进行授权,这意味着用户可以自由地使用、修改和分发代码。

    github.com/facebookresearch/segment-anything - 2026-07-05 - 收藏
  • MagicAvatar

    MagicAvatar

    MagicAvatar是由字节跳动开发的多模态框架,它能够将各种输入模式(如文本、视频和音频)转换为运动信号,进而生成或激活一个虚拟形象(Avatar)。然后基于这些信号生成以形象为中心的视频。 以下是几种模式场景: 文本引导的形象生成: 用户可以通过简单的文本提示来创建形象。例如,输入“一个在火山里踢踏舞的宇航员”就能生成一个相应的虚拟形象。 视频引导的形象生成: 用户可以提供一个源视频,然后框架会创建一个跟随给定动作的形象。这意味着你可以录制一个动作,然后让虚拟形象模仿这个动作。 多模态形象动画: 这个功能允许用户激活一个特定主题的形象。例如,你可以选择一个已经存在的虚拟形象,并通过多模态输入来激活它。 音频引导的形象生成(即将推出): 这个即将推出的功能将允许用户通过音频输入来创建形象。这意味着你可以通过说话或唱歌来生成一个动作。

    magic-avatar.github.io - 2026-07-05 - 收藏

推荐资讯

推荐站点

  • 造点造点

    核心功能与模型 “造点”平台的最大亮点是整合了业界顶尖的AI模型,实现了“强强联合”: 1. AI生视频:率先接入 通义万相 Wan2.5 全球首发/国内首个: 成为国内首个支持音画同步生成的平台。它可以在生成视频画面的同时,自动匹配人声、音效和背景音乐。 高质量输出: 支持生成长达10秒、1080P高清、24帧/秒的视频,画质可满足专业需求。 强指令遵循: 能够理解并执行复杂的指令,如运镜、视角切换等连续变化。 声音驱动: 用户可以在提示词中用引号(“”)来描述声音,实现声音驱动画面生成。 2. AI生图:集成 Midjourney V7与夸克图片1.0 顶级美学: 接入了Midjourney V7模型。 本土化优化与易用性: 无需魔法,中文友好: 国内用户可以直接使用Midjourney V7模型,无需海外网络环境。 UI简化: 将MJ复杂的参数(如风格化、怪异化)做成了直观的滑块控制,方便调节。 辅助功能: 提供“智能润色”和“特征词库”等功能,帮助新手快速上手。 特色能力: 结合夸克自研技术,夸克图片1.0模型在亚洲人像、中文文字生成、国风元素等方面表现出色,适合电商、设计等场景。 产品体验与工作流 一站式创作流: 用户可以在平台内使用Midjourney V7生成高质量图片后,一键调用通义万相Wan2.5将图片转化为动态视频,整个创作流程非常顺畅。 双端体验: PC网页端: 提供功能最全面的专业创作体验,面向专业创作者。 夸克APP移动端: 提供轻量化的创作体验,以对话式交互为主,满足普通用户的趣味玩法和日常修图需求,如“一句话P图”、换发型、换背景、风格转换等。 价格与优惠活动 会员定价: 标准会员: 48元/月,可生成约400张MJ图片。相比Midjourney官方订阅(约70元/月生成200张),价格近乎“腰斩”。 高级会员: 188元/月,可生成约1800张MJ图片。 还有免费套餐,登录可获取每日积分。 限时免费活动: 活动时间: 即日起至9月30日。 活动内容: 所有用户均可享受7天免费体验通义万相Wan2.5的视频生成功能。 综上所述,“造点”是夸克在AIGC领域推出的一个旗舰级产品,它通过集成中外最顶尖的AI模型(通义万相2.5 + Midjourney V7),并辅以出色的本土化优化和极具竞争力的价格,为从专业创作者到普通用户的广泛人群提供了一个强大且易用的一站式AI内容创作平台。

    create.qianwen.com
  • 百小应百小应

    百川智能发布最新一代基座大模型Baichuan 4,并推出成立之后的首款AI助手“百小应”。Baichuan 4相较Baichuan 3 在各项能力上均有极大提升,其中通用能力提升超过10%,数学和代码能力分别提升14%和9%,在国内权威大模型评测机构SuperCLUE的评测中,模型能力国内第一。此外,Baichuan 4还具备行业领先的多模态能力,在各大评测基准上表现优异,领先Gemini Pro、Claude3-sonnet等多模态模型。在Baichuan 4强大能力的基础上,百川智能将搜索技术与大模型深度融合,推出懂搜索、会提问的AI助手“百小应”。

    yi.baichuan-ai.com
  • 腾讯元宝腾讯元宝

    腾讯元宝是基于腾讯混元大模型的AI助手应用,集成AI搜索、AI总结、AI写作、AI绘画等能力,同时支持创意绘画生图,帮助用户在工作、学习和生活中提高效率。

    yuanbao.tencent.com