)
Open Generative AI 完整指南:420 模型的免费 AI 图像与视频生成工作室(可自托管)【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image video generation studio with 600 models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AIOpen Generative AI 是一个免费、开源、可自托管的 AI 图像与 AI 视频生成工作室:一个项目里聚合了 420 个主流模型(Flux、Midjourney、Kling、Sora、Veo 等),用 16 个工作室页签覆盖图像、视频、音频和智能体创作,提示词不做平台级拦截,也没有订阅费。它同时提供浏览器 Web 版和 Electron 桌面版,桌面版还能在本机 GPU 上跑私有模型。适合想低成本批量产出 AIGC 内容、又在意数据归属和提示词自由度的个人创作者与独立开发者。三条路线怎么选:先问自己三个问题不用记架构图,按你能接受哪种前置条件来定路:问一:我愿意装东西吗?不愿意、只想看效果 →托管 Web 版。注册一个托管端账号,浏览器直接打开,零本地环境。代价:生成永远走云端 API,数据经过托管网关。愿意装、但要长期使用 →桌面版(Electron)。macOS / Windows / Linux 都是一键安装包,不需要 Node.js。代价:安装包未签名,首次启动要绕过一次系统告警。愿意装,还愿意折腾 → 在桌面版基础上叠加本地推理,另需下载推理引擎和数 GB 模型权重。问二:我生成得多吗?在意数据在哪吗?偶尔玩一次,托管版够了;每天出片、且不想提示词经过别人的网关,桌面版更稳。问三:我的局域网里有 GPU 机器吗?有(NVIDIA 或 AMD 显卡的 Linux/Windows 主机,或租的云 GPU)→ 可以叠加本地推理,把最重的视频模型放上去跑;没有 → 本地推理引擎只适合跑轻量图像模型。一句话判断标准:只看效果 → 托管版;每天出片且在意数据归属 → 桌面版;提示词和成片都不出局域网 → 桌面版 本地推理。三条路径共用同一套界面,随时可切换,选错路不会锁死。想产出什么,就去哪个工作室16 个页签不用背,按产出物找入口就行。页签与导航分组定义在 components/StandaloneShell.js 的 TABS 数组里,官方按图像 / 视频 / 音频 / 智能体与自动化四类组织。要出图Image Studio:最核心的入口。文生图(50 模型)与图生图(55 模型)两套模型集,按你有没有上传参考图自动切换,图生图模式下提示词变为可选。Cinema Studio:电影感镜头,把相机、镜头、焦距、光圈这类专业参数直接变成可勾选的提示词修饰符。另外三个按用途选:Layers Studio(分层编辑与合成)、Design Agent(基于画布的自主设计代理)、AI Influencer(风格一致的 AI 虚拟人内容管理)。要出片Video Studio:逻辑与 Image Studio 一致——文生视频(40 模型)与首帧图生视频(60 模型)智能切换,上传首帧图就自动换到图生视频那套。Lip Sync:人像 音频,或视频 音频,产出说话视频,共 9 个专用模型。其余按需求挑:AI Clipping(长视频自动剪高光)、Body Swap / Recast(图像或视频里重铸主体外观/换装)、Vibe Motion(风格化动效)、Marketing(单一输入批量出广告创意变体)。要出声音:Audio Studio,文本驱动的 AI 音乐与音频生成、remix、编辑。要自动化Agent Studio:多轮对话式创意代理,会自己规划并执行生成任务。Workflow Studio:节点式可视化流水线,把图像、视频、音频模型串成自动化流程,带社区模板和 Playground 交互运行。Explore Apps:基于同一模型目录的应用模板目录;Motion Control:动作控制类生成。贯穿所有工作室的三件基础能力,新手容易忽略:参考图上传一次后本地持久化、跨会话直接点缩略图复用;生成历史存在浏览器里,可回看、重新下载;宽高比 / 分辨率 / 时长等参数选择器会随所选模型能力自动适配,不会在无关模型上暴露无效参数。420 个模型里怎么挑先建立量级概念,再按输入形态 → 能力两步筛:图像:文生图 70(Flux Dev、Nano Banana 2、Seedream 5.0、Midjourney v7),图生图 70(Nano Banana 2 Edit、Flux Kontext Pro、GPT-4o Edit)。视频:文生视频 85(Kling v3、Sora 2、Veo 3、Wan 2.6、Hailuo 2.3),图生视频 120(Kling v2.1 I2V、Veo3 I2V、Seedance 2.0 I2V);另有视频转视频 35。专项:唇形同步 15、主体换装/重铸 3、音频 15。Marketing、Agent、Design Agent 三个工作室还会透出目录之外的额外模型,所以实际可选数大于 420。挑选逻辑其实就两条:先定输入形态:纯文字 → 文生X 模型集;手里有图 → 图生X;手里有视频 → 视频转视频 / 唇形同步 / Recast。界面会按你传没传素材自动切集,你只需要在切好后的候选里挑。再看多图输入上限:需要同时喂多张参考图(比如多角色一致性)时,按模型上限选——Nano Banana 2 Edit 单次最多 14 张,GPT-4o Edit 与 Flux Kontext Dev 各 10 张,Vidu Q2 为 7 张。选中兼容模型后上传器自动变多选,缩略图带顺序编号、编号决定传给模型的顺序,整组图片在单次 API 请求里一次性发出,不用逐张排队。本地推理怎么配:两套引擎,互不干扰本地推理的价值:生成不再依赖 API Key 和云端排队,提示词与成片都留在自己机器上。它只在桌面版可用,统一在 Settings → Local Models 配置,两套引擎相互独立——可以只用其一,也都可以不用。引擎实现都在 electron/lib/ 下。引擎一:sd.cpp(应用内置,同机运行)本质:stable-diffusion.cpp 的 C 推理引擎,应用内一键下载,与 App 同机跑。适合:纯图像模型——SD 1.5、SDXL、Z-Image 系列;Mac M 系列可直接使用。硬件:全平台可 CPU 跑;Apple Silicon 走内置 Metal GPU,Linux/Windows 支持 CUDA/Vulkan/ROCm。取舍标准:内存小于 16GB 就别碰 Z-Image(8GB 基础款 M 系 Mac 上已知会挂起系统),改用 2GB 级别的 SD 1.5 模型(如 DreamShaper 8);Z-Image 类模型还需两个共享辅助文件(Qwen3-4B 文本编码器约 2.4GB FLUX VAE),只下一次、两个模型共用。日常流程:Settings → Local Models 一键安装引擎 → 下载模型 → Image Studio 里点模型选择器旁的⚡ Local开关 → 生成,全程无需 API Key。判断引擎是否健康:单步 1–2 秒(M2 走 Metal 的正常值)是好的;单步掉到约 10 秒说明回退到了 CPU 路径,在设置里重装引擎即可。引擎与权重默认放在应用数据目录(macOS 为~/Library/Application Support/open-generative-ai/local-ai);想换磁盘,启动前设置环境变量OPEN_GENERATIVE_AI_LOCAL_AI_DIR,应用会自动建好bin/、models/、tmp/子目录。所有下载都发生在应用内,不向系统装任何东西。引擎二:Wan2GP(你自己的 GPU 服务器)本质:桌面版只内置一个 HTTP 客户端。你在自己的机器上跑一个 Wan2GP 的 Gradio 服务器,再把 URL 指给应用。适合:视频模型(Wan 2.2、Hunyuan、LTX)与大型图像模型(Flux.1 Dev、Qwen Image,图像模型会直接出现在 Image Studio)。硬件:服务器端需要 CUDA/ROCm GPU(NVIDIA 或 AMD);桌面端本身可以是 Mac。取舍标准:Wan2GP 的运行时(Sage attention、flash-attn、AWQ/GGUF 内核)只支持 CUDA,没有 Apple Silicon 路径。所以 Mac 用户只能把推理卸载到局域网里的 Linux/Windows GPU 机器或租用的云 GPU 实例;反之,如果你只有 Mac,这套就别选了,用 sd.cpp 跑图像模型。配置:在设置里粘贴服务器 URL 后,先点Test再点Save。连接时客户端会自动拉取服务器端点做函数名映射,不同版本服务器的端点差异也能兼容。三种部署落地:各给一条最短路径改代码 → 跑源码git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run dev两个容易踩的坑:--recurse-submodules不能省(workflow 与 agent 包依赖子模块),且npm run setup会把子模块初始化、依赖安装、workspace 子包构建一次做完,只跑npm install不够。npm run dev起 Web 版(localhost:3000);日常使用更推荐npm run electron:dev起桌面版;生产构建是npm run buildnpm run start,打包桌面安装包用npm run electron:build(macOS)、:win、:linux,产物统一进release/目录。排错:dev 启动报Couldnt find a pages directory,说明没在仓库根目录执行或子模块没初始化;packages/Vibe-Workflow目录为空,重跑一次npm run setup。出内容 → 装桌面版三大平台一键安装包,装完即用。首次启动的平台排错:macOS Gatekeeper 拦截:终端执行xattr -cr /Applications/Open Generative AI.app,然后右键 Open;或走 系统设置 → 隐私与安全性 → Open Anyway。只需做一次,之后正常打开。Windows SmartScreen 警告:More info → Run anyway,应用静默装到 %LocalAppData%。Ubuntu 24.04 的 AppImage 启动即失败:改装 .deb(自带 AppArmor profile);或临时执行sudo sysctl -w kernel.apparmor_restrict_unprivileged_userns0。老系统 AppImage 起不来:补装libfuse2依赖即可。长期挂服务 → Dockerdocker-compose.yml 把宿主 3001 端口映射到容器内 Next.js 的 3000,production 模式 自动重启:docker compose up -d --buildDockerfile 是三阶段构建,最终镜像只含.next、public、node_modules与package.json,不带开发依赖,体积可控。想二次开发:四个最该动手的位置加模型:packages/studio/src/models.js 是模型单一事实来源,420 模型定义都在这里——endpoint、参数、每模型多图上限maxImages都是字段。新增模型就是追加一条,Web 版、桌面版与托管版立即共同生效,这是全项目性价比最高的动手点。改界面 / 加页签:16 个页签、导航分组与密钥管理集中在 components/StandaloneShell.js;packages/studio组件库被自托管版与托管版共同消费,改一处两边同步。改请求链路:生成走提交-轮询两步式——先POST /api/v1/{模型端点}提交任务,再GET /api/v1/predictions/{id}/result轮询到 completed;本地代理路由(app/api/api/v1/)负责把请求转发到 Muapi 网关,并剥掉host/connection/cookie等敏感头,cookie 鉴权已移除。理解密钥流:BYOK 密钥只存浏览器 localStorage(key 为muapi_key),同步一份一年有效期的 SameSiteLax cookie 供后台请求建立身份;Axios 拦截器只向内部代理路径注入x-api-key,不会把密钥发给第三方域名;账户余额每 30 秒轮询,生成完成或失败会全局通知。写在最后Open Generative AI 用一套界面证明了:全模型目录、自托管部署与本地推理三件事可以共存,而且新手 30 秒内就能定下自己该走的那条路。如果只打算做一件事作为起点,建议先在 models.js 里挑一个你常用的模型跑通全流程,再考虑往 Workflow Studio 里搭第一条自动化流水线——那是这个开源项目里最贴近真实生产的地方。【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image video generation studio with 600 models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考