SulphurAI 在 Hugging Face 上发布了 Sulphur-2-base。从模型卡信息看,Sulphur 2 是一个基于 LTX 2.3 的视频生成模型,定位是 uncensored video generation model,原生支持文生视频、图生视频,也兼容 LTX 2.3 的其他格式。
模型地址:https://huggingface.co/SulphurAI/Sulphur-2-base
Sulphur 2 是什么
Sulphur 2 的重点不是做通用聊天,而是围绕视频生成工作流提供模型权重和相关工具。模型卡里给出的核心信息可以概括为几点:
- 基于 LTX 2.3。
- 支持 text-to-video 和 image-to-video。
- 提供用于提示词优化的 prompt enhancer。
- Hugging Face 页面提供 Diffusers、llama.cpp、Ollama、LM Studio、Jan 等入口。
- 页面显示模型文件包含 GGUF 相关内容,方便部分本地工具加载。
也就是说,它更像是一个面向视频生成玩家和工作流作者的模型发布,而不是普通用户开箱即用的网页产品。
Sulphur 2 和 LTX 2.3 的关系
理解 Sulphur 2,最好先把它放回 LTX 2.3 的生态里看。
LTX 2.3 是底层视频生成模型路线,决定了它支持哪些输入形式、模型组件和工作流结构。Sulphur 2 则是在这个基础上发布的一个变体,重点是把文生视频、图生视频和相关工作流整合到一起。
所以 Sulphur 2 不是一个完全独立的新工具,也不是一个普通聊天模型。它更像是 LTX 2.3 生态里的一个模型包:你仍然需要选择合适的前端、节点、权重版本和参数,才能真正跑出视频。
这也解释了为什么它的使用门槛比网页生成工具高。网页工具把模型、参数、显存调度和失败重试都藏在后端;本地部署则需要自己处理这些细节。
为什么值得关注
LTX 系列本身就以高效视频生成受到关注,Sulphur 2 选择基于 LTX 2.3,意味着它天然更适合接入已有的 LTX 工作流。对 ComfyUI、Diffusers 或本地推理工具用户来说,这类模型的价值主要在于可控性和可改造性。
另一个看点是 prompt enhancer。视频生成对提示词非常敏感,同样的主体、镜头、动作、风格和质量描述,写法不同会明显影响结果。Sulphur 2 把提示词增强器一起放进生态里,说明作者希望用户不只是下载权重,还能更稳定地把普通描述扩展成适合模型理解的提示词。
模型卡里的使用建议
官方模型卡建议入门时下载 dev 版本,例如 fp8mixed 或 bf16,并搭配提供的 distill lora。需要注意的是,模型卡也提醒:如果使用 LoRA,就不要同时再加载完整模型的重复部分,避免工作流里同时叠加两套相同能力。
prompt enhancer 的使用方式更偏本地工具路线。模型卡提到,可以在 LM Studio 的模型目录里创建 Sulphur/promptenhancer 这样的目录结构,把 gguf 文件和 mmproj 文件放进去,然后加载提示词增强器。它不需要 system prompt,直接发送想增强的文本,也可以附带图像。
本地运行入口
Hugging Face 页面给出了一些常见工具入口。比如使用 llama.cpp 时,可以通过模型仓库启动本地服务:
|
|
也可以直接在终端运行:
|
|
使用 Ollama 的入口则是:
|
|
这些命令更像是 Hugging Face 自动生成的本地加载入口,实际能否顺利运行,还要看本机显存、模型文件版本、量化格式和对应工具的兼容性。视频生成模型通常比纯文本模型更吃资源,第一次尝试时建议先按模型卡推荐的版本和工作流走,不要一上来混用多个来源的权重。
推荐测试环境:ComfyUI / Diffusers / GGUF 怎么选
如果你只是想最快看到结果,优先看社区是否已经整理好 ComfyUI 工作流。ComfyUI 的好处是可视化强,模型、LoRA、采样器、分辨率、帧数和后处理节点都能摆在同一张图里,适合调试视频生成。
如果你更熟悉 Python,或者想把 Sulphur 2 接到自己的脚本里,Diffusers 会更适合。它的优点是可复现、可自动化,适合批量测试参数,也方便记录不同设置下的显存占用和生成耗时。
GGUF、llama.cpp、Ollama、LM Studio 这些入口更适合 prompt enhancer 或文本侧组件。不要看到 GGUF 就默认它能完整承担视频生成流程。视频模型通常还涉及视觉模型、VAE、采样流程和帧生成组件,GGUF 更多是本地加载和轻量化生态的一部分。
简单说:
- 新手先找 ComfyUI 工作流。
- 脚本用户用 Diffusers 做复现和批量测试。
- prompt enhancer 或文本增强器再看 GGUF / LM Studio / Ollama。
- 不确定时,优先按模型卡推荐的 dev 版本和 LoRA 搭配走。
8G 显存能不能跑?要看版本和工作流
8G 显存能不能跑 Sulphur 2,不能只看模型名字,要看具体版本、量化方式、分辨率、帧数、批量大小和工作流。
一般来说,视频生成比图片生成更吃显存,因为它不只是生成一张图,而是要处理多帧、时间一致性和视频相关的中间状态。即使模型本身有较轻的版本,工作流里叠加 LoRA、较高分辨率、较长帧数或额外后处理节点,也可能让 8G 显存很快爆掉。
如果只有 8G 显存,可以从这些方向降低压力:
- 优先尝试
fp8mixed、量化版本或社区整理的低显存工作流。 - 降低分辨率,先用小尺寸确认流程能跑通。
- 减少帧数,不要一开始就生成长视频。
- batch size 设为 1。
- 暂时关闭不必要的增强节点和后处理节点。
- 使用 CPU offload、低显存模式或框架提供的显存优化选项。
所以“8G 显存也能跑”更准确的说法是:在低显存版本、较低分辨率、较短帧数和精简工作流下,有机会跑通;但不适合直接期待高分辨率、长视频和复杂工作流。
prompt enhancer 怎么用
Sulphur 2 的模型卡特别提到 prompt enhancer。它的作用不是生成视频,而是把普通提示词改写成更适合模型理解的提示词。
视频提示词通常要同时描述主体、动作、镜头、场景、光线、风格和质量。如果只写一句很短的描述,模型可能抓不到重点。prompt enhancer 可以把简短描述扩展成更完整的提示词,让后续视频生成更稳定。
模型卡给出的思路是,在 LM Studio 的模型目录里创建 Sulphur/promptenhancer 目录,把对应的 gguf 和 mmproj 文件放进去,然后加载这个增强器。使用时不需要 system prompt,直接发送想增强的文本,也可以附带图像。
可以把它理解成一个提示词预处理工具:
|
|
如果你只是测试模型能不能跑,prompt enhancer 不是第一优先级。先把主工作流跑通,再用它改善提示词,会更容易定位问题。
本地部署常见失败原因
Sulphur 2 这类模型本地部署失败,通常不是一个原因造成的。比较常见的坑有这些:
- 模型版本和工作流不匹配,比如工作流要求 dev 版本,但实际下载了其他权重。
- LoRA 和完整模型重复加载,导致效果异常或显存占用过高。
- 显存不足,尤其是在高分辨率、长帧数、复杂节点下更明显。
- 工具版本太旧,ComfyUI 节点、Diffusers、Transformers 或 Accelerate 版本不兼容。
- 缺少 VAE、文本编码器、mmproj、prompt enhancer 等配套文件。
- 文件路径或目录结构不符合工具要求。
- 只复制 Hugging Face 页面上的命令,没有确认它对应的是视频生成主流程还是文本侧组件。
排查时建议按顺序来:先确认模型文件完整,再确认工作流要求的版本,然后降低分辨率和帧数,最后再逐步加 LoRA、prompt enhancer 和后处理节点。一次只改一个变量,最容易定位问题。
适合谁尝试
Sulphur 2 比较适合这几类用户:
- 已经在玩 LTX、ComfyUI、Diffusers 或本地视频生成工作流。
- 想尝试文生视频、图生视频,并能接受手动配置模型文件。
- 需要 uncensored 视频生成模型,且理解这类模型的使用边界。
- 想研究 prompt enhancer 如何改善视频提示词。
- 有足够显存或愿意尝试量化版本、本地推理工具。
如果只是想快速生成短视频,在线产品仍然更省心。Sulphur 2 更适合愿意折腾模型、节点、LoRA、提示词和本地环境的人。
使用时的注意点
第一,模型卡信息还在更新中。作者也提到 README 后续会补充更完整的设置说明和训练方式,所以具体工作流要以最新模型卡和文件列表为准。
第二,不要只看 Hugging Face 页面上的一条命令就判断它能直接跑起来。视频生成涉及主模型、VAE、LoRA、提示词增强器、采样参数、分辨率、帧数和显存占用,任何一个环节不匹配都可能失败。
第三,uncensored 模型并不等于可以无边界使用。生成内容仍然需要遵守所在平台、社区和法律规则,尤其是涉及真人、版权角色、未成年人、暴力或隐私内容时,更要谨慎。
小结
Sulphur 2 的定位很清楚:它不是一个聊天模型,而是一个面向 LTX 2.3 视频生成生态的模型发布。它的看点在于支持文生视频和图生视频,同时把 prompt enhancer、本地工具入口和推荐工作流放在一起。
对普通用户来说,它的门槛不低;对本地视频生成玩家来说,它值得加入待测试列表。真正决定体验的,还是具体工作流、显存配置、提示词质量,以及后续 README 和社区样例是否完善。
为什么它会被称为“无审查”
Sulphur 2 最有争议的标签,是 uncensored,也就是常被翻译成“无审查”。
这个词很容易被误解。它不应该被理解成“可以生成任何内容”,更不意味着可以用于违法、侵权、骚扰、伪造身份或制作非自愿影像。更准确的理解是:相比很多商业视频生成平台,Sulphur 2 更少因为某些敏感但合法的题材直接拒绝响应。
商业平台通常会采取保守策略。为了降低法律、品牌和合规风险,它们可能会屏蔽一批模糊地带的提示词。这样做能降低滥用概率,但也会误伤一些正常创作场景,例如:
- 医学教育。
- 历史题材。
- 新闻再现。
- 艺术实验。
- 小众风格创作。
- 严肃纪录片素材构思。
Sulphur 2 的思路是把更多判断权交给本地用户,同时保留对非法内容的底线过滤。这个方向会带来更高创作自由度,也会带来更高责任要求。
技术上不只是“去掉限制”
把 Sulphur 2 说成“删掉审查层的 LTX 2.3”并不完整。
从公开信息看,它提供的是一组围绕 LTX 2.3 的模型权重和配套工具,包括:
- BF16 全精度版本,适合显存更充足的硬件。
- FP8 mixed 版本,用更低显存换取更好的可用性。
- Distill LoRA 版本,适合在速度和质量之间取舍。
- ComfyUI 工作流,方便用户进行文生视频和图生视频测试。
- Prompt Enhancer,用于把简短描述扩展成更适合视频生成的提示词。
视频生成和图片生成不同。视频里不只有主体和风格,还包含镜头运动、人物动作、时间连续性、帧间一致性、景别变化和节奏控制。提示词写得太短,模型经常会补出不稳定细节。
所以 Prompt Enhancer 的意义在于降低提示词门槛:用户给出一个简单想法,小模型把它扩展成更适合视频模型理解的描述,再交给 Sulphur 2 工作流生成。
实际体验:更听话,但不是万能
从社区反馈看,Sulphur 2 的一个明显特点是更愿意遵循提示词。
因为限制更少,它不容易在某些合法题材上突然拒绝、降级或绕开用户意图。这对需要精确控制内容的人很有吸引力,尤其是本地创作、实验影像、概念短片和小众题材。
但它并不是“视频生成终局”。
当前开源视频模型仍然普遍存在这些问题:
- 人体动作不自然。
- 肢体和手部容易变形。
- 长镜头一致性不足。
- 多主体交互容易混乱。
- 复杂场景理解偏字面。
- 画面符合提示词,但美感和剪辑感不足。
这些问题不是 Sulphur 2 独有,而是当前 AI 视频生成模型的共性。它能改善一部分提示词响应问题,但不能消除视频生成本身的技术难点。
最大争议:开放和安全怎么平衡
Sulphur 2 的争议,本质上不是某个模型参数好不好,而是开源 AI 视频生成的治理问题。
支持者认为,开源模型不应该替用户做过度判断。只要内容合法,用户就应该能在本地环境里探索艺术、教育、研究和创作边界。
质疑者担心,视频比图片更容易造成现实伤害。更开放的模型可能被用于伪造、骚扰、侵权、误导传播或其他滥用场景。即使开发者保留了非法内容过滤,也很难完全阻止二次修改和恶意使用。
这两种观点都不能简单忽视。
开源模型需要自由,也需要责任。比较可行的方向不是把模型彻底封死,也不是完全放任,而是建立更清晰的社区规范、模型卡说明、使用限制、溯源工具和举报机制。
参考
- Hugging Face 模型页:https://huggingface.co/SulphurAI/Sulphur-2-base
- FreeDidi 参考页:https://www.freedidi.com/24142.html