


SoulCut:一款由自然语言驱动的完整非线性音视频编辑器
为什么做 SoulCut
现有的视频剪辑工具大多建立在十几年前的技术架构上。C++ 写成的 NLE 内核,性能确实够用,但代价是内存安全问题长期靠“小心编码”来维持,扩展新能力时处处受制于历史包袱。另一条路是云端优先——功能很全,但你的素材、你的项目、你的创作过程,都默认要经过别人的服务器。断网,就等于停工。
SoulCut 走的是另一条路。
底层 NLE 引擎用 Rust 从零重写,不是给旧架构打补丁,而是把内存安全问题在语言层面彻底杜绝。这意味着更少的崩溃、更稳的长时间剪辑、以及一套可以持续往上叠新能力的架构,而不是每加一个功能就要先绕开三个历史遗留问题。
同时,SoulCut 是离线优先的。素材在本地,项目在本地,剪辑在本地。不联网,照样从导入到导出走完全程。AI 能力是叠加在本地引擎之上的一层,而不是把整个创作流程绑在云上。
SoulCut 想验证的事情很简单:如果把交互从“学习工具怎么用”变成“描述你想完成什么”,剪辑这件事会不会变得不一样。
所以它的核心不是“AI 自动帮你剪”,而是让你用自然语言描述剪辑意图,由 LLM 对选中片段进行处理,并对所有片段做节奏对齐。同时它也是一个完整的多轨时间线编辑器,保留手动精修的能力。
SoulCut 是什么
一款免费、本地运行的桌面非线性音视频编辑器,支持 Windows / macOS / Linux。
SoulCut 的底层是一套完整自研的 NLE(非线性编辑)引擎。这意味着:即使完全不使用任何 AI 功能,你也可以像在传统剪辑软件里一样,手动完成多轨编排、裁剪、转场、调色、音频处理和导出。AI 是在这套引擎之上的一层交互方式,而不是替代品。
- 🎬 对话式剪辑 — 用自然语言描述剪辑意图,自动完成粗剪、精剪与节奏对齐。
- 🖐 完整手动编辑 — 底层自研 NLE 引擎,不依赖 AI 也能手动完成全部剪辑流程。
- :film_frames: 多轨时间线 — 多轨道编辑,支持实时预览、多机位渲染与精准时间对齐。
- 🌀 线性动画 — 支持锚点、时间、关键字三种线性动画,可用于运镜、转场与素材运动控制。
- 🧩 多模态素材生成 — 视频、音频、图片直接生成并拖入时间线,无需跨工具导入导出。
- 🎨 滤镜 · 特效 · 运镜 · 转场 — 15 种滤镜、78 种视觉特效、15 种运镜效果、26 种转场特效。
- 📤 一键导出 — 支持多种分辨率与平台预设,快速交付成片。
多模态生成:视频、音频、图片直接进时间线
SoulCut 集成了视频、音频、图片的生成能力。你不需要在多个工具之间来回导出导入——生成的素材可以直接拖入时间线,和已有素材一起参与剪辑。
- 视频生成:根据描述生成视频片段,拖入时间线即可使用。
- 音频生成:生成配乐、音效或旁白,直接落到对应音频轨道。
- 图片生成:生成贴图、封面或素材图,拖入画面轨道参与合成。
生成的素材和多轨时间线是打通的,不是“生成完再下载再导入”的割裂流程。
下一步想验证什么
SoulCut 现在最需要的不是更多曝光,而是真实使用反馈。具体想验证这几件事:
- LLM 在整个视频创作环节中,可以替代多少手动操作? 从粗剪、节奏对齐、配乐选择到转场和导出,哪些环节 LLM 能真正省掉手动步骤,哪些环节仍然需要人来回调?替代的比例到底有多高?
- 所有素材是否都可以纯靠 LLM 生成,并创作出完整成片? 视频、音频、图片全部由 AI 生成,直接拖入时间线,最终能不能走完从零素材到成片的完整流程?生成质量和可控性是否达到可交付的程度?
- 对话式剪辑是否真的省时间 — 用自然语言描述意图完成粗剪,和手动拖时间线相比,到底快了多少?还是说在某些场景下反而更绕?
- 谁是真的用户 — 是短视频创作者、Vlogger、还是需要快速出片的企业用户?不同人群对“自然语言剪辑”的接受度可能完全不同。
如果你下载了 SoulCut,哪怕只打开过一次,欢迎告诉我:你用它做了什么?哪个环节让你觉得“这个有用”,哪个环节让你想关掉它?
持续迭代中
SoulCut 目前正在持续快速迭代中。功能、交互和生成能力都会随着版本更新不断变化。如果你现在下载的版本没有覆盖你的使用场景,欢迎反馈——你的需求很可能就是下一个版本要解决的问题。
在后续的迭代版本中,会逐渐让产品变得更完善:加入更多转场、运镜、特效和滤镜,持续丰富创作表达的手段,也会不断打磨对话式剪辑与多模态生成的实际体验。