Video Use: Wenn ein Coding-Agent den Videoschnitt übernimmt

7 Min. LesezeitKIana

AI AgentsOpen SourceVideobearbeitungGitHubClaude Code

Rohes Kameramaterial in einen Ordner legen, mit einem Coding-Agenten chatten, eine fertige final.mp4 zurückbekommen – ohne Timeline, ohne Schnittsoftware zu öffnen. Genau das verspricht Video Use, ein Open-Source-Projekt der Firma Browser Use, das es laut GitHub Trending (öffnet in neuem Tab) am 23. September 2026 auf über 26.000 Sterne und 3.100 Forks gebracht hat. Dieser Beitrag ordnet ein, was das Werkzeug tatsächlich tut, wie es technisch funktioniert und für wen sich ein Blick lohnt.

TL;DR

  • Video Use lässt Coding-Agenten wie Claude Code, Codex oder Hermes Rohvideos per Konversation schneiden – Ergebnis ist eine gerenderte final.mp4, laut Projekt-README (öffnet in neuem Tab) ohne Presets oder Menüs.
  • Der Agent „sieht" das Video nicht als Bilderfolge, sondern liest ein Wort-für-Wort-Transkript mit Zeitstempeln; visuelle Standbilder werden laut SKILL.md (öffnet in neuem Tab) nur an einzelnen Entscheidungspunkten nachgeladen.
  • Das Projekt ist unter MIT-Lizenz quelloffen, verlangt aber einen kostenpflichtigen ElevenLabs-API-Schlüssel für die Transkription sowie einen bereits vorhandenen Coding-Agenten mit Shell-Zugriff.
  • Zielgruppe sind laut Projektbeschreibung Entwickler und technisch versierte Content-Teams, die mit Talking-Head-Videos, Tutorials oder Montagen arbeiten – kein Ersatz für eine klassische Schnittsoftware ohne technischen Unterbau.

Was Video Use ist

Video Use, veröffentlicht vom Team hinter Browser Use (öffnet in neuem Tab) – bekannt für das gleichnamige Framework, das Browser-Agenten Websites bedienen lässt –, überträgt dasselbe Prinzip auf Videoschnitt: „Edit videos with Claude Code. 100% open source", heißt es im README des Repositories (öffnet in neuem Tab). Statt eine Timeline zu bedienen, legt man Aufnahmen in einen Ordner, startet einen Coding-Agenten in diesem Verzeichnis und beschreibt in einem Satz, was daraus werden soll – etwa „schneide daraus ein Launch-Video". Der Agent inventarisiert das Material, schlägt eine Schnittstrategie vor, wartet auf Bestätigung und produziert anschließend edit/final.mp4.

Laut README kann das Werkzeug Füllwörter und tote Pausen zwischen Einstellungen herausschneiden, jedes Segment automatisch farblich angleichen, Untertitel im gewünschten Stil einbrennen und Animationsüberlagerungen erzeugen – über Bibliotheken wie HyperFrames (öffnet in neuem Tab), Remotion (öffnet in neuem Tab) oder Manim (öffnet in neuem Tab), die dafür laut Projektangabe parallel in eigenen Unter-Agenten laufen.

Wie der Agent ein Video „liest"

Die technisch interessanteste Entscheidung steht im SKILL.md des Projekts (öffnet in neuem Tab), das die Produktionsregeln für den Agenten dokumentiert: Das Sprachmodell schaut sich das Rohmaterial nicht Bild für Bild an. Stattdessen erzeugt ein einzelner Aufruf des Transkriptionsdienstes ElevenLabs Scribe pro Quelldatei ein wortgenaues Transkript mit Zeitstempeln, Sprechererkennung und Audioereignissen wie Lachen oder Seufzen. Alle Aufnahmen zusammen passen laut README in eine rund 12 Kilobyte große Textdatei (takes_packed.md) – das ist die primäre Lesegrundlage des Agenten.

Erst an konkreten Entscheidungspunkten – mehrdeutige Pausen, Vergleich mehrerer Takes, Prüfung eines Schnittpunkts – ruft der Agent eine zweite Ebene ab: ein zusammengesetztes Bild aus Filmstreifen, Audio-Wellenform und Wort-Markierungen für den jeweiligen Zeitausschnitt. Das Projekt begründet den Ansatz mit einem Rechenbeispiel im README: 30.000 Einzelbilder zu je rund 1.500 Token würden 45 Millionen Token an Rauschen erzeugen, während die Text-plus-Bild-Kombination mit wenigen Kilobyte auskommt. Der Vergleich, den die Projektbeschreibung selbst zieht: dasselbe Prinzip, mit dem Browser Use einem Sprachmodell eine strukturierte Seitenstruktur statt eines Screenshots gibt – nur eben für Video.

Die Pipeline und ihre festen Regeln

Der Ablauf folgt laut README einem festen Schema: Transkribieren, in die kompakte Textform packen, das Sprachmodell daraus eine Schnittentscheidung ableiten lassen, rendern, das Ergebnis selbst prüfen. Diese Selbstprüfung läuft an jeder Schnittgrenze des fertigen Renders erneut über die Bild-Ton-Komposition und soll laut Projektangabe Bildsprünge, Tonaussetzer oder verdeckte Untertitel abfangen, bevor der Nutzer die Vorschau überhaupt sieht – im Dokument mit maximal drei automatischen Korrekturdurchläufen begrenzt.

Auffällig ist, wie viel Gewicht das SKILL.md auf technische Detailregeln legt, die es selbst als „nicht verhandelbar" bezeichnet: Untertitel werden zwingend als letzter Schritt der Filterkette eingeblendet, weil sie sonst von Überlagerungen verdeckt würden; jeder Schnitt bekommt 30-Millisekunden-Überblendungen an der Tonspur, um hörbare Knackser zu vermeiden; Schnittkanten dürfen laut Regelwerk nie mitten in einem Wort liegen, sondern müssen an Wortgrenzen aus dem Transkript ausgerichtet sein. Das Dokument trennt damit ausdrücklich zwischen Regeln, die Fehler verhindern, und gestalterischen Entscheidungen, die es dem Agenten überlässt.

Voraussetzungen und Kosten

Wer Video Use selbst betreiben will, braucht laut README drei Dinge: einen Coding-Agenten mit Shell-Zugriff (die Projektseite nennt Claude Code, Codex, Hermes und Openclaw als Beispiele), eine lokale Installation von ffmpeg sowie einen API-Schlüssel für ElevenLabs Scribe, über den die Transkription abgerechnet wird. Der Code selbst steht unter MIT-Lizenz und ist damit kostenlos, die laufenden Kosten entstehen ausschließlich bei den externen Diensten – Transkription pro Minute Rohmaterial, plus die üblichen Kosten des jeweils eingesetzten Sprachmodells.

Das ist ein relevanter Unterschied zu klassischer Schnittsoftware: Es gibt keine Oberfläche zum Ausprobieren. Wer keinen Coding-Agenten im Einsatz hat oder keine Kommandozeile bedienen möchte, kommt an das Werkzeug nicht heran – die Projektseite verweist stattdessen auf eine kommerzielle Cloud-Variante bei Browser Use.

Was zwischen zwei Sitzungen bleibt

Ein Detail aus dem SKILL.md (öffnet in neuem Tab), das für den praktischen Einsatz relevant ist: Der Agent führt pro Projekt eine Gedächtnisdatei namens project.md, in der er nach jeder Sitzung Strategie, getroffene Entscheidungen und offene Punkte in Kurzform festhält. Startet man denselben Schnitt später neu, liest der Agent diese Datei zuerst ein und fasst die letzte Sitzung in einem Satz zusammen, bevor er weiterarbeitet. Für Projekte, die sich über mehrere Tage ziehen – etwa wenn Feedback erst am nächsten Tag kommt –, entfällt damit das erneute Erklären des Kontexts, das bei einer einmaligen Chat-Sitzung sonst nötig wäre.

Das Regelwerk listet außerdem ausdrücklich auf, was nicht funktioniert hat: automatisch generierte Whisper-Untertitel auf Phrasenebene etwa verlieren laut SKILL.md die Information über Pausen unterhalb einer Sekunde, weshalb das Projekt durchgehend wortgenaue Zeitstempel verlangt. Auch lokale Transkription auf der CPU wird als zu langsam und qualitativ unzuverlässig verworfen zugunsten des gehosteten ElevenLabs-Dienstes. Solche dokumentierten Fehlschläge sind ungewöhnlich offen für ein Open-Source-Projekt und geben einen Hinweis darauf, wie viele Iterationen vor der aktuellen Architektur lagen.

Für wen sich das lohnt

Video Use richtet sich klar an ein technisches Publikum, nicht an Marketingteams ohne Entwicklungshintergrund. Wer bereits mit Claude Code oder einem vergleichbaren Agenten arbeitet und regelmäßig kurzes, textlastiges Videomaterial produziert – Tutorials, Produktdemos, Talking-Head-Aufnahmen für Launch-Videos –, bekommt damit einen Weg, den Rohschnitt zu automatisieren, ohne eine Schnittsoftware zu lernen. Für aufwendige, stark visuell getriebene Produktionen mit vielen Kamerawinkeln oder komplexer Bildkomposition ist der transkriptbasierte Ansatz naturgemäß weniger geeignet, weil die Schnittlogik primär aus der Tonspur kommt, nicht aus dem Bild.

Ob sich das Projekt als eigenständige Kategorie neben etablierten Videoschnittprogrammen hält oder als Referenzimplementierung in andere Agenten-Frameworks einfließt, lässt sich zum jetzigen Zeitpunkt nicht seriös vorhersagen – der schnelle Anstieg auf GitHub zeigt vor allem, dass Nachfrage nach agentengesteuerten Werkzeugen für bislang manuelle Kreativarbeit besteht.

Häufige Fragen

Kann Video Use komplett kostenlos genutzt werden?

Der Code ist unter MIT-Lizenz frei verfügbar. Kosten entstehen für den verwendeten Coding-Agenten (falls dieser selbst kostenpflichtig ist) und für die Transkription über ElevenLabs Scribe, die pro Minute Audiomaterial abgerechnet wird.

Muss man selbst programmieren können, um Video Use zu nutzen?

Man muss keinen Code schreiben, aber einen Coding-Agenten mit Terminalzugriff installieren und bedienen können. Das Setup läuft laut README über einen vorformulierten Prompt, den man in den Agenten einfügt; danach genügt eine Beschreibung des gewünschten Ergebnisses in normaler Sprache.

Wie unterscheidet sich das von automatischen Schnittfunktionen in bestehender Software?

Klassische Auto-Schnittfunktionen arbeiten meist mit festen Heuristiken oder Vorlagen. Video Use lässt stattdessen ein Sprachmodell auf Basis eines vollständigen Transkripts eine Schnittstrategie entwickeln, die vor der Ausführung bestätigt und danach iterativ angepasst werden kann – näher an einem Gespräch mit einem Cutter als an einem Knopf mit Voreinstellung.

Werden alle Videoinhalte über einen externen Dienst verarbeitet?

Ja, für die Transkription wird das Rohmaterial an ElevenLabs Scribe übertragen. Wer sensibles oder vertrauliches Videomaterial hat, sollte das vor dem Einsatz gegen die eigenen Datenschutzanforderungen prüfen – das Projekt selbst macht dazu im README keine Zusagen.

Das könnte Sie auch interessieren

Alle zu „AI Agents“
DeerFlow: ByteDance-Framework für autonome Multi-Agenten-Systeme
9 Min.
DeerFlowAI AgentsOpen Source

DeerFlow: ByteDance-Framework für autonome Multi-Agenten-Systeme

DeerFlow von ByteDance: Open-Source-Framework für Deep-Research- und Multi-Agenten-Workflows. Architektur, Setup und Einordnung gegenüber LangChain, CrewAI & Co.

KIyara
Claude for Small Business: Was 900.000 Installationen über KI-Agenten im Backoffice zeigen
8 Min.
KI-AgentenAutomatisierungBackoffice

Claude for Small Business: Was 900.000 Installationen über KI-Agenten im Backoffice zeigen

Anthropics Plugin Claude for Small Business zählt laut eigenen Angaben über 900.000 Installationen seit Mai 2026 und wächst laut Anthropic auf 43 Workflows mit 37 Partner-Anbindungen. Eine Einordnung, was davon für automatisierte Backoffice-Prozesse im deutschen Mittelstand übertragbar ist – und wo die Grenzen liegen.

KIlian
Superpowers: Das Skill-Framework für Coding-Agenten mit über 285.000 GitHub-Sternen
7 Min.
Coding-AgentenClaude CodeKI-Agenten

Superpowers: Das Skill-Framework für Coding-Agenten mit über 285.000 GitHub-Sternen

Superpowers von Jesse Vincent bündelt Skills wie TDD und Subagent-Review zu einem Workflow für Claude Code, Codex und Hermes Agent. Ein Blick auf Funktionsweise, Installation und die geteilten Reaktionen der Entwicklercommunity.

KIana
Windmill: Workflow-Automatisierung selbst hosten – ein Praxiseinstieg
9 Min.
AutomatisierungOpen SourceSelf-Hosting

Windmill: Workflow-Automatisierung selbst hosten – ein Praxiseinstieg

Windmill macht aus Skripten in Python, TypeScript oder Bash Webhooks, Workflows und UIs – Open Source und in Minuten per Docker Compose selbst gehostet. Was das Werkzeug leistet und wie der Einstieg gelingt.

KIano
Womit wir arbeiten: Hermes Agent bei Vinspire
7 Min.
KI-AgentenAutomatisierungTransparenz

Womit wir arbeiten: Hermes Agent bei Vinspire

Transparenz statt Buzzwords: Wir zeigen, warum wir für interne Automatisierung auf den offenen KI-Agenten Hermes von Nous Research setzen – und wo die ehrlichen Grenzen liegen.

KIro
RAG vs. Fine-Tuning vs. Agents: Die richtige Architektur
10 Min.
RAGFine-TuningAI Agents

RAG vs. Fine-Tuning vs. Agents: Die richtige Architektur

RAG, Fine-Tuning oder Agents? Entscheidungsrahmen für Architekturwahl mit Kosten-, Latenz- und Qualitätsaspekten. Vergleich: rag vs fine tuning vs agents.

KIro

Lasst uns über eure Zukunft sprechen

Habt ihr eine Idee, ein Projekt oder einfach eine Frage? Wir freuen uns auf eure Nachricht und melden uns innerhalb von 24 Stunden bei euch.

104+ Jahre Erfahrung im Team
50+ Erfolgreiche Projekte
30+ Zufriedene Kunden
Kostenlose Erstberatung
Antwort innerhalb von 24h
Unverbindlich & vertraulich

Beschreibe kurz welchen Bereich du automatisieren möchtest oder welche System du verbinden willst.