Zurück zum Blog
·Jan Tyl·14 min Lesezeit

Wenn eine Drohne sieht und entscheidet: Was KI heute auf dem Schlachtfeld leisten kann und wo der Mensch beteiligt bleiben muss

Wie eine Drohne ihre Umgebung erkennt, warum sie ein kleines YOLO-Modell anstelle eines riesigen Sprachmodells ausführt und warum der Kontext am schwierigsten zu verstehen ist. Technologie, Autonomie, Recht und tschechische Forschung ohne unnötige Panikmache.

Wenn eine Drohne sieht und entscheidet: Was KI heute auf dem Schlachtfeld leisten kann und wo der Mensch beteiligt bleiben muss

Die Titelillustration bezieht sich auf die fiktive Drohne Baron aus meinem Buch Syndikát. Es stellt weder das eigentliche Produkt noch eine echte Militäroperation dar.

CNN Prima NEWS · 5. September 2026 um 10:10 Uhr

Heute habe ich in einem Live-Interview darüber gesprochen, was künstliche Intelligenz im Inneren einer Drohne bedeutet, wo Hilfe endet und Autonomie beginnt, warum menschliche Entscheidungen auf dem modernen Schlachtfeld zu langsam sein können und was KI trotz ihrer rasanten Entwicklung nicht zuverlässig beurteilen kann. Dieser Artikel erweitert die TV-Minuten um technischen Kontext, Daten, Recht und tschechische Forschung.

Wenn man von „Drohne mit künstlicher Intelligenz“ spricht, stellt man sich leicht ein einzelnes elektronisches Gehirn vor, das sieht, denkt und Entscheidungen trifft. Die Realität ist ernüchternder. Im Inneren arbeiten meist eine Kamera, mehrere kleine Spezialmodelle, Navigationsalgorithmen und ein klassischer Autopilot zusammen.

Der Baron aus dem Eröffnungsbild gehört zur Fiktion. Die im folgenden Text beschriebenen Technologien sind real und ich trenne sie bewusst von der Geschichte.

Jeder Teil löst ein anderes Problem. Die Kamera liefert das Bild. Das Computer-Vision-Modell markiert die Objekte. Die Navigation schätzt den Standort. Der Planer wählt eine sichere Route. Der Autopilot setzt den Plan in die Bewegung der Motoren um.

Das Erkennen eines Panzers im Bild ist ein technisches Problem. Die Entscheidung, ob es sich um ein legitimes militärisches Ziel handelt, ist eine Frage des Kontexts, des Rechts und der menschlichen Verantwortung.

Dieser Unterschied ist meiner Meinung nach der wichtigste Teil der gesamten Debatte.

Was wirklich in der Drohne passiert

Eine vereinfachte Verarbeitungskette sieht so aus:

SchrittWas ist losTypische Werkzeuge
WahrnehmungEine Kamera oder Wärmebildkamera liefert ein Bild und das System sucht darin nach Objekten.YOLO, Bildsegmentierung, Objektverfolgung
PositionierungDie Drohne schätzt, wo sie sich befindet und wie sie ausgerichtet ist.Gyroskop, Beschleunigungsmesser, GPS/GNSS, visuelle Odometrie, Kartenanpassung
PlanungDas System vergleicht die Route, Hindernisse, verbotene Zonen und den Energiestatus.Navigationsalgorithmen und Missionsregeln
FlugkontrolleDer Autopilot rechnet die gewünschte Richtung in die Umdrehungen der einzelnen Motoren um.Regelkreise und Flugregler

KI ist also nicht gleichbedeutend mit Autonomie. Die Drohne kann mithilfe der KI nur Hindernisse erkennen, während jeder wichtige Schritt von einem Menschen genehmigt wird. Umgekehrt können einige automatische Funktionen auf klassischen Algorithmen ohne neuronales Netzwerk aufgebaut werden.

Darüber hinaus lernt das Modell in der Regel nicht alles spontan von Grund auf neu. Das rechenintensive Training erfolgt vorher anhand großer Datensätze. Die Drohne führt dann hauptsächlich Inferenz durch, also die schnelle Anwendung des gelernten Modells auf ein neues Bild.

YOLO ist kein kleines ChatGPT. Es ermöglicht schnelle visuelle Wahrnehmung

Im Interview erwähnte ich die Modellfamilie YOLO, aus dem Englischen You Only Look Once. Es handelt sich nicht um ein Sprachmodell, sondern um ein Computer-Vision-Modell zur Objekterkennung. Normalerweise werden die Rechtecke, Klassennamen und das Konfidenzniveau aus dem Bild zurückgegeben. Es kann beispielsweise lauten: „In diesem Teil des Bildes befindet sich ein Fahrzeug, 87-prozentige Sicherheit.“

YOLO weiß nicht, ob das Fahrzeug zur eigenen Einheit gehört, ob es außer Gefecht gesetzt ist, ob es kapituliert, was sich dahinter verbirgt oder ob ein Angriff rechtlich verhältnismäßig wäre. Dies sind alles zusätzliche Ebenen der Entscheidungsfindung.

Jede YOLO-Generation verfügt über mehrere Größen, von n als Nano bis x als Extra Large. Die folgenden Zahlen stammen aus der Ultralytics YOLOv8-Dokumentation und dem offiziellen YOLOv12-Repository. Die letzte Spalte ist meine ungefähre Neuberechnung der Gewichte selbst bei zwei Bytes pro Parameter im FP16-Format.

VarianteYOLOv8YOLOv12Ungefähre Größe der Gewichte in FP16
n nano3,2 Millionen Parameter2,5 Millionen Parameterca. 5 bis 7 MB
s klein11,2 Millionen9,1 Millionen18 bis 23 MB
m mittel25,9 Millionen19,6 Millionen39 bis 52 MB
l groß43,7 Millionen26,5 Millionen53 bis 87 MB
x extra groß68,2 Millionen59,3 Millionen119 bis 136 MB

Im Vergleich dazu verfügt YOLOv12n über 2,5 Millionen Parameter. Ein übliches, als 7B bezeichnetes Sprachmodell hat sieben Milliarden. Deshalb ist YOLOv12n entsprechend der Anzahl der Parameter etwa 2.800-mal kleiner. Die Parameterzahlen der größten geschlossenen GPT- oder Gemini-Modelle sind nicht öffentlich, daher macht es keinen Sinn, sie als verifizierte Nummer auszugeben.

Allerdings ist die Größe der Gewichtsdatei nicht gleichbedeutend mit dem Speicherverbrauch im Betrieb. Die Drohne benötigt außerdem Platz für Zwischenschichtergebnisse, Bildpuffer und die Laufzeitumgebung. Es hängt von der Auflösung, der Genauigkeit der Berechnung, der Anzahl der Bilder, dem Chip und der spezifischen Engine ab. Eine ehrliche Zahl wird daher nur durch Messung am Zielgerät erstellt.

YOLOv8 ist hauptsächlich ein Faltungsnetzwerk. YOLOv12 ist ein neuerer Forschungszweig, der sich stärker auf den Aufmerksamkeitsmechanismus stützt. Eine höhere Generationszahl allein bedeutet nicht, dass sie die beste Wahl für eine bestimmte Drohne ist. In der Praxis sind Genauigkeit, Latenz, Verbrauch, Stabilität der Tools und ob das Modell Tests auf realer Hardware bestanden hat, entscheidend.

Warum die Intelligenz mit an Bord sein muss

Eine Server-Grafikkarte mit großer Kühlung und Stromversorgung kann man nicht einfach in ein kleines Fluggerät stecken. Jedes Gramm und jedes Watt beeinflusst die Flugdauer. Das Senden jedes Frames an die Cloud führt wiederum zu Verzögerungen und setzt eine zuverlässige Verbindung voraus, die in einer Krisenumgebung möglicherweise nicht besteht.

Deshalb kommt Edge AI zum Einsatz, also die Berechnung direkt auf dem Gerät. Es bringt drei grundlegende Vorteile mit sich:

  • schnelle Antwort ohne Datenpfad zu einem Remote-Server,
  • weniger Abhängigkeit von Verbindung und Cloud,
  • die Fähigkeit, auch dann zu arbeiten, wenn die Kommunikation oder die Satellitennavigation unterbrochen ist.

Der Preis dafür ist klar: geringer Stromverbrauch, wenig Speicher und begrenzte Rechenleistung. Der Entwickler verkleinert, quantisiert und optimiert daher das Modell für einen bestimmten Beschleuniger. Der Erfolg wird nicht nur an der Genauigkeit im Labor gemessen, sondern auch an Bildern pro Sekunde, Stromverbrauch, Temperatur und Signalverlustverhalten.

Das DARPA REMA-Programm erforscht beispielsweise autonome Subsysteme, die vorhandenen Drohnen dabei helfen können, eine Mission zu erfüllen, selbst wenn die Kommunikation durch elektronische Kriegsführung unterbrochen wird. Dies zeigt deutlich, warum Edge Computing von militärischem Interesse ist. Gleichzeitig erhöht gerade der Verbindungsverlust die Anforderungen an vorgegebene Einschränkungen und den sicheren Abschluss der Mission.

Gyroskop, Beschleunigungsmesser und eine Karte auf dem Knie

Das Bild allein reicht nicht aus. Die Drohne muss wissen, wie sie gedreht wird und wohin sie sich bewegt hat.

Das Gyroskop misst die Winkelgeschwindigkeit, also wie schnell sich das Gerät dreht. Beschleunigungsmesser misst die Beschleunigung in einzelnen Achsen und die Schwerkraft spiegelt sich auch in seinen Daten wider. Zusammen bilden sie die Basis der Inertial Measurement Unit, kurz IMU.

Wenn wir die Daten einfach addieren, summieren sich kleine Fehler nach und nach und die Positionsschätzung beginnt zu rutschen. Dazu wird die IMU mit einer Kamera, Satellitennavigation oder einer Karte kombiniert.

Ich habe die Analogie eines Piloten aus dem Ersten Weltkrieg im Fernsehen verwendet. Mit einer Papierkarte auf dem Knie schaut er hinaus, findet einen Fluss, eine Eisenbahnstrecke und eine Stadt und korrigiert seine Positionseinschätzung anhand ihrer Form. Map Matching macht etwas Ähnliches maschinell: Es vergleicht die beobachteten Merkmale der Landschaft mit einer vorgefertigten digitalen Karte.

Bei modernen Systemen kommt oft noch die visuell-inertiale Odometrie oder SLAM hinzu, also die gleichzeitige Erstellung einer Karte und Bestimmung der eigenen Position. Eine Studie einer autonomen Renndrohne Swift in Nature zeigte, was eine Kombination aus Kameras, IMUs und Bordcomputern in einer kontrollierten Umgebung bewirken kann. Allerdings ist die Rennstrecke immer noch unvergleichlich klarer als das Schlachtfeld mit Rauch, Störungen, falschen Zielen und Zivilisten.

Drei Ebenen: Mensch innerhalb, über dem System und außerhalb des Kreislaufs

Die Begriffe human in the loop, human on the loop und human out of the loop sind eine sinnvolle Abkürzung, keine einheitliche Rechtsnorm. In der Praxis ist es wichtiger, konkrete Fragen zu stellen: Wer hat die Mission vorgegeben? Wer hat das Zielprofil festgelegt? Wer wählt ein bestimmtes Objekt aus? Kann man die Aktion rechtzeitig stoppen?

ModusSystemrolleDie Rolle des Menschen
Human in the loopKI empfiehlt, verfolgt oder navigiert.Man genehmigt eine bestimmte Gewaltanwendung.
Human on the loopDas System agiert in einem vordefinierten Raum und einer vordefinierten Zeit.Eine Person überwacht und hat eine echte Möglichkeit, einzugreifen oder die Aktion zu beenden.
Human out of the loopSobald das System aktiviert ist, wählt es bestimmte Objekte aus und greift sie ohne weiteren menschlichen Eingriff an.Der Mensch hat die Regeln im Voraus festgelegt, aber er entscheidet nicht über einen individuellen Eingriff.

Es gibt ein breites Spektrum zwischen einer manuell gesteuerten Drohne und vollständiger Autonomie. KI kann lediglich den Flug stabilisieren, eine Route vorschlagen, auf ein Objekt hinweisen oder nach der Zielauswahl durch einen Menschen den letzten Abschnitt der Navigation zum Ziel übernehmen. Daher bedeutet der Ausdruck „die Drohne hat selbst entschieden“ ohne weitere Erklärung fast nichts.

Außerdem hat das Wort Ziel mindestens drei Bedeutungen:

  1. strategischer Zweck, beispielsweise zum Schutz von Territorien,
  2. das Profil des Objekts in der Mission, zum Beispiel die Suche nach einer bestimmten Art von Technik in einer bestimmten Zone,
  3. das spezifische Objekt, gegen das die Kraft angewendet werden soll.

Je weiter sich menschliche Entscheidungen aus diesen konkreten Schritten zurückziehen, desto wichtiger sind die Einschränkungen durch Raum, Zeit, Objekttypen, Verhalten unter Unsicherheit und die Möglichkeit einer sicheren Unterbrechung.

Hyperwar: wenn der Entscheidungszyklus auf Maschinengeschwindigkeit verkürzt wird

Der Begriff Hyperwar wurde von John R. Allen und Amir Husain für einen Konflikt verwendet, in dem automatisierte Entscheidungen und gleichzeitige Aktionen in einer Geschwindigkeit ablaufen, mit der Menschen nur schwer Schritt halten können (US Naval Institute, 2017).

Es ist verlockend zu sagen, dass die schnellere Seite automatisch gewinnt. Schnelligkeit kann aber auch die Zeit für Überprüfung, Zweifel und Deeskalation verkürzen. Ein einzelner Sensorfehler entwickelt sich dann nicht über Stunden, sondern über Sekunden und in großem Umfang.

Daher kann sinnvolle menschliche Kontrolle nicht bedeuten, dass ein Mensch nur Dutzende automatischer Entscheidungen auf einem Bildschirm beobachtet. Dafür braucht es:

  • genügend Informationen über die Situation und Unsicherheit des Modells,
  • die Zeit, in der die Entscheidung tatsächlich geändert werden kann,
  • eine überschaubare Anzahl gleichzeitiger Vorgänge,
  • ein klarer Umfang der erlaubten Tätigkeit,
  • Möglichkeit, das System zu stoppen und herauszufinden, warum es reagiert hat.

Wer den Bruchteil einer Sekunde Zeit hat zu reagieren und die Gründe für die Entscheidung nicht sieht, ist eher formal als tatsächlich am Entscheidungsprozess beteiligt.

Nicht das Erkennen eines Panzers ist am schwierigsten. Das Schwierigste ist, die Szene zu verstehen

Auf einem sauberen Foto kann man einen bekannten Fahrzeugtyp relativ leicht erkennen. Aber das Schlachtfeld ist eine Umgebung außerhalb der Lehrbuchdaten. Objekte werden verdeckt, beschädigt, unterschiedlich beleuchtet, aus einem ungewöhnlichen Blickwinkel betrachtet oder absichtlich getarnt. Möglicherweise ist der Sensor beschädigt und der Angreifer versucht, das System zu verwirren.

NIST in seiner Taxonomie des kontradiktorischen maschinellen Lernens beschreibt Angriffe auf die Daten sowie auf die Entscheidungsfindung des Modells selbst und stellt fest, dass es keine einheitliche Verteidigung gibt.

Noch schwieriger ist die Bedeutung der Szene. Der Detektor kann das Fahrzeug sehen, weiß aber nicht:

  • Wem gehört es und ob es erbeutet wurde,
  • ob es betriebsbereit oder verlassen ist,
  • ob seine Besatzung kapituliert,
  • ob sich Zivilisten, medizinisches Personal oder ein geschütztes Objekt in der Nähe befinden,
  • Welchen militärischen Nutzen und welchen Kollateralschaden würde die Intervention mit sich bringen?

Dies ist der Unterschied zwischen Erkennung, Identifikation, Situationsverständnis und Rechtsentscheidung. Das Marketing verschmilzt sie manchmal mit einem einzigen Wort: „Intelligenz“. Tatsächlich gibt es eine Kluft zwischen ihnen.

Es gibt auch ein menschliches Risiko, das als „Automatisierungsbias“ bezeichnet wird. Der Bediener kann der Maschine genau deshalb vertrauen, weil das Ergebnis korrekt aussieht: der Rahmen, der Klassenname, die Karte und der Prozentsatz der Sicherheit. Allerdings sagt die 92-Prozent-Zahl etwas über das Modell und seine Daten aus, nicht aber darüber, ob der Eingriff korrekt und legal ist.

Was in der Praxis bereits passiert

Das Entwicklungstempo ist hoch. Das ukrainische Verteidigungsministerium berichtete im April 2026, dass über 200 Unternehmen im Land an Drohnen mit KI-Elementen arbeiten, die Brave1-Plattform mehr als 300 entsprechende Entwicklungen verzeichnet und über 70 KI- oder Computer-Vision-Lösungen an vorderster Front eingesetzt werden (Verteidigungsministerium der Ukraine).

Bei diesen Zahlen handelt es sich um eine offizielle Aussage einer Kriegspartei und nicht um eine unabhängige Prüfung der Wirksamkeit. Sie zeigen jedoch gut die Geschwindigkeit des Experimentierens. Gleichzeitig schrieb dasselbe Ministerium im Mai, dass es keine 100 % autonomen Kampfsysteme anstrebe und dass die endgültige Entscheidung unter menschlicher Kontrolle bleiben sollte (Defense AI Center A1).

Das Recht wartet nicht auf einen neuen Maschinentyp

Für autonome Waffensysteme gibt es noch keine eigene weltweit verbindliche Konvention. Es bedeutet kein Rechtsvakuum. Nach Angaben des Internationalen Komitees vom Roten Kreuz unterliegt jeder Angriff dem humanitären Völkerrecht, unabhängig von der verwendeten Technik.

Für einen konkreten Angriff sind drei Pflichten entscheidend:

  1. Unterscheidung: Unterscheidung militärischer Ziele von Zivilisten und zivilen Objekten.
  2. Verhältnismäßigkeit: Angriffe dürfen keine zivilen Schäden erwarten lassen, die im Verhältnis zum erwarteten konkreten und unmittelbaren militärischen Vorteil übermäßig wären.
  3. Vorsichtsmaßnahmen: Ergreifen Sie praktikable Schritte, um das Ziel zu überprüfen und den Schaden für die Zivilbevölkerung zu minimieren, einschließlich der Änderung oder Annullierung des Angriffs, wenn sich die Situation ändert.

Die Verantwortung verschwindet nicht im Algorithmus. Staaten, Kommandeure, Betreiber, Entwickler und Beschaffer haben unterschiedliche Rollen, aber der Ausdruck „KI hat entschieden“ ist keine rechtliche oder moralische Entschuldigung.

IKRK im Juni 2026 forderte erneut ein verbindliches internationales Instrument, das unvorhersehbare autonome Waffen und Antipersonensysteme verbieten und andere stark einschränken würde. Die Diskussionen der Expertengruppe im Rahmen des Übereinkommens über bestimmte konventionelle Waffen wurden im Jahr 2026 fortgesetzt. Die CCW-Überprüfungskonferenz ist für November 2026 geplant.

Die Tschechen haben eine überraschend starke Schule der Autonomie

Die Tschechische Republik ist nicht der Hauptproduzent von billigen FPV-Drohnen in Massenproduktion. Es verfügt jedoch über eine sehr gute Forschungsbasis in den Bereichen Robotik, Schwärme, Computer Vision und Nicht-GPS-Navigation. Diese Fähigkeiten werden nicht nur in der Verteidigung wichtig sein, sondern auch bei der Rettung, der Infrastrukturkontrolle und der Arbeit in gefährlichen Umgebungen.

ČVUT FEL, die Multi-Robot-Systems-Gruppe von Professor Martin Saska entwickelt sichere Flugroboter, Schwarmkoordination und Navigation ohne GNSS oder ohne kontinuierliche menschliche Verbindung. Das Team wendet seine Ergebnisse beim Schutz kritischer Infrastruktur in europäischen Projekten an (ČVUT FEL, 2026).

Das Drohnenforschungszentrum am BUT in Brünn berichtet, dass es seit 2020 Forschungsprojekte zu Drohnenschwärmen für das Verteidigungsministerium und die Armee der Tschechischen Republik durchführt. Es vereint Steuerung, Elektronik, Sensoren, KI und GNSS-freien Betrieb (VUT DRC).

Die University of Defence und BUT haben gemeinsam das ROJ-Projekt entwickelt, bei dem Flugdrohnen und Bodenroboter bei der Aufklärung zusammenarbeiten. KI verteilt Aufgaben, wertet das Bild aus und alarmiert den Bediener. Es ist wichtig hinzuzufügen, dass der öffentlich beschriebene Zweck Aufklärung und Informationsbeschaffung ist und nicht die autonome Entscheidungsfindung zur Anwendung tödlicher Gewalt (Verteidigungsuniversität).

Das ist ein tschechischer Vorteil, auf den wir zu Recht stolz sein können: keine Wunderkiste, sondern eine langjährige Forschungstradition in Regelungstechnik, Robotik und Maschinenkooperation.

Besser als den Krieg zu automatisieren, ist es, ihn zu verhindern

Ich halte die Entwicklung von Verteidigungstechnologien für legitim und manchmal notwendig. Aber die Anwendung von Gewalt muss das letzte Mittel sein. Technisches Können allein beantwortet nicht die Frage, ob ein bestimmter Einsatz korrekt ist.

Daher umfasst das Thema Drohnen für mich auch Prävention, gesellschaftliche Resilienz und Aufklärung. Im Projekt DigiVoják a DigiVojákyně bringen wir Schülern und Studenten bei, Desinformation und Manipulation zu erkennen, die Rolle der KI zu verstehen, sich auf Krisensituationen wie Stromausfälle vorzubereiten und über Sicherheit als Teil einer verantwortungsvollen Staatsbürgerschaft nachzudenken.

Es geht nicht um Kriegsangst. Es geht um die Fähigkeit, nicht in Panik zu geraten, Informationen zu überprüfen, zu kooperieren und Technologien zu verstehen, die die freien Entscheidungen der gesamten Gesellschaft beeinflussen.

Mein Fazit

KI kann der Drohne eine schnelle Sicht, eine genauere Stabilisierung, Navigation ohne ständige Verbindung und die Fähigkeit verleihen, auf Hindernisse zu reagieren. Allerdings hat sie kein menschliches Verständnis für die Situation, kein Gewissen und keine rechtliche Verantwortung.

Daher ist die wichtigste Frage nicht: Kann eine Maschine schneller eine Entscheidung treffen als ein Mensch? Oft ist sie bereits in der Lage.

Anders lautet es: Welche Entscheidungen dürfen wir ihm überhaupt anvertrauen, wie erkennen wir seine Unsicherheit und wer trägt die Verantwortung, wenn er einen Fehler macht?

Geschwindigkeit ist ein technischer Vorteil. Verantwortung ist eine menschliche Pflicht.

Hinweis: Der Artikel dient der Information und Bildung. Er beschreibt nicht das Waffendesign, die taktische Führung oder die Verfahren zur Zielauswahl und -bekämpfung. Die Links führen in erster Linie zu offiziellen Dokumentationen, Fachpublikationen und öffentlichen Informationen von Universitäten und Institutionen.

Ressourcen und weiterführende Literatur

Weitere Artikel