Wenn du dich mit 3D-Fotos beschäftigst, kommst du vielleicht nicht drum herum, mit Begriffen zu hantieren, die eigentlich dasselbe meinen, es aber nicht tun. Fotogrammetrie? Gaussian Splatting? NeRF? Ich wollte mal fragen, wo DFX SplatCore steht. Klar, die Verwirrung ist verständlich. Die Begriffe kommen aus zwei verschiedenen Welten, die erst vor kurzem zusammengefunden haben. In diesem Kapitel werden sie vorgestellt und wir erfahren die kurze, wilde Geschichte des Neuankömmlings. Am Ende geht es um die Frage, die hier eigentlich zählt: Was heißt das für deine Fotos?
Die Fotogrammetrie ist sozusagen die direkte Fortsetzung der Geschichte aus Teil 1. Hier kurz und knapp der Ablauf: Zunächst werden aus vielen Fotos die Kamerapositionen zurückgerechnet, also der Rückwärtsschnitt gemacht. Dann wird für eine Unmenge an Bildpunkten per Triangulation die Lage im Raum bestimmt. So entsteht eine Punktwolke, aus der ein Drahtgeflecht, auch "Mesh" genannt, gespannt wird. Auf dieses "Mesh" werden dann die Fotos als Oberflächenbild aufgezogen.
Das Ergebnis ist maßhaltig, man kann also ganz genau messen. Deshalb ist Fotogrammetrie bis heute das Werkzeug der Wahl, wenn es um Zahlen geht: Vermessung, Bauwesen, Kartografie, Denkmalpflege. Ihre Schwächen liegen auf der anderen Seite: Sie braucht Oberflächen mit Struktur (glatte, glänzende oder durchsichtige Dinge scheitern), feine Details wie Haare oder Gitter zerfallen, und der Fotorealismus hat eine Grenze – die Textur ist auf die Geometrie aufgeklebt. Wenn man da von der Seite guckt oder bei schrägem Licht, sieht man das.
2020 hat eine Forschungsgruppe ein Verfahren vorgestellt, das die Aufgabe ganz anders angeht: NeRF ("Neural Radiance Fields"). Keine Punktwolke, kein Drahtgeflecht – stattdessen wird ein neuronales Netz darauf trainiert, eine einzige Frage zu beantworten: "Ich stehe hier und schaue dorthin – was sehe ich?" Für jedes Bild, das man sehen will, wird diese Frage millionenfach gestellt, und die Antworten zeigen dann die Ansicht.
Die Ergebnisse waren echt der Hammer: fotorealistische freie Ansichten, weiche Materialien, Lichtstimmungen – Dinge, die mit der aufgeklebten Textur der Fotogrammetrie einfach nicht möglich sind. Der Preis war allerdings brutal: Training über Stunden bis Tage, und selbst das fertige Modell brauchte Sekunden bis Minuten pro Bild. Es sieht super aus, aber leider ist es für die praktische Arbeit unbrauchbar.
Dann ging es zwei Jahre lang darum, immer schneller zu werden. Und dann kam jemand auf eine Erkenntnis, die den Weg für alles Weitere freimachte. Andere Verfahren wie Plenoxels (2022) haben das neuronale Netz komplett überflüssig gemacht. Mit einem einfachen Raster haben sie fast die gleiche Qualität erreicht – und das in einem Bruchteil der Zeit. Instant-NGP (2022) hat das Training von Tagen auf Sekunden reduziert. Die Lehre daraus ist also, dass der Zauber nie im neuronalen Netz steckte. Die Idee ist, eine Szene so lange zu verfeinern, bis sie alle Fotos gleichzeitig erklärt. Wenn das auch ohne Netz funktioniert, dann sollte die Darstellung einfach, schnell und direkt bearbeitbar sein.
2023 hat eine Arbeit aus Frankreich zwei Traditionen zusammengeführt, die zwanzig Jahre lang nebeneinander hergelaufen waren. Die eine kommt aus der Computergrafik: Schon 2001 wusste man, wie man Oberflächen aus weichen, elliptischen Farbtupfern ("Splats") sauber darstellen kann. Die andere ist die junge Strahlungsfeld-Idee aus NeRF. Das Ergebnis heißt 3D Gaussian Splatting und hat in beiden Richtungen gleichzeitig überzeugt: NeRF-Qualität bei Echtzeit-Wiedergabe.
Die Idee dahinter ist echt gut. Eine Szene besteht aus Millionen winziger Farbtupfer im Raum. Jeder Tupfer hat seinen eigenen Platz und eine Form – von kugelrund bis nadelfein gestreckt, so schmiegen sie sich an Kanten und Flächen. Außerdem haben sie eine bestimmte Durchsichtigkeit und Farbe, die sich je nach Blickrichtung leicht ändern darf. Das Training funktioniert wie Bildhauerei in Zeitraffer: Die Tupfer werden gezeichnet, mit den echten Fotos verglichen, verschoben, geteilt, gelöscht, nachgefärbt – zigtausendmal, bis die gerenderte Szene die Fotos erklärt.
Und hier kommen wir wieder zu Teil 1 zurück, der die gesamte Architektur von DFX SplatCore erklärt. Das Training startet mit den Punkten und Kamerapositionen aus der alten Mess-Welt. Erst berechnet die klassische Fotogrammetrie-Maschine das Skelett – also wo die Kameras standen und wo die ersten Punkte liegen – und dann legt das Splatting-Training die fotorealistische Haut darüber. Die zweitausendjährige Messtradition wurde nicht ersetzt. Sie wurde zum Fundament.
Die Konfluenz von 2023. Rechts die Familienzweige, die seither entstanden sind — Abschnitt 2.6 zeigt, welcher davon wo in DFX SplatCore arbeitet.
KI-Bild
Nach 2023 ging die Forschung richtig ab, und aus dem einen Verfahren wurde eine ganze Familie. Jeder Zweig löst eine eigene Schwäche des Originals: Verfahren für wenige Bilder (das Original brauchte viele), für die Erzeugung aus einem einzigen Bild, für saubere Netze und Exporte in klassische 3D-Programme, für Robustheit gegen verwackelte oder schwierige Aufnahmen, für spiegelnde Oberflächen und für das Herausrechnen des Lichts aus den Aufnahmen. Die Namen dieser Verfahren – InstantSplat, BAD-GS, SpikeGS, FlashGS und viele mehr – muss sich niemand merken. Aber es lohnt sich, zu wissen, dass es sie gibt. Denn:
DFX SplatCore ist da ganz anders. Es ist das Orchester, in dem ausgewählte Familienmitglieder zusammenspielen – jedes dort, wo seine Stärke liegt, und ohne dass du dich um die Besetzung kümmern musst:
| Familienzweig | In DFX SplatCore |
|---|---|
| Erzeugung aus einem einzigen Bild | der TripoSplat-Weg beim Einzelbild-Import |
| Rekonstruktion aus wenigen Bildern (2–12) | der MapAnything-Weg für kleine Serien |
| Klassischer Viel-Bild-Weg | COLMAP-Kamerarechnung + Splatting-Training |
| Geometrie, Netz & Export | 2D-Splatting-Training, Netz-Erzeugung, GLB-Export |
| Robustheit gegen Aufnahmefehler | die fünf Toleranzstufen von Motion Guard tragen exakt die Namen dieser Verfahren |
| Licht herausrechnen | die PBR-Aufbereitung mit De-Lighting im Orbit-Modul |
| Spiegelnde Oberflächen | in Arbeit — offen benannt in Teil 7 |
Zwei Dinge an der Tabelle sind bemerkenswert. Erstens: Die Toleranztabelle von Motion Guard, die beim Import über deine Bilder urteilt, besteht nicht aus erfundenen Zahlen. Dahinter stehen reale Verfahren mit real gemessener Fehlertoleranz. Zweitens: Die letzte Zeile ist absichtlich ehrlich. Wenn noch nicht alles geklärt ist, steht das hier – und nirgendwo anders wirst du es deutlicher lesen als in Teil 7.
Das Doppelwesen – Mess-Skelett plus Wiedergabe-Haut – zeigt uns eine Einsicht, die das gesamte Aufnahme-Wissen ordnet und die alte Ratgeber oft übersehen:
Womit die entscheidende Frage auf dem Tisch liegt: Was genau braucht so eine Rekonstruktion denn nun von deinen Fotos? Das ist Teil 3 — das kürzeste Kapitel mit der größten Wirkung.