Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

DLSS 5 zur Gamescom 2026: 3D-Guided Neural Rendering zwischen klassischem Rendering und generativer Bildsynthese

Дата публикации: 01-09-2026 13:00:42

Es wurde zwar schon alles mehr oder weniger detailliert geleakt, aber ich schreibe diesen Artikel heute trotzdem, weil es einerseits auf offiziellen Informationen basiert und zweitens auch mehr Details erklären kann. Denn mit DLSS 5 verschiebt Nvidia den Schwerpunkt seiner DLSS-Technik deutlich. Bisher ging es bei DLSS vor allem darum, bereits vorhandene Bildinformationen effizienter zu nutzen.

Основное содержимое страницы с новостью.

next.png

📖 Lesezeit: ca. 34 Minuten · 6.677 Wörter · 51.647 Zeichen

Inhaltsübersicht als Kurzfassung

Die Gamescom-Präsentation 2026 beschreibt DLSS 5 als „3D-Guided Neural Rendering“: Die Spiele-Engine rendert weiterhin Geometrie, Kamera, Animation und die grundlegende Szenenstruktur, während ein neuronales Modell den fertigen Farbframe anhand von Bewegungsinformationen semantisch interpretiert und Licht- sowie Materialwirkung verändert. DLSS 5 ist damit weder eine reine Bildrekonstruktion noch eine vollständig freie Bildgenerierung. Die gezeigten Leistungs- und Qualitätsaussagen stammen ausschließlich von NVIDIA und sind noch nicht durch unabhängige Tests bestätigt.

Wichtigste Fakten
Aspekt Angabe Einordnung
Grundprinzip 3D-Guided Neural Rendering Neuronale Verfeinerung eines bereits gerenderten Bildes
Laufzeiteingaben Farbframe und Motion Vectors Die klassische Renderingpipeline liefert die Szenenführung
Modellbezeichnung Pixel Space Diffusion Transformer Model Verarbeitung im Bildraum; der vollständige Inferenzablauf ist nicht veröffentlicht
Erstes genanntes Spiel NBA 2K27 Verfügbarkeit laut NVIDIA ab 4. September 2026, 06:00 Uhr MESZ
Unterstützte Plattformen im Beispiel GeForce-RTX-50-GPUs, entsprechende Notebooks und GeForce NOW Keine vollständige Kompatibilitätsmatrix
Entwicklerkontrollen Structure Intensity, Tone Intensity, Masken und Modellvarianten Die Stärke und der Anwendungsbereich sollen steuerbar sein
Technische Eckdaten

</tr}

Komponente Beschreibung Technische Bedeutung
Farbframe Bereits von der Engine erzeugtes Bild DLSS 5 baut auf vorhandener Geometrie, Beleuchtung und Materialzuordnung auf
Motion Vectors Bewegungsinformationen zwischen Frames Unterstützen die zeitliche Zuordnung von Objekten und Bilddetails
Trainingsinformationen Unter anderem Albedo, Beleuchtung, Normalen, Motion Vectors und Szenensemantik Trennen Materialeigenschaften, Lichtwirkung, Oberflächenrichtung und Objektbedeutung
Semantische Steuerung Automaskierung sowie manuelle Entwicklermasken Unterschiedliche Objektgruppen können separat behandelt werden
Integration Streamline und Plugin für Unreal Engine 5 Die technische Einbindung soll standardisierte Schnittstellen nutzen
Weitere DLSS-Verfahren Super Resolution, Frame Generation und Multi Frame Generation Diese Funktionen sind von der eigentlichen DLSS-5-Bildbearbeitung zu unterscheiden
Messwerte und Beobachtungen

Die folgenden Werte stammen aus den von NVIDIA gezeigten Präsentationsfolien. Sie sind Herstellerangaben und keine unabhängig reproduzierten Messungen. Die Leistungswerte kombinieren mehrere DLSS-Verfahren und erlauben deshalb keine isolierte Bewertung der Kosten oder Qualität von DLSS 5.

</tr} </tr}

Auflösung und Einstellungen Grafikkarte Angabe von NVIDIA
3840 × 2160, Ultra, Raytracing, DLSS 5, Multi Frame Generation 6X, Super Resolution im Performance-Modus GeForce RTX 5080 232 FPS
3840 × 2160, Ultra, Raytracing, DLSS 5, Multi Frame Generation 6X, Super Resolution im Performance-Modus GeForce RTX 5090 370 FPS
2560 × 1440, Ultra, Raytracing, Super Resolution im Quality-Modus GeForce RTX 5070 261 FPS
2560 × 1440, Ultra, Raytracing, Super Resolution im Quality-Modus GeForce RTX 5070 Ti 352 FPS
2560 × 1440, Ultra, Raytracing, Super Resolution im Quality-Modus GeForce RTX 5080 413 FPS
2560 × 1440, Ultra, Raytracing, Super Resolution im Quality-Modus GeForce RTX 5090 594 FPS
1920 × 1080, Hoch, Raytracing, Super Resolution im Quality-Modus GeForce RTX 5060, RTX 5060 Ti und RTX 5070 258, 324 und 385 FPS
DLSS-5-Modellleistung innerhalb von sechs Monaten RTX-50-Serie Faktor 5 laut NVIDIA

Als zusätzliche Folie nennt NVIDIA für NBA 2K27 227 FPS mit deaktiviertem und 370 FPS mit aktiviertem DLSS. Die genaue Zusammensetzung der aktivierten DLSS-Funktionen wird in dieser Darstellung nicht vollständig wiederholt. NVIDIA zeigt außerdem einen Faktor von 375.000 bei der Rechenleistung zwischen der GeForce 8800 GTX aus dem Jahr 2006 und der GeForce RTX 5090. Dieser Wert beschreibt keinen direkten Spieleleistungsfaktor, sondern eine über viele GPU-Generationen nur eingeschränkt vergleichbare theoretische Rechenleistung.

Testbedingungen und GrenzenDie Leistungsdaten stammen aus NVIDIA-Präsentationsfolien und wurden nicht unabhängig nachgemessen.Die Benchmarks kombinieren DLSS 5 mit Super Resolution und teilweise Multi Frame Generation 6X. Die isolierte Rechenzeit von DLSS 5 bleibt daher offen.NVIDIA veröffentlicht Durchschnitts-FPS, aber keine 1-%-Lows, keine Frame-Time-Verläufe und keine unabhängigen Latenzmessungen.Aus mehreren hundert ausgegebenen FPS lässt sich wegen Frame Generation nicht auf dieselbe Zahl vollständig klassisch gerenderter Bilder oder auf eine entsprechend niedrige Eingabelatenz schließen.Die gezeigten Qualitätsvergleiche sind Standbilder. Aussagen zu Flimmern, Ghosting, schnellen Kamerabewegungen, Transparenzen, Partikeln und Disocclusions sind daraus nicht belastbar ableitbar.Exakte Modellgröße, VRAM-Bedarf und Inferenzzeit nennt NVIDIA nicht. Auch die Unterschiede zwischen Model A, Model B und Model C bleiben offen.Einordnung

DLSS 5 positioniert sich zwischen klassischem Rendering und generativer Bildsynthese. Anders als ein generatives Modell, das aus einem Prompt oder Referenzbild ein neues Bild erzeugt, bleibt DLSS 5 an den von der Engine vorgegebenen Farbframe und dessen Bewegungsstruktur gebunden. Anders als Super Resolution beschränkt sich die Technik nach NVIDIAs Darstellung nicht auf die Rekonstruktion fehlender Bildauflösung. Das Modell soll erkennen, ob Bildbereiche beispielsweise Haut, Stoff, Metall, Holz oder Pflanzen darstellen, und darauf aufbauend Beleuchtung, Reflexionen, Kontaktschatten oder feine Materialwirkung beeinflussen.

DLSS 5 ersetzt laut Präsentation weder Rasterisierung noch Raytracing oder Path Tracing. Ein besseres Ausgangsbild soll zu einem besseren Ergebnis führen. Raytracing und hochwertiges klassisches Rendering behalten deshalb ihre Bedeutung, weil sie geometrisch besser verankerte Informationen zu Schatten, Reflexionen und indirekter Beleuchtung liefern können. DLSS 5 ergänzt diese Grundlage um eine stärker semantische neuronale Stufe.

Die praktische Einordnung hängt wesentlich von der Entwicklerkontrolle ab. Structure Intensity soll hochfrequente Details wie feine Strukturen und lokale Reflexionen steuern, während Tone Intensity großflächige Helligkeits- und Farbverläufe beeinflusst. Manuelle und semantische Masken sollen verhindern, dass Gesichter, Kleidung, Hintergrund und andere Objektgruppen zwangsläufig identisch bearbeitet werden.

StärkenDie Technik bleibt an Geometrie, Kamera, Animation und die Szenenstruktur der Spiele-Engine gebunden, statt die komplette Szene frei neu zu erzeugen.Motion Vectors unterstützen die zeitliche Verfolgung von Bilddetails und sollen die Stabilität zwischen Frames verbessern.Structure Intensity, Tone Intensity, Modellwahl und Maskierung ermöglichen eine Anpassung an unterschiedliche visuelle Stile.Die gezeigten Konfigurationen erreichen laut NVIDIA bis zu 594 FPS bei 2560 × 1440 und bis zu 370 FPS bei 3840 × 2160, allerdings mit weiteren DLSS-Verfahren.EinschränkungenDie Präsentation belegt weder die tatsächliche temporale Stabilität in Bewegung noch das Verhalten bei Haaren, feinen Mustern, Transparenzen, Partikeln oder schnellen Disocclusions.Die gezeigten FPS-Werte erlauben wegen der kombinierten Verfahren keine isolierte Aussage über DLSS 5.Modellgröße, Speicherbedarf, Inferenzzeit und die genaue Bedeutung der angegebenen fünffachen Modellleistung sind nicht dokumentiert.Die Wirkung auf stilisierte Spiele, HUD-Elemente, Untertitel und ungewöhnliche Materialien bleibt offen.Ob semantische Automasken zuverlässig arbeiten oder Materialien falsch klassifizieren, muss mit reproduzierbaren Spieletests geprüft werden.Fragen und AntwortenErsetzt DLSS 5 die 3D-Engine eines Spiels? Nein. Geometrie, Kamera, Animation und die grundlegende Szenenstruktur werden weiterhin klassisch von der Spiele-Engine erzeugt.Was verarbeitet DLSS 5 zur Laufzeit? Laut NVIDIA einen bereits gerenderten Farbframe und Motion Vectors.Ist DLSS 5 dasselbe wie Super Resolution? Nein. Super Resolution rekonstruiert ein höher aufgelöstes Bild, während DLSS 5 zusätzlich Material- und Beleuchtungswirkung semantisch verändern soll.Beweisen 594 FPS bei 2560 × 1440 eine entsprechend niedrige Latenz? Nein. Der Wert steht im Zusammenhang mit einer kombinierten DLSS-Konfiguration und Multi Frame Generation 6X.Welche offenen Punkte benötigen unabhängige Tests? Unter anderem Bildqualität in Bewegung, temporale Stabilität, Latenz, Frame Times, VRAM-Bedarf, Inferenzzeit und die Wirkung der Masken und Intensitätsregler.

Automatisch aus dem Artikelinhalt als redaktionelle, sichtbare Inhaltsübersicht erzeugt.

Es wurde zwar schon alles mehr oder weniger detailliert geleakt, aber ich schreibe diesen Artikel heute trotzdem, weil es  einerseits auf offiziellen Informationen basiert und zweitens auch mehr Details erklären kann. Denn mit DLSS 5 verschiebt Nvidia den Schwerpunkt seiner DLSS-Technik deutlich. Bisher ging es bei DLSS vor allem darum, bereits vorhandene Bildinformationen effizienter zu nutzen. DLSS Super Resolution rekonstruiert aus einer niedrigeren internen Renderauflösung ein höher aufgelöstes Ausgabebild, Ray Reconstruction ersetzt beziehungsweise ergänzt klassische Entrauschungsverfahren für Raytracing, Frame Generation erzeugt zusätzliche Zwischenbilder und Multi Frame Generation erweitert diesen Ansatz auf mehrere künstlich erzeugte Frames. DLSS 5 greift an einer anderen Stelle an. Die Technik soll das bereits von der Spiele-Engine gerenderte Bild semantisch interpretieren und dessen Beleuchtung, Materialwirkung sowie feine Oberflächeneigenschaften mit einem neuronalen Modell verändern. Nvidia bezeichnet diesen Ansatz als „3D-Guided Neural Rendering“. Der Begriff klingt zunächst so, als würde ein KI-Modell die komplette 3D-Szene selbst rendern. Genau das ist nach den vorliegenden Unterlagen jedoch nicht der Fall. Geometrie, Kamera, Animation, grundlegende Materialzuordnung und die räumliche Struktur der Szene entstehen weiterhin in der klassischen Renderingpipeline des Spiels. DLSS 5 arbeitet auf dieser Grundlage weiter und soll das Ergebnis visuell verfeinern. Damit bewegt sich die Technik zwischen klassischem Rendering und generativer Bildsynthese, ohne vollständig zu einer freien Bildgenerierung zu werden.

Die zur Gamescom 2026 vorliegende Nvidia-Präsentation liefert dafür deutlich mehr technische Details als frühere Kurzbeschreibungen oder die meisten Leaks. Gleichzeitig muss aber sauber zwischen der Funktionsbeschreibung des Herstellers und unabhängig nachgewiesenen Eigenschaften unterschieden werden. Die gezeigten Bildvergleiche, Leistungswerte und Aussagen zur Modellbeschleunigung stammen von Nvidia. Sie zeigen, was die Technik nach Herstellerangaben leisten soll, ersetzen aber keinen unabhängigen Bildqualitäts-, Performance- oder Latenztest und sie beantworten auch nicht alle Fragen.

Vom programmierbaren Shader bis zum neuronalen Rendering

Nvidia beginnt die Präsentation mit einer historischen Einordnung. Genannt werden programmierbare Shader, CUDA, Raytracing, Path Tracing und schließlich DLSS als aufeinanderfolgende Entwicklungsschritte auf dem Weg zu immer realistischeren Echtzeitbildern. Für den Abstand zwischen der GeForce 8800 GTX aus dem Jahr 2006 und einer aktuellen GeForce RTX 5090 nennt Nvidia einen Faktor von 375.000 bei der Rechenleistung.

Diese Zahl sollte nicht als direkter Leistungsfaktor für Spiele verstanden werden. FLOPS, also „Floating Point Operations per Second“, geben an, wie viele Gleitkommaberechnungen ein Rechenwerk theoretisch pro Sekunde ausführen kann. Solche Werte lassen sich über fast zwei Jahrzehnte GPU-Entwicklung jedoch nur eingeschränkt vergleichen, weil sich Rechenformate, Parallelisierung, Takt, Cache-Hierarchien und spezialisierte Recheneinheiten stark verändert haben. Eine moderne GPU besitzt außerdem dedizierte Einheiten für Raytracing und Matrixoperationen, deren Nutzen in einer einfachen FLOPS-Zahl nicht vollständig abgebildet wird. Programmierbare Shader waren ein entscheidender Schritt, weil Entwickler damit nicht mehr ausschließlich fest vorgegebene Grafikfunktionen verwenden mussten. Ein Shader ist vereinfacht gesagt ein kleines Programm, das auf der GPU ausgeführt wird und beispielsweise berechnet, wie ein Pixel beleuchtet wird, wie eine Oberfläche auf Licht reagiert oder wie Geometrie transformiert wird. CUDA erweiterte GPUs später zu allgemeiner nutzbaren Parallelrechnern. Raytracing fügte spezialisierte Verfahren zur Berechnung von Lichtstrahlen hinzu, und Path Tracing treibt dieses Prinzip noch weiter, indem sehr viele mögliche Lichtwege statistisch verfolgt werden.

Der eigentliche Punkt hinter Nvidias historischem Vergleich ist deshalb weniger die konkrete Zahl als das Zeitbudget. Ein Spiel mit 60 Bildern pro Sekunde hat für ein vollständiges Bild theoretisch nur rund 16,7 Millisekunden Zeit. Bei 120 FPS sinkt dieses Budget auf etwa 8,3 Millisekunden, bei 240 FPS auf gut 4,2 Millisekunden. In diesem Zeitraum müssen Simulation, CPU-Arbeit, Geometrieaufbereitung, Beleuchtung, Nachbearbeitung und die eigentliche GPU-Ausgabe erledigt werden. Ein Effekt, der in einer Filmproduktion Minuten oder Stunden pro Bild benötigt, lässt sich nicht einfach unverändert in ein Echtzeitspiel übernehmen. Genau hier setzt die Idee hinter DLSS 5 an. Statt alle sichtbaren Details ausschließlich mit immer mehr klassischen Renderoperationen zu berechnen, soll ein trainiertes Modell lernen, aus dem bereits vorhandenen Bild weitere plausible Beleuchtungs- und Materialinformationen abzuleiten. Das neuronale Modell ersetzt damit nicht zwangsläufig eine physikalische Berechnung eins zu eins, sondern versucht, deren sichtbare Wirkung effizient anzunähern.

Zwei Wege zu einem realistisch wirkenden Bild

Die Präsentation stellt zwei grundsätzlich unterschiedliche Wege zu einem fotorealistischen Ergebnis gegenüber. Der klassische Renderingpfad beginnt mit einer definierten 3D-Szene. Darin befinden sich geometrische Modelle, Lichtquellen, Kamerapositionen und Materialien. Danach berechnet die Engine daraus ein Bild. PBR steht für „Physically Based Rendering“, also physikalisch basiertes Rendering. Ein PBR-Material beschreibt Oberflächen nicht einfach nur durch eine Farbe, sondern durch Eigenschaften wie Grundfarbe, Rauheit, Metallanteil, Reflexionsverhalten oder Normaleninformationen. Dadurch kann eine Engine beispielsweise zwischen lackiertem Metall, mattem Kunststoff, rauem Stein und feuchter Haut unterscheiden und diese Materialien abhängig von der Beleuchtung unterschiedlich darstellen. Rasterisierung, Raytracing und Path Tracing sind verschiedene Wege, aus dieser 3D-Beschreibung ein zweidimensionales Bild zu erzeugen. Bei der Rasterisierung wird vereinfacht gesagt berechnet, welche Dreiecke einer 3D-Szene auf welchen Pixeln des Bildschirms landen. Beleuchtung und Schatten werden anschließend mit vielen zusätzlichen Verfahren angenähert. Rasterisierung ist sehr schnell und bildet bis heute die Grundlage praktisch aller Echtzeitgrafik.

Raytracing verfolgt dagegen Lichtstrahlen beziehungsweise Sichtstrahlen durch die Szene. Damit lassen sich Reflexionen, Schatten oder indirekte Beleuchtung geometrisch konsistenter berechnen. Path Tracing ist eine umfassendere Variante, bei der komplette Lichttransportpfade mit mehreren Reflexionen beziehungsweise Lichtwechselwirkungen berücksichtigt werden. Das Ergebnis kann physikalisch überzeugender sein, ist aber erheblich rechenintensiver. Nvidia stellt diesem klassischen Weg einen generativen Weg gegenüber. Hier wird ein Modell zunächst mit vielen Beispielen trainiert. Danach erzeugt es auf Basis einer Eingabe, etwa eines Prompts, eines Referenzbildes oder einer anderen Konditionierung, ein neues Bild. 

Der wichtige Unterschied liegt in der Art, wie das Ergebnis entsteht. Beim klassischen Rendering ist ein Objekt an eine definierte Geometrie gebunden. Eine Tasse steht dort, weil die 3D-Szene an dieser Position eine Tasse enthält. Ein generatives Modell dagegen erzeugt Pixel nach erlernten Wahrscheinlichkeiten. Das Ergebnis kann sehr realistisch aussehen, muss aber nicht in jedem Durchlauf identisch sein oder exakt die zuvor festgelegte räumliche Struktur einhalten. Nvidia bezeichnet diese Eigenschaft in der Präsentation als probabilistisch. Das bedeutet nicht, dass das Modell einfach „rät“. Es bedeutet vielmehr, dass mehrere plausible Lösungen existieren können und die Bildentstehung auf statistisch gelernten Zusammenhängen beruht. Ein generatives Modell kann zum Beispiel wissen, wie Haut, Stoff oder Metall typischerweise aussehen, ohne dass jedes sichtbare Detail zuvor geometrisch modelliert wurde.

Für Einzelbilder oder offline erzeugte Videos ist das oft akzeptabel. Für ein Spiel entsteht daraus jedoch ein Problem. Eine Figur muss über viele Tausend Frames dieselbe Figur bleiben. Ein Knopf auf einer Jacke darf nicht im nächsten Bild an einer anderen Stelle sitzen, ein Gesicht darf seine Proportionen nicht leicht verändern und ein Schatten darf nicht ohne Ursache zwischen unterschiedlichen plausiblen Varianten springen. Hinzu kommt die Latenz. Viele generative Videoverfahren arbeiten nicht streng Bild für Bild im Takt einer Spiele-Engine, sondern erzeugen mehrere Frames als zusammenhängenden Block. Das kann für Videogenerierung sinnvoll sein, passt aber schlecht zu einem interaktiven Spiel, dessen nächstes Bild davon abhängt, was der Spieler wenige Millisekunden zuvor mit Maus, Tastatur oder Controller getan hat.

Mit „offline“ ist in diesem Zusammenhang nicht gemeint, dass kein Internetzugang vorhanden ist. Offline Rendering bedeutet, dass ein Bild oder eine Bildfolge nicht innerhalb eines festen Echtzeitbudgets fertig werden muss. Ein Filmstudio kann für einen Frame erheblich mehr Rechenzeit aufwenden als ein Spiel. Echtzeitgrafik muss das Ergebnis dagegen rechtzeitig zum nächsten Bild liefern.

Was „3D-Guided“ bei DLSS 5 wirklich bedeutet

Der zentrale technische Punkt der Präsentation ist die Laufzeitpipeline. Laut Nvidia erhält DLSS 5 einen bereits gerenderten Farbframe und Motion Vectors. Diese Daten werden von einem Modell verarbeitet, das Nvidia in der Präsentation als „Pixel Space Diffusion Transformer Model“ bezeichnet. Das Ergebnis soll deterministisch, zeitlich stabil und in Echtzeit erzeugt werden. Ein Farbframe ist zunächst einfach das von der Engine erzeugte Bild, bevor beziehungsweise während DLSS 5 darauf angewendet wird. Motion Vectors sind dagegen Zusatzinformationen. Sie beschreiben, wie sich Bildpunkte oder Objekte von einem Frame zum nächsten bewegen. Wenn sich eine Figur beispielsweise zehn Pixel nach rechts bewegt oder die Kamera schwenkt, kann ein Bewegungsvektor angeben, wo ein Pixel aus dem vorherigen Bild im neuen Bild ungefähr zu finden ist.

Solche Vektoren sind für temporale Verfahren besonders wertvoll. „Temporal“ bedeutet hier, dass nicht nur das aktuelle Bild, sondern auch Informationen über zeitlich benachbarte Bilder genutzt werden. Ohne Bewegungsvektoren müsste ein Algorithmus allein aus den Farben zweier Frames erraten, welche Pixel zueinander gehören. Mit Motion Vectors kann er deutlich besser verfolgen, welche Bildbereiche dieselbe Oberfläche oder dasselbe Objekt repräsentieren. 

  • Der Begriff „Pixel Space“ legt nahe, dass das Modell im Bildraum arbeitet. Der Bildraum ist die zweidimensionale Darstellung, die nach der Projektion der 3D-Szene entsteht. Das ist von Verfahren zu unterscheiden, die direkt auf Dreiecken, Meshes oder volumetrischen 3D-Daten operieren.
  • „Transformer“ bezeichnet eine Klasse neuronaler Netze, die Beziehungen zwischen Informationen über größere Bereiche hinweg modellieren kann. Transformer wurden zunächst vor allem durch Sprachmodelle bekannt, werden aber längst auch für Bildverarbeitung eingesetzt. Für ein Renderbild ist das interessant, weil die Bedeutung eines Pixels oft nicht allein aus seiner unmittelbaren Nachbarschaft hervorgeht. Ein heller Fleck kann eine Reflexion, Hautglanz, eine Lichtquelle oder eine bemalte Oberfläche sein. Der weitere Bildkontext hilft bei dieser Einordnung.
  • Der Ausdruck „Diffusion“ stammt aus einer Familie generativer Modelle, die während des Trainings lernen, aus gestörten beziehungsweise verrauschten Daten schrittweise wieder eine sinnvolle Struktur zu rekonstruieren. Daraus sollte jedoch nicht automatisch geschlossen werden, dass DLSS 5 zur Laufzeit wie ein klassischer Text-zu-Bild-Generator mehrere langsame Diffusionsschritte ausführt. Nvidia nennt die Architektur in der Präsentation ein „Pixel Space Diffusion Transformer Model“, veröffentlicht dort aber keine vollständige technische Beschreibung des internen Inferenzablaufs.
  • „Inferenz“ ist der Fachbegriff für die eigentliche Anwendung eines bereits trainierten neuronalen Netzes. Training und Inferenz sind zwei unterschiedliche Phasen. Beim Training wird das Modell anhand großer Datenmengen optimiert. Bei der Inferenz bekommt das fertige Modell neue Eingabedaten und berechnet daraus sein Ergebnis. Im Spiel findet die Inferenz statt, nicht das vollständige Training.

Die Bezeichnung „3D-Guided“ darf deshalb nicht so gelesen werden, als ob DLSS 5 nach den vorliegenden Angaben die komplette 3D-Welt als neuronales Modell neu berechnet. Die Führung kommt aus dem klassischen Rendering. Die Engine legt fest, welche Objekte vorhanden sind, wo sie stehen, wie die Kamera blickt und wie der Ausgangsframe aussieht. DLSS 5 interpretiert dieses Ergebnis und soll sich an dessen Struktur halten.

Albedo, Normalen und Semantik

Die Trainingsdarstellung in der Präsentation ist umfangreicher als die gezeigte Laufzeitpipeline. Nvidia zeigt neben dem gerenderten Frame unter anderem Surface Albedo, Beleuchtungsinformationen, Oberflächennormalen und Motion Vectors. Zusätzlich werden semantische Eigenschaften von Szene, Licht, Kamera und Figuren hervorgehoben.

Der gerenderte Frame enthält bereits viele dieser Eigenschaften miteinander vermischt. Die Farbe eines Pixels kann von der eigentlichen Materialfarbe, der Lichtfarbe, einem Schatten, einer Reflexion und weiteren Effekten beeinflusst sein. Für ein neuronales Modell ist es deshalb beim Training hilfreich, diese Bestandteile auch getrennt zu kennen.

Surface Albedo bezeichnet vereinfacht die Grundfarbe beziehungsweise das Reflexionsvermögen einer Oberfläche ohne die momentane Beleuchtung. Ein roter Stoff bleibt in seiner Materialdefinition rot, auch wenn er in einem dunklen Schatten fast schwarz erscheint. Eine Albedo-Darstellung hilft einem Modell deshalb dabei, Materialfarbe und Lichtwirkung voneinander zu unterscheiden.

Die Beleuchtungsinformation beschreibt dagegen, wie Licht auf die Szene wirkt. Dazu gehören Richtung, Stärke und nach Nvidias semantischer Einordnung auch die gewünschte Lichtstimmung. Das ist wichtig, weil identische Materialien unter warmem Sonnenlicht, kaltem Kunstlicht oder im Schatten völlig unterschiedlich aussehen können.

Surface Normals, also Oberflächennormalen, sind Richtungsvektoren, die angeben, wohin eine Oberfläche an einer bestimmten Stelle zeigt. Bei einem ebenen Tisch zeigen viele Normalen in dieselbe Richtung. Bei einer runden Kugel ändern sie sich kontinuierlich über die Oberfläche. Normalen sind für Beleuchtungsberechnungen elementar, weil der Winkel zwischen Oberfläche und Lichtquelle bestimmt, wie stark Licht auf eine Stelle trifft.

Motion Vectors ergänzen diese räumlichen Informationen um die Bewegung zwischen den Frames. Damit kann das Training lernen, wie ein visuelles Detail über die Zeit stabil verfolgt werden sollte.

Nvidia nennt außerdem „Scene Semantics“. Semantik bedeutet in diesem Zusammenhang die inhaltliche Bedeutung eines Bildbereichs. Das Modell soll also nicht nur erkennen, dass an einer bestimmten Stelle eine Ansammlung heller und dunkler Pixel liegt, sondern möglichst verstehen, ob es sich um Haut, Stoff, Metall, Holz, Pflanzen oder ein anderes Objekt handelt. Ebenso sollen Beziehungen zwischen Objekten berücksichtigt werden. Zur „Lighting Semantics“ gehören laut Präsentation Richtung, Intensität und Stimmung des Lichts. Bei „Camera + Composition“ geht es um Blickwinkel, Bildausschnitt und Perspektive. Für Figuren nennt Nvidia Gesicht, Silhouette und Kleidung als Merkmale der Identität. Das Ziel ist erkennbar: Wenn das Modell das Bild verändert, soll es nicht nur lokal schöne Texturen produzieren, sondern die inhaltliche und künstlerische Struktur bewahren. Dabei ist eine wichtige technische Trennung nötig. Die Präsentation zeigt diese Informationen im Kontext des Trainings. Daraus folgt nicht automatisch, dass jedes Spiel zur Laufzeit Albedo, Normalen und sämtliche semantischen Daten als eigene Buffer an DLSS 5 liefern muss. Ein Modell kann im Training wesentlich detailliertere Ziel- und Hilfsinformationen erhalten als später bei der Inferenz. Gerade dadurch kann es lernen, bestimmte Eigenschaften später aus einem weniger umfangreichen Eingabesatz abzuleiten.

Wie gut das in der Praxis funktioniert, ist eine der entscheidenden offenen Fragen. Ungewöhnliche Materialien, stark stilisierte Spiele, halbtransparente Flächen, Partikel, extrem schnelle Kamerabewegungen oder Objekte, die plötzlich sichtbar werden, können eine semantische Interpretation erschweren. Nvidia zeigt in der Präsentation kontrollierte Beispiele. Ob dieselbe Stabilität in einem hektischen Spiel dauerhaft erreicht wird, muss später unabhängig geprüft werden.

Deterministisch und temporal konsistent? Eine Erklärung

Nvidia beschreibt DLSS 5 als „deterministic“ und „temporally consistent“. Beide Begriffe sind wichtig, weil sie einen direkten Unterschied zu frei generierten Bildern markieren. Deterministisch bedeutet im allgemeinen technischen Sinn, dass dieselbe Eingabe unter denselben Bedingungen immer zum selben Ergebnis führt. Im Kontext der Präsentation sollte der Begriff zunächst enger verstanden werden: DLSS 5 soll nicht bei jedem Frame eine zufällig andere plausible Variante derselben Szene erfinden. Die Augenform einer Figur soll nicht wechseln, ein Kratzer auf Metall soll nicht spontan verschwinden und ein Kleidungsdetail soll nicht zwischen verschiedenen Versionen springen. Aus den Unterlagen lässt sich dagegen nicht ableiten, ob zwei unterschiedliche GPUs, Treiberversionen oder Implementierungen bitgenau identische Ausgabepixel erzeugen. „Deterministisch“ ist hier vor allem eine Aussage gegen die freie probabilistische Variation klassischer Generationsmodelle. 

Temporale Konsistenz bedeutet, dass ein Detail über mehrere Frames hinweg stabil bleibt. Das klingt selbstverständlich, ist technisch aber schwierig. Ein einzelnes Standbild kann sehr überzeugend aussehen, während dieselbe Technik in Bewegung flimmert, Details verschiebt oder Oberflächen von Frame zu Frame leicht verändert. Für Spiele ist die Stabilität in Bewegung deshalb oft wichtiger als die Qualität eines einzelnen Screenshots. Ein besonders schwieriger Fall sind sogenannte Disocclusions. Eine Disocclusion entsteht, wenn durch eine Bewegung plötzlich ein Bildbereich sichtbar wird, der im vorherigen Frame verdeckt war. Dreht sich eine Figur beispielsweise zur Seite, können Teile der Kleidung oder des Hintergrunds neu erscheinen. Für diesen Bereich existiert keine direkt passende Historie aus dem vorherigen Frame. Temporale Verfahren müssen dort vorsichtig entscheiden, welche Informationen weiterverwendet werden können und wo ein neuer Bildinhalt aufgebaut werden muss.

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1DLSS 5 mit ReShade installieren: Anleitung, Einstellungen und kompatible Spiele012.5805-09-2026
2Энтузиаст создал открытую реализацию DLSS 5 Разработчик maanHimself представил OpenDLSS-NR. ...014.8426-09-2026
3DLSS 5 in Star Citizen ohne ReShade-Injektion: So habe ich es mit Magpie ausprobiert012.0614-09-2026
4LeakWatch KW 36/2026: Berlins Verwaltungsdaten im Darknet, DLSS 5 auf Wanderschaft und Leaks mit erstaunlich viel Substanz014.5306-09-2026
5Neue Analysten-Prognosen lassen Nvidia durch Decke schießen011.2327-08-2026
6Blizzard to take "a somewhat different approach" to level-scaling in Diablo 5, suggesting more influence from Diablo 2 than Diablo 4019.7323-09-2026
7Geschätzt wurden Millionen: NSA gibt Milliarden US-Dollar für KI-Prüfung aus022.6325-09-2026
8Die Bewertung der Nvidia-Aktie stürzt auf ein historisches Tief012.7122-09-2026
9SSD Next 1.0.105 wird zugänglicher: Neuer Consumer-Modus kommt nächste Woche, Advanced bleibt trotzdem vollständig erhalten09.0604-09-2026
10Bericht über Milliardendeal: Nvidia will Hugging Face kaufen011.5527-08-2026

Классификация: . Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 12.91. Источник: www.igorslab.de.