>_ der Promptbote
News vom 1.9.2026  ·  2104 neue Artikel heute  ·  14 Kanäle
Schlagwort: Deep LearningFilter entfernen ×
Google Research 1 Artikel Forschung
research.google · 01.09. 20:40

Kartierung globaler Methanemissionen aus dem All mittels Deep Learning

Durch den Einsatz fortschrittlicher Deep-Learning-Verfahren gelingt die präzise Kartierung globaler Methanemissionen direkt aus Satellitendaten. Diese KI-gestützte Analytik ermöglicht es, Emissionsquellen auf der Erdoberfläche hochauflösend zu identifizieren und zeitlich konsistent zu überwachen. Damit steht ein mächtiges Werkzeug zur Verfügung, um Treibhausgasströme weltweit transparent zu machen und gezielte Maßnahmen zum Klimaschutz zu steuern. Die automatisierte Auswertung großer Erdbeobachtungsdatenmengen besc

arXiv – cs.LG 274 Artikel Forschung
arxiv.org · 01.09. 06:00

SDF-bewusste Gewichtung: Adaptive Eikonal-Regularisierung für dreidimensionale Level-Set-PINNs

Bei physikalisch informierten neuronalen Netzen schlagen herkömmliche Verfahren zur dynamischen Verlustgewichtung fehl, wenn Eikonal-Regularisierungen auf Level-Set-Advektionen angewendet werden, da die korrekte Lösung dort einen von Null verschiedenen Residuenwert aufweisen kann. Zur Lösung dieses Problems wurde die SDF-aware Weighting Method entwickelt, welche ein auf Perzentilen basierendes Filtertor mit einem Gradienten-Norm-Verhältnis kombiniert. Diese Architektur ermöglicht es, Punkte mit physikalisch bedingt

arxiv.org · 01.09. 06:00

MultiHashFormer: Hash-basierte generative Sprachmodelle

Zur Reduzierung des enormen Parameterbedarfs großer Sprachmodelle wird ein neuartiger Architekturansatz namens MultiHashFormer vorgestellt, der autoregressive Prozesse mithilfe von Hash-Techniken ermöglicht. Dabei wird jedes Token durch eine eindeutige Hash-Signatur repräsentiert, die durch mehrere unabhängige Hash-Funktionen erzeugt und mittels eines speziellen Encoders sowie Decoders verarbeitet wird. Umfassende Evaluierungen über verschiedene Modellgrößen hinweg zeigen, dass dieser Ansatz standardmäßige Transfor

arxiv.org · 31.08. 06:00

GAN-Diff: Kopplung vortrainierter WGAN-GP-Merkmale mit konditionalen Diffusions-U-Nets

Ein neuartiger hybrider Ansatz kombiniert die Effizienz generativer adversarialer Netzwerke mit der Bildwiederherstellungsqualität von Diffusionsmodellen. Dabei werden intermediäre Merkmale eines eingefrorenen, vortrainierten WGAN-GP-Generators über Kreuzaufmerksamkeit in ein konditionales Diffusions-U-Net eingebunden. Die Evaluierung an Aufgaben wie Rauschunterdrückung und Super-Resolution zeigt signifikante Qualitätssteigerungen gegenüber den jeweiligen Eingangswertbasen. Durch gezielte Behebung von Instabilitäte

arxiv.org · 28.08. 06:00

Heterogene Ensembles mit Multimodalen Sprachmodellen für robuste klassenübergreifende Bildklassifikation

Ein neuartiger adaptiver Router nutzt multimodale große Sprachmodelle, um Bilder in heterogenen Ensembles dynamisch an passende Vision-Backbones weiterzuleiten. Durch die Kombination verschiedener Architekturen wie Convolutional Neural Networks, selbstüberwachten Repräsentationslernern und Vision-Language-Modellen auf einem einheitlichen Label-Raum wird die Generalisierungsfähigkeit über verschiedene visuelle Domänen hinweg deutlich gesteigert. Das System verbessert die Anpassungsfähigkeit durch einfache Prompt-Mod

arxiv.org · 28.08. 06:00

Nutzen von Code-Automorphismen für ein verbessertes syndrombasiertes neuronales Decodieren

Syndrombasiertes neuronales Decodieren stellt einen vielversprechenden Deep-Learning-Ansatz für die Fehlerkorrektur dar, weist jedoch Optimierungspotenzial auf. Durch den gezielten Einsatz von Code-Automorphismen lässt sich die Generalisierungsfähigkeit bestehender Modelle mittels Datenerweiterung während des Trainings und der Inferenz deutlich steigern. Dies ermöglicht es, mit kleinen Datensätzen eine Leistung zu erzielen, die der maximalen Wahrscheinlichkeitsdecodierung sehr nahekommt. Zudem zeigen die Ergebnisse

arxiv.org · 27.08. 06:00

TokEval: Eine Evaluierungssuite für Tokenizer

Tokenizer in Sprachmodellen werden häufig ohne umfassende Überprüfung ausgewählt, obwohl ihre Architektur die Modellfähigkeiten maßgeblich beeinflusst. Um diese Lücke zu schließen, wurde TokEval entwickelt, ein Framework zur Bewertung von Tokenizer-Eigenschaften, das über klassische Kompressionsraten hinausgeht und linguistische sowie strukturelle Merkmale analysiert. Durch kontrollierte Vortrainingsexperimente konnte nachgewiesen werden, dass spezifische intrinsische Metriken direkte Vorhersagen über die spätere M

arxiv.org · 27.08. 06:00

Gated Recurrent Transformers: Ausdrucksstarke Tiefe durch rekurrente Modulation

Zur Lösung des Konflikts zwischen Ausdrucksstärke und Speichereffizienz bei Transformer-Sprachmodellen wurde eine Architektur mit rekurrenter Tiefenwiederholung entwickelt. Dabei schliessen feste Vor- und Nachlaufblöcke einen einzelnen, mehrfach iterierten Kern ein, dessen Updates über leichtgewichtige Projektionen und elementweise Gating-Mechanismen gesteuert werden. Diese adaptive Wiederholung ermöglicht eine funktionale Spezialisierung bei deutlich reduziertem Speicherbedarf und geringerer Parameterzahl. Unter g

arxiv.org · 26.08. 06:00

GOD: Verbesserung der Generalisierung durch Deep Grafting für sequentielle Empfehlungssysteme

Sequentielle Empfehlungssysteme leiden häufig unter spärlichen und verrauschten Interaktionsverläufen, was ihre Generalisierbarkeit auf unbekannte Daten einschränkt. Herkömmliche Ansätze der Wissensdestillation trennen Lehrer- und Schülermodelle meist und gleichen lediglich deren Endausgaben ab, wodurch die genaue Ursache für Schwächen im Schülermodell verschleiert wird. Ein neuartiger Ansatz namens Graft-Oriented Distillation (GOD) löst dieses Problem durch eine komponentenbasierte Destillation auf Basis von Hybri

arxiv.org · 26.08. 06:00

Gated Recurrent Transformers: Ausdrucksstarke Tiefe durch rekursive Modulation in Transformer-Modellen

Zur Entschärfung des Konflikts zwischen Modellkapazität und Speichereffizienz bei Transformer-Architekturen wurde der Gated Recurrent Transformer entwickelt. Dieser Ansatz kombiniert feste Ein- und Ausgabeblöcke mit einem mehrfach iterierten, geteilten Kern, der über ein adaptives Torsions- und Projektionsverfahren gesteuert wird. Durch diese rekursive Tiefenwiederverwendung erzielt das Modell eine funktionale Spezialisierung, die bei gleicher Rechenleistung die Leistungsfähigkeit deutlich größerer Standardmodelle

arxiv.org · 26.08. 06:00

Von lokaler Geometrie zur globalen Pseudolabeling-Strategie für robustes Positive-Unlabeled-Lernen unter Covariate Shift

Die Erkennung von Covariate Shift ist entscheidend für stabile Computersituationssysteme, jedoch erfordert dieser Prozess meist aufwendig annotierte Daten aus beiden Verteilungen. Ein neuer Ansatz nutzt schwache Supervision durch Positive-Unlabeled-Lernen, um diese Einschränkung zu umgehen, und begegnet Datenüberlappungen durch ein geometriebasiertes Framework namens SPUNA. Dieses Verfahren nutzt lokale Mannigfaltigkeitsstrukturen visueller Merkmale, um verschobene Daten schrittweise zu identifizieren und zu klassi

arxiv.org · 26.08. 06:00

NAIMA: Semantikbewusste, RGB-gestützte Tiefen-Super-Resolution

Die geführte Tiefen-Super-Resolution kombiniert niedrig aufgelöste Tiefenkarten mit hoch aufgelösten RGB-Bildern zur Rekonstruktion feiner Strukturdetails. Herkömmliche Verfahren nutzen häufig vortrainierte Modelle, deren dekodierte Prädiktionen jedoch zu Artefakten und ungenauen Tiefengrenzen führen können. Ein neu entwickelter Ansatz umgeht dieses Problem durch die direkte Integration globaler kontextueller Semantikprädikate aus Vision-Transformer-Token-Embeddings. Mithilfe eines neuartigen Aufmerksamkeitsmoduls

arxiv.org · 24.08. 06:00

Latent Softmax für dateneffiziente, phonembasierte und mehrsprachige Spracherkennung

Bei der gemeinsamen Modellierung tonaler und nicht-tonaler Sprachen in der automatischen Spracherkennung führt die unterschiedliche Granularität der Annotationen zu Herausforderungen beim sprachübergreifenden Wissenstransfer. Ein neu entwickelter Ausgabelayer namens Latent Softmax löst dieses Problem, indem tonalisierte Vokale als Subklassen modelliert und nicht annotierte Basisvokale marginalisiert werden. Dadurch lassen sich akustische Informationen deutlich effektiver über Sprachgrenzen hinweg teilen, was die Fe

arxiv.org · 24.08. 06:00

CFM: Sprachausgerichtetes Konzept-Grundlagenmodell für visuelle Daten

Bestehende sprachausgerichtete Bild-Grundlagenmodelle zeigen starke Leistungen bei nachgelagerten Aufgaben, bleiben jedoch in ihren internen Repräsentationen und Entscheidungsprozessen undurchsichtig. Um diesem Problem zu begegnen, wurde ein neuartiges Konzept-Grundlagenmodell entwickelt, das feingranulare, für Menschen interpretierbare und räumlich verankerte Konzepte im Eingangsbild bereitstellt. Durch die Analyse lokaler Kookkurrenzabhängigkeiten lassen sich zudem konzeptuelle Beziehungen definieren, welche die

arxiv.org · 24.08. 06:00

MeltwaterBench: Deep Learning für das räumlich-zeitliche Downscaling von Oberflächenschmelzwasser

Zur präzisen Analyse der Schmelzprozesse auf dem grönländischen Eisschild wurde ein neuartiges Deep-Learning-Modell entwickelt, das hochauflösende tägliche Schmelzwasserkarten im 100-Meter-Raster generiert. Durch die Fusion von Fernerkundungsdaten wie Synthetic Aperture Radar und passiven Mikrowellendaten mit physikalischen Klimamodellen überwindet der Ansatz den bisherigen Kompromiss zwischen zeitlicher und räumlicher Auflösung. Die datengetriebene Methodik erreicht eine signifikant höhere Genauigkeit als herkömml

arxiv.org · 21.08. 06:00

Welche Negativbeispiele zählen? Adaptive Ähnlichkeitsabstände für das dichte Untertitel-Retrieval

Bei der kontrastiven Feinabstimmung von Modellen für das dichte Untertitel-Retrieval führt die gängige InfoNCE-Zielfunktion häufig zu einer vorzeitigen Sättigung und verschwindenden Gradienten. Als Lösung wurde ein neuer Ansatz namens HN-CLIP entwickelt, der die interne Textgeometrie des Textencoders nutzt, um pro negativem Beispiel adaptive Ähnlichkeitsabstände zu berechnen. Diese Methode benötigt keine zusätzlichen Trainingsdaten oder Offline-Vorverarbeitungen und erzeugt keinen Mehraufwand zur Inferenzzeit. Umfa

arxiv.org · 21.08. 06:00

Automatisierte Lernendenbewertung: Benchmarking von Machine-Learning- und Deep-Learning-Modellen zur EEG-basierten Vorhersage kognitiver Vertrautheit

Die objektive Messung von Lernprozessen anhand von Elektroenzephalografie-Daten stellt eine zentrale Herausforderung in der Bildungstechnologie dar. Eine aktuelle vergleichende Analyse von fünfzehn Machine-Learning- und Deep-Learning-Modellen untersucht die Vorhersage kognitiver Vertrautheit bei Gesichtern und mathematischen Gleichungen auf Basis spektraler EEG-Merkmale. Die Ergebnisse demonstrieren, dass konventionelle Validierungsmethoden aufgrund temporaler Datenlecks zu unrealistisch hohen Klassifikationsleistu

arxiv.org · 21.08. 06:00

Unsicherheitsbewusste kompositorische Lokalisierung und Platzierungsbewertung von Kathetern und Schläuchen in Thoraxröntgenaufnahmen

Die automatisierte Beurteilung von Kathetern und Tuben in Röntgenaufnahmen des Brustkorbs ist sicherheitskritisch, jedoch fehleranfällig. Ein neues kompositorisches Framework namens UCompCXR kombiniert lokale Fragmenterkennung, graphenbasiertes Clustering und präzisionsgewichtete Gauß-Schätzung, um die Platzierung einzelner medizinischer Geräte präzise zu bewerten. Evaluierungen auf Basis eines umfangreichen Datensatzes zeigen eine deutlich höhere Detektionsrate bei stark reduzierten Fehlalarmen im Vergleich zu her

arxiv.org · 21.08. 06:00

Von Genauigkeit zur Auditierbarkeit: Eine Übersicht über Determinismus in Finanz-KI-Systemen

Der Einsatz von maschinellem Lernen in regulierten Finanzbereichen offenbart kritische Schwachstellen bei der algorithmischen Reproduzierbarkeit. Insbesondere moderne Deep-Neural-Networks und generative KI führen durch hardware- und architekturbedingten Nondeterminismus zu Abweichungen, die von tabellarischen Modellen über Graphennetzwerke bis hin zu agentenbasierten LLM-Workflows reichen. Eine aktuelle Untersuchung analysiert diese Reproduzierbarkeitsfehler anhand empirischer Experimente zu Kreditscoring, Betrugse

arxiv.org · 21.08. 06:00

MambaX-Net: Duales Mamba-verstärktes Cross-Attention-Netzwerk zur longitudinalen Prostata-MRT-Segmentierung

Für die automatisierte Verlaufsbeobachtung von Prostatakrebs mittels serieller MRT wurde eine neue semisuwervisierte Architektur zur 3D-Segmentierung entwickelt. Das System nutzt MRT-Daten sowie die Segmentierungsmaske des vorherigen Zeitpunkts, um zeitliche Veränderungen und räumliche Abhängigkeiten effizient zu erfassen. Ein integriertes Mamba-verstärktes Cross-Attention-Modul sowie ein Formextraktionsmodul verbessern dabei die anatomische Zonendefinition. Mithilfe einer semisubervisierten Selbsttrainingsstrategi

arxiv.org · 21.08. 06:00

Entkopplung hoher und niedriger Frequenzen für detailgetreue Bildgenerierung

Latente generative Modelle stehen häufig vor der Herausforderung, feine Details und Texturen in Bildern präzise zu rekonstruieren, da herkömmliche Lernziele grobe Strukturen priorisieren. Als Lösungsansatz wurde ein entkoppelter Frequenzband-Tokenizer entwickelt, der das Erlernen von Einbettungen für niedrige und hohe Frequenzen explizit trennt. Diese Entkopplung ermöglicht in Kombination mit latenten Diffusionsmodellen eine deutlich schärfere und realistischere Bildsynthese. Dadurch bleibt die globale Konsistenz g

arxiv.org · 21.08. 06:00

Grafisches Design interpretierbarer Architekturen

Zur besseren Darstellung und Vergleichbarkeit von interpretierbaren KI-Architekturen wurde eine neue grafische Notation auf Basis der Penrose-Tensordotation entwickelt. Diese Methode bietet eine globale visuelle Übersicht über komplexe Netzwerkstrukturen und ermöglicht gleichzeitig eine direkte, eins-zu-eins-Abbildung auf PyTorch-Einsum-Code. Damit lassen sich gängige interpretierbare Modelle wie Konzept-Engpässe, Sparse Probes und Prototypen-Netzwerke präzise dokumentieren und reproduzieren. Auch fortgeschrittene

arxiv.org · 21.08. 06:00

Geometrische und verhaltensbezogene Schichtung in Transformer-Residualströmen

Untersuchungen an trainierten Transformer-Modellen zeigen, dass die Vorhersagerichtung als inhaltsdefinierter, privilegierter Anker im Residualstrom fungiert. Gemessen an diesem Anker ist die Variation des Residualstroms geometrisch und verhaltensbezogen nach ihrer Nähe zur Vorhersage geschichtet, was sich über verschiedene Modellarchitekturen und Größen hinweg bestätigt. Eine schmale, skaleninvariante Vorhersageschnittstelle konzentriert die für das Auslesen relevante Struktur, während der distale Bereich mit der

arxiv.org · 20.08. 06:00

STAND: Semantische Verankerungsbeschränkung mit feingranularer Disambiguierung für die Änderungserkennung in der Fernerkundung

Für die präzise Beschreibung von Veränderungen in Fernerkundungsbildern wurde ein neuartiger Ansatz entwickelt, der grundlegende Mehrdeutigkeiten bezüglich Perspektiven, Maßstäben und Vorwissen systematisch adressiert. Das Verfahren nutzt eine interpretierbare Beschränkung zur Regularisierung temporaler Repräsentationen sowie ein duales Disambiguierungsmodul, welches globale Kontextaggregation mit frequenzbasierten Aufmerksamkeitsmechanismen kombiniert. Zusätzlich verankert ein semantisches Konzeptmodul sprachliche

arxiv.org · 20.08. 06:00

SHANG++: Robuste stochastische Beschleunigung unter multiplikativem Rauschen

Unter den Bedingungen multiplikativen Rauschens erweisen sich klassische Beschleunigungsverfahren oft als instabil und neigen zur Divergenz. Als Lösung wurden zwei neue stochastische Gradientenabstiegsverfahren entwickelt, die auf der Diskretisierung des Hess-getriebenen Nesterov-Gradientenflusses basieren. Insbesondere die erweiterte Variante SHANG++ integriert eine zusätzliche Dämpfungskorrektur, wodurch eine schnellere Konvergenz bei gleichzeitig deutlich erhöhter Rauschrobuste erzielt wird. Umfangreiche theoret

arxiv.org · 19.08. 06:00

Der Null-Token weiß Bescheid: Reduzierung nachrichtenfreier Halluzinationen in ASR und NMT

Moderne Encoder-Decoder-Architekturen neigen dazu, flüssigen Text zu generieren, selbst wenn die Eingabe keine verwertbaren Informationen enthält. Eine aktuelle Untersuchung analysiert dieses Fehlverhalten bei automatischer Spracherkennung und maschineller Übersetzung anhand reservierter Null-Tokens und deren Beendigungsscores. Die Auswertung zeigt, dass diese internen Signale zwar ein abstimmbares Potenzial zur Vermeidung von Halluzinationen bieten, standardmäßige Dekodierungsverfahren dieses jedoch unzureichend n

arxiv.org · 19.08. 06:00

RecurrentGPT: Ausdrucksstärke durch rekursive Modulation in Transformern

Skalierte Transformer-Sprachmodelle stehen in einem inhärenten Spannungsfeld zwischen Ausdrucksstärke und Speichereffizienz. Ein neuer Ansatz löst dieses Dilemma durch eine rekursive Architektur, bei der ein einzelner, mehrfach iterierter Kern zwischen feste Anfangs- und Endblöcke geschaltet wird. Mithilfe einer leichten Projektion und eines elementweisen Aktualisierungsgatters moduliert das System den rekursiven Zustand dynamisch, wodurch funktionale Vielfalt bei geringem Speicherbedarf erreicht wird. Unter gleich

arxiv.org · 19.08. 06:00

CHM-Net: Ein makro-mikro-basiertes Modellierungsnetzwerk auf Basis von Center Heatmaps zur MRT-basierten Stratifizierung der mikrobiellen Dichte

Zur nicht-invasiven Bestimmung der mikrobiellen Dichte mittels multimodaler Magnetresonanztomographie wurde ein neuartiger Ansatz zur patientenbezogenen Repräsentationslernen entwickelt. Das vorgestellte Netzwerk verknüpft bildgebende Phänotypen über zentrumslenkende Heatmaps direkt mit mikrobiellen Zuständen, um makro- und mikrostrukturelle Evidenzen für präzisere Vorhersagen zu aggregieren. Umfangreiche empirische Auswertungen auf spezialisierten Datensätzen belegen eine signifikante Leistungssteigerung gegenüber

arxiv.org · 19.08. 06:00

SEAM: Shortcut-bewusste Echtzeiterkennung von skriptbasierten und spontanen Sprachmustern für Interview-Sicherheitsvorkehrungen

Ein neues Framework zur Erkennung skriptbasierter versus spontaner Sprache in Echtzeit adressiert das Problem irreführender Shortcuts, die häufig durch Korpusmerkmale, Kanalbedingungen oder Aufnahme-Artefakte entstehen. Durch eine Kombination aus einheitlicher Vorverarbeitung, Shortcut-bewusstem Sampling, Nicht-Sprach-Augmentation und einem kompakten DistilHuBERT-Backbone erreicht das Modell eine hohe Güte bei externen Tests. Post-Training-Quantisierung reduziert den Speicherbedarf des Modells zudem deutlich auf 41

arxiv.org · 19.08. 06:00

Speicher durch Design: Probabilistische Sequenzschichten

Es wird ein neues Gestaltungsrahmenwerk vorgestellt, das effiziente rekurrente Sequenzabbildungen aus expliziten Speicherannahmen ableitet. Durch exaktes Bayes-Filtern schreibt ein solches Modell Evidenzen in den Speicher, wobei eine abfrageabhängige Auslese eine prädiktive Verteilung erzeugt. Die lineare-gaußsche Instanziierung, die sogenannte Bayes-Schicht, propagiert sowohl Mittelwert als auch Kovarianz, um Unsicherheiten zu verfolgen und die Speicherung zu optimieren. Dieser Ansatz vereint diverse sub-quadratis

arxiv.org · 19.08. 06:00

Nichtlineare GENERIC-eingebettete neuronale Netze zur Modellierung thermodynamischer Dynamiken

Mit den sogenannten N-GENNs wurde ein Deep-Learning-Framework zur Entdeckung von Evolutionsgleichungen entwickelt, die dem formalen GENERIC-Rahmenwerk für Nicht-Gleichgewichtssysteme folgen. Der Ansatz integriert verallgemeinerte Gradientenflüsse über konvexe Dissipationspotentiale, wodurch auch nicht-quadratische Dissipationsstrukturen abgebildet werden können. Durch gezielte Reparametrisierungen des reversiblen Operators und des Dissipationspotentials wird die thermodynamische Konsistenz gemäß dem ersten und zwei

arxiv.org · 19.08. 06:00

FairNVT: Faire Klassifikation durch Rauschinjektion in Vision Transformern

Es wird ein leichtgewichtiger Ansatz zur Entzerrung vorrainierter Transformer-Encoder vorgestellt, der die Fairness von Vorhersagen verbessert, ohne die ursprüngliche Leistungsfähigkeit zu beeinträchtigen. Durch den Einsatz leichter Adapter werden aufgabenrelevante und sensible Einbettungen erzeugt, wobei letztere gezielt mit kalibriertem Gaußschen Rauschen versehen und mit der Hauptrepräsentation fusioniert werden. In Kombination mit Orthogonalitätsbeschränkungen und einer Fairness-Regularisierung gelingt es, die

arxiv.org · 19.08. 06:00

SegWithU: Unsicherheit als Störenergie für die medizinische Bildsegmentierung in einem einzigen Durchlauf

Für den klinischen Einsatz in der medizinischen Bildsegmentierung ist eine verlässliche Bestimmung der Modellunsicherheit essenziell. Bisherige hocheffiziente Verfahren, die mit einem einzigen Vorwärtsdurchlauf auskommen, leiden häufig unter ungenauen Fehlerbewertungen oder restriktiven Annahmen im Merkmalsraum. Ein neuer post-hoc-Ansatz erweitert ein eingefrorenes vortrainiertes Segmentierungsmodell um einen leichtgewichtigen Unsicherheitskopf, der Zwischenmerkmale nutzt und Unsicherheit als Störenergie in einem k

arxiv.org · 19.08. 06:00

Von Diffusion zu Flow: Effiziente Bewegungserzeugung in MotionGPT3

In einer kontrollierten empirischen Studie im Rahmen der MotionGPT3-Architektur wurde untersucht, wie sich rectifizierte Flussziele im Vergleich zu herkömmlichen Diffusionsverfahren auf die textbasierte Generierung menschlicher Bewegungen auswirken. Die Ergebnisse auf Basis des HumanML3D-Datensatzes zeigen, dass Fluss-basierte Modelle in deutlich weniger Trainingsepochen konvergieren und eine höhere Inferenz-Effizienz bei gleichbleibender oder besserer Qualität erreichen. Damit lassen sich die bekannten Vorteile vo

arxiv.org · 19.08. 06:00

SparsePixels: Effiziente Faltungsoperationen für spärliche Daten auf FPGAs

Standardmäßige neuronale Faltungsnetze auf FPGAs leiden häufig unter hoher Latenz, da Berechnungen unabhängig vom Informationsgehalt auf alle Eingangspixel angewendet werden. Ein neu eingeführter Ansatz namens SparsePixels adressiert dieses Ineffizienzproblem, indem er gezielt nur eine definierte Teilmenge aktiver Pixel verarbeitet und irrelevante Regionen ignoriert. Dadurch lässt sich der Rechen- und Speicheraufwand drastisch reduzieren, während die Latenz durch ein festes Pixelbudget zur Laufzeit konstant und dat

arxiv.org · 19.08. 06:00

Inverse Probleme partieller Differentialgleichungen mit Koeffizientensprüngen durch zweistufiges physik-informiertes Deep Learning und statistische Mischmodelle

Es wird ein zweistufiger, physik-informierter Deep-Learning-Ansatz zur Lösung inverser Probleme bei partiellen Differentialgleichungen mit unstetigen Koeffizienten vorgestellt. In der ersten Phase approximiert eine neuronale Architektur die Lösung sowie ein entspanntes Surrogat des Koeffizientenfeldes, während statistische Lernverfahren und Markov-Chain-Modelle die Anzahl der Regimes und Übergangsbereiche ermitteln. Die zweite Phase reformuliert das inverse Problem als optimierten Schätzer, welcher den Koeffiziente

arxiv.org · 18.08. 06:00

GALA: Generationsbewusstes, korss-modales Alignment für die Text-zu-Zeitreihen-Synthese

Die Synthese von Zeitreihen aus natürlichsprachlichen Beschreibungen erfordert präzise Steuerungsm机制echanismen, wobei bisherige Ansätze oft unter unzureichend angepassten Texteinbettungen leiden. Ein neu entwickelter zweistufiger Ansatz namens GALA koppelt vortrainierte Text-Encoder kontrastiv mit Zeitreihen-Grundlagenmodellen in einem gemeinsamen Einbettungsraum. Durch den Einsatz eines zusätzlichen generativen Verlusts während der Angleichung und die anschließende Steuerung eines Flow-Matching-Generators werden s

arxiv.org · 17.08. 06:00

Von der Erholung zum Abfall: Wie das Aktions-Post-Training die Decodierbarkeit tiefer Schichten in Vision-Language-Modellen beeinflusst

Eine Untersuchung an Open-Source-Modellen zeigt, wie sich das Aktions-Post-Training zum Aufbau von Vision-Language-Action-Modellen auf das räumliche Verständnis und die Tiefenwahrnehmung auswirkt. Während die Decodierbarkeit von Tiefeninformationen in den Modellen durchgehend sinkt, bricht sie in den späten Schichten drastisch ein. Kausale Analysen lokalisieren die Ursache hierfür in Interferenzen der späten Multilayer-Perzeptron-Schichten, da entsprechende Ablationen den Leistungsabfall weitgehend rückgängig mache

arxiv.org · 17.08. 06:00

Ein systematischer Vergleich von Trainingszielen für die Out-of-Distribution-Erkennung in der Bildklassifikation

Die Erkennung von Out-of-Distribution-Daten ist insbesondere in sicherheitskritischen Anwendungen von entscheidender Bedeutung, wobei der Einfluss spezifischer Trainingsziele auf dieses Verhalten bislang unzureichend erforscht ist. In einer aktuellen Untersuchung wurden vier gängige Ansätze – darunter Cross-Entropy Loss, Prototype Loss, Triplet Loss und Average Precision Loss – unter standardisierten Protokollen systematisch miteinander verglichen. Die Ergebnisse zeigen, dass die Kreuzentropie-Verlustfunktion insge

arxiv.org · 17.08. 06:00

XtraLight-MedMamba zur Klassifikation neoplastischer tubulärer Adenome

Für eine präzisere Risikostratifizierung von Darmpolypen während Koloskopien wurde ein extrem leichtgewichtiges Deep-Learning-Framework auf Basis von State-Space-Modellen entwickelt. Die Architektur kombiniert einen flachen ConvNeXt-basierten Merkmalsextraktor mit parallelen Vision-Mamba-Blöcken sowie einem speziellen Aufmerksamkeitsmodul, um lokale Texturen und globale Kontextstrukturen effizient zu modellieren. Durch den Einsatz eines optimierten Klassifikators gelingt eine erhebliche Parameterreduktion bei gleic

arxiv.org · 17.08. 06:00

MLCC: Ein Ansatz zur Staukontrolle zur Beschleunigung des ML-Trainings

Es wurde ein neuartiges Verfahren zur Staukontrolle entwickelt, das darauf abzielt, das Training von Deep-Neural-Network-Modellen in gemeinsam genutzten GPU-Clustern dezentral zu beschleunigen. Durch die gezielte Skalierung von Senderaten werden Kommunikations- und Berechnungsphasen verschiedener Datenströme intelligent miteinander verschränkt, um Netzwerkkonflikte zu minimieren. Die Integration dieses Prinzips in bestehende Protokolle erfordert nur minimalen Implementierungsaufwand und führt in Testumgebungen sowi

arxiv.org · 14.08. 06:00

CookVoice: Einheitliches Framework für stilkontrollierbare multimodale menschliche Stimmgenerierung

CookVoice ist ein neuartiges, einheitliches Framework zur multimodalen Erzeugung und Bearbeitung menschlicher Stimmen, das Sprache und Gesang in einem einzigen Modell vereint. Durch die Dekomposition in Inhalt, Prosodie und Stil sowie eine präzise Ausrichtungsstrategie auf Frame-Ebene ermöglicht das System eine feingranulare Steuerung für vielfältige Aufgaben wie Text-to-Speech, Voice Cloning und Stimmtransformation. Mit lediglich rund 43,5 Millionen Parametern und einer effizienten Inferenz in nur wenigen ODE-Schr

arxiv.org · 14.08. 06:00

SAF3R: Dynamische Sparse Attention für Feed-Forward-3D-Rekonstruktions-Transformer

Feed-Forward-3D-Rekonstruktions-Transformer stoßen bei der Skalierung auf lange Bildsequenzen aufgrund der quadratischen Komplexität der Cross-View-Attention an erhebliche Rechengrenzen. Eine detaillierte Analyse offenbart jedoch, dass die Aufmerksamkeitsmuster über Schichten und Köpfe hinweg extrem sparsam, dynamisch und heterogen ausgeprägt sind. Darauf aufbauend wurde ein trainingsfreies Framework entwickelt, das Offline-Profiling mit einer effizienten Online-Adaption kombiniert, um diese inhärente Sparsität aus

arxiv.org · 13.08. 06:00

Neuer Ansatz zur medizinischen Landmarkenlokalisierung mittels prototypenbasierter progressiver Versatzkorrektur

Für eine präzise quantitative Bildanalyse in der Medizin wurde ein neues, parameterökonomisches Verfahren zur Landmarkenlokalisation entwickelt. Das System kombiniert eine mehrskalige dynamische Perzeption zur iterativen Optimierung mit einem prototypenbasierten Lernmechanismus, der anatomisch ähnliche Muster durch robuste lokale Semantik auflöst. Eine neuartige fehlerbewusste Zuverlässigkeitsregularisierung stabilisiert dabei das Modelltraining und gewährleistet eine hohe Genauigkeit bei gleichzeitig geringer Mode

arxiv.org · 13.08. 06:00

WBMM: Fenstermaschinen-Batch-Matrixmultiplikation für effiziente Faltungen mit großem Rezeptivfeld

Große Kernel-Faltungen leiden oft unter ineffizientem Speicherzugriff bei wachsender Kernel-Größe, was die Leistung mindert. Ein neuer Ansatz namens Windowed Batch Matrix Multiplication (WBMM) teilt Eingaben in zusammenhängende Fenster auf und nutzt eine kompakte Positionstabelle, um regelmäßige Speicherzugriffe über Batched Matrix Multiplications zu ermöglichen. Dadurch steigt der Durchsatz von WBMM im Gegensatz zu herkömmlichen tiefenbezogenen Faltungen bei größeren Fenstern sogar an. In Benchmarks zeigt der Oper

arxiv.org · 13.08. 06:00

LLM-Router: Intelligentes Routing über Prefill-Aktivierungen

Bisherige Ansätze zum Routing von Sprachmodellen basieren meist auf semantischen Anfrage-Merkmalen oder manuellen Heuristiken, vernachlässigen jedoch modellspezifische Leistungsgrenzen. Ein neuer Ansatz nutzt stattdessen interne Modellaktivierungen im Residualstrom als treffsichere Entscheidungsgrundlage. Durch eine Trennung von Encoder und Zielmodell lässt sich die Leistungsfähigkeit offener und geschlossener Architekturen präzise vorhersagen. Mithilfe eines gemeinsamen Multi-Output-Netzwerks auf Basis kombinierte

arxiv.org · 12.08. 06:00

TSCoNet: Ein zweistufiges Copula-CNN-LSTM für unsicherheitsbasierte raumzeitliche Vorhersagen

Für zuverlässige Vorhersagen miteinander verknüpfter Umweltvariablen über verschiedene Standorte hinweg sind neben präzisen Prognosen auch belastbare Aussagen zur Unsicherheit erforderlich. Ein neues zweistufiges Modell kombiniert konvolutionale und rekurrente neuronale Netze mit einer Gauß-Copula, um mehrere Variablen simultan über Raum und Zeit vorherzusagen und gleichzeitig die Vorhersageunsicherheit zu quantifizieren. Das Verfahren ermittelt zunächst präzise Mittelwertprognosen und verfeinert diese in einem zwe

arxiv.org · 12.08. 06:00

Auswahl eines JPEG-Dekoders für PyTorch-DataLoaders: Workload-spezifischer Durchsatz auf vier CPUs

Ein aktueller Benchmark untersucht die Leistung von zwölf verschiedenen Python-JPEG-Dekodern im Zusammenspiel mit PyTorch-DataLoaders auf unterschiedlichen Cloud-Architekturen. Die Untersuchung zeigt, dass die Wahl des optimalen Dekoders stark vom zugrundeliegenden Bildmaterial und der verwendeten CPU-Plattform abhängt. Während bei hochauflösenden Kameraaufnahmen die Geschwindigkeitsunterschiede gering ausfallen, erreichen optimierte Bibliotheken bei gemischten Workloads signifikante Leistungssteigerungen gegenüber

arxiv.org · 12.08. 06:00

RankFormer: Ein Vorschlag-und-Auswahl-Transformer für multimodale Trajektorienvorhersage in Multi-Agenten-Systemen

Für das autonome Fahren und die Verkehrssicherheit ist die präzise Vorhersage von Verkehrsteilnehmer-Trajektorien essenziell, aber durch komplexe Interaktionen und Intentionsvielfalt hochgradig anspruchsvoll. Herkömmliche Deep-Learning-Ansätze basieren oft auf Graph-Netzwerken oder manuell gelabelten Intentionen. Als Alternative wurde ein reines Transformer-Modell entwickelt, das temporale Abhängigkeiten und räumliche Interaktionen verarbeitet. Durch eine parallele Decodierung nach dem Prinzip des Vorschlagens und

arxiv.org · 11.08. 06:00

bioMoR: Biologisch gesteuerte Mixture-of-Recursions für effizientes genomisches Lernen

Es wurde ein neues Framework zur Analyse hochdimensionaler Omics-Daten vorgestellt, das biologisches Fachwissen in eine Mixture-of-Recursions-Architektur integriert. Durch graphbasierten Informationsaustausch, strukturelle Biases und einen graphbewussten Router wird die Rekursionstiefe adaptiv gesteuert, um relevante Gene und Signalwege präzise zu verarbeiten. Evaluierungen über acht Benchmarks zeigen signifikante Leistungssteigerungen bei gleichzeitiger Reduktion von Parametern und Rechenaufwand im Vergleich zu he

arxiv.org · 11.08. 06:00

Faehigkeitsherkunft in Sprachmodellen: Eine Fallstudie zum sozialen Schliessen

Mithilfe von Trainingsdatenattribution wurde untersucht, welche Bereiche des Vortrainingskorpus spezifische Faehigkeiten wie soziales Schliessen im Vergleich zu STEM-Aufgaben in grossen Sprachmodellen ermoeglichen. Durch gradientenbasierte Attributionsverfahren und Aggregation ueber eine strukturierte Themen- und Format-Taxonomie zeigt sich, dass soziales und logisch-technisches Schliessen auf qualitativ unterschiedliche Korpusregionen zugreifen. Gezieltes Machine Unlearning bestaetigt diesen Zusammenhang kausal, d

Hacker News – AI/LLM 14 Artikel Community
github.com · 28.08. 16:39

Lokale Zeitreihenprognose mit KI und erklärbaren Modellen

Ein neues Open-Source-Projekt ermöglicht die Durchführung von Zeitreihenvorhersagen vollständig auf lokalen Endgeräten. Die Architektur basiert auf einem hybriden Modell aus Temporal Convolutional Networks, Long Short-Term Memory und Attention-Mechanismen, implementiert in PyTorch. Ergänzt wird das System durch Interpretierbarkeitswerkzeuge auf Basis von Captum sowie die Anbindung an Open-Source-Sprachmodelle, um die Ergebnisse für Anwender verständlich aufzubereiten.

openrating.io · 27.08. 12:30

Der aktuelle Stand von KI-Chips

Die Entwicklung von spezialisierten Halbleitern für künstliche Intelligenz schreitet rasant voran und bildet das fundamentale Rückgrat moderner Deep-Learning-Infrastrukturen. Dabei stehen insbesondere die Steigerung der Rechenleistung, die Energieeffizienz und die Optimierung für大规模 Large Language Models im Fokus der Halbleiterindustrie. Neue Architekturen zielen darauf ab, sowohl das Training als auch die Inferenzprozesse in Rechenzentren und Edge-Geräten deutlich zu beschleunigen. Der Markt ist geprägt von einem

jepeake.com · 23.08. 04:25

Architekturen von KI-Chips im Überblick

Der Artikel beleuchtet die verschiedenen Hardware-Architekturen und spezialisierten Prozessoren, die für das Training und den Betrieb moderner künstlicher Intelligenz entwickelt wurden. Im Fokus stehen dabei etablierte Grafikprozessoren ebenso wie maßgeschneiderte Tensor-Prozessoren und alternative Rechenparadigmen. Die Untersuchung verdeutlicht, wie unterschiedliche Halbleiterdesigns auf die enormen Rechenanforderungen und Skalierungsprobleme im Bereich des maschinellen Lernens optimiert sind.

arxiv.org · 20.08. 14:06

KI-Photoscanner von Google ermittelt Körperfettanteil durch Selfies

Ein neu entwickeltes Deep-Learning-Verfahren ermöglicht die präzise Bestimmung der Körperzusammensetzung direkt über Smartphone-Aufnahmen, um die Grenzen traditioneller BMI-Messungen zu überwinden. Das System wurde anhand umfangreicher medizinischer Datensätze vortrainiert und validiert, um eine skalierbare Alternative zu klinischen Goldstandard-Methoden wie der Röntgendensitometrie bereitzustellen. Damit lässt sich das kardio-metabolische Gesundheitsrisiko künftig unkompliziert und breit flächendeckend einschätzen

netflixtechblog.com · 15.08. 14:56

GenRec: Auf dem Weg zu LLM-nativen Empfehlungssystemen

Die Weiterentwicklung klassischer Empfehlungsarchitekturen hin zu vollständig auf Large Language Models basierenden Systemen steht im Fokus aktueller Forschungs- und Entwicklungsanstrengungen. Der vorgestellte Ansatz GenRec zielt darauf ab, generative Sprachmodelle tief in den Kern von Personalisierungs- und Retrieval-Pipelines zu integrieren. Durch diesen nativen Paradigmenwechsel sollen komplexe Nutzerpräferenzen und Kontextinformationen präziser verarbeitet werden als mit traditionellen kollaborativen Filterverf

youtube.com · 12.08. 18:46

Werden grosse Sprachmodelle oft fälschlicherweise für bewusst oder intelligent gehalten?

Die Debatte um den vermeintlichen Besitz von Bewusstsein, Intelligenz und Persönlichkeit bei modernen grossen Sprachmodellen beleuchtet die psychologischen und technischen Aspekte der Mensch-Maschine-Interaktion. Anhand aktueller Entwicklungen im Bereich leistungsstarker KI-Architekturen wird analysiert, wie fortschrittliche Textgenerierung und syntaktische Fähigkeiten fälschlicherweise als echte kognitive Prozesse interpretiert werden. Dabei stehen die Mechanismen im Fokus, die bei Anwendern den Eindruck von Inten

blog.georeactor.com · 11.08. 06:22

Faltung von Prionen-Proteinen mit Methoden der künstlichen Intelligenz

Aktuelle Forschungsansätze nutzen Methoden der künstlichen Intelligenz und des Deep Learning, um die Proteinfaltung und strukturelle Dynamik von Prionen zu untersuchen. Mithilfe von offenen Open-Source-Modellen und spezialisierten Klassifikatoren lassen sich Sequenzen analysieren sowie antimikrobielle Peptide und alternative Proteinkonformationen identifizieren. Diese virtuellen Simulationsumgebungen tragen dazu bei, die komplexen Mechanismen der Fehlfaltung und deren Übergänge besser zu verstehen, ohne auf physisc

techxplore.com · 11.08. 00:04

KI-Framework auf Basis der Kognitionswissenschaften steigert Effizienz bei Aufgaben

Forscher haben ein neues Framework für Künstliche Intelligenz vorgestellt, das auf Erkenntnissen der Kognitionswissenschaften beruht und komplexe Aufgaben deutlich effizienter bearbeiten kann als herkömmliche Modelle. Der Ansatz kombiniert traditionelle neuronale Netze mit kognitiven Architekturprinzipien, um Entscheidungsprozesse und Problemlösungskompetenzen zu optimieren. Dadurch soll die Recheneffizienz gesteigert und gleichzeitig der Ressourcenbedarf bei der Ausführung spezifischer Arbeitslasten minimiert werd

wan3.io · 10.08. 09:57

Wan 3.0 AI – Multimodale Videogenerierung

Das neue multimodale System Wan 3.0 AI ermöglicht die Erzeugung bis zu 30 Sekunden langer Videos aus einer Kombination von Text, Bildern, Audio, bestehenden Videos und Dokumenten. Die Architektur gewährleistet dabei eine hohe Konsistenz über alle Referenzquellen hinweg sowie eine detailgetreue und realistische Darstellung in jedem einzelnen Frame. Durch die Integration verschiedenster Eingabemodalitäten werden neue Ansätze für die automatisierte und präzise audiovisuelle Content-Produktion geschaffen.

lesswrong.com · 10.08. 09:01

Wie man ein Forscher für KI-Sicherheit wird

Der Einstieg in die Sicherheitsforschung für künstliche Intelligenz erfordert gezieltes Engagement, fundierte technische Kenntnisse und aktives Networking. Neben Programmierkenntnissen in Python und tiefem Lernen mit PyTorch sind mathematische Grundlagen sowie praktische Git- und Docker-Erfahrung essenziell. Da klassische Stellenmärkte in diesem Bereich weniger stark vertreten sind, erfolgt der Jobeinstieg meist über direkte Kontakte, Fellowships und das Veröffentlichen eigener Forschungsbeiträge. Angehende Forsche

youtube.com · 09.08. 02:56

Ein Pionier der modernen künstlichen Intelligenz und seine frühen Arbeiten

Im Rahmen eines exklusiven Interviews gibt der für wegweisende Entwicklungen im Bereich des Deep Learning und der künstlichen Intelligenz bekannte Forscher Einblicke in seine historischen Arbeiten. Dabei werden die mathematischen und architektonischen Grundlagen beleuchtet, die maßgeblich zur heutigen Verbreitung generativer KI-Modelle beigetragen haben. Die Diskussion spannt den Bogen von den Anfängen neuronaler Netzwerke bis hin zu den technologischen Meilensteinen, die moderne Systeme prägen.

gilesthomas.com · 31.07. 02:16

Warum übertreffen die Gewichte von OpenAIs GPT-2 meine eigenen? Teil 3: Tests zum Over-Training

In der Untersuchung wird der Frage nachgegangen, ob ein absichtliches Over-Training bei selbst entwickelten Sprachmodellen im Stil von GPT-2 ausreicht, um die Fähigkeiten der Originalmodelle hinsichtlich der Befehlsausführung zu erreichen. Dabei stehen gezielte Tests und Analysen im Fokus, um die Auswirkungen des Trainingsprozesses auf das Verhalten und die Leistung kleinerer Modellarchitekturen nachzuvollziehen. Diese experimentelle Arbeit trägt zum besseren Verständnis der Faktoren bei, die für die Qualität und I

blog.bytebytego.com · 28.07. 13:57

Wie Nvidia offene Modelle für das Zeitalter der Künstlichen Intelligenz entwickelt

Ein Einblick in die Entwicklung offener Modelle verdeutlicht die architektonischen Hintergründe und die strategischen Beweggründe hinter der Bereitstellung quelloffener Technologie im Bereich der angewandten Deep-Learning-Forschung. Die Betrachtung beleuchtet, wie technische Entscheidungen getroffen werden, um moderne KI-Systeme leistungsfähig und zugänglich zu gestalten. Dabei wird aufgezeigt, welche Rolle offene Architekturen für die Weiterentwicklung der Branche spielen.

news.ycombinator.com · 25.07. 11:20

Wird neuromorphes Computing die traditionelle KI ersetzen?

Aktuelle Deep-Learning-Systeme und Sprachmodelle basieren auf massivem Rechenaufwand, kontinuierlicher Aktivierung aller Neuronen und globalem Backpropagation-Training. Im Gegensatz dazu arbeitet das menschliche Gehirn extrem sparsam, ereignisbasiert und dezentral mit lokalen Anpassungsprozessen. Angesichts physikalischer und energetischer Grenzen der reinen Skalierungsstrategie stellt sich die Frage nach radikalen Effizienzsteigerungen. Ob neuromorphes Computing langfristig eine echte Alternative darstellt oder no

Latent Space 1 Artikel Community
latent.space · 26.08. 17:15

Grundlagenmodelle für die physikalische Welt

Während für Textverarbeitung bereits hochentwickelte Sprachmodelle existieren, fehlt ein vergleichbares Fundament für physikalische Systeme. Um diese Lücke zu schliessen, fokussiert sich die aktuelle KI-Forschung verstär

The Decoder 6 Artikel News
the-decoder.com · 26.08. 16:40

Alibaba veröffentlicht Qwen3.8-Flash-Next mit Fokus auf maximale Kosteneffizienz

Das Entwicklerteam hat eine Vorschau auf die Qwen4-Architektur gegeben und das Mixture-of-Experts-Modell Qwen3.8-Flash-Next vorgestellt, das pro Token nur 6 von insgesamt 125 Milliarden Parametern aktiviert. Trotz deutlich geringerer Trainingskosten übertrifft das System etablierte Konkurrenzmodelle bei Programmier- und Büroanwendungen. Damit erhöht sich der Preis- und Wettbewerbsdruck auf dem Markt für generative Sprachmodelle erheblich.

the-decoder.com · 24.08. 17:35

Alibaba präsentiert Videogenerierungsmodell Wan3.0 für bis zu 30 Sekunden lange Clips

Das neue KI-Modell Wan3.0 generiert hochauflösende Videoclips mit einer Länge von bis zu 30 Sekunden direkt aus Texteingaben, Bildern, PDFs sowie Präsentationen. Die Technologie ermöglicht die Erstellung von zehnsekündigen bis hin zu halbstündigen Sequenzen zu skalierbaren Rechenkosten. Diese Entwicklung unterstreicht die massiven Investitionen in generative Medienmodelle, während gleichzeitig ein deutlicher Rückgang des Quartalsgewinns im Zuge dieser strategischen Ausrichtung verzeichnet wird.

the-decoder.com · 07.08. 20:01

AMD übernimmt Startup Taalas zur Integration von KI-Modellen direkt in Silizium

Der Halbleiterkonzern AMD übernimmt das kanadische Startup Taalas, das spezialisierte Inferenz-Chips entwickelt, bei denen KI-Modellgewichte direkt in die Hardware eingebrannt werden. Durch diesen hardwarebasierten Ansatz entfallen traditionelle Speicherzugriffe, was extreme Verarbeitungsgeschwindigkeiten und eine hohe Energieeffizienz ermöglicht. Allerdings führt die feste Implementierung dazu, dass ein solcher Chip dauerhaft an genau ein spezifisches neuronales Netz gebunden ist. Erste Demonstrationsobjekte errei

the-decoder.com · 05.08. 15:06

Black Forest Labs veröffentlicht FLUX 3 Video für die Allgemeinheit und beansprucht Leistungsvorteile gegenüber Seedance 2.0

Mit FLUX 3 Video steht ein neues Modell zur Generierung von bis zu zwanzig Sekunden langen Full-HD-Videoclips zur Verfügung. Die Software unterstützt natives Audio, lippensynchrone Dialoge in über vierzehn Sprachen sowie die direkte Darstellung von Typografie in Filmszenen. Interne Elo-Rankings positionieren das System vor vergleichbaren Modellen wie Gemini Omni Flash und Seedance 2.0. Diese Entwicklung markiert einen signifikanten Fortschritt in der multimodalen KI-gestützten Videoproduktion und Audiorenderung.

the-decoder.com · 19.07. 12:17

Google Deepmind: Videogeneratoren enthalten bereits Weltmodelle für die Computer Vision

Das Forschungsprojekt GenCeption zeigt, dass Videogeneratoren erfolgreich für klassische Aufgaben der Computer Vision wie Tiefenschätzung und Segmentierung eingesetzt werden können. Dabei erzielt das Modell Ergebnisse auf dem Niveau aktueller Spitzenlösungen, benötigt jedoch deutlich weniger Trainingsdaten. Da das System fast ausschließlich mit synthetischen Videos trainiert wurde, stützt es die These, dass moderne Videogeneratoren bereits eine Form von universellem Weltmodell in sich tragen, das für das Verständni

the-decoder.com · 13.07. 11:41

Deutsches KI-Konsortium veröffentlicht Soofi S, ein offenes 30B-Modell mit Spitzenwerten in Deutsch und Englisch

Ein deutsches Forschungskonsortium hat das Sprachmodell Soofi S 30B-A3B vorgestellt, das vollständig auf Cloud-Infrastruktur in München trainiert wurde. Das Modell nutzt eine effiziente Hybrid-Architektur, bei der pro Token nur ein Bruchteil der insgesamt 31,6 Milliarden Parameter aktiviert wird, was eine hohe Verarbeitungsgeschwindigkeit auch bei langen Kontexten ermöglicht. Durch einen Trainingsdatensatz mit einem gezielten Schwerpunkt auf der deutschen Sprache übertrifft das Modell vergleichbare offene Alternati

OpenAI Blog 1 Artikel Anbieter
openai.com · 25.08. 09:00

Erste Testergebnisse von Jalapeño belegen branchenführende Geschwindigkeit und Effizienz bei der KI-Inferenz

OpenAI hat Details zu Jalapeño vorgestellt, einem kundenspezifischen Inferenzchip für moderne künstliche Intelligenz. Die ersten Testergebnisse zeigen eine deutlich höhere Leistung, verbesserte Durchsatzraten sowie eine reduzierte Latenz bei gleichzeitig gesteigerter Energieeffizienz. Damit unterstreicht die Entwicklung das Bestreben, die Hardware-Infrastruktur für komplexe KI-Workloads gezielt zu optimieren.

arXiv – cs.CL 11 Artikel Forschung
arxiv.org · 25.08. 06:00

RSMeM: Wissensbasiertes Memory-Evolutionsverfahren für Erdbeobachtungs-Agenten

Für geowissenschaftliche Analysen und komplexe Aufgaben in der Fernerkundung mangelt es aktuellen Sprachmodell-Agenten oft an domänenspezifischem Fachwissen, was zu fehleranfälligen Arbeitsabläufen führt. Ein neu entwickelter Mechanismen zur Wissensanreicherung und Gedächtnisevolution kombiniert hierarchisches Domänenwissen mit einer systematischen Aufarbeitung von Ausführungsfehlern. Dabei wird vortrainiertes Fachwissen für die Planung und Tool-Auswahl genutzt, während fehlerhafte Interaktionen iterativ in wiederv

arxiv.org · 25.08. 06:00

Was große Sprachmodelle erklären, entspricht nicht ihren Überzeugungen: Bewertung der Erklärungsgenauigkeit anhand modellinterner Eingabeüberzeugungen

Freitext-Erklärungen und Denkketten großer Sprachmodelle werden zunehmend in sicherheitskritischen Bereichen eingesetzt, um Modellentscheidungen zu rechtfertigen, wobei ihre tatsächliche Hinlänglichkeit oft unklar bleibt. Zur Schließung dieser Lücke wird ein formaler Bewertungsansatz vorgestellt, der die Verteilung der Eingabedaten berücksichtigt und das Modell nutzt, um alternative Eingaben auf Basis eigener Überzeugungen zu generieren. Mithilfe einer neuen informationstheoretischen Metrik lässt sich die Erklärung

arxiv.org · 25.08. 06:00

Optimierte Aufmerksamkeitsmechanismen durch trainierbare Entropische Optimaltransport-Priors

Durch die Betrachtung des Attention-Mechanismus durch die Linse des Entropischen Optimaltransports wurde eine neue Methode namens GOAT entwickelt, die starre Uniform-Annahmen durch lernbare, kontinuierliche Priors ersetzt. Dieser Ansatz ist voll kompatibel mit optimierten Kerneln wie FlashAttention und bietet zudem eine fundierte Erklärung für sogenannte Attention Sinks. Durch die Integration räumlicher Informationen in die Kernberechnung gelingt es dem Modell, gelernte positionale Einbettungen mit der Längengenera

arxiv.org · 29.07. 06:00

Deep Delta Learning: Strukturierte Aktualisierungen für Transformer-Residualströme

Forscher haben Deep Delta Learning eingeführt, eine strukturierte Residualaktualisierung für Transformer-Architekturen, die gezielte Bearbeitungen des Residualzustands ermöglicht. Die Methode trennt das Lesen, Vergleichen und Ersetzen von Inhalten durch einen expliziten Residualvorgang, der die Identitätspfad-Struktur bewahrt. Jede Schicht liest den aktuellen Zustand entlang einer gelernten Richtung aus, vergleicht ihn mit einem Ziel und schreibt eine gesteuerte Korrektur zurück. Experimente zeigen, dass dieser Ans

arxiv.org · 29.07. 06:00

Eingeschränktes CTC-Dekodieren zur effizienten Diakritika-Wiederherstellung

Für die automatische Spracherkennung im Arabischen stellt die Wiederherstellung fehlender Diakritika eine wesentliche Herausforderung dar, da die meisten Sprachdaten undiakritisiert vorliegen. Um diese Lücke zu schließen, wurde ein effizienter, nicht-autoregressiver Ansatz entwickelt, der auf der Connectionist Temporal Classification basiert. Dabei werden während des Dekodierungsprozesses harte Einschränkungen in Form eines zeichenbasierten Gitters angewendet, um ausschließlich gültige diakritisierte Textvarianten

arxiv.org · 29.07. 06:00

Physik von Sprachmodellen: Architekturdesign und Kanonschichten

Zur Untersuchung architektonischer Unterschiede in Sprachmodellen wurde ein kontrollierter, synthetischer Trainingsansatz entwickelt, der Kernkompetenzen isoliert und bewertet. Im Rahmen dieser Analyse entstanden sogenannte Kanonschichten, bei denen es sich um leichtgewichtige Komponenten zur horizontalen Informationsverarbeitung zwischen benachbarten Token handelt. Diese Schichten lassen sich nahtlos in verschiedene Sequenzarchitekturen wie Transformatoren oder Zustandsraummodelle integrieren. Die Untersuchungen z

arxiv.org · 17.07. 06:00

xHC: Erweiterte Hyper-Connections für effizientes LLM-Training

Die Methode der Hyper-Connections erweitert den Residual-Stream von Transformern in mehrere parallele Ströme, um die Speicherkapazität jenseits von Modellbreite und -tiefe zu skalieren. Da bisherige Ansätze bei einer Erweiterung über vier Ströme hinaus an Effizienz verloren, wurde xHC entwickelt. Durch zeitliche Merkmalsanreicherung und eine spärliche Architektur, die nur einen Teil der Ströme aktualisiert, ermöglicht xHC eine effektive Skalierung auf bis zu 16 Ströme. In Kombination mit der Optimierung xHC-Flash w

arxiv.org · 17.07. 06:00

T^2MLR: Transformer mit zeitlicher Rekursion in der mittleren Schicht

Die Architektur T^2MLR adressiert die Einschränkungen autoregressiver Transformer bei komplexen Schlussfolgerungsprozessen. Durch die Integration einer zwischengespeicherten Repräsentation der mittleren Schicht aus dem vorherigen Token in die aktuelle Berechnungsebene können abstrakte Zwischenzustände über mehrere Dekodierungsschritte hinweg erhalten bleiben. Dieser Ansatz erfordert nur einen geringen Rechenaufwand und lässt sich durch ein kurzes Finetuning in bestehende vortrainierte Modelle integrieren. Die Metho

arxiv.org · 13.07. 04:00

Verloren in der Backpropagation: Der LM-Head als Gradienten-Flaschenhals

Die letzte Schicht neuronaler Sprachmodelle, die Merkmale auf die Vokabulargröße projiziert, erweist sich als kritischer Engpass für das Training. Da die Dimension der Merkmale deutlich geringer ist als die des Vokabulars, kommt es bei der Backpropagation zu einer massiven Kompression der Gradienten. Empirische Messungen zeigen, dass bis zu 99 Prozent der Gradientennorm durch diese Schicht unterdrückt werden, was zu ineffizienten Aktualisierungen der Modellparameter führt. Dieser strukturelle Mangel beeinträchtigt

arxiv.org · 13.07. 04:00

Modell zur Relationsextraktion auf Basis eines semantischen Verbesserungsmechanismus

Die Extraktion von Relationen ist eine zentrale Aufgabe der natürlichen Sprachverarbeitung, wobei bestehende Methoden häufig Schwierigkeiten bei der Identifizierung überlappender Tripel aufweisen. Das neu entwickelte CasAug-Modell adressiert diese Herausforderung durch die Integration eines semantischen Verbesserungsmechanismus in das bestehende CasRel-Framework. Durch eine Vorabklassifizierung potenzieller Subjekte und die Berechnung semantischer Ähnlichkeiten mittels Aufmerksamkeitsmechanismen werden redundante R

arxiv.org · 13.07. 04:00

Neuraler Kollaps ist untersagt: Informationsuntergrenzen in Sprachmodellen

Die interne Varianz in Sprachmodellrepräsentationen wird oft als unvollständiger neuraler Kollaps interpretiert. Diese Untersuchung zeigt jedoch, dass es sich dabei um eine gezielte Informationsspeicherung handelt, die einem festen Gesetz folgt. Analysen über 14 verschiedene Modelle hinweg belegen, dass die kontextuelle Information innerhalb von Tokens den Großteil der Varianz ausmacht, während makrokategoriale Strukturen nur einen geringen Anteil beanspruchen. Zudem erzwingt eine mathematisch nachgewiesene Untergr

Hugging Face Blog 5 Artikel Modelle
huggingface.co · 20.08. 18:52

Bis zu 3,2-fache Inferenzgeschwindigkeit mit LFM2.5-DSpark

Die Veröffentlichung von LFM2.5-DSpark demonstriert signifikante Leistungssteigerungen bei der Ausführung von KI-Modellen. Durch optimierte Architekturen konnte die Inferenzgeschwindigkeit um das bis zu 3,2-fache erhöht werden. Diese Entwicklung unterstreicht den kontinuierlichen Fortschritt bei der Effizienzsteigerung neuronaler Netzwerke für rechenintensive Anwendungen.

huggingface.co · 19.08. 15:48

LFM2.5 Q4_0 Checkpoints aus quantisierungsbewusster Distillation

Es wurden neue Modell-Checkpoints für LFM2.5 in der Quantisierungsstufe Q4_0 veröffentlicht, die durch den Einsatz von quantisierungsbewusster Distillation optimiert wurden. Diese Technik zielt darauf ab, den Genauigkeitsverlust bei der Modellkomprimierung zu minimieren und gleichzeitig die Inferenzgeschwindigkeit auf ressourcenbeschränkter Hardware zu erhöhen. Die optimierten Gewichte stehen für Entwickler bereit, um effizientere Deep-Learning-Workflows in lokalen und Edge-Umgebungen zu realisieren.

huggingface.co · 12.08. 18:14

Einführung von OlmoEarth-Embeddings: Maßgeschneiderte Embedding-Exporte aus dem OlmoEarth Studio für nachgelagerte Analysen

Das OlmoEarth Studio bietet ab sofort spezialisierte Embedding-Exporte an, die gezielt für nachgelagerte Analysen im Bereich der Geodaten- und Erderkundungsmodellierung optimiert sind. Diese benutzerdefinierten Repräsentationen ermöglichen Entwicklern und Forschern den nahtlosen Zugriff auf vortrainierte Modellmerkmale zur Integration in eigene Machine-Learning-Pipelines. Durch die Bereitstellung hochdimensionaler Vektoren lassen sich spezifische räumliche und ökologische Fragestellungen effizienter mit modernen De

huggingface.co · 23.07. 02:00

Nunchaku 4-Bit-Diffusionsinferenz für Diffusers integrieren

Eine neue Integration ermöglicht das direkte Laden von quantisierten Nunchaku-Modellen in gängige Diffusions-Pipelines, ohne dass eine lokale CUDA-Kompilierung oder separate Inferenz-Engines erforderlich sind. Durch die Kombination von 4-Bit-Gewichtungen und -Aktivierungen sowie speziellen Laufzeit-Schichten wird der Speicherbedarf im Vergleich zu Standardformaten deutlich reduziert, während gleichzeitig die Inferenzgeschwindigkeit steigt. Zusätzlich vereinfacht ein neues Toolkit die Quantisierung und Veröffentlich

huggingface.co · 10.07. 00:00

Profiling in PyTorch (Teil 3): Aufmerksamkeit ist alles, was man profiliert

Der dritte Teil der Artikelserie widmet sich der detaillierten Leistungsanalyse von Transformer-Modellen innerhalb des PyTorch-Frameworks. Im Fokus steht dabei die Identifikation von Engpässen bei der Berechnung von Attention-Mechanismen, die für moderne Sprachmodelle essenziell sind. Durch den Einsatz spezialisierter Profiling-Werkzeuge können Entwickler die Ausführungszeit und den Speicherverbrauch präzise messen. Dies ermöglicht eine gezielte Optimierung der Rechenoperationen, um die Effizienz beim Training und

Microsoft Research 1 Artikel Forschung
microsoft.com · 20.08. 18:00

Erweiterter Zugang zu Skala beschleunigt prädiktive Dichtefunktionaltheorie

Microsoft Research hat die Version 1.1 seines Deep-Learning-basierten Austausch-Korrelations-Funktionals Skala veröffentlicht. Das aktualisierte Modell bietet eine höhere Genauigkeit sowie eine erweiterte Integration in

AWS Machine Learning 1 Artikel Anbieter
aws.amazon.com · 24.07. 17:42

Entwicklung eines erklärbaren Empfehlungssystems für Bankprodukte auf AWS

Es wird eine Architektur für ein Empfehlungssystem im Bankensektor vorgestellt, das auf maschinellem Lernen basiert und passgenaue Produktvorschläge für einzelne Kunden ermittelt. Ein Multi-Tower-Neuronennetzwerk mit integrierter Aufmerksamkeitsmechanik sorgt dabei für präzise Ergebnisse. Gleichzeitig erfüllt das System die strengen Transparenz- und Erklärbarkeitsanforderungen von Bankenaufsichtsbehörden, indem es die Entscheidungswege der Modellvorhersagen nachvollziehbar macht.

arXiv ? cs.AI 2 Artikel Forschung
arxiv.org · 17.07. 06:00

Von der Rekonstruktion zur Interpretation: Zero-Setup-Segmentierung für Röntgen-Tomographiedaten

Ein neues Framework ermöglicht die automatisierte Segmentierung von Röntgen-Tomographiedaten ohne vorheriges Training oder manuelle Eingaben. Durch die Kombination einer materialunabhängigen Maskenstrategie mit einem vortrainierten semantischen Segmentierungsnetzwerk lassen sich verschiedene strukturelle Regionen wie Porosität oder Materialdichte direkt identifizieren. Das Verfahren liefert innerhalb weniger Minuten nach der Rekonstruktion diagnostische Ergebnisse und übertrifft herkömmliche intensitätsbasierte Met

arxiv.org · 17.07. 06:00

Der RG-Flow Transformer: Skalenfreie Dynamik in begrenzten EEG-Daten

Die Untersuchung analysiert den Einsatz eines speziellen Transformer-Modells, das durch ein Renormierungsgruppen-Induktionsbias erweitert wurde, um die skalenfreie Dynamik von Gehirnstromsignalen in EEG-Daten zu erfassen. Im direkten Vergleich mit einem herkömmlichen Transformer bei der Klassifizierung von Schlafstadien zeigt das Modell keine signifikanten Vorteile bei der reinen Vorhersagegenauigkeit, selbst bei begrenzten Datenmengen. Der entscheidende Mehrwert liegt jedoch in der Interpretierbarkeit: Das Modell

TechCrunch – AI 2 Artikel News
techcrunch.com · 16.07. 15:02

Ehemaliger DeepMind-Forscher erzielt 300-Millionen-Dollar-Bewertung vor Produktstart

Ein erfahrener KI-Experte, der maßgeblich an der Entwicklung wegweisender Sprachmodelle beteiligt war, hat für sein neues Vorhaben eine Bewertung von 300 Millionen US-Dollar in der Pre-Seed-Phase erhalten. Der Fokus des Unternehmens liegt auf dem Bereich der visuellen Künstlichen Intelligenz. Diese Technologie wird als eine der nächsten großen Entwicklungsgrenzen innerhalb der KI-Forschung betrachtet. Trotz des Fehlens eines marktreifen Produkts unterstreicht die hohe Bewertung das enorme Investoreninteresse an spe

techcrunch.com · 16.07. 14:26

Moonshots kommendes Modell Kimi 3 soll den Rückstand zu Anthropics Opus 4.8 verringern

Das in Entwicklung befindliche KI-Modell Kimi 3 wird voraussichtlich als das bisher umfangreichste offene Sprachmodell aus China veröffentlicht. Mit einer geschätzten Parameteranzahl zwischen zwei und drei Billionen zielt das Modell darauf ab, die technologische Lücke zu führenden internationalen Systemen wie Anthropics Opus 4.8 zu schließen. Diese Entwicklung unterstreicht die zunehmende Ambition chinesischer Akteure, im Bereich der hochleistungsfähigen KI-Modelle eine Spitzenposition einzunehmen.

BAIR ? Berkeley AI 1 Artikel Forschung
bair.berkeley.edu · 01.07. 09:00

Ganzkörper-konditionierte egozentrische Videovorhersage

Die Forschung befasst sich mit der Vorhersage von Videosequenzen aus der Egoperspektive unter Einbeziehung von Ganzkörperbewegungen. Durch die Verknüpfung von Kameradaten mit der Körperhaltung des Nutzers lässt sich das zukünftige Sichtfeld präziser modellieren. Dieser Ansatz verbessert das Verständnis für die Interaktion zwischen einer Person und ihrer Umgebung in dynamischen Szenarien. Die Methode ist besonders für Anwendungen in der Robotik und bei tragbaren Assistenzsystemen von Bedeutung, da sie eine realistis

The Gradient 1 Artikel News
thegradient.pub · 28.03. 01:24

Mamba erklärt

Mamba stellt eine neue Architektur für KI-Modelle vor, die auf sogenannten State Space Models basiert. Diese Technologie zielt darauf ab, die Effizienzprobleme klassischer Transformer-Modelle bei der Verarbeitung sehr langer Datenfolgen zu lösen. Durch einen neuartigen Ansatz zur Sequenzmodellierung bietet Mamba eine leistungsfähige Alternative, die den hohen Rechenaufwand herkömmlicher Aufmerksamkeitsmechanismen reduziert und somit eine skalierbarere Verarbeitung komplexer Informationen ermöglicht.