>_ der Promptbote
News vom 24.7.2026  ·  843 neue Artikel heute  ·  4 Kanäle
Schlagwort: Machine LearningFilter entfernen ×
arXiv – cs.LG 49 Artikel Forschung
arxiv.org · 24.07. 06:00

Mehrstufige dynamische Auswahl für projektübergreifende Fehlerorhersage

Für die projektübergreifende Softwarefehlerorhersage wurde ein neues Framework entwickelt, das Verteilungsunterschiede zwischen Trainings- und Zielprojekten überwindet. Ein zweistufiges Klassifikator-Auswahlsystem bewertet zunächst Konfigurationen auf Projektebene und wählt anschließend zum Testzeitpunkt auf Modulebene die jeweils kompetentesten Klassifikatoren aus. Durch diese granulare Anpassung reagiert das System robuster auf unterschiedliche Datenverteilungen als herkömmliche Ansätze. Umfangreiche Experimente

arxiv.org · 24.07. 06:00

Der Preis versteckter Krümmung: Eine untere Schranke für die Bandit-Konvexoptimierung

Forscher haben eine neue untere Schranke für den Minimax-Bedauerns-Wert bei der stochastischen Bandit-Konvexoptimierung hergeleitet. Die Analyse zeigt, dass dieses Optimierungsproblem fundamental schwieriger ist als lineare Banditen, da der Fehler schneller wächst als bisher angenommen. Durch die Konstruktion einer speziellen Klasse konvexer Funktionen wird ein inhärentes Dilemma beim Erlernen unbekannter linearer Transformationen und Vektoren nachgewiesen. Diese theoretischen Erkenntnisse vertiefen das mathematisc

arxiv.org · 24.07. 06:00

Multimodales Stacking bei blockweisen Fehlwerten und Anwendung auf Biomarker zur Vorhersage von Immuntherapieresistenzen

Die Integration multimodaler Datensätze in der klinischen Onkologie wird häufig durch hohe Dimensionalität und blockweise fehlende Werte erschwert, bei denen ganze Datenquellen für bestimmte Patientengruppen nicht verfügbar sind. Ein neu entwickelter Late-Fusion-Ansatz namens MSB ermöglicht eine Überlebensanalyse, indem modalitiespezifische Merkmale unabhängig modelliert und Vorhersagen durch einen kreuzvalidierten Stacking-Meta-Learner aggregiert werden. Bei der Validierung anhand einer Biomarker-Studie zur Vorher

arxiv.org · 24.07. 06:00

Fairness-Restriktionen in hochdimensionalen verallgemeinerten linearen Modellen

Es wurde ein neues methodisches Framework entwickelt, um Fairness-Anforderungen in verallgemeinerten linearen Modellen auch dann zu erfüllen, wenn sensible Merkmale nicht direkt beobachtbar sind. Stattdessen werden latente Gruppenmitgliedschaften über probabilistische Mischverteilungen aus Stellvertretervariablen geschätzt und genutzt, um den Einfluss unzulässiger Diskriminierung in den Vorhersagen zu minimieren. Das Verfahren eignet sich sowohl für kontinuierliche als auch für binäre Zielvariablen und lässt sich d

arxiv.org · 24.07. 06:00

Gumbel-Distillation für die parallele Textgenerierung

Um die langsame, sequentielle Natur autoregressiver Sprachmodelle zu umgehen, wird ein neuartiges Distillationsverfahren für parallele Decoder vorgestellt. Die Technik nutzt den Gumbel-Max-Trick, um eine deterministische Abbildung von einem latenten Randraum auf die Ausgabetoken eines leistungsstarken Lehrer-Modells zu erzeugen. Als modellunabhängiger Ansatz lässt sich das Verfahren nahtlos in verschiedene Architekturen integrieren. Experimente zeigen deutliche Verbesserungen der Generierungsqualität und der Perple

arxiv.org · 24.07. 06:00

Interpretierbare Einbettungen mit Sparse Autoencoders als Werkzeug für die Datenanalyse

Sparse Autoencoders ermöglichen die Erstellung von Einbettungen, deren Dimensionen direkt auf interpretierbare Konzepte abgebilden. Durch diese Methode lassen sich Datensätze kosteneffizienter und zuverlässiger analysieren als mit herkömmlichen Sprachmodellen oder dichten Einbettungen. Die Technik bietet präzisere Kontrolle über die Merkmalsextraktion, was unter anderem das Aufdecken unerwarteter Konzeptkorrelationen, semantischer Unterschiede und Verzerrungen in Trainingsdaten erleichtert. Damit erweisen sich Spar

arxiv.org · 23.07. 06:00

Nicht-asymptotisches Variationslernen für monotone, nichtlineare, multiskalige elliptische Gleichungen

Es wurde eine neuwertige Theorie zur Approximation, Stichprobenziehung und Optimierung für physikalisch informierte neuronale Netze bei multiskaligen elliptischen Gleichungen entwickelt. Die Methode nutzt konvexe primale-duale Physikverluste, um berechenbare obere Schranken für den Fehler zu ermitteln. Analysen zeigen zudem, dass die Komplexität starker Residuen unter bestimmten Bedingungen stark von der Skala abhängt. Numerische Experimente bestätigen die theoretischen Vorhersagen und belegen eine deutliche Redukt

arxiv.org · 23.07. 06:00

Ist Zufall für die adaptive Datenanalyse notwendig?

Die adaptive Datenanalyse untersucht die Herausforderung, Fehlentdeckungen und Überanpassungen bei der wiederholten Nutzung von Datensätzen zu verhindern. Bisher war unklar, ob für diese Mechanismen zwingend Zufall erforderlich ist oder ob auch deterministische Ansätze ausreichen. Neue theoretische Forschungen zeigen nun, dass Zufall für uneingeschränkte Analysten strikt notwendig ist, um eine signifikante Anzahl adaptiver Abfragen fehlerfrei zu beantworten. Ohne Zufall scheitern deterministische Mechanismen bereit

arxiv.org · 23.07. 06:00

Formatkontrollierte, multiskalige JPEG-Kompressionsanalyse für die bildbasierte Fälschungserkennung

Ein neuer, ressourceneffizienter Ansatz zur Erkennung von Bildmanipulationen verzichtet auf rechenintensive Grafikprozessoren und setzt stattdessen auf eine Kombination aus gradientengestützten Entscheidungsbäumen und CPU-Berechnungen. Im Kern analysiert die Methode Kompressionsartefakte über sieben verschiedene JPEG-Qualitätsstufen hinweg und nutzt neuartige Verhältnisse zwischen diesen Qualitätsstufen, um digitale Manipulationen zu entlarven. Zusätzliche Merkmale wie räumliche Entropie, Fouriertransformationen un

arxiv.org · 23.07. 06:00

SGMD: Score Gradient Matching Distillation für die effiziente Diffusion-Videogenerierung

Ein neues Verfahren zur Beschleunigung von Videodiffusionsmodellen optimiert die Inferenz in wenigen Schritten, indem es die Nachteile herkömmlicher Verteilungsabgleichsmethoden überwindet. Das Konzept nutzt eine direkte Optimierung von Fehlscores in Kombination mit stabilen Verteilungszielen sowie dualen Potentialen für Korrektur- und Trackingprozesse. Dadurch wird das Training im Vergleich zu etablierten Ansätzen erheblich beschleunigt, während gleichzeitig die Bewegungsdynamik und die zeitliche Konsistenz in vie

arxiv.org · 23.07. 06:00

QLIF-CAST: Quantum Leaky-Integrate-and-Fire für die Wettervorhersage von Zeitreihen

Für präzise und effiziente Vorhersagen von multivariaten Umweltdaten wurde ein hybrides quantum-klassisches neuronales Netz entwickelt, das auf spiking Neuronen basiert. Das sogenannte QLIF-CAST-Modell kodiert Anregungszustände als Ein-Qubit-Superpositionen und wurde erfolgreich für die kontinuierliche Wetterprognose adaptiert. Vergleiche zeigen, dass dieser Ansatz im Vergleich zu klassischen Modellen den Vorhersagefehler deutlich reduziert und die Trainingszeit drastisch verkürzt. Zudem bestätigten erfolgreiche Ha

arxiv.org · 23.07. 06:00

Spektrale Transportstabilität und gutartiges Overfitting bei minimaler Norminterpolation

Gutartiges Overfitting beschreibt die Fähigkeit von Schätzern mit minimaler Norm, trotz exakter Anpassung an verrauschte Daten gute Verallgemeinerungseigenschaften zu besitzen. Bisherige Erklärungen stützen sich auf empfindliche spektrale Funktionale der Kovarianz, deren Stabilität bei Störungen des Spektrums nun durch einen spektralen Transportansatz mittels Wasserstein-Metrik untersucht wurde. Die Untersuchung zeigt, dass wesentliche Kenngrößen wie Eigenwert-Endsummen und effektive Ränge Lipschitz-stabil gegenübe

arxiv.org · 22.07. 06:00

Es kommt auf den Datensatz an: Wann die vorhergesagten Reaktionen von Gehirnkodierungsmodellen das visuelle Backbone für die Video-Einprägsamkeit übertreffen

Es wurde untersucht, ob vorhergesagte fMRI-Reaktionen von Gehirnkodierungsmodellen als Merkmal für nachgelagerte Aufgaben wie die Vorhersage der Einprägsamkeit von Videos dienen können. Ein Vergleich mit den zugrundeliegenden visuellen Backbone-Modellen zeigte, dass der Nutzen vom jeweiligen Datensatz abhängt: Während bei einem Datensatz das Backbone besser abschneidet, gewinnt bei einem anderen die gehirnbasierte Projektion. Die Analyse offenbart ein datensatzspezifisches Repräsentationssignal im ventralen occipit

arxiv.org · 22.07. 06:00

LP-SFT: Lokal erhaltendes überwachtes Fine-Tuning mittels multimodaler Entropiestruktur

Beim traditionellen überwachten Fine-Tuning von Sprachmodellen kommt es häufig zu einem Verlust bereits vorhandener Fähigkeiten, da die Verteilung der Wahrscheinlichkeiten für alternative Token unkontrolliert verändert wird. Eine Analyse zeigt, dass vortrainierte Modelle eine reguläre multimodale Entropiestruktur aufweisen, die reichhaltiges distributional Wissen kodiert. Um dieses zu schützen, wurde das Verfahren LP-SFT entwickelt, welches eine lokal normalisierte Kullback-Leibler-Divergenz nutzt, um die relative

arxiv.org · 22.07. 06:00

Forensische Trajektoriensignaturen zur Erkennung von Agenten-Gedächtnismanipulationen

Forscher haben ein verhaltensbasiertes Invarianten-Muster bei Sprachmodell-Agenten unter anhaltender Gedächtnismanipulation entdeckt und analysiert. Angriffe erzwingen dabei eine bestimmte Abfolge von Speicherabrufen vor dem Versenden von E-Mails, was als forensische Signatur zur Erkennung genutzt werden kann. Da jedoch auch gutartige Prozesse ähnliche Muster aufweisen, führt eine alleinige Blockierung zu hohen Fehlalarmen. Erst die Kombination mit Empfängermetadaten ermöglicht eine präzise Unterscheidung und effek

arxiv.org · 22.07. 06:00

Flusskorrigiertes Thompson Sampling für nicht-stationäre kontextuelle Banditen

In der Untersuchung wird ein neues bayesianisches Verfahren zur Bewältigung zeitlich veränderlicher Belohnungsmodelle in kontextuellen Banditen vorgestellt. Der Ansatz namens Flow-Corrected Thompson Sampling nutzt historische Daten effizienter, indem er vergangene Beobachtungen mithilfe eines expliziten Driftmodells und Gewichtungen in die Gegenwart überträgt, anstatt sie einfach zu verwerfen. Das Verfahren deckt verschiedene Formen von Instabilität wie lineare Parameterdrifts, periodische Schwankungen und wiederke

arxiv.org · 21.07. 06:00

Haben wir das Problem gelöst? Ein unabhängiger Stresstest für Metriken zur Erkennung von Zeitreihenanomalien

Die Bewertung von Modellen zur Erkennung von Zeitreihenanomalien war lange Zeit durch fehlerhafte Metriken verzerrt, die selbst zufälligen Vorhersagen hohe Genauigkeitswerte zuschrieben. Eine neue Untersuchung zeigt, dass alternative Metriken wie VUS oder Affiliation-F1 zwar bei einzelnen Testläufen robust sind, jedoch bei mehrfachen Versuchen und der Auswahl des besten Ergebnisses massiv manipulierbar werden. Insbesondere ROC-basierte Metriken neigen bei hoher Datenunwucht zu einer künstlichen Aufblähung der Werte

arxiv.org · 17.07. 06:00

Vorlesungsskript zu Machine-Learning-Anwendungen für globale statistische Fits

Dieses Vorlesungsskript erläutert einen methodischen Rahmen für globale statistische Fits in der Hochenergiephysik unter Nutzung moderner Machine-Learning-Surrogate. Um den hohen Rechenaufwand herkömmlicher Minimierungsverfahren zu umgehen, werden Boosted Decision Trees zur Approximation der Log-Likelihood-Funktion eingesetzt. Der Workflow umfasst die effiziente Generierung von Trainingsdaten durch Gauß-Prozesse, Hyperparameter-Optimierung sowie die Modellinterpretierbarkeit mittels SHAP-Werten. Die praktische Anwe

arxiv.org · 17.07. 06:00

Ein Machine-Learning-Benchmarking-Framework zur Vorhersage der Transfektionseffizienz von Lipid-Nanopartikeln

Die Entwicklung effizienter Lipid-Nanopartikel für den RNA-Transport ist ein zentraler Engpass in der medizinischen Forschung. Ein neues Benchmarking-Framework ermöglicht nun die systematische Evaluierung von Machine-Learning-Modellen, die auf Basis von Lipidstrukturen die Transfektionseffizienz vorhersagen. Durch den Vergleich verschiedener molekularer Repräsentationen und Architekturen identifiziert das Framework zuverlässige Basismodelle. Die Ergebnisse zeigen, dass Modelle mit expliziter Kodierung molekularer S

arxiv.org · 17.07. 06:00

Adaptives Zeitreihen-Reasoning durch Segmentauswahl

Das Modell ARTIST verbessert die Analyse von Zeitreihen, indem es diese als sequenzielles Entscheidungsproblem behandelt. Anstatt die gesamte Datenmenge statisch zu verarbeiten, wählt ein Controller-Modell mittels Reinforcement Learning gezielt relevante Zeitsegmente aus, die anschließend von einem Reasoner-Modell ausgewertet werden. Dieser adaptive Ansatz ermöglicht eine präzisere Beantwortung von Fragen, insbesondere bei der Lokalisierung seltener Ereignisse und komplexen Aufgaben über mehrere Zeitabschnitte hinw

arxiv.org · 17.07. 06:00

Der Herausforderer: Wann rechtfertigen neue Datenquellen den Wechsel von Machine-Learning-Modellen?

Organisationen stehen häufig vor der Entscheidung, ob sie ein bestehendes Vorhersagemodell durch ein neues Modell ersetzen sollen, das auf zusätzlichen Datenquellen basiert. Da das Training mit neuen Merkmalen kostenintensiv ist und Zeit benötigt, wurde ein mathematischer Rahmen entwickelt, der die Lernkurvendynamik mit den ökonomischen Aspekten des Modellwechsels verknüpft. Ein sequenzieller Bewertungsalgorithmus nutzt lokale Trends der Lernkurve, um den optimalen Zeitpunkt für den Umstieg zu bestimmen. Dieser Ans

arxiv.org · 17.07. 06:00

Mixtures of SubExperts für kontinuierliches Lernen in großen Sprachmodellen

Das neue Framework Mixtures of SubExperts adressiert das Stabilitäts-Plastizitäts-Dilemma bei der kontinuierlichen Weiterentwicklung von Sprachmodellen. Durch eine modulare und dünnbesetzte Architektur werden Modellkapazitäten in wiederverwendbare, kompositionelle Einheiten zerlegt. Ein lernfähiger Routing-Mechanismus wählt dynamisch relevante Sub-Module aus, wodurch Wissen lokalisiert gespeichert und gleichzeitig durch Kombinationen neu genutzt werden kann. Dies ermöglicht ein effizientes Lernen neuer Aufgaben ohn

arxiv.org · 17.07. 06:00

Der Einfluss von Stochastik beim Sampling in Score-basierten Diffusionsmodellen: Eine KL-Divergenz-Analyse

Diese Untersuchung analysiert die Auswirkungen stochastischer Prozesse auf die Bild- und Datengenerierung in Score-basierten Diffusionsmodellen. Durch die mathematische Herleitung von KL-Divergenz-Grenzen wird aufgezeigt, dass Stochastik bei exakten Score-Funktionen eine kontraktive Wirkung hat und die Divergenz entlang des Sampling-Pfads verringert. Bei approximativen Scores entsteht jedoch ein Zielkonflikt zwischen der Korrektur akkumulierter Fehler und der Verstärkung aktueller Score-Fehler. Die Ergebnisse verde

arxiv.org · 17.07. 06:00

Random Logit Scaling: Schutz von Deep Neural Networks gegen Black-Box-Angriffe

Die zunehmende Verbreitung von Machine-Learning-Modellen erfordert robuste Abwehrmechanismen gegen sogenannte Adversarial Examples. Mit Random Logit Scaling wird ein neues Verfahren vorgestellt, das die Logits eines Modells zufällig skaliert, um Angreifer bei Black-Box-Szenarien zu täuschen, ohne die Genauigkeit des Modells zu beeinträchtigen. Diese Methode lässt sich als effiziente Nachbearbeitung in bestehende Systeme integrieren. Zudem wurde eine adaptive Angriffsmethode entwickelt, die Schwachstellen in bisheri

arxiv.org · 17.07. 06:00

Asymmetrische, spitzenbewusste Verlustfunktion für die kritische Zeitreihenprognose

Bei vielen Anwendungen der Zeitreihenprognose ist die Unterschätzung von Bedarfsspitzen riskanter als eine Überschätzung. Die neue Methode Asymmetric Peak-Aware Loss (APAL) adressiert dieses Problem, indem sie Unterschätzungen stärker bestraft und die Gewichtung von Spitzenbereichen während des Trainings erhöht. Das modellunabhängige Verfahren verbessert die Genauigkeit bei Extremwerten und die zeitliche Präzision bei der Vorhersage von Spitzenlasten. Ein ergänzendes Evaluierungsprotokoll ermöglicht zudem eine präz

arxiv.org · 17.07. 06:00

Lyapunov Guidance: Ein einheitliches Framework zur Stabilisierung generativer Flows

Das neue Framework LyaGuide überträgt Prinzipien der Lyapunov-Regelungstechnik auf generative Flow-Modelle, um deren Steuerung effizienter und stabiler zu gestalten. Anstatt vortrainierte Modelle aufwendig neu zu trainieren, ermöglicht dieser Ansatz eine mathematisch fundierte Anleitung der Generierungsprozesse. Durch die Einführung eines Pseudo-Projektionsoperators erhalten bestehende Methoden wie Classifier- oder Reward-Guidance explizite Stabilitätsgarantien. Das Verfahren lässt sich sowohl modellbasiert als auc

arxiv.org · 17.07. 06:00

Ein zeitbasiertes Machine-Learning-Modell zur Vorhersage des ALS-Verlaufs und des Versorgungsbedarfs

Zur Unterstützung der individuellen Prognose bei Amyotropher Lateralsklerose wurde ein auf digitalen Zwillingen basierendes Framework entwickelt. Durch die Integration longitudinaler Daten aus klinischen Bewertungen und demografischen Informationen identifiziert das System funktionelle Verschlechterungen in verschiedenen Körperbereichen. Ein zeitbasiertes Machine-Learning-Modell erstellt dabei personalisierte Überlebenskurven und prognostiziert dynamisch den Zeitpunkt, ab dem Hilfsmittel wie Rollstühle benötigt wer

arxiv.org · 16.07. 04:00

Optimierung der Modellzusammenführung: Einfluss der Trainingsdauer von Expertenmodellen

Die Zusammenführung spezialisierter KI-Modelle zu einem einzigen System erfolgt bisher meist auf Basis des optimalen Validierungsverlusts der Einzelmodelle. Eine systematische Untersuchung zeigt jedoch, dass die ideale Trainingsdauer stark von der gewählten Zusammenführungsmethode abhängt. Während einfache Durchschnittsbildungen bei Überanpassung an Qualität verlieren, profitieren sparsamkeitsbasierte Ansätze von einer längeren Trainingsdauer über das bisherige Optimum hinaus. Diese Erkenntnisse verdeutlichen, dass

arxiv.org · 16.07. 04:00

Grundlagenmodelle für die Kreditrisikoprognose: Ein Wendepunkt?

Die Kreditrisikobewertung steht vor einer technologischen Neuerung durch den Einsatz von tabellarischen Grundlagenmodellen. Diese auf umfangreichen Datensätzen vortrainierten KI-Modelle zeigen in aktuellen Benchmarks eine überlegene Leistung bei der Vorhersage von Ausfallwahrscheinlichkeiten und Verlustquoten. Besonders in Szenarien mit begrenzten Datenmengen, wie bei der Kreditvergabe an kleine und mittlere Unternehmen, bieten sie signifikante Vorteile gegenüber klassischen Machine-Learning-Verfahren. Die Modelle

arxiv.org · 16.07. 04:00

Neubewertung der multimodalen Fusion für Zeitreihen: Textmodalitäten erfordern kontrollierte Integration

Die Integration von Text- oder Bilddaten in Zeitreihenprognosen führt häufig nur zu geringen Leistungssteigerungen, da naive Fusionsstrategien oft irrelevante Informationen einbringen und die Vorhersagequalität verschlechtern können. Eine neue Untersuchung zeigt, dass kontrollierte Fusionsmethoden diese Probleme lösen. Mit dem Controlled Fusion Adapter (CFA) wurde eine Methode entwickelt, die mittels Low-Rank-Adaptern gezielt nur relevante Textinformationen filtert und in Zeitreihendaten integriert. Dies verbessert

arxiv.org · 16.07. 04:00

Approximation parameterabhängiger Problemlösungen durch Residuale Neuronale Netze

Es wurde ein neues Verfahren zur effizienten Approximation von Lösungen parameterabhängiger Probleme mittels neuronaler Netze entwickelt. Durch die Nutzung analytischer Aktivierungsfunktionen und gradientenbasierter Flüsse lässt sich das Training mathematisch fundiert konvergieren. Die Koeffizienten des Netzwerks werden dabei über ein System gewöhnlicher Differentialgleichungen bestimmt. Das Verfahren erweist sich als besonders robust bei der Lösung inverser Probleme, selbst wenn diese unter schwierigen Bedingungen

arxiv.org · 16.07. 04:00

Constraint-basierte Modelloptimierung: Ein industrieller Rahmen zur Auswahl von Kompressions- und Beschleunigungstechniken

Die Optimierung von Machine-Learning-Modellen erfolgt in der Praxis oft auf Basis von Heuristiken statt fundierter Methoden. Ein neuer, systematischer Ansatz betrachtet die Modelloptimierung als mehrzielige Ingenieursaufgabe, die durch fünf zentrale Dimensionen definiert wird: Datenverfügbarkeit, Latenz, Speicherbedarf, Genauigkeitstoleranz und das Budget für das Nachtraining. Durch die Zuordnung empirischer Forschungsergebnisse zu diesen operativen Rahmenbedingungen entsteht ein strukturierter Leitfaden. Dieser un

arxiv.org · 15.07. 04:00

Propheticus: Machine Learning Framework zur Entwicklung prädiktiver Modelle für zuverlässige und sichere Software

Die zunehmende Komplexität moderner Software erfordert neue Ansätze zur Gewährleistung von Sicherheit und Zuverlässigkeit. Das neu entwickelte Framework Propheticus abstrahiert die Komplexität von Machine-Learning-Prozessen, um die Erstellung prädiktiver Modelle zu vereinfachen. Durch die Unterstützung bei der Modellentwicklung sollen Fehler bei der Anwendung von KI-Methoden reduziert werden. Anhand von Fallstudien zur Vorhersage von Software-Schwachstellen und Systemausfällen wird demonstriert, wie das Framework d

arxiv.org · 15.07. 04:00

Physikalisch konsistente Parameterinferenz: Transparente Machine-Learning-Emulation in der Hochenergiephysik und Kosmologie

In der Hochenergiephysik und Kosmologie stellt die Analyse hochdimensionaler Parameterbereiche mit komplexen Wahrscheinlichkeitsfunktionen eine große rechnerische Herausforderung dar. Ein neues Framework nutzt Gradient-Boosted Regression Trees, um diese komplexen Landschaften effizient zu emulieren und präzise Konfidenzbereiche zu bestimmen. Die Methode wurde erfolgreich an Zerfallsprozessen von B-Mesonen validiert und lässt sich auf weitere physikalische Systeme übertragen. Durch den Einsatz von SHAP-Werten bleibt

arxiv.org · 15.07. 04:00

MAGE: Analyse von Stabilitäts- und Leistungs-Abwägungen bei der Prompt-Optimierung

Die Untersuchung MAGE beleuchtet das Zusammenspiel verschiedener Komponenten bei der iterativen Optimierung von Prompts. Dabei wurde der sogenannte Prompt Optimization Coupling Effect identifiziert, bei dem stochastische Optimierungssignale in geschlossenen Reflexionsschleifen gleichzeitig die Leistung steigern und die Varianz verstärken. Die Ergebnisse zeigen, dass eine fehlerbasierte Reflexion entscheidend für den Erfolg ist. Zudem verdeutlicht die Studie, dass die Wahl des Grundgerüsts bei geringen Datenmengen w

arxiv.org · 15.07. 04:00

Datenschutz bei KI-Modellen: Nicht Informationsabhängigkeit, sondern nicht-robuste Merkmale verursachen Datenlecks

Die Forschung stellt die gängige Annahme infrage, dass das Auswendiglernen von Trainingsdaten die Hauptursache für Datenschutzrisiken bei Bildrekonstruktionsangriffen ist. Stattdessen zeigt sich, dass die Anfälligkeit für solche Angriffe kausal mit sogenannten nicht-robusten Merkmalen zusammenhängt, die für Menschen unsichtbar, aber für KI-Modelle generalisierbar sind. Durch die Einführung eines neuen Trainingsverfahrens namens Anti Adversarial Training wird belegt, dass eine gezielte Nutzung dieser Merkmale den Sc

arxiv.org · 15.07. 04:00

Gradientenflussdynamik und implizite Verzerrung diagonal linearer Netzwerke bei infinitesimaler Initialisierung

Die Untersuchung analysiert die Dynamik des Gradientenflusses bei diagonal linearen Netzwerken für Regressionsaufgaben unter der Bedingung einer infinitesimalen Initialisierung. Es wird nachgewiesen, dass die Trainingsverläufe tiefer sowie zweischichtiger diagonal linearer Netzwerke durch einen spezifischen Algorithmus charakterisiert werden können, der gegen die Lösung eines modifizierten L1-Norm-Minimierungsproblems konvergiert. Damit lässt sich die implizite Verzerrung dieser Architekturen als modifizierte L1-No

arxiv.org · 15.07. 04:00

Proximity-Features: Datenschutzkonforme Kaltstart-Personalisierung bei Airbnb

Auf Plattformen mit seltenen Käufen stellt das Fehlen ausreichender Nutzerhistorie eine Herausforderung für die Personalisierung dar. Um dieses Kaltstart-Problem bei nicht angemeldeten oder neuen Nutzern zu lösen, wurden Proximity-Features entwickelt. Dabei werden Nutzer anhand von Geo-IP-Daten in Clustern von etwa 1.000 Personen zusammengefasst, um aggregierte Signale ohne individuelle Identifikatoren zu nutzen. Dieser datenschutzkonforme Ansatz ermöglicht präzise Empfehlungen auf Landingpages und in Marketing-Kan

arxiv.org · 15.07. 04:00

Vergessliche Aufmerksamkeit: Ein trainierbarer Support-Vector-Speicher mit zertifizierter Selektion und exaktem Unlearning

Die neue Methode Support Vector Attention ermöglicht eine präzise Steuerung von Gedächtnisinhalten in KI-Modellen. Durch die Nutzung von Support-Vektor-Maschinen können einzelne Tokens gezielt und zertifiziert aus dem Kontext gelöscht werden, ohne die restlichen Ausgaben zu beeinflussen. Dieser Ansatz erlaubt ein exaktes Unlearning, bei dem der Zustand des Modells exakt dem einer vollständigen Neu-Trainierung ohne das gelöschte Element entspricht. Die Technik verbessert die Leistung bei der Verarbeitung seltener Da

arxiv.org · 15.07. 04:00

Vorhersage institutioneller Aktienbestände mittels Knotenaffinitäten in dynamischen Graphen

Die Vorhersage künftiger Portfolioallokationen großer Investmentmanager ist aufgrund von Verzögerungen bei der Offenlegung und der Beständigkeit institutionellen Verhaltens komplex. Ein neuer Ansatz nutzt Methoden des temporalen Graph-Machine-Learnings, um Bestandsveränderungen als Knotenaffinitätsproblem auf einem bipartiten Graphen zwischen Managern und Wertpapieren abzubilden. Das entwickelte Modell NAVIS übertrifft dabei bestehende dynamische Graph-Lernverfahren und heuristische Methoden deutlich. Die Ergebniss

arxiv.org · 14.07. 04:00

DemoPSD: Disagreement-Modulated Policy Self-Distillation

Das neue Framework DemoPSD adressiert die Schwächen der On-Policy Self-Distillation beim Training großer Sprachmodelle. Bei herkömmlichen Methoden führt die Nutzung privilegierter Informationen durch den Lehrer oft zu Overfitting und dem Erlernen von Abkürzungen, die bei der Anwendung nicht verfügbar sind. DemoPSD löst dies durch eine selektive Steuerung der Lehrer-Anleitung, bei der eine gewichtete Kombination aus Lehrer- und Schülerverteilung genutzt wird. Durch die Messung der Diskrepanz zwischen beiden Modellen

arxiv.org · 14.07. 04:00

Wie können Machine-Learning-Emulatoren die Klimaforschung optimal unterstützen?

Physikbasierte Klimamodelle sind aufgrund ihres hohen Rechenaufwands in der Anwendung stark limitiert. Machine-Learning-Emulatoren versprechen eine effiziente Alternative, werden jedoch in der Praxis aufgrund mangelnder physikalischer Fundierung und fehlender Anwenderfreundlichkeit bisher selten genutzt. Ein neuer Rahmenplan soll nun die Entwicklung dieser Werkzeuge verbessern, indem er den Fokus auf klar definierte Aufgaben, Zuverlässigkeit und eine bessere Integration in die bestehende Klimaforschung legt. Ziel i

arxiv.org · 14.07. 04:00

Training diagonaler linearer Netzwerke mit stochastischer Schärfe-bewusster Minimierung

Die Untersuchung analysiert das Trainingsverhalten diagonaler linearer Netzwerke bei linearer Regression unter Einfluss von isotropem Rauschen. Dieser Prozess lässt sich als stochastische Form der Schärfe-bewussten Minimierung interpretieren, die eine gewichtete Mischung aus fraktionalen Norm-Strafen induziert. Dies fördert die Balance zwischen den Netzwerkschichten und begünstigt Lösungen, die durch einen Shrinkage-Thresholding-Operator charakterisiert sind. Die Ergebnisse zeigen, dass das Rauschen als Regularisie

arxiv.org · 14.07. 04:00

Wenn günstige Gradienten versagen: Die Messkosten bei Angriffen auf Quantenklassifikatoren

Variationale Quantenklassifikatoren verfügen über einen inhärenten Schutzmechanismus gegen gradientenbasierte Angriffe. Da die für die Gradientenschätzung notwendigen Messungen auf Quantenschaltkreisen statistischem Rauschen unterliegen, steigen die Kosten für einen Angreifer mit zunehmender Dimension des Modells drastisch an. Während klassische Modelle durch automatische Differenzierung effizient angegriffen werden können, erzwingt die physikalische Natur der Quantenmessungen einen hohen Aufwand. Dieser Effekt tri

arxiv.org · 14.07. 04:00

MMRM: Ein multiplexes multimodales Repräsentationsmodell für das Produktranking im E-Commerce

Das neue Modell MMRM optimiert das Ranking in E-Commerce-Suchmaschinen durch die Integration vielfältiger multimodaler Daten. Im Gegensatz zu bisherigen Ansätzen, die meist nur ein einzelnes kollaboratives Signal nutzen, verarbeitet das Framework heterogene Signale gleichzeitig über ein gemeinsames Backbone mit aufgabenspezifischen Tokens. Durch die Generierung umfassender Repräsentationen in einem einzigen Inferenzschritt und eine neuartige Strategie zur Modellierung von Nutzerverhalten auf Basis dieser Daten wird

arxiv.org · 13.07. 04:00

ECHO: Effizientes Gedächtnismanagement für agentische Reinforcement Learning-Systeme

Die Verwaltung langer Interaktionsverläufe stellt bei KI-Agenten eine Herausforderung dar, da komprimierte Kontextinformationen oft den Bezug zu den entscheidenden Beweisen verlieren. Das neue Framework ECHO adressiert dieses Problem durch eine selektive Speicherung von Interaktionsschritten, die eine präzise Rückverfolgbarkeit ermöglicht. Durch die Verknüpfung von ausgewählten Gedächtniseinträgen mit dem finalen Lernerfolg können Agenten eine effizientere Zuweisung von Belohnungen vornehmen. In Tests übertrifft di

arxiv.org · 13.07. 04:00

Verbesserung von KI- und dynamischen subsaisonalen Wettervorhersagen durch probabilistische Fehlerkorrektur

Wettervorhersagen für den Zeitraum von zwei bis sechs Wochen sind aufgrund systematischer Modellfehler und atmosphärischer Instabilitäten bisher ungenau. Ein neues Machine-Learning-Framework zur probabilistischen Fehlerkorrektur reduziert diese systematischen Abweichungen signifikant, indem es aus historischen Vorhersagedaten lernt. Die Anwendung dieses Verfahrens auf führende KI- und physikalische Modelle führt zu einer deutlichen Steigerung der Prognosegüte für Temperatur, Niederschlag und Luftdruck. Das System ü

arxiv.org · 13.07. 04:00

Automatische thematische Indexierung literarischer Großkorpora: Ein Machine-Learning-Ansatz am Beispiel von Voltaire

Die thematische Indexierung umfangreicher literarischer und historischer Texte ist bisher ein zeitaufwendiger manueller Prozess. Eine aktuelle Untersuchung evaluiert den Einsatz von Machine Learning zur Automatisierung dieser Aufgabe am Beispiel der Werke von Voltaire. Dabei wird die Indexierung als Multi-Label-Klassifikationsproblem definiert und verschiedene Modellarchitekturen, von Encoder-basierten Modellen bis hin zu feinabgestimmten Large Language Models, miteinander verglichen. Die Ergebnisse zeigen, dass mo

arxiv.org · 13.07. 04:00

SAMPAT: Eine interpretierbare neuronale Architektur für mathematische Modellierung

Die neue neuronale Architektur SAMPAT (Smooth Approximation via Multivariate Polynomials and Analytic Transformations) adressiert das Problem der mangelnden Interpretierbarkeit in aktuellen Deep-Learning-Modellen. Durch die Verwendung von glatten, überall differenzierbaren Funktionen ermöglicht das dreischichtige Modell eine präzise Approximation komplexer Zusammenhänge in Form kompakter algebraischer Ausdrücke. Dies erlaubt Wissenschaftlern, die gelernten Modelle mathematisch nachzuvollziehen und zu analysieren. E

Hacker News – AI/LLM 5 Artikel Community
arxiv.org · 24.07. 05:07

Vorsicht bei Labels: Lizenzwäsche in KI-Lieferketten

Eine Untersuchung von KI-Lieferketten über Plattformen wie Hugging Face und GitHub zeigt, ob und wie Lizenzverpflichtungen beim Weitervertreib von Datensätzen und Modellen verändert oder entfernt werden. Dabei wurden Hunderttausende Übergänge von Datensätzen zu Modellen und Anwendungen analysiert, um die Einhaltung urheberrechtlicher Vorgaben zu überprüfen. Die Ergebnisse verdeutlichen potenzielle Risiken im Umgang mit Lizenzen bei der Weiterverwendung digitaler Artefakte. Dies betrifft insbesondere die Transparenz

arxiv.org · 23.07. 22:38

Synchronisieren sich gemeinsam platzierte KI-Trainingsaufträge?

Im Bereich des maschinellen Lernens stellt sich die grundlegende Frage, ob räumlich oder rechnerisch nah beieinander liegende KI-Trainingsprozesse eine unvorhergesehene Synchronisation aufweisen. Dies kann erhebliche Auswirkungen auf die Effizienz der genutzten Rechenzentren und die Stabilität der Netzwerke haben. Die Analyse solcher Verhaltensweisen hilft dabei, Ressourcen besser zu verteilen und Engpässe bei großen Trainingsläufen zu vermeiden.

seldon-ai.com · 23.07. 19:38

Clusterung von LLM-Spuren ohne den Einsatz von großen Sprachmodellen

Ein neuer technischer Ansatz zeigt, dass die Analyse und Gruppierung wiederkehrender API-Anfragen im Bereich von Sprachmodellen auch ohne den direkten Einsatz von KI-Modellen mit hoher Präzision gelingt. Durch die Kombination von harten Datenverträgen und deterministischen Clustermethoden lassen sich identische Programmstrukturen effizient identifizieren. Dies ermöglicht es Unternehmen, repetitive und kostenintensive Abfragen zu erkennen und durch deterministische, kostengünstigere Datenpipelines zu ersetzen, ohne

github.com · 22.07. 23:05

Autograd-freie Sprachmodell-Steuerung ohne zusätzlichen VRAM-Bedarf

Ein neues hybrides Steuerungssystem ermöglicht die Vorab-Korrektur von Datenströmen für große Sprachmodelle ohne automatische Differenzierung und mit minimalem Speicherbedarf. Durch den Einsatz physikalischer Gleichungen zur Strömungsmechanik werden hochrangige Verzerrungen bereits vor der eigentlichen Verarbeitung im Transformer-Modell ausgeglichen. Dies führt zu einer effizienteren und speicherschonenderen Führung von KI-Modellen während der Inferenz. Die Methode stellt einen alternativen Ansatz dar, um die Reche

languagemodelbuilder.com · 22.07. 19:28

Lernen Sie, wie man KI von Grund auf kostenlos baut

Eine kostenlose Mac-Anwendung ermöglicht es Anwendern, ein kleines Sprachmodell Schritt für Schritt von Grund auf selbst zu erstellen. Der Prozess umfasst das Trainieren eines Tokenizers, die Datenauswahl, das Vortraining, die Feinabstimmung sowie das anschließende Chatten mit dem selbst erstellten Modell. Das Werkzeug richtet sich an Interessierte, die die zugrundeliegenden Mechanismen moderner Sprachmodelle praktisch nachvollziehen möchten.

AWS Machine Learning 2 Artikel Anbieter
aws.amazon.com · 21.07. 18:23

Erforschung von selbstdestilliertem Reasoning für das überwachte Fine-Tuning

Ein neuer Ansatz zur Generierung von Denk-Token für Datensätze ohne bestehende Reasoning-Spuren beim überwachten Fine-Tuning wird vorgestellt. Zunächst wird das Problem der sogenannten Reasoning-Unterdrückung analysiert.

aws.amazon.com · 15.07. 18:08

Zentralisierte Überwachung von Amazon SageMaker Pipelines über AWS-Konten hinweg

Es wurde eine Lösung entwickelt, um die Überwachung von SageMaker-Pipelines über verschiedene AWS-Konten und Regionen hinweg zu zentralisieren. Durch den Einsatz von benutzerdefinierten Amazon CloudWatch-Dashboards erhalten Anwender einen konsolidierten Überblick über ihre Machine-Learning-Workflows. Ein bereitgestelltes Beispiel mit dem AWS Cloud Development Kit ermöglicht die automatisierte Bereitstellung der notwendigen Infrastruktur, um den Status und die Leistung der Pipelines effizient über komplexe Cloud-Umg

arXiv – cs.CL 2 Artikel Forschung
arxiv.org · 17.07. 06:00

On-Policy Delta-Destillation für Sprachmodelle

Die On-Policy Delta-Destillation stellt eine neue Methode für das Post-Training von Sprachmodellen dar, die auf der Übertragung von Schlussfolgerungsfähigkeiten basiert. Anstatt lediglich die Ausgabeverteilung eines Lehrermodells zu imitieren, nutzt das Verfahren ein sogenanntes Delta-Signal. Dieses Signal berechnet die Differenz zwischen einem spezialisierten Lehrermodell und dessen Basismodell vor dem Instruction-Tuning. Durch diesen Ansatz lassen sich logische Fähigkeiten effizienter übertragen, was in Benchmark

arxiv.org · 13.07. 04:00

Latent Thoughts Tuning: Verknüpfung von Kontext und logischem Denken durch fusionierte Informationen in latenten Tokens

Latent Thoughts Tuning ist ein neues Post-Training-Framework, das die logischen Fähigkeiten von Sprachmodellen verbessert, indem es das Denken in kontinuierlichen latenten Räumen optimiert. Anstatt sich ausschließlich auf rohe verborgene Zustände zu verlassen, nutzt das Verfahren einen Mechanismus zur Fusion von Kontextvorhersagen und semantischen Hinweisen aus dem Vokabular-Einbettungsraum. Durch einen dreistufigen Lehrplan ermöglicht das System zudem einen dynamischen Wechsel zwischen latenten und expliziten Denk