>_ der Promptbote
News vom 21.7.2026  ·  1231 neue Artikel heute  ·  5 Kanäle
Schlagwort: KI-TrainingFilter entfernen ×
Hacker News – AI/LLM 2 Artikel Community
reuters.com · 21.07. 07:38

Buchverlag verklagt Technologieunternehmen wegen KI-Training

Ein Buchverlag hat rechtliche Schritte gegen Technologieunternehmen eingeleitet, um gegen die unautorisierte Nutzung urheberrechtlich geschützter Werke für das Training von Künstlicher Intelligenz vorzugehen. Im Zentrum des Rechtsstreits steht die Frage, ob das Einlesen von Büchern zur Entwicklung von Sprachmodellen eine Urheberrechtsverletzung darstellt oder unter die Regelungen zur fairen Nutzung fällt. Dieser Fall könnte weitreichende Konsequenzen für die Zukunft der KI-Entwicklung und den Schutz geistigen Eigen

petapixel.com · 18.07. 00:36

Patreon blockiert KI-Crawler zum Schutz von Inhalten

Die Plattform Patreon ergreift Maßnahmen, um das automatische Auslesen von Inhalten durch KI-Crawler zu unterbinden. Das Unternehmen betont, dass Urheber für die Nutzung ihrer Werke durch KI-Modelle fair entlohnt werden sollten. Durch diese Entscheidung soll die Kontrolle der Kreativen über ihre eigenen Inhalte gestärkt und eine unautorisierte Datennutzung für das Training von Künstlicher Intelligenz verhindert werden.

TechCrunch – AI 2 Artikel News
techcrunch.com · 21.07. 02:12

Grundsatzurteil: Vergleich über 1,5 Milliarden Dollar im Urheberrechtsstreit gegen Anthropic genehmigt

Ein US-Gericht hat einen Vergleich in Höhe von 1,5 Milliarden Dollar im Zusammenhang mit Urheberrechtsverletzungen durch KI-Modelle offiziell bestätigt. Damit wird ein bedeutender Rechtsstreit beigelegt, der sich auf die unautorisierte Nutzung geschützter Werke für das Training von Künstlicher Intelligenz konzentrierte. Trotz dieser Einigung bleibt die grundlegende rechtliche Frage ungeklärt, inwieweit das Training von KI-Systemen mit urheberrechtlich geschützten Inhalten zulässig ist. Die Entscheidung markiert ein

techcrunch.com · 14.07. 18:33

Google sieht sich mit weiterer Klage wegen KI-Trainingsdaten konfrontiert

Mehrere große Verlagshäuser, darunter Hachette, Cengage und Elsevier, haben Klage gegen Google eingereicht. Die Kläger werfen dem Unternehmen vor, urheberrechtlich geschützte Werke ohne entsprechende Genehmigung für das Training von KI-Modellen verwendet zu haben. Dieser Rechtsstreit unterstreicht die wachsende Auseinandersetzung zwischen Inhabern von geistigem Eigentum und Technologieunternehmen bezüglich der Nutzung von Daten für die Entwicklung generativer Künstlicher Intelligenz.

arXiv – cs.LG 21 Artikel Forschung
arxiv.org · 17.07. 06:00

Multimodalität als Supervision: Selbstüberwachte Spezialisierung auf Testumgebungen

Das Konzept der Test-Space Training (TST) Methode nutzt multimodale Sensordaten direkt aus der Zielumgebung, um KI-Modelle ohne externe Internet-Datensätze zu trainieren. Durch die Vorhersage einer Modalität aus einer anderen lernen die Systeme Repräsentationen, die in spezifischen Umgebungen mit etablierten Generalisten-Modellen wie DINOv2 oder CLIP konkurrieren können. Dieser Ansatz zeigt, dass eine gezielte Nutzung von Sensordaten die Abhängigkeit von riesigen, externen Trainingsdatenmengen verringern kann. Die

arxiv.org · 17.07. 06:00

Jenseits von Entropie: Korrektheitsbasierte Advantage-Formung durch kontrastive Richtlinienoptimierung

Die kontrastive Richtlinienoptimierung (CPO) bietet einen neuen Ansatz für das verstärkende Lernen mit verifizierbaren Belohnungen. Anstatt sich auf Entropie zu verlassen, nutzt das Verfahren tokenbasierte Unterschiede zwischen referenzgesteuerten und Standard-Generierungsverteilungen, um die Korrektheit von Modellausgaben präziser zu bewerten. Dieser Mechanismus ermöglicht eine effektivere Steuerung des Lernprozesses und löst das Problem verschwindender Vorteile. Praktische Tests zeigen, dass CPO herkömmliche entr

arxiv.org · 17.07. 06:00

Ein zeitkontinuierliches Reinforcement-Learning-Framework für das Fine-Tuning diskreter Diffusionsmodelle

Ein neuer Ansatz formuliert Reinforcement Learning in zeitkontinuierlichen diskreten Zustandsräumen mittels stochastischer Kontrolle. Durch die Modellierung als kontrollierte Markov-Ketten lassen sich Policy-Gradient-Methoden wie PPO und GRPO auf diskrete Diffusionsmodelle übertragen. Dies ermöglicht eine belohnungsbasierte Optimierung, die nicht auf differenzierbare Signale angewiesen ist und Zwischenbelohnungen entlang des gesamten Denoising-Pfades integriert. Speziell für maskierte Diffusions-Sprachmodelle reduz

arxiv.org · 17.07. 06:00

RENEW: Weltmodelle durch menschliches Feedback verbessern und Modell-Exploitation beheben

Weltmodelle im Offline-Reinforcement-Learning leiden häufig unter Modell-Exploitation, bei der das Modell in Bereichen mit geringer Datenabdeckung fehlerhafte Dynamiken erzeugt. Ein neuer Ansatz namens Dynamics Learning from Human Feedback nutzt menschliche Präferenzen über simulierte Abläufe, um diese Halluzinationen zu korrigieren. Da dieser Prozess in der Grundform ineffizient ist, fokussiert die Methode RENEW das Training mittels epistemischer Unsicherheit gezielt auf kritische Modellbereiche. Dies steigert die

arxiv.org · 17.07. 06:00

Branching Policy Optimization: Ein neuer Ansatz für Reinforcement Learning bei Sprachmodellen

Ein neuer Algorithmus namens Branching Policy Optimization verbessert das Training von Sprachmodell-Agenten in deterministischen Sandbox-Umgebungen. Anstatt unabhängige Pfade zu verfolgen, nutzt das Verfahren die Möglichkeit, Zustände zu speichern und von Zwischenpunkten aus zu verzweigen. Durch das Teilen gemeinsamer Präfixe bei den Entscheidungsbäumen wird die Varianz der Gradienten signifikant reduziert und die Effizienz bei der Optimierung gesteigert. In Benchmarks wie WebShop und SWE-bench zeigt der Ansatz ein

arxiv.org · 16.07. 04:00

Optimierung der Modellzusammenführung: Einfluss der Trainingsdauer von Expertenmodellen

Die Zusammenführung spezialisierter KI-Modelle zu einem einzigen System erfolgt bisher meist auf Basis des optimalen Validierungsverlusts der Einzelmodelle. Eine systematische Untersuchung zeigt jedoch, dass die ideale Trainingsdauer stark von der gewählten Zusammenführungsmethode abhängt. Während einfache Durchschnittsbildungen bei Überanpassung an Qualität verlieren, profitieren sparsamkeitsbasierte Ansätze von einer längeren Trainingsdauer über das bisherige Optimum hinaus. Diese Erkenntnisse verdeutlichen, dass

arxiv.org · 16.07. 04:00

SCOPE-RL: Optimierung von Schlussfolgerungspfaden vor und nach dem Erfolg

SCOPE-RL ist ein zweistufiges Framework zur Optimierung von Sprachmodellen, das die Schwächen herkömmlicher Reinforcement-Learning-Methoden mit spärlichen Belohnungssignalen adressiert. Vor dem Erreichen der korrekten Antwort werden durch adaptive, in Teilfragen zerlegte Belohnungen Fortschritte in der Argumentationskette gefördert. Nach dem Erfolg sorgt eine qualitätsbewusste Prozesssteuerung für die Verfeinerung der Trajektorien, um Redundanzen und Fehler zu minimieren. Die Methode steigert die Genauigkeit bei ma

arxiv.org · 16.07. 04:00

M+Adam: Training mit niedriger Präzision durch additiv-multiplikative Optimierung

Das Training von KI-Modellen mit quantisierten Gewichten senkt die Kosten, führt jedoch häufig zu Genauigkeitsverlusten, da Standard-Optimierer bei niedriger Präzision aufgrund grober Mantissenauflösung stagnieren können. Der neue Optimierer M+Adam kombiniert additive und multiplikative Aktualisierungsschritte, um diese Schwächen auszugleichen. Während additive Schritte bei Vorzeichenwechseln und kleinen Werten greifen, sichern multiplikative Schritte den Fortschritt bei großen Gewichten. Tests mit LLaMA-Modellen i

arxiv.org · 16.07. 04:00

GFlowRL: Skalierung von Distribution-Matching Reinforcement Learning für große Sprachmodelle

GFlowRL stellt einen neuen Ansatz für das Reinforcement Learning bei großen Sprachmodellen dar, der auf dem Prinzip der Verteilungsanpassung basiert. Anstatt sich auf die Maximierung einzelner Belohnungen zu konzentrieren, fördert das Verfahren vielfältige Lösungswege. Durch den Verzicht auf ein komplexes Partitionierungsnetzwerk zugunsten einer effizienten Monte-Carlo-Schätzung innerhalb der Trainingsstapel wird die Stabilität bei der Skalierung auf Modelle mit bis zu 235 Milliarden Parametern deutlich verbessert.

arxiv.org · 16.07. 04:00

Optimierung der Rechenressourcen beim Reinforcement Learning nach dem Training

Beim Reinforcement Learning nach dem Vortraining stellt sich die Frage, wie ein festes Budget an Rechenleistung optimal verteilt werden sollte. Die Untersuchung analysiert das Verhältnis zwischen Modellgröße, Suchtiefe, Lernintensität und Feedback-Qualität. Dabei zeigt sich, dass es keine universelle Lösung gibt, da die optimale Ressourcenallokation stark von der Modellgröße, dem gewählten Belohnungssystem und dem Ziel der Evaluierung abhängt. Ein neues Diagnoseprotokoll soll helfen, die effizienteste Strategie vor

arxiv.org · 15.07. 04:00

Zuverlässige Entscheidungsfindung durch attribution-basiertes Training mit menschlichen Vorgaben

Modelle erzielen oft hohe Genauigkeit durch fehlerhafte Korrelationen anstatt durch relevante Beweise. Ein neuer Trainingsansatz adressiert dieses Problem, indem menschliche Vorgaben als räumliche Einschränkungen in den Lernprozess integriert werden. Durch eine auf Teilmengen basierende Attributionsmethode wird das Modell bestraft, wenn es seine Entscheidungen auf Bereiche stützt, die nicht den vorgegebenen Kriterien entsprechen. Dies zwingt das System dazu, seine Aufmerksamkeit auf die intendierten Merkmale zu len

arxiv.org · 15.07. 04:00

PluRel: Synthetische Daten ermöglichen Skalierungsgesetze für relationale Basismodelle

Relationale Basismodelle sind für die datengestützte Entscheidungsfindung essenziell, scheitern jedoch oft an der Verfügbarkeit komplexer, datenschutzkonformer Datenbanken. Das neue Framework PluRel löst dieses Problem durch die automatisierte Synthese mehrdimensionaler relationaler Datenbanken. Dabei werden Schemata als gerichtete Graphen, Verbindungen über bipartite Graphen und Merkmalsverteilungen durch kausale Mechanismen modelliert. Die Ergebnisse zeigen erstmals, dass die Skalierung synthetischer Daten zu ein

arxiv.org · 15.07. 04:00

Erklärung der Skalierungsgesetze für Datenmischungen

Aktuelle Forschungsergebnisse führen ein theoretisches Rahmenwerk ein, um die Leistungsfähigkeit von KI-Modellen bei der Verarbeitung von Datenmischungen aus verschiedenen Domänen vorherzusagen. Das Modell basiert auf der Annahme, dass sich Domänen in grundlegenden Fähigkeiten überschneiden, während sie sich in spezialisierten Bereichen unterscheiden. Dabei identifiziert der Ansatz zwei zentrale Faktoren: den Kapazitätswettbewerb, bei dem die begrenzte Modellkapazität die Verluste der Domänen koppelt, sowie die Rau

arxiv.org · 15.07. 04:00

AMUSE: Anytime Muon mit stabiler Gradientenauswertung

Das neue Optimierungsverfahren AMUSE kombiniert die Vorteile der Muon-Methode mit dem Konzept des Schedule-Free-Trainings. Während Muon durch orthogonale Impulsberechnungen schnelle Fortschritte in flachen Verlustlandschaften ermöglicht, neigt es zu Oszillationen in steilen Bereichen. AMUSE löst dieses Problem durch einen zeitlich variablen Interpolationskoeffizienten, der anfangs die schnelle Anpassung von Muon nutzt und im Verlauf auf eine stabilisierende Mittelwertbildung umschaltet. Dies eliminiert die Notwendi

arxiv.org · 15.07. 04:00

Evolutionsstrategien im großen Maßstab: LLM-Feinabstimmung jenseits von Reinforcement Learning

Die Feinabstimmung großer Sprachmodelle erfolgt bisher primär durch Reinforcement Learning. Eine neue Untersuchung zeigt nun, dass Evolutionsstrategien entgegen bisheriger Annahmen ebenfalls für die vollständige Parameteroptimierung von Modellen im Milliarden-Parameter-Bereich geeignet sind. Dieser Ansatz kommt ohne Backpropagation aus und bietet Vorteile wie eine höhere Stabilität, eine geringere Anfälligkeit für Reward-Hacking sowie eine verbesserte Robustheit gegenüber verzögerten Belohnungen. Damit etablieren s

arxiv.org · 15.07. 04:00

Datenschutz bei KI-Modellen: Nicht Informationsabhängigkeit, sondern nicht-robuste Merkmale verursachen Datenlecks

Die Forschung stellt die gängige Annahme infrage, dass das Auswendiglernen von Trainingsdaten die Hauptursache für Datenschutzrisiken bei Bildrekonstruktionsangriffen ist. Stattdessen zeigt sich, dass die Anfälligkeit für solche Angriffe kausal mit sogenannten nicht-robusten Merkmalen zusammenhängt, die für Menschen unsichtbar, aber für KI-Modelle generalisierbar sind. Durch die Einführung eines neuen Trainingsverfahrens namens Anti Adversarial Training wird belegt, dass eine gezielte Nutzung dieser Merkmale den Sc

arxiv.org · 14.07. 04:00

Gefen: Ein speichereffizienter Optimierer für Deep Learning

Gefen ist ein neuer Optimierer für das Training großer neuronaler Netze, der den Speicherbedarf im Vergleich zu AdamW um das Achtfache reduziert. Dies wird durch das Teilen von Momentenschätzungen über Parameterblöcke hinweg und eine adaptive Quantisierung des ersten Moments erreicht, ohne die Leistung zu beeinträchtigen. Da das Verfahren keine zusätzlichen Hyperparameter erfordert und auf bestehenden Strukturen aufbaut, fungiert es als direkter Ersatz für Standard-Optimierer. Die signifikante Einsparung von Arbeit

arxiv.org · 14.07. 04:00

Training mit irrelevanten Zuständen als Datenaugmentierung: Generalisierung in kontextuellen MDPs

Bei der Generalisierung in kontextuellen Markov-Entscheidungsprozessen kann das Training mit irrelevanten Zuständen die Leistung auf unbekannten Kontexten verbessern, beeinträchtigt jedoch potenziell die Genauigkeit der Wertfunktion. Die Forschung zeigt, dass eine Kombination aus erhöhter Abdeckung durch zusätzliche Zustände und einer gesteigerten Genauigkeit der Wertfunktion die Generalisierungsfähigkeit signifikant steigert. Mit Explore-Go wird ein neuer Ansatz vorgestellt, der eine reine Explorationsphase zu Beg

arxiv.org · 13.07. 04:00

HiPO: Hierarchische Präferenzoptimierung für adaptives Schlussfolgern in Sprachmodellen

Die neue Methode HiPO erweitert das bestehende Framework der direkten Präferenzoptimierung, um die Leistung großer Sprachmodelle bei komplexen logischen Aufgaben zu verbessern. Anstatt die gesamte Antwort als Einheit zu bewerten, unterteilt das Verfahren die Lösung in spezifische Segmente wie Kontext, einzelne Denkschritte und das Endergebnis. Durch eine gewichtete Verlustfunktion für diese Teilbereiche wird das Training präziser gesteuert, ohne die rechnerische Effizienz zu beeinträchtigen. In Tests mit mathematis

arxiv.org · 13.07. 04:00

Ein praktischer Leitfaden zur Erzeugung synthetischer Daten mit Differential Privacy

Hochwertige Daten sind für das Training leistungsfähiger KI-Systeme essenziell, doch die Nutzung realer Nutzerdaten birgt erhebliche Datenschutzrisiken. Differential Privacy bietet einen etablierten Rahmen, um synthetische Datensätze zu erstellen, die statistische Trends bewahren und gleichzeitig die Privatsphäre der Individuen schützen. Dieser Leitfaden erläutert die notwendigen technischen Komponenten für die Generierung solcher Daten, von der Datenvorbereitung bis hin zur empirischen Prüfung der Privatsphäre. Zi

arxiv.org · 13.07. 04:00

Eine deskriptive und normative Theorie menschlicher Überzeugungen bei RLHF

Bei der Optimierung von KI-Modellen durch menschliches Feedback (RLHF) spielen nicht nur Belohnungsfunktionen eine Rolle, sondern auch die Erwartungen der Labeler an die Fähigkeiten des Agenten. Diese Studie untersucht, wie Überzeugungen über KI-Leistungen die Präferenzbildung beeinflussen und welche Auswirkungen Fehlannahmen auf die resultierende Modellpolitik haben. Es wird ein neues Präferenzmodell vorgestellt, das menschliche Überzeugungen explizit integriert. Die Ergebnisse zeigen, dass die Annahme einer perfe

arXiv – cs.CL 6 Artikel Forschung
arxiv.org · 17.07. 06:00

Verbalized Sampling: Strategien gegen Mode Collapse und für mehr Vielfalt bei Sprachmodellen

Das Phänomen des Mode Collapse, bei dem Sprachmodelle an Diversität verlieren, wird häufig auf algorithmische Einschränkungen zurückgeführt. Die Untersuchung zeigt jedoch, dass ein systematischer Bias in Präferenzdaten die Hauptursache ist, da menschliche Annotatoren bevorzugt vertraute Textmuster wählen. Als Lösung wird Verbalized Sampling eingeführt, eine Methode ohne zusätzliches Training, bei der das Modell angewiesen wird, Wahrscheinlichkeitsverteilungen über verschiedene Antwortmöglichkeiten zu generieren. Di

arxiv.org · 17.07. 06:00

Trainingsdaten für KI-Modelle können durch computergestützte Propaganda manipuliert werden

Die Manipulation von Trainingsdaten stellt ein erhebliches Sicherheitsrisiko für Sprachmodelle dar, da sie schwer erkennbare und schädliche Verhaltensweisen induzieren kann. Bisherige Untersuchungen vernachlässigten oft die Komplexität und Heterogenität moderner Datensätze. Eine neue Analyse zeigt, dass öffentliche Diskussionsplattformen als Vektoren für groß angelegte Injektionsangriffe dienen können. Mit dem entwickelten Analysetool HalfLife lässt sich nun erstmals quantifizieren, inwieweit bösartige Inhalte trot

arxiv.org · 17.07. 06:00

Jenseits von Entropie: Korrektheitsbewusste Advantage-Formung durch kontrastive Richtlinienoptimierung

Die kontrastive Richtlinienoptimierung (CPO) bietet einen neuen Ansatz für das Reinforcement Learning mit verifizierbaren Belohnungen. Anstatt sich auf Entropie zu verlassen, nutzt das Verfahren tokenbasierte Diskrepanzen zwischen referenzgesteuerten und Standard-Generierungsverteilungen, um die Korrektheit von Modellen präziser zu bewerten. Dieser Ansatz löst das Problem verschwindender Vorteile und verbessert die Leistung bei In-Domain- sowie Out-of-Domain-Benchmarks erheblich. Durch die gezielte Balance zwischen

arxiv.org · 17.07. 06:00

Rubrics on Trial: Entwicklung von Bewertungsmaßstäben durch synthetische paarweise Evidenz

Das neue Framework Rubrics on Trial ermöglicht die automatisierte Erstellung präziser Bewertungsmaßstäbe für große Sprachmodelle, ohne auf externe menschliche Annotationen oder ein zusätzliches Modelltraining angewiesen zu sein. Das Verfahren generiert Bewertungskriterien direkt aus der Anfrage und validiert diese durch synthetische Antwortpaare. Dadurch werden ungeeignete, nicht diskriminierende oder zu spezifische Kriterien frühzeitig aussortiert. In verschiedenen Benchmarks zeigt sich, dass dieser Ansatz die Gen

arxiv.org · 13.07. 04:00

Latent Thoughts Tuning: Verknüpfung von Kontext und logischem Denken durch fusionierte Informationen in latenten Tokens

Latent Thoughts Tuning ist ein neues Post-Training-Framework, das die logischen Fähigkeiten von Sprachmodellen verbessert, indem es das Denken in kontinuierlichen latenten Räumen optimiert. Anstatt sich ausschließlich auf rohe verborgene Zustände zu verlassen, nutzt das Verfahren einen Mechanismus zur Fusion von Kontextvorhersagen und semantischen Hinweisen aus dem Vokabular-Einbettungsraum. Durch einen dreistufigen Lehrplan ermöglicht das System zudem einen dynamischen Wechsel zwischen latenten und expliziten Denk

arxiv.org · 13.07. 04:00

Ordnungsruf: Aktionsorientierte LLM-Personamodellierung für datengestützte bürgerschaftliche Beratung

Die Simulation bürgerschaftlicher Beratungsprozesse mittels großer Sprachmodelle scheitert bisher oft an fehlenden Sprecherzuordnungen und mangelnden Methoden zur Bewertung institutionellen Verhaltens. Ein neuer Ansatz transformiert öffentliche Videoaufzeichnungen in sprecherbezogene Transkripte, die um spezifische Rollenprofile und pragmatische Aktionsmarkierungen ergänzt werden. Durch das Training auf diesen strukturierten Daten lassen sich KI-Personas erzeugen, die institutionelle Abläufe und Verhaltensweisen pr

The Decoder 1 Artikel News
the-decoder.com · 13.07. 14:28

Kritik an KI-Laboren: Widersprüche bei Datennutzung und Modell-Destillation

Führende KI-Unternehmen stehen in der Kritik, da sie einerseits öffentlich zugängliche Daten für das Training ihrer Modelle unter Berufung auf Fair-Use-Prinzipien nutzen, andererseits jedoch die Destillation ihrer eigenen Modelle durch Dritte untersagen. Diese Praxis wird als Informationsparadoxon bezeichnet, da die Firmen gleichzeitig von Nutzerinteraktionen lernen, während sie anderen den Zugriff auf ihre Technologie verwehren. Gefordert wird eine stärkere Kontrolle der Unternehmen über ihre eigene Lerninfrastruk