>_ der Promptbote
News vom 29.7.2026  ·  508 neue Artikel heute  ·  9 Kanäle
Schlagwort: Große SprachmodelleFilter entfernen ×
arXiv – cs.CL 18 Artikel Forschung
arxiv.org · 29.07. 06:00

ClinFusion: Ein visionszentriertes multimodales KI-System für das ganzheitliche medizinische Verständnis

Forscher haben ein neues multimodales Sprachmodell entwickelt, das gezielt auf die visuell geprägten Anforderungen der klinischen Medizin ausgerichtet ist. Das System kombiniert eine kaskadierte Architektur zur Verarbeitung unterschiedlicher zweidimensionaler und dreidimensionaler medizinischer Bilddaten mit einem neuartigen Auswertungsrahmenwerk. Durch präzise lokalisierte Analysen und faktenbasierte Berichterstellung erzielt die Entwicklung in zahlreichen standardisierten Benchmarks Bestwerte. Fachärztliche Valid

arxiv.org · 29.07. 06:00

Systematische Analyse von Sprachmodellen und Transformer-basierten Übersetzungssystemen für Englisch und Tamil

Die Untersuchung widmet sich den Herausforderungen der maschinellen Übersetzung für ressourcenarme Sprachen am Beispiel des Sprachpaars Englisch und Tamil. Dabei werden verschiedene überwachte neuronale Übersetzungsmodelle sowie spezialisierte Sprachmodelle anhand mehrerer Datensätze umfassend evaluiert. Die Ergebnisse zeigen, dass sowohl die Datenqualität als auch die Domänenanpassung die Modellleistung massiv beeinflussen. Zudem verdeutlichen aufmerksamkeitsbasierte Analysen und Few-Shot-Ansätze mit großen Sprach

arxiv.org · 29.07. 06:00

CAGE: Kognitive Attributionsgraphen für verlässliche Inline-Zitate bei ausführlichen Antworten

Ausführliche Antworten von Sprachmodellen basieren häufig auf abgerufenen Beweisen, weisen jedoch oft Zitate zu, die inhaltlich zwar verwandt, aber für die konkrete Behauptung unzureichend sind. Zur Lösung dieses Problems wurde ein zweistufiges Framework namens CAGE entwickelt, das vor der eigentlichen Textgenerierung eine explizite kognitive Attributionskarte erstellt. Ein sogenanntes Cognitive Map Induction Model konstruiert dabei antwortzentrierte Unterstützungs-Subgraphen, während ein strukturiertes Zitier-Mode

arxiv.org · 29.07. 06:00

M2PO: Multi-Perspektiven-Präferenzoptimierung für maschinelle Übersetzung

Die Ausrichtung von Sprachmodellen an menschlichen Vorlieben ist entscheidend für die maschinelle Übersetzung, leidet jedoch oft unter irreführenden Belohnungssignalen bei partiellen Fehlern wie Halluzinationen oder Auslassungen. Um diese Schwächen zu beheben, wurde ein datenzentriertes Framework zur Präferenzoptimierung entwickelt, das semantische Treue und Sprachfluss durch einen dualen Mechanismus entkoppelt. Ein neuartiger Multi-Paar-Ansatz nutzt zudem das gesamte Kandidatenspektrum, um feingranulare Fehlersign

arxiv.org · 29.07. 06:00

Schutz und Risiko: Eine Übersicht zur Erzeugung schädlicher Inhalte und Sicherheitsmaßnahmen bei Sprachmodellen

Große Sprachmodelle bieten enorme Potenziale in der Textgenerierung, bergen jedoch gleichzeitig das Risiko, toxische, anstößige oder voreingenommene Inhalte zu erzeugen. Eine aktuelle Untersuchung beleuchtet diese zweifache Rolle und analysiert systematisch sowohl unbeabsichtigte Toxizität als auch gezielte Jailbreak-Angriffe. Im Fokus stehen dabei umfassende Schutzmechanismen wie Inhaltsmoderation, Sicherheitsausrichtung und Reinforcement Learning mit menschlichem Feedback. Die Arbeit stellt eine einheitliche Taxo

arxiv.org · 29.07. 06:00

Med-R3: Verbesserung des medizinischen Retrieval-Augmented Reasoning von Sprachmodellen durch progressives Bestärkungslernen

Für medizinische Anwendungen ist die Kombination aus externem Wissen und logischem Schließen von großer Bedeutung, doch bisherige Ansätze optimieren beide Bereiche meist isoliert und setzen stark auf überwachtes Feintuning. Dies schränkt die Generalisierungsfähigkeit ein und lässt spezifische Anforderungen des medizinischen Fachbereichs unberücksichtigt. Um diese Defizite zu beheben, wurde ein neues Framework entwickelt, das auf progressivem Bestärkungslernen basiert und die Fähigkeiten zum logischen Schließen sowi

arxiv.org · 29.07. 06:00

Auf dem Weg zum Verständnis der kognitiven Gewohnheiten großer Schlußfolgerungsmodelle

Grosse Sprachmodelle mit integrierten Denkprozessen zeigen beim autonomen Generieren von Lösungswegen menschlich anmutende kognitive Gewohnheiten. Um diese Verhaltensmuster systematisch zu untersuchen, wurde ein neuer Evaluationsrahmen mit sechzehn verschiedenen Gewohnheiten entwickelt. Die Auswertung zahlreicher Modelle zeigt, dass diese nicht nur artspezifische Problemlösungsmuster aufweisen, sondern diese auch aufgabenabhängig anpassen. Zudem offenbaren Analysen Zusammenhänge zwischen bestimmten Verhaltensmuster

arxiv.org · 29.07. 06:00

Lokalisierung von Personenrepräsentationen in großen Sprachmodellen

In einer aktuellen Untersuchung wurde analysiert, wie und an welchen Stellen unterschiedliche menschliche Merkmale, Werte und Weltanschauungen im Repräsentationsraum großer Sprachmodelle verschlüsselt sind. Mithilfe von Dimensionsreduktion und Mustererkennung zeigte sich, dass signifikante Unterschiede in der Kodierung von Persönlichkeiten vor allem im letzten Drittel der Decoder-Schichten auftreten. Dabei lassen sich für ethische Perspektiven teils überlappende Aktivierungen beobachten, während politische Ideologi

arxiv.org · 29.07. 06:00

Ein kosteneffizientes multimodales LLM-Framework für die Fragebeantwortung über unregelmäßige klinische Zeitreihen

Für die automatisierte Auswertung medizinischer Zeitreihen wurde ein neues multimodales Sprachmodell-Framework namens ClinPRISM entwickelt, das speziell auf die Herausforderungen unregelmäßiger klinischer Daten ausgelegt ist. Das System kombiniert einen unregelmäßigkeitsbewussten Multiskalen-Encoder mit einem temporalen Evidenz-Distiller, um spärliche Daten effizient zu verdichten und in den Einbettungsraum großer Sprachmodelle zu integrieren. Durch eine progressive Ausrichtungsstrategie werden die klinischen Traje

arxiv.org · 29.07. 06:00

RSIBench-Data: Evaluierung von KI-Agenten für datenzentrierte rekursive Selbstverbesserung

Ein neuer Benchmark namens RSIBench-Data untersucht die Fähigkeit von Sprachmodell-Agenten, datenzentrierte Forschungsprozesse im Rahmen der rekursiven Selbstverbesserung zu automatisieren. Dabei optimieren die Agenten iterativ Trainingsdatenstrategien für ein festes Zielmodell, während Trainings- und Evaluationsinfrastrukturen standardisiert sind. Tests mit führenden Agenten zeigen, dass diese zwar in der Mehrzahl der Fälle durch Feedback Verbesserungen gegenüber ersten Versuchen erzielen, diese Optimierungen jedo

arxiv.org · 29.07. 06:00

Die Leistungsfähigkeit von KI bei der Unterstützung der wissenschaftlichen Forschung in Physik, Astrophysik und Kosmologie I: Literaturrecherche

In einer kontrollierten Studie wurde untersucht, inwiefern große Sprachmodelle bei der Literaturrecherche für wissenschaftliche Forschungsprojekte unterstützen können. Dabei traten menschliche Experten und KI-gestützte Prompter in acht Fachprojekten aus den Bereichen Physik, Astrophysik und Kosmologie gegeneinander an. Die von aktuellen Sprachmodellen ausgewählten Literaturreferenzen wurden mit den Ergebnissen der menschlichen Experten verglichen. Die Auswertung zeigte, dass die Überschneidung zwischen den von Mens

arxiv.org · 29.07. 06:00

MemSFT: Verringerung der Alignment-Steuer durch einen externen parametrischen Speicher

Die Anpassung großer Sprachmodelle an spezialisiertes Fachwissen führt oft zu Leistungseinbußen bei allgemeinen Aufgaben. Ein neu entwickelter Ansatz namens MemSFT entkoppelt die Spezialisierung von der Aktualisierung der Basisparameter durch einen modularen parametrischen Speicher. Ein dynamischer Router kombiniert während der Generierung die Ausgaben des Speichers und des Basismodells, wodurch Fachwissen selektiv abgerufen werden kann. Tests in verschiedenen Fachbereichen zeigen, dass die Leistung in Spezialdomän

arxiv.org · 17.07. 06:00

MemTrace: Fehlerverfolgung und Ursachenanalyse in Speichersystemen für große Sprachmodelle

Speichersysteme sind entscheidend für die langfristige Argumentationsfähigkeit großer Sprachmodelle, leiden jedoch häufig unter mangelnder Zuverlässigkeit und schwieriger Fehlerdiagnose. Das neue Framework MemTrace transformiert Speicherabläufe in ausführbare Evolutionsgraphen, um den Informationsfluss präzise nachzuvollziehen. Ergänzt durch den Benchmark MemTraceBench ermöglicht das System eine automatisierte Ursachenanalyse für Speicherfehler. Die Ergebnisse zeigen, dass Fehler meist auf operativer Ebene entstehe

arxiv.org · 17.07. 06:00

Idea2Plan: Untersuchung KI-gestützter Forschungsplanung

Große Sprachmodelle besitzen das Potenzial, den wissenschaftlichen Erkenntnisprozess durch die Strukturierung von Forschungsideen zu beschleunigen. Um diese Fähigkeit systematisch zu bewerten, wurde das Idea2Plan-Framework entwickelt, das auf aktuellen wissenschaftlichen Publikationen basiert. Es umfasst Benchmarks zur Messung der Planungsqualität sowie ein Evaluationssystem für KI-basierte Beurteilungen. Die Ergebnisse zeigen, dass aktuelle Modelle zwar Fortschritte bei der Erstellung strukturierter Forschungsplän

arxiv.org · 17.07. 06:00

WrAFT: Ein modularisiertes System zur automatisierten Bewertung argumentativer Essays

Das neue System WrAFT ermöglicht die automatisierte Bewertung und Analyse argumentativer Essays durch einen modularen Aufbau, der sich in Punktevergabe sowie oberflächliches und tiefgreifendes Feedback unterteilt. Unter Einsatz verschiedener großer Sprachmodelle erreicht die Lösung bei der Bewertung von TOEFL-Texten eine hohe Genauigkeit, die mit offiziellen Benchmarks vergleichbar ist. Neben der präzisen Benotung bietet das System detaillierte Rückmeldungen, die in menschlichen Evaluationen eine hohe Akzeptanz erz

arxiv.org · 17.07. 06:00

RetroAgent: Nutzung von LLMs zur Suche in strukturiertem Gedächtnis für die agentenbasierte Retrosyntheseplanung

Die computergestützte Retrosyntheseplanung zielt darauf ab, Zielmoleküle effizient in kommerziell verfügbare Bausteine zu zerlegen. RetroAgent kombiniert hierfür symbolische Suche mit den Schlussfolgerungsfähigkeiten großer Sprachmodelle. Durch ein strukturiertes Gedächtnis und spezialisierte chemische Werkzeuge kann der Agent den gesamten Suchzustand erfassen, bereits erkundete Routen bewerten und fundierte Entscheidungen treffen. Diese Methode überwindet die Einschränkungen herkömmlicher Ansätze, die oft nur isol

arxiv.org · 13.07. 04:00

Agora: Optimierung der Schlussfolgerungsfähigkeit von KI-Agenten durch auktionsbasierte Aufgabenverteilung

Das Framework Agora verbessert die Effizienz von KI-Agenten, indem es Aufgaben dynamisch über einen auktionsbasierten Mechanismus an spezialisierte Modelle verteilt. Anstatt sich auf eine grobe Zuordnung zu verlassen, bewertet das System die Kompetenz der verfügbaren Werkzeuge und Modelle anhand von Geboten. Dieser Ansatz stellt sicher, dass komplexe logische Schritte an die leistungsfähigsten Solver geleitet werden, anstatt an Modelle mit der höchsten Selbstüberschätzung. Durch die Implementierung dieses Auktionsm

arxiv.org · 13.07. 04:00

Git-Assistant: Planungsbasierte Unterstützung für Git-Repository-Updates

Git-Assistant ist ein KI-gestütztes Werkzeug, das große Sprachmodelle mit automatisierter Planung kombiniert, um Entwickler bei komplexen Git-Operationen zu unterstützen. Das System analysiert den Kontext eines Repositories und übersetzt Anfragen in natürlicher Sprache in präzise Befehlssequenzen. Durch die Integration formaler Planungstechniken wird die Korrektheit und Sicherheit der ausgeführten Befehle sichergestellt. Evaluierungen zeigen, dass dieser hybride Ansatz die Zuverlässigkeit bei der Repository-Verwalt

Hacker News – AI/LLM 14 Artikel Community
theatlantic.com · 29.07. 04:01

Urheberrechtlich geschützte Bücher bekannter Autoren für das Training von generativer KI verwendet

Tausende urheberrechtlich geschützte Werke bekannter Schriftstellerinnen und Schriftsteller wurden offenbar zum Training großer Sprachmodelle herangezogen. Zu den betroffenen Personen zählen prominente Autoren wie Stephen King, Zadie Smith und Michael Pollan. Dieser Umstand wirft erneut drängende rechtliche und ethische Fragen hinsichtlich der unautorisierten Nutzung urheberrechtlich geschützten Materials im Bereich der künstlichen Intelligenz auf. Die Enthüllungen verdeutlichen den anhaltenden Konflikt zwischen de

github.com · 28.07. 19:48

Ein Browser für große Sprachmodelle zur Erforschung alternativer Universen

Ein neues Open-Source-Projekt verbindet Webbrowser-Funktionalitäten mit großen Sprachmodellen, um Nutzern die interaktive Erkundung bestehender sowie rein hypothetischer Universen zu ermöglichen. Durch die Integration von künstlicher Intelligenz lassen sich dynamische Inhalte generieren und kontextbezogen analysieren. Das Werkzeug demonstriert neuartige Ansätze für die Mensch-Computer-Interaktion und die kreative Wissensvermittlung auf Basis generativer Modelle.

justinflick.com · 28.07. 02:06

Warum man großen Sprachmodellen keine Konfidenzwerte entlocken sollte

Große Sprachmodelle eignen sich schlecht dafür, verlässliche Wahrscheinlichkeiten oder Konfidenzwerte für ihre eigenen Antworten zu liefern. Solche internen Metriken spiegeln oft nicht die tatsächliche Korrektheit der generierten Ausgabe wider und können zu einer falsch verstandenen Sicherheit führen. Bei kritischen Anwendungen sollten Entwickler daher auf alternative Validierungsmethoden anstatt auf direkte Wahrscheinlichkeitsangaben des Modells setzen.

antirez.com · 27.07. 23:15

Verteilung von LLM-Inferenz in DwarfStar

Die Inferenz von großen Sprachmodellen erfordert enorme Rechenressourcen, was die Verteilung auf verschiedene Systeme und Architekturen notwendig macht. Ein neuer Ansatz namens DwarfStar widmet sich dieser Herausforderung, um die Effizienz und Skalierbarkeit bei der Ausführung von KI-Modellen zu verbessern. Durch optimierte Verteilungsstrategien soll die Leistung gesteigert und der Ressourcenbedarf bei der Modellrechnung minimiert werden. Dies ist ein wichtiger Schritt für den effizienten Betrieb moderner KI-System

platformengineering.org · 27.07. 22:14

Plattform-Engineering 2.0 mindert Sicherheits- und Compliance-Risiken bei KI

Der Übergang zum Plattform-Engineering 2.0 bietet Lösungsansätze zur Bewältigung zentraler Sicherheits- und Compliance-Herausforderungen beim Einsatz von künstlicher Intelligenz. Durch native Modellgovernance und Arbeitslastisolierung wird ein skalierbares sowie sicheres Fundament geschaffen. Dies ermöglicht eine kontrollierte Integration von KI-Agenten und großen Sprachmodellen in produktive Arbeitsabläufe.

fnune.com · 26.07. 14:30

Die Produktfunktion im Zeitalter der Künstlichen Intelligenz

Durch den Einsatz von großen Sprachmodellen wird die Softwareentwicklung in der Ausführung zwar deutlich beschleunigt, doch dies erhöht gleichzeitig die Bedeutung einer präzisen und zielgerichteten Produktstrategie. Wenn die technische Umsetzung schneller erfolgt, wird es umso wichtiger, dass das Produktteam von Anfang an die korrekte Richtung vorgibt. Künstliche Intelligenz verschiebt den Schwerpunkt somit von reiner Programmierleistung hin zu strategischer Planung und Ausrichtung. Unternehmen müssen sicherstellen

github.com · 26.07. 13:42

Eine interaktive Oberfläche für LLM-Gespräche als editierbare Gedankenlandkarte

Ein neues Open-Source-Projekt bietet eine unendliche Arbeitsfläche, auf der Konversationen mit großen Sprachmodellen in dynamische und editierbare Wissensgraphen überführt werden. Verbindungen zwischen den Knotenpunkten dienen dabei als direkter Kontext für die generierten Inhalte. Nutzer können ihre Gedankenprozesse visuell anordnen, vernetzen und interaktiv weiterentwickeln. Dies ermöglicht eine strukturiertere Interaktion mit KI-Systemen jenseits des klassischen Chat-Verlaufs.

kraghavan.ca · 26.07. 07:17

Praxisleitfaden für LLM-gestützte Bewertungen

Der Artikel beleuchtet die Funktionsweise und Herausforderungen beim Einsatz von großen Sprachmodellen als automatisierte Bewerter. Basierend auf intensiven Recherchen und eigenen Experimenten werden zentrale Erkenntnisse und Best Practices für diese Evaluierungsmethode vermittelt. Dabei wird aufgezeigt, wie solche Bewertungs-Pipelines effektiv aufgebaut und typische Fallstricke vermieden werden können. Die Ausarbeitung dient als fundierte Orientierungshilfe für Entwickler, die generative Modelle zur Qualitätsmessu

arxiv.org · 24.07. 09:39

Jenseits statischer Zusammenfassungen: Proaktive Speicherextraktion für KI-Agenten

Für die Bewältigung langfristiger Interaktionen und Personalisierung ist ein effizientes Gedächtnismanagement von entscheidender Bedeutung. Bisherige Ansätze konzentrieren sich meist auf die Organisation und Nutzung von Speicherzusammenfassungen, vernachlässigen dabei jedoch oft die entscheidende Phase der initialen Speicherextraktion. Basierend auf der Theorie der rekurrenten Verarbeitung wird aufgezeigt, dass herkömmliche, rein zusammenfassende Methoden erhebliche Einschränkungen aufweisen, da sie typischerweise

arxiv.org · 24.07. 03:10

Mathematische Forschung voranbringen mit KI-gestützter formaler Beweissuche

Große Sprachmodelle zeigen starkes Potenzial im mathematischen Schließen, leiden jedoch unter mangelnder Zuverlässigkeit in der Forschung. Um dem entgegenzuwirken, werden solche Modelle eingesetzt, um formale Beweise in Programmiersprachen wie Lean zu generieren. In einer umfassenden Untersuchung wurde dieser Ansatz erstmals in großem Maßstab an ungelösten mathematischen Problemen getestet. Dabei gelang es einem autonomen Agenten, mehrere bekannte offene Probleme erfolgreich zu lösen.

cbowdon.github.io · 23.07. 23:02

Erforschung der Fitnessstudio-Teuerung mit KI

Eine neue Untersuchung nutzt Videodaten von Online-Plattformen und große Sprachmodelle, um die wirtschaftlichen Entwicklungen und Preisanstiege in der Fitnessbranche zu analysieren. Durch die automatisierte Auswertung von Inhalten lässt sich feststellen, in welchem Maße Preissteigerungen in diesem Sektor tatsächlich stattfinden und wie sie öffentlich diskutiert werden. Dieser datengetriebene Ansatz verdeutlicht das Potenzial von KI-gestützten Text- und Videoanalysen für sozioökonomische Fragestellungen.

github.com · 23.07. 03:03

Entwicklung einer Web-Scraping-Engine mit LLM-gesteuerter Konfiguration

Ein Entwickler hat ein neuartiges System zur Datenerfassung von Websites und Schnittstellen vorgestellt, bei dem große Sprachmodelle die notwendigen Konfigurationen anstelle von klassischem Programmcode erstellen. Dieser Ansatz zielt darauf ab, den Prozess des Extrahierens von Informationen zu vereinfachen und flexibler zu gestalten. Durch die automatisierte Generierung von Konfigurationsdaten entfällt ein Teil des manuellen Aufwands bei der Erstellung von Scrapern. Die Lösung demonstriert praktische Anwendungsmögl

arxiv.org · 23.07. 00:49

Anthropomorphismus in den Interaktionen von Kindern mit KI-Chatbots

Forscher haben untersucht, wie Kinder menschliche Eigenschaften auf sprachbasierte KI-Chatbots übertragen und diese vermenschlichen. Eine Auswertung von 35 empirischen Studien aus den Jahren 2022 bis 2025 fasst die bisherigen, oft fragmentierten Erkenntnisse zu diesem Phänomen zusammen. Die Ergebnisse verdeutlichen, wie junge Nutzer mit künstlichen Intelligenzen kommunizieren und welche psychologischen Mechanismen dabei eine Rolle spielen. Dies liefert wichtige Einblicke für die Gestaltung zukünftiger Bildungs- und

github.com · 21.07. 18:26

KI-gestütztes Tool zur hierarchischen Themenmodellierung

Ein neues Werkzeug nutzt große Sprachmodelle, um Texte automatisiert und in einer hierarchischen Struktur nach Themen zu ordnen. Diese Methode ermöglicht eine präzisere und tiefgehendere Analyse von großen Dokumentenmengen. Durch die Kombination von kontextsensitivem Sprachverständnis und strukturierter Klassifikation lassen sich verborgene Muster in Textdaten effizient aufdecken. Das Verfahren unterstützt Anwender dabei, komplexe Informationsräume übersichtlich zu organisieren und thematische Zusammenhänge schnell

The Verge – AI 1 Artikel News
theverge.com · 28.07. 13:39

Intelligente Ringe als vielversprechende KI-Geräte

Die Weiterentwicklung von Sprach-zu-Text-Technologien und großen Sprachmodellen hat die Diktierfunktion auf verschiedenen Geräten stark verbessert. Besonders die Integration dieser fortschrittlichen Spracherkennung in ko

arXiv – cs.LG 19 Artikel Forschung
arxiv.org · 28.07. 06:00

EvalSafetyGap: Ein hybrider Überblick und konzeptioneller Rahmen für die Bewertung von LLM-Sicherheitsfehlern

Diese Untersuchung beleuchtet die grundlegenden Messprobleme bei der Evaluierung großer Sprachmodelle und der KI-Sicherheit, bei denen Benchmark-Ergebnisse und Sicherheitsmetriken steigen können, während die zugrundeliegenden Fähigkeiten und Eigenschaften unsicher bleiben. Durch die Synthese zahlreicher Studien aus den Jahren 2018 bis 2026 wird eine Evidenztaxonomie erstellt, die Bereiche wie Benchmark-Validität, Kontamination und gegnerische Sicherheitstests strukturiert. Darauf aufbauend wird ein konzeptioneller

arxiv.org · 28.07. 06:00

Wiederholungs-Token-Zählung enthüllt Dissoziation zwischen internen Repräsentationen und Ausgaben

Große Sprachmodelle scheitern häufig daran, die Wiederholungen von Wörtern in Listen korrekt zu zählen, obwohl sie komplexe Denkaufgaben meistern. Neue Analysen zeigen, dass diese Fehler nicht auf mangelnde interne Zählkapazitäten zurückzuführen sind. Lineare Sonden belegen, dass die Modelle die korrekte Anzahl intern durchgehend fehlerfrei repräsentieren, selbst wenn die endgültige Ausgabe falsch ist. Stattdessen überschreibt ein spezifischer Block im neuronalen Netzwerk den korrekten Zählwert kurz vor der Ausgabe

arxiv.org · 27.07. 06:00

Die Geometrie der Persönlichkeit: Aktivierungssteuerung mit jungianischen kognitiven Funktionen

Große Sprachmodelle lassen sich durch gezielte Aktivierungssteuerung präzise in ihrem Verhalten beeinflussen, wobei bisher meist statische Persönlichkeitsmodelle verwendet wurden. Neue Untersuchungen zeigen, dass sich Persönlichkeiten auch über die acht kognitiven Funktionen nach Carl Jung abbilden und steuern lassen. Mithilfe eines neuartigen Evaluationsprotokolls und eines umfangreichen Datensatzes gelang es Forschern, die Aktivierungsvektoren für alle acht Funktionen erfolgreich zu kontrollieren. Die Analysen of

arxiv.org · 24.07. 06:00

Mit der Theorie des Geistes lernen: Ein Doppelagent-Verteidiger zur Überzeugungssteuerung

Große Sprachmodelle erfordern ausgefeilte Fähigkeiten zur Einschätzung der Intentionen ihrer Gesprächspartner, um in potenziell adversarialen Umgebungen sicher zu agieren. Ein neuartiger datenschutzorientierter Benchmark namens ToM-SB untersucht, wie ein verteidigender Agent als Doppelagent agiert, um die Überzeugungen eines Angreifers gezielt zu steuern und die Preisgabe sensibler Informationen zu verhindern. Die Untersuchung zeigt, dass selbst führende Sprachmodelle bei dieser Aufgabe in schwierigen Szenarien oft

arxiv.org · 22.07. 06:00

Kontextmaskierte Begründungsprüfungen zur Erkennung von Antwortschlüssel-Abhängigkeit in KI-Tutoren

Große Sprachmodelle als Bildungstuporen nutzen oft versteckte Quellen wie Antwortschlüssel oder Lösungswege, um Erklärungen für Lernende zu generieren. Forscher haben eine Methode namens TRACE entwickelt, um zu untersuchen, ob verkürzte Überlegungen den direkten Zugriff auf diese privaten Kontexte nachweisen können. Die Ergebnisse zeigen, dass Modelle stark von im Hintergrund bereitgestellten Antworten beeinflusst werden und diese Information in ihren Ausgaben spiegeln. Durch eine gezielte Kontextmaskierung lässt s

arxiv.org · 22.07. 06:00

EvalSafetyGap: Ein hybrider Überblick und konzeptioneller Rahmen für die Sicherheitsbewertung von Sprachmodellen

Die Sicherheitsbewertung großer Sprachmodelle leidet unter Validitätsproblemen und unzureichender Verifizierbarkeit latenter Eigenschaften trotz steigender Metrikwerte. Eine neue Untersuchung verbindet eine systematische Literatursynthese mit einem konzeptionellen Rahmen und einem strukturierten Audit an zehn verschiedenen Modellen. Dabei werden acht Evidenzströme von Benchmarks bis hin zu Governance-Fragen analysiert und das Konzept der EvalSafetyGap als Hypothese zur Untersuchung von Proxy-Fehlern unter Optimieru

arxiv.org · 22.07. 06:00

Die Korrektheitsillusion bei KI-generierten GPU-Kernels

Aktuelle Benchmarks zur Bewertung von KI-generierten GPU-Kernels nutzen oft nur starre, vereinfachte Tests mit festen Datengrößen, wodurch fehlerhafte Programmierungen fälschlicherweise als korrekt eingestuft werden können. Um diese Lücke zu schließen, wurde ein präziseres Testverfahren mittels schema-bewusstem Fuzzing und hochpräzisen Referenzrechnungen entwickelt. Die Untersuchung zeigt, dass herkömmliche Methoden subtile Übersetzungsfehler übersehen, während der erweiterte Prüfansatz fehlerhafte Kernel zuverläss

arxiv.org · 21.07. 06:00

FAME: Fehlerbewusste Mixture-of-Experts-Architektur zur nachrichtenbasierten Log-Anomalieerkennung

Die Überwachung von Produktionssystemen erfordert effiziente Methoden zur Identifikation von Fehlern in Log-Daten. Herkömmliche Ansätze arbeiten oft auf einer zu groben Ebene, während die direkte Analyse durch große Sprachmodelle für den Dauerbetrieb zu rechenintensiv ist. FAME löst dieses Problem durch ein Mixture-of-Experts-Framework, das große Sprachmodelle lediglich für die initiale Offline-Konfiguration nutzt. Durch die Partitionierung in Fehlerdomänen und das Training leichtgewichtiger Expertenmodelle erreich

arxiv.org · 17.07. 06:00

MemTrace: Fehlerverfolgung und Ursachenanalyse in Speichersystemen für große Sprachmodelle

Die Zuverlässigkeit von Speichersystemen in großen Sprachmodellen ist entscheidend für langfristiges logisches Schlussfolgern, stellt jedoch aufgrund mangelnder Transparenz eine Herausforderung dar. MemTrace adressiert dieses Problem durch ein Framework, das Speicherabläufe in ausführbare Evolutionsgraphen überführt und so den Informationsfluss präzise nachvollziehbar macht. Mithilfe des neuen Benchmarks MemTraceBench wurden systematische Fehlerquellen identifiziert, die häufig auf Informationsverlust oder fehlerha

arxiv.org · 17.07. 06:00

KI-gestützte Konstruktion von Bayes-Netzen für operative Entscheidungsunterstützung

Die Erstellung von Bayes-Netzen zur Entscheidungsfindung unter Unsicherheit ist oft komplex, da sie entweder auf Expertenwissen oder umfangreichen Datensätzen basiert. Ein neuer methodischer Ansatz nutzt nun große Sprachmodelle, um diese Lücke zu schließen. Dabei simuliert ein Gremium aus KI-Agenten mit spezifischen Personas Wahrscheinlichkeitsschätzungen, deren Rauschen durch statistische Verfahren reduziert wird. Die Anwendung dieses sechsstufigen Frameworks verdeutlicht am Beispiel der Patientenberatung, dass so

arxiv.org · 16.07. 04:00

Verkehrsbewusste randomisierte Glättung für LLM-basierte Netzwerkerkennung

Die Sicherheit von auf großen Sprachmodellen basierenden Systemen zur Netzwerkerkennung ist anfällig für gezielte Manipulationen des Datenverkehrs. Ein neuer Ansatz namens Traffic-Aware Randomized Smoothing (TA-RS) adressiert dieses Problem, indem er Gaußsches Rauschen gezielt in die vom Angreifer kontrollierbaren Merkmalsbereiche injiziert. Durch die Abstimmung von Training und Zertifizierung auf diese spezifischen Subräume wird die Robustheit gegenüber Angriffen signifikant erhöht. Die Methode erreicht in verschi

arxiv.org · 16.07. 04:00

FixItFlow: Automatisierte Erstellung von Fehlerbehebungsanleitungen für Cloud-Vorfälle

FixItFlow ist ein automatisiertes System, das mithilfe von großen Sprachmodellen Fehlerbehebungsanleitungen aus historischen Vorfalldaten generiert. Das System extrahiert Diagnosemuster aus den Aktionen von Ingenieuren und erstellt daraus strukturierte, validierte Anleitungen, um manuelle Dokumentationsaufwände zu reduzieren. In praktischen Tests konnte die Zeit zur Störungsbehebung durch die Nutzung dieser automatisierten Anleitungen um den Faktor 2,3 gesenkt werden. Damit bietet das System einen effizienten Ansat

arxiv.org · 15.07. 04:00

Automatisierte Tensor-Planung für hybride CPU-GPU-LLM-Inferenz auf Endgeräten

Die Ausführung großer Sprachmodelle auf Endgeräten wie Laptops scheitert oft an begrenzten GPU-Speicherkapazitäten, was eine Auslagerung auf den CPU-Speicher erforderlich macht. Das neue System ATSInfer optimiert diesen Prozess durch eine Inferenz auf Tensor-Ebene statt auf Schicht-Ebene. Durch die Kombination von statischer Platzierung und dynamischer, lastabhängiger Datenübertragung sowie einer asynchronen Koordination zwischen CPU und GPU wird die Hardwareauslastung signifikant gesteigert. Dies führt zu einer de

arxiv.org · 15.07. 04:00

Von vielen zu aussagekräftigen Daten: Feature-gestütztes Zero-Shot-Screening für chronische Nierenerkrankungen mittels großer Sprachmodelle

Die Früherkennung chronischer Nierenerkrankungen ist entscheidend, scheitert jedoch oft an der Abhängigkeit von umfangreichen Datensätzen und aufwendigen klinischen Tests. Ein neuer Ansatz nutzt große Sprachmodelle in einer Zero-Shot-Umgebung, um ohne spezifisches Training Diagnosen zu stellen. Dabei werden klinisch relevante Merkmale durch maschinelles Lernen vorselektiert und in standardisierte Textformate für die KI-Analyse übersetzt. Die Untersuchung zeigt, dass dieser Ansatz über verschiedene Datensätze hinweg

arxiv.org · 15.07. 04:00

LiteTopK: Effizientere Indexer-TopK-Kernel für Sparse Attention bei langen Kontexten

Die Indexer-TopK-Operation ist ein zentraler Bestandteil von Sparse-Attention-Mechanismen in großen Sprachmodellen und Vektordatenbanken, leidet jedoch bei aktuellen GPU-Implementierungen unter hohem Speicheraufwand und ineffizienter Synchronisation. Der neue Ansatz LiteTopK nutzt die mathematischen Eigenschaften hochdimensionaler Räume, um durch gezieltes Sampling und dynamische Partitionierung die Datenverarbeitung zu optimieren. Durch diese Methode werden unnötige Schreib- und Lesezugriffe reduziert, während die

arxiv.org · 14.07. 04:00

Geräte-Cloud-kollaborative LLM-Inferenz für multimodale und mehrstufige Konversationen

Das vorgestellte System TMO optimiert die Ausführung von großen Sprachmodellen durch eine intelligente Aufteilung zwischen lokalen Endgeräten und der Cloud. Ein leichtgewichtiges lokales Modell übernimmt einfache Aufgaben für eine schnelle Reaktionszeit, während komplexe multimodale Anfragen an die Cloud delegiert werden. Eine auf Reinforcement Learning basierende Strategie steuert dabei dynamisch die Verteilung der Rechenlast, um Latenz, Kosten und Antwortqualität unter Berücksichtigung begrenzter Ressourcen zu ma

arxiv.org · 14.07. 04:00

Nachbildung menschlicher Verzerrungen bei der Routenwahl durch große Sprachmodelle: Ein Weg zur skalierbaren Verhaltensmodellierung

Menschliche Entscheidungen weichen oft von rationalen Modellen ab und folgen systematischen Verzerrungen, die bisher aufwendig durch Umfragen oder Experimente kalibriert werden mussten. Eine neue Untersuchung zeigt, dass große Sprachmodelle in der Lage sind, diese nicht-rationalen Verhaltensmuster bei der Routenwahl ohne explizite Parameterfestlegung abzubilden. Die Ergebnisse deuten darauf hin, dass generative KI-Modelle eine skalierbare Alternative zur Simulation menschlicher Entscheidungsprozesse darstellen. Die

arxiv.org · 13.07. 04:00

Alle Erklärungen sind falsch, aber viele sind nützlich: Untersuchung der Rashomon-Erklärungsmenge bei großen Sprachmodellen

Die Forschung hinterfragt den vermeintlichen Zielkonflikt zwischen der Genauigkeit und der Erklärbarkeit von Modellen des maschinellen Lernens. Anstatt Erklärungen und Vorhersagen als getrennte Ziele zu betrachten, zeigt der neue Rashomon-Erklärungsansatz, dass eine enge Kopplung beider Aspekte die Modellleistung sogar steigern kann. Durch den Einsatz eines agentenbasierten Workflows namens RashomonLLM werden natürlichsprachliche Erklärungen iterativ mit Vorhersagen abgeglichen. In verschiedenen Anwendungsbereichen

arxiv.org · 13.07. 04:00

Ein einheitlicher Ansatz zur Interpretation von Knowledge Distillation bei großen Sprachmodellen durch Interaktionen

Die Mechanismen hinter der Wissensdestillation bei großen Sprachmodellen sind bisher nur unzureichend verstanden. Eine neue Untersuchung zeigt, dass der Erfolg verschiedener Destillationsmethoden auf der gezielten Vereinfachung komplexer Interaktionen zwischen Eingabevariablen basiert. Dabei behalten effiziente Schülermodelle nur eine reduzierte Anzahl an Interaktionen bei, während irrelevante Einflüsse unterdrückt werden. Basierend auf dieser Erkenntnis wurde eine neue Verlustfunktion entwickelt, die gezielt kompl

Ars Technica – AI 1 Artikel News
arstechnica.com · 24.07. 23:25

Kanadischer Abgeordneter liest scheinbare KI-Antwort im Parlament vor

Während einer Parlamentsdebatte hat ein kanadischer Abgeordneter offensichtlich einen Text vorgetragen, der zuvor von einem großen Sprachmodell generiert wurde. Der Vorfall wirft neue Fragen zum Umgang von Politikern mit generativer künstlicher Intelligenz bei der Erarbeitung offizieller Reden auf. Kritiker bemängeln mangelnde Transparenz und Authentizität bei der Nutzung solcher Technologien im parlamentarischen Alltag. Befürworter sehen darin hingegen ein effizientes Werkzeug zur Formulierung komplexer Sachverhal

AWS Machine Learning 1 Artikel Anbieter
aws.amazon.com · 23.07. 18:42

Handelsassistent: Wie Jefferies den Front-Office-Handel mit KI optimierte

Ein neues KI-gestütztes System optimiert die Handelsabläufe im Front-Office durch den Einsatz autonomer Agenten, großer Sprachmodelle und spezialisierter Werkzeuge. Die Architektur kombiniert ein Framework zur Agentenorc

The Decoder 1 Artikel News
the-decoder.com · 18.07. 10:10

Das neue KI-Handbuch des Pentagons bewertet langsame Einführung als größeres Risiko als unvollständige Ausrichtung

Das US-Verteidigungsministerium verfolgt eine neue Strategie zur umfassenden Integration von Daten und künstlicher Intelligenz in die Flotte. Ziel ist der Aufbau einer KI-gestützten Marine, bei der große Sprachmodelle direkt auf Kriegsschiffen zum Einsatz kommen sollen. Ein neu geschaffener KI-Kriegsrat wird dabei spezifische Einsatzszenarien priorisieren. Die zentrale Prämisse dieser Strategie lautet, dass eine zu langsame technologische Adaption ein signifikant höheres Sicherheitsrisiko darstellt als eine potenzi

Google Research 1 Artikel Forschung
research.google · 24.06. 16:51

Denken zum Erinnern: Wie Schlussfolgerungen parametrisches Wissen in Sprachmodellen erschließen

Die Fähigkeit von großen Sprachmodellen, auf gespeichertes Wissen zuzugreifen, hängt maßgeblich von internen Schlussfolgerungsprozessen ab. Aktuelle Untersuchungen zeigen, dass Modelle ihr parametrisches Wissen effektiver abrufen können, wenn sie explizit dazu angeleitet werden, logische Denkschritte auszuführen. Dieser Ansatz verbessert die Genauigkeit bei der Informationswiedergabe erheblich, da das Modell nicht nur auf statistische Wahrscheinlichkeiten vertraut, sondern gezielte kognitive Pfade nutzt. Die Method

BAIR ? Berkeley AI 1 Artikel Forschung
bair.berkeley.edu · 13.03. 09:00

Skalierbare Identifizierung von Interaktionen in großen Sprachmodellen

Die Analyse des Verhaltens komplexer maschineller Lernsysteme, insbesondere großer Sprachmodelle, stellt eine zentrale Herausforderung in der aktuellen Forschung dar. Ziel der Interpretierbarkeitsforschung ist es, Entscheidungsprozesse transparenter zu gestalten, um die Sicherheit und Vertrauenswürdigkeit von KI-Systemen zu erhöhen. Durch die Untersuchung systematischer Interaktionen innerhalb dieser Modelle können Entwickler tiefere Einblicke in die Funktionsweise gewinnen. Dieser Ansatz ermöglicht ein besseres Ve