>_ der Promptbote
News vom 21.7.2026  ·  1231 neue Artikel heute  ·  6 Kanäle
Schlagwort: BenchmarkFilter entfernen ×
Hacker News – AI/LLM 7 Artikel Community
runtimewire.com · 21.07. 08:46

Direkter Vergleich: GLM 5.2 gegen GPT-5.6 Sol

In einem direkten Leistungsvergleich zeigt sich eine deutliche Überlegenheit des Modells GPT-5.6 Sol gegenüber GLM 5.2. Die Analyse konzentriert sich dabei auf praxisrelevante Kriterien wie die Einhaltung von Anweisungen, die Qualität der Formatierung sowie die allgemeine Fehleranfälligkeit. Dabei erweist sich GPT-5.6 Sol als präziser und zuverlässiger in der praktischen Anwendung, während GLM 5.2 in diesen entscheidenden Kategorien das Nachsehen hat.

i-programmer.info · 21.07. 04:58

DeepSWE – Der beste Benchmark zur Evaluierung von KI-Programmieragenten?

Die Evaluierung von KI-gestützten Softwareentwicklungsagenten stellt eine wachsende Herausforderung dar, da herkömmliche Metriken die komplexen Anforderungen der Programmierung oft nur unzureichend abbilden. DeepSWE tritt als neuer Benchmark an, um die Leistungsfähigkeit dieser Agenten in realitätsnahen Szenarien präziser zu messen. Durch die Simulation anspruchsvoller Programmieraufgaben soll eine objektive Vergleichbarkeit geschaffen werden, die über einfache Code-Vervollständigung hinausgeht. Dies ermöglicht ein

arxiv.org · 20.07. 13:07

Zwang und Täuschung in der KI-zu-KI-Steuerung: Ein neuer Benchmark für Agenten

In Multi-Agenten-Systemen übernehmen KI-Modelle häufig hierarchische Rollen, in denen ein Manager-Agent einen Untergebenen steuert. Wenn ein untergeordneter Agent eine Aufgabe verweigert, stehen dem Manager verschiedene Strategien offen, darunter Verhandlung, ehrliche Berichterstattung, Zwang oder Täuschung. Der neu entwickelte Manager Coercion Benchmark untersucht erstmals systematisch, welche dieser Verhaltensweisen ein KI-Modell ohne explizite Anweisung wählt. Ziel ist es, die ethischen Implikationen und das str

quesma.com · 18.07. 13:40

Baba Is You: KI-Modelle im Vergleich bei komplexen Logikrätseln

Das Logikspiel Baba Is You wurde auf das Harbor-Framework portiert, um die Problemlösungsfähigkeiten aktueller KI-Sprachmodelle wie Claude, GPT, Gemini, GLM und DeepSeek systematisch zu testen. Die Ergebnisse zeigen deutliche Leistungsunterschiede bei der Bewältigung der spielinternen Regeländerungen. Im direkten Vergleich mit menschlichen Spielern, die via Twitch streamten, zeigte sich, dass selbst leistungsfähige KI-Modelle wie Claude Fable 5 bei der Lösungsgeschwindigkeit noch deutlich hinter menschlichen Expert

rootly.com · 18.07. 08:36

Was Doom über KI-gestützte Vorfallreaktion lehrt

Die Entwicklung der Doom Agent Arena, eines Open-Source-Benchmarks für KI-Agenten in einer Spielumgebung, liefert neue Erkenntnisse für die automatisierte Reaktion auf IT-Sicherheitsvorfälle. Durch den Einsatz des Model Context Protocol (MCP) treten KI-Agenten in komplexen Szenarien gegeneinander an, um ihre Entscheidungsfähigkeit unter Druck zu testen. Diese spielerische Umgebung dient als Testfeld, um die Effizienz und Zuverlässigkeit von KI-Systemen bei der Bewältigung von unvorhersehbaren Ereignissen in Echtzei

neutralityproject.org · 12.07. 08:21

Benchmark zur politischen Neutralität populärer KI-Modelle

Ein neuer Benchmark untersucht die politische Ausrichtung von 18 KI-Modellen aus zwölf verschiedenen Forschungslaboren in den USA, Frankreich, China und der EU. Die Analyse bewertet dabei gezielt die politische Tendenz der Antworten und berücksichtigt zudem, wie häufig Modelle Anfragen aufgrund ihrer Sicherheitsrichtlinien ablehnen. Durch eine vollständige Reproduzierbarkeit der Ergebnisse bietet die Untersuchung eine transparente Grundlage, um die Neutralität und das Antwortverhalten aktueller Sprachmodelle im glo

tryai.dev · 10.07. 20:52

Leistungsvergleich aktueller KI-Modelle bei der Softwareentwicklung

Verschiedene führende KI-Modelle, darunter GPT-5.6, Grok 4.5, Claude und Muse Spark, wurden in einem direkten Vergleich bei der Programmierung von vier spezifischen Anwendungen getestet. Die Aufgaben umfassten die Erstellung eines Raycasters, eines virtuellen Zauberwürfels, eines Taschenrechners sowie einer Simulation des Game of Life. Dabei wurden die unterschiedlichen Modellvarianten hinsichtlich ihrer Effizienz, der anfallenden Kosten sowie der Latenzzeiten bei der Code-Generierung analysiert und gegenübergestel

arXiv – cs.LG 34 Artikel Forschung
arxiv.org · 21.07. 06:00

Jenseits mehrsprachiger Durchschnitte: MTEB-PT, ein Benchmark für portugiesische Satz-Encoder

Die Evaluierung von Text-Embedding-Modellen für die portugiesische Sprache ist bisher unterrepräsentiert, da oft auf englischsprachige oder allgemeine Metriken zurückgegriffen wird. Mit MTEB-PT wurde ein neuer Benchmark eingeführt, der 14 Datensätze aus Bereichen wie semantische Ähnlichkeit, Klassifizierung und Retrieval umfasst. Die Untersuchung von 17 Modellen zeigt, dass die Leistung stark aufgabenspezifisch ist und mehrsprachige Rankings die tatsächliche Qualität im Portugiesischen nur unzureichend abbilden. Sp

arxiv.org · 21.07. 06:00

CyberGym-E2E: Skalierbarer Benchmark für die End-to-End-Cybersicherheit von KI-Agenten

CyberGym-E2E ist ein neuer Benchmark, der die Fähigkeiten von KI-Agenten bei der Identifizierung, Analyse und Behebung von Software-Schwachstellen umfassend bewertet. Im Gegensatz zu bisherigen Ansätzen deckt das System den gesamten Lebenszyklus von der Schwachstellensuche über die Erstellung von Proof-of-Concepts bis hin zur automatisierten Patch-Entwicklung ab. Die Plattform nutzt eine skalierbare Pipeline, um Open-Source-Daten in realistische Testumgebungen zu überführen. Aktuell umfasst der Benchmark 920 reale

arxiv.org · 20.07. 06:00

AuAu: Ein Benchmark zur Überprüfung autoritärer Tendenzen in großen Sprachmodellen

Der neue Benchmark AuAu ermöglicht eine systematische Untersuchung von autoritären Einstellungen in großen Sprachmodellen. Durch die Kombination von psychometrischen Tests, Verhaltensszenarien und realistischen Nutzeranfragen analysiert das Verfahren spezifische Ausprägungen wie Aggression, Unterwürfigkeit und Konventionalismus. Die Untersuchung von 17 internationalen Modellen zeigt, dass diese zwar in psychometrischen Tests autoritäre Tendenzen aufweisen, in praxisnahen Aufgaben jedoch weniger anfällig sind. Denno

arxiv.org · 20.07. 06:00

LVSum: Ein Benchmark für zeitbasierte Zusammenfassungen langer Videos

Die Zusammenfassung langer Videos stellt multimodale Sprachmodelle vor große Herausforderungen hinsichtlich der zeitlichen Genauigkeit und inhaltlichen Kohärenz. Mit LVSum wurde ein neuer, von Menschen annotierter Benchmark eingeführt, der 72 Videos aus 13 verschiedenen Bereichen umfasst und eine präzise zeitliche Ausrichtung erfordert. Die Untersuchung führender Modelle zeigt, dass Transkripte für die Qualität der Zusammenfassungen entscheidender sind als visuelle Daten. Zudem verdeutlichen die Ergebnisse eine sig

arxiv.org · 20.07. 06:00

Jailbreak Foundry: Von wissenschaftlichen Arbeiten zu ausführbaren Angriffen für reproduzierbare Benchmarks

Jailbreak Foundry ist ein neues System, das die Lücke zwischen theoretischer Sicherheitsforschung bei großen Sprachmodellen und deren praktischer Überprüfung schließt. Durch einen Multi-Agenten-Workflow werden wissenschaftliche Publikationen in standardisierte, ausführbare Module übersetzt, die eine einheitliche Bewertung ermöglichen. Das System reduziert den Implementierungsaufwand erheblich und bietet eine konsistente Infrastruktur für die Evaluierung von Sicherheitslücken. Damit lassen sich aktuelle Angriffsvekt

arxiv.org · 20.07. 06:00

Ein standardisierter Benchmark für skelettbasierte Rehabilitationsbewertung mittels Deep Learning

Die automatisierte Analyse menschlicher Bewegungsabläufe ist für eine objektive Leistungsbewertung in der Rehabilitation entscheidend. Da es bisher an einheitlichen Standards und vergleichbaren Datensätzen mangelt, wurde mit Rehab-Pile ein umfassendes Archiv geschaffen, das bestehende Daten zusammenführt. Ein neues Benchmarking-Framework ermöglicht nun die systematische Evaluierung von Deep-Learning-Methoden für Klassifizierungs- und Regressionsaufgaben. Durch die Bereitstellung dieser Ressourcen soll die Entwicklu

arxiv.org · 17.07. 06:00

Wenn Richtungsgenauigkeit täuscht: Ein Benchmark für LoRA-adaptierte Zeitreihenmodelle bei Aktienprognosen

Bei der Anwendung von vortrainierten Zeitreihenmodellen wie TimesFM auf Finanzmärkte erweist sich die reine Richtungsgenauigkeit oft als irreführend. In steigenden Märkten können triviale Strategien hohe Trefferquoten erzielen, ohne tatsächliche Vorhersagekompetenz zu besitzen. Um echten Mehrwert von statistischen Artefakten zu trennen, wurde ein neuer Benchmark entwickelt, der durch standardisierte Testverfahren und den Vergleich mit simplen Basismodellen die tatsächliche Prognoseleistung bewertet. Die Ergebnisse

arxiv.org · 17.07. 06:00

Idea2Plan: Untersuchung KI-gestützter Forschungsplanung

Große Sprachmodelle besitzen das Potenzial, den wissenschaftlichen Erkenntnisprozess durch die Strukturierung von Forschungsideen zu beschleunigen. Um diese Fähigkeiten systematisch zu bewerten, wurde das Idea2Plan-Framework eingeführt, das auf aktuellen wissenschaftlichen Publikationen basiert und die Qualität von Forschungsplänen anhand spezifischer Kriterien misst. Zudem ermöglicht ein ergänzendes Evaluierungssystem die Überprüfung der Zuverlässigkeit KI-basierter Bewertungsinstanzen im Vergleich zu menschlichen

arxiv.org · 17.07. 06:00

Ein Machine-Learning-Benchmarking-Framework zur Vorhersage der Transfektionseffizienz von Lipid-Nanopartikeln

Die Entwicklung effizienter Lipid-Nanopartikel für den RNA-Transport ist ein zentraler Engpass in der medizinischen Forschung. Ein neues Benchmarking-Framework ermöglicht nun die systematische Evaluierung von Machine-Learning-Modellen, die auf Basis von Lipidstrukturen die Transfektionseffizienz vorhersagen. Durch den Vergleich verschiedener molekularer Repräsentationen und Architekturen identifiziert das Framework zuverlässige Basismodelle. Die Ergebnisse zeigen, dass Modelle mit expliziter Kodierung molekularer S

arxiv.org · 17.07. 06:00

Schließung von Benchmarking-Lücken bei Sprachmodellen im Gesundheitswesen durch dynamisches Red-Teaming

Große Sprachmodelle im Gesundheitssektor basieren oft auf statischen Benchmarks, die Sicherheitsrisiken nur unzureichend abbilden. Ein neues Framework namens DAS nutzt automatisierte, gegnerische Agenten, um Modelle kontinuierlich auf Robustheit, Datenschutz, Voreingenommenheit und Halluzinationen zu prüfen. Die Untersuchung von 15 Modellen zeigt eine erhebliche Diskrepanz zwischen guten Ergebnissen in statischen Tests und einer hohen Fehleranfälligkeit unter dynamischen Bedingungen. Diese Ergebnisse deuten darauf

arxiv.org · 17.07. 06:00

SafeOR-Gym: Eine Benchmark-Suite für sichere Reinforcement-Learning-Algorithmen in der Operations Research

Die neue Benchmark-Suite SafeOR-Gym schließt eine Lücke in der Forschung zum sicheren Reinforcement Learning, indem sie den Fokus von der Robotik auf komplexe industrielle Problemstellungen verlagert. Die Sammlung umfasst neun Umgebungen aus den Bereichen Operations Research, die realistische Herausforderungen wie gemischt-ganzzahlige Entscheidungen, komplexe Planungshorizonte und strikte Kostenbeschränkungen abbilden. Durch die Integration in bestehende Schnittstellen ermöglicht das Framework eine standardisierte

arxiv.org · 17.07. 06:00

ChronoQG: Ein neuer Benchmark für zeitlich ausdrucksstarke Wissensgraphen-Fragengenerierung

Die Generierung von Fragen aus Wissensgraphen konzentriert sich bisher primär auf statische Daten, wodurch zeitliche Zusammenhänge und die chronologische Gültigkeit von Fakten oft vernachlässigt werden. Mit ChronoQG wurde ein neuer Benchmark-Rahmen eingeführt, der explizit zeitliche Beschränkungen und topologische Strukturen berücksichtigt. Durch die Integration einer Taxonomie für zeitliche Constraints und ein spezielles Subgraph-Sampling ermöglicht das System die Erstellung präziser, zeitlich fundierter Fragen. T

arxiv.org · 17.07. 06:00

HyperShadow: Ein Benchmark zur Erkennung von 3D-Projektionen höherdimensionaler räumlicher Objekte

HyperShadow ist ein neuer Benchmark, der darauf abzielt, 3D-Punktwolken von nativen dreidimensionalen Formen zu unterscheiden, die als Projektionen von Objekten in vier- bis sechsdimensionalen Räumen entstehen. Während herkömmliche Schätzverfahren für intrinsische Dimensionen bei dieser Aufgabe versagen, erreicht ein spezialisiertes neuronales Netzwerk eine Genauigkeit von über 96 Prozent. Zudem wurde eine mathematische Methode entwickelt, die durch die Analyse von Rotationsbewegungen zwischen Einzelbildern eine pr

arxiv.org · 16.07. 04:00

Rückkehr der Regelinduktion in die Forschung zur fluiden Intelligenz? Eine erste Validierung des ARC-AGI-Benchmarks bei Menschen

Die Studie untersucht die psychometrischen Eigenschaften des ARC-AGI-Benchmarks, der ursprünglich für künstliche Intelligenz entwickelt wurde, im Kontext menschlicher fluider Intelligenz. Mit 100 Probanden wurde nachgewiesen, dass der Benchmark signifikant mit klassischen Tests zur figuralen Intelligenz korreliert, während Zusammenhänge mit figuraler Originalität gering ausfielen. Die Ergebnisse stützen die Validität von ARC-AGI als Instrument zur Messung menschlicher kognitiver Fähigkeiten. Die Arbeit plädiert daf

arxiv.org · 16.07. 04:00

STOCKTAKE: Messung der Lücke zwischen Wahrnehmung und Handeln bei LLM-Agenten

Der neue Benchmark STOCKTAKE ermöglicht eine präzise Analyse der Leistungsfähigkeit von KI-Agenten in komplexen Lieferketten-Szenarien. Dabei wird differenziert, ob ein System an einer fehlerhaften Zustandsbewertung oder an einer ineffektiven Handlungsstrategie scheitert. Durch den Vergleich der KI-Entscheidungen mit einem Bayes-basierten Orakel lässt sich die sogenannte Knowing-Doing-Lücke quantifizieren. Aktuelle Sprachmodelle zeigen zwar eine hohe Trefferquote bei der Diagnose verborgener Probleme, offenbaren je

arxiv.org · 16.07. 04:00

HRIBench: Ein Benchmark für interaktionszentrierte Mensch-Roboter-Kollaboration

HRIBench wurde entwickelt, um die Lücke bei der Bewertung von Mensch-Roboter-Interaktionen zu schließen, da bisherige Benchmarks primär isolierte Manipulationsfähigkeiten fokussieren. Das System modelliert kollaborative Aufgaben durch strukturierte Szenarioskripte, die Rollenverteilungen, zeitliche Abhängigkeiten und menschliches Verhalten berücksichtigen. Mit 13 rollenbasierten Aufgaben und über 650 Episoden ermöglicht es eine detaillierte Analyse von Koordination, Reaktionsfähigkeit und Sicherheit. Die Evaluation

arxiv.org · 16.07. 04:00

LessonBench-V1: Ein Benchmark-Datensatz zur Evaluierung von KI-Agenten für die Unterrichtsplanung

Zur systematischen Bewertung von KI-gestützten Systemen für die Erstellung von Bildungsinhalten wurde der Datensatz LessonBench-V1 entwickelt. Er umfasst 647 von Menschen erstellte Unterrichtseinheiten aus 240 MINT-Themenbereichen, die mit KI-generierten Unterrichtsplänen verknüpft sind. Die methodische Grundlage bilden anerkannte pädagogische Modelle wie die Bloom-Taxonomie und das 5E-Instruktionsmodell. Mit über 3.600 Lernzielen und zugehörigen Metadaten ermöglicht der Datensatz eine reproduzierbare Leistungsprüf

arxiv.org · 16.07. 04:00

Lohnt sich der statistische Vorteil? Ein empirischer Vergleich von KANs und MLPs bei der Klassifizierung strukturierter Daten

Eine aktuelle Studie vergleicht die Leistungsfähigkeit von Kolmogorov-Arnold-Netzwerken (KANs) mit klassischen Multi-Layer-Perceptrons (MLPs) bei der Klassifizierung strukturierter tabellarischer Daten. Die Untersuchung zeigt, dass KANs in binären und mehrklassigen Szenarien statistisch bessere Ergebnisse erzielen und eine höhere Generalisierungsfähigkeit aufweisen. Dieser Vorteil geht jedoch mit einer deutlich höheren Rechenkomplexität und einem größeren Parameterbedarf einher. Während KANs somit für hochpräzise A

arxiv.org · 15.07. 04:00

Rückkehr zur Regelinduktion in der Forschung zur fluiden Intelligenz? Eine erste Validierung des ARC-AGI-Benchmarks bei Menschen

Die Studie untersucht das ARC-AGI-Benchmark-System, das ursprünglich für künstliche Intelligenz entwickelt wurde, hinsichtlich seiner Eignung zur Messung der menschlichen fluiden Intelligenz. Im Gegensatz zu herkömmlichen Tests, die primär auf Arbeitsgedächtniskapazität basieren, erfordert ARC-AGI verstärkt die Fähigkeit zur Induktion neuer Regeln. Die Ergebnisse zeigen eine signifikante Korrelation mit etablierten Tests zur figuralen Intelligenz, was die Validität des Benchmarks für menschliche kognitive Fähigkeit

arxiv.org · 15.07. 04:00

AgentLens: Ein neuer Benchmark zur Bewertung von Coding-Agenten anhand von Prozessverläufen

AgentLens ist ein neuer Benchmark für interaktive Coding-Agenten, der über die bloße Erfolgsprüfung hinausgeht. Anstatt lediglich das Endergebnis zu bewerten, analysiert das System den gesamten Interaktionsverlauf, einschließlich der Befolgung von Anweisungen, der Werkzeugnutzung und der Fehlerkorrektur. Durch die Kombination von formaler Verifizierung mit KI-gestützten Analysen und direkten Vergleichen liefert das Tool detaillierte Erklärungen für die Leistungsbewertung. Dies ermöglicht Entwicklern, das Verhalten

arxiv.org · 15.07. 04:00

Umfassende Evaluierung von Deep-Learning-Modellen zur Objekterkennung auf heterogenen Edge-Geräten

Die Studie analysiert die Leistungsfähigkeit verschiedener Objekterkennungsmodelle wie YOLOv8, EfficientDet Lite und SSD auf unterschiedlicher Edge-Hardware, darunter Raspberry Pi-Varianten und Jetson-Systeme. Dabei werden Kriterien wie Energieverbrauch, Latenz und Genauigkeit unter variierender Szenenkomplexität untersucht. Die Ergebnisse zeigen deutliche Zielkonflikte zwischen Effizienz und Präzision auf. Während SSD-Modelle bei geringem Ressourcenverbrauch punkten, bietet YOLOv8 eine höhere Genauigkeit bei geste

arxiv.org · 15.07. 04:00

TopCoW-Challenge: Topologiebasierte Segmentierung des Circulus arteriosus cerebri bei CT- und MR-Angiographien

Der Circulus arteriosus cerebri spielt eine zentrale Rolle bei neurovaskulären Erkrankungen, stellt jedoch aufgrund seiner anatomischen Variabilität hohe Anforderungen an die medizinische Bildanalyse. Die TopCoW-Challenge adressiert diesen Bedarf durch die Bereitstellung eines annotierten Datensatzes aus 125 gepaarten MRA- und CTA-Scans. Im Rahmen des Wettbewerbs wurden Algorithmen zur Segmentierung, Komponentenerkennung und Variantenklassifikation entwickelt. Die besten Modelle erreichten hohe Genauigkeiten bei de

arxiv.org · 15.07. 04:00

Deep4ge: Trainingsverläufe tiefer neuronaler Netze zur Fehlererkennung und Diagnose

Deep4ge ist ein neuer Benchmark-Datensatz, der speziell für die Analyse von Fehlern in Deep-Learning-Systemen entwickelt wurde. Er umfasst über 14.000 Trainingsläufe, die auf Basis von 59 verschiedenen neuronalen Netzwerkmodellen generiert wurden. Durch gezielte Quellcode-Transformationen wurden systematisch Fehler in die Trainingsprozesse eingeführt, um die Auswirkungen auf Metriken wie Gewichte, Gradienten und Verlustverläufe zu dokumentieren. Der Datensatz ermöglicht die Entwicklung und Evaluierung von Methoden

arxiv.org · 15.07. 04:00

Was messen zeitliche Benchmarks? Analyse der Kanalnutzung bei der Evaluation von Video-VLM

Aktuelle Benchmarks für zeitliche Video-Frage-Antwort-Systeme vermengen oft zwei Aspekte: die Notwendigkeit einer zeitlichen Analyse und die tatsächliche Informationsquelle des Modells. Viele Modelle stützen sich bei der Lösung nicht auf die visuelle Abfolge, sondern auf Positionskodierungen oder statistische Vorannahmen. Mit dem sogenannten Reversal-Drop wurde eine Methode entwickelt, die ohne neue Annotationen misst, ob ein Modell die visuelle Reihenfolge oder lediglich Positionsdaten nutzt. Die Untersuchung zeig

arxiv.org · 15.07. 04:00

Wenn Richtungsgenauigkeit täuscht: Ein Benchmark für LoRA-adaptierte Zeitreihenmodelle bei der Aktienprognose

Die Anwendung großer vortrainierter Zeitreihenmodelle wie TimesFM auf Finanzmärkte erfordert eine kritische Überprüfung der Genauigkeitsmetriken. Eine hohe Richtungsgenauigkeit kann in steigenden Märkten durch triviale Strategien wie eine ständige Kaufempfehlung vorgetäuscht werden, ohne dass das Modell tatsächliche Vorhersagekompetenz besitzt. Durch einen neuen, reproduzierbaren Benchmark mit strengen statistischen Tests wird nachgewiesen, dass LoRA-adaptierte Modelle in diesem Kontext keinen signifikanten Mehrwer

arxiv.org · 15.07. 04:00

OOD-RL-Bench: Ein Benchmark-Framework zur Erkennung von Out-of-Distribution-Zuständen im Reinforcement Learning

Zuverlässige Reinforcement-Learning-Agenten müssen in der Lage sein, Abweichungen von ihren Trainingsannahmen, sogenannte Out-of-Distribution-Zustände, sicher zu identifizieren. Das neue Framework OOD-RL-Bench schließt eine Lücke in der aktuellen Forschung, indem es speziell auf die komplexen, aktionsabhängigen Zeitstrukturen von RL-Trajektorien ausgerichtet ist. Es ermöglicht die systematische Evaluierung von Detektionsmethoden anhand verschiedener Anomaliekategorien wie Sensorstörungen oder Umgebungsänderungen. E

arxiv.org · 14.07. 04:00

SPQR: Ein mehrdimensionaler Benchmark für die Sicherheitsausrichtung bei der Modellanpassung

Text-zu-Bild-Diffusionsmodelle können problematische Inhalte erzeugen, weshalb Sicherheitsausrichtungen implementiert werden. Diese verlieren jedoch häufig ihre Wirkung, wenn Modelle nach der Bereitstellung durch Techniken wie LoRA oder Style-Adapter feinabgestimmt werden. Der neue SPQR-Benchmark adressiert dieses Problem, indem er ein einheitliches Framework zur Messung von Sicherheit, Prompt-Treue, Qualität und Robustheit bietet. Durch eine zentrale Kennzahl ermöglicht das Verfahren eine vergleichbare Bewertung d

arxiv.org · 14.07. 04:00

Multi-Agenten-Routing als mengenwertiges Vorhersageproblem: Ein WildChat-Benchmark und kostenbewusste Evaluierung

Die Zuweisung von Aufgaben an spezialisierte KI-Agenten auf Basis natürlicher Sprache stellt ein komplexes Problem dar, da eine Anfrage oft mehrere Agenten erfordert, während eine übermäßige Auswahl die Kosten in die Höhe treibt. Ein neuer Benchmark auf Basis von 3.000 Anfragen ermöglicht die systematische Untersuchung dieses Routing-Prozesses. Die Evaluierung umfasst verschiedene Metriken zur Genauigkeit sowie eine Simulation der Ausführungskosten. Die Ergebnisse zeigen, dass überwachte Lernverfahren bei der Auswa

arxiv.org · 14.07. 04:00

CTFusion: Ein auf CTF-Wettbewerben basierender Benchmark für die Evaluierung von LLM-Agenten

Die Evaluierung von KI-Agenten im Bereich Cybersicherheit leidet häufig unter Datenkontamination, da bestehende Benchmarks auf wiederverwendeten Aufgaben basieren. CTFusion löst dieses Problem durch ein Streaming-Framework, das Live-CTF-Wettbewerbe nutzt, um eine dynamische und manipulationssichere Testumgebung zu schaffen. Das System integriert sich über das Model Context Protocol in bestehende Plattformen und stellt sicher, dass Agenten unabhängig voneinander bewertet werden. Durch die Nutzung aktueller Wettbewer

arxiv.org · 14.07. 04:00

SynthSAEBench: Evaluierung von Sparse Autoencodern mit skalierbaren synthetischen Daten

Sparse Autoencoder sind entscheidend für die Interpretierbarkeit von Sprachmodellen, doch bisherige Benchmarks leiden unter mangelnder Präzision oder unrealistischen Testbedingungen. SynthSAEBench bietet ein neues Framework, das auf großskaligen synthetischen Daten basiert und realistische Merkmale wie Korrelationen, Hierarchien und Superposition abbildet. Durch den Zugriff auf Ground-Truth-Daten ermöglicht das Tool eine präzise Diagnose von Architekturfehlern und reproduziert bekannte Phänomene aus der Forschung a

arxiv.org · 14.07. 04:00

Rückkehr der Regelinduktion in die Erforschung fluider Intelligenz? Eine erste Validierung des ARC-AGI-Benchmarks bei Menschen

Die Studie untersucht die psychometrischen Eigenschaften des ARC-AGI-Benchmarks, der ursprünglich für künstliche Intelligenz entwickelt wurde, nun aber auf seine Eignung zur Messung menschlicher fluider Intelligenz geprüft wird. Im Gegensatz zu herkömmlichen Tests, die primär auf Arbeitsgedächtniskapazität fokussieren, erfordert dieser Benchmark maßgeblich die Fähigkeit zur Regelinduktion. Die Ergebnisse zeigen eine signifikante Korrelation mit etablierten Tests zur figuralen Intelligenz. Dies unterstreicht das Pot

arxiv.org · 13.07. 04:00

Test-Time-Skalierung für kleine multimodale Sprachmodelle bei visuellen Multiple-Choice-Aufgaben

Die Untersuchung analysiert, ob Test-Time-Skalierung (TTS) die Schlussfolgerungsfähigkeiten kleiner Open-Source-Vision-Language-Modelle verbessern kann. Dabei zeigt sich, dass die Formatierung der Eingabeaufforderungen und die Bereitstellung eines ausreichenden Token-Budgets für die Generierung entscheidender sind als komplexe Such- oder Verifizierungsmechanismen. Während eine Erhöhung der Token-Limits signifikante Leistungssteigerungen ermöglicht, bieten aufwendige Methoden wie PRM-gesteuerte Beam-Suche kaum Vorte

arxiv.org · 13.07. 04:00

SolarChain-Eval: Ein physikalisch fundierter Benchmark für vertrauenswürdige KI-Agenten in dezentralen Energiemärkten

Der neue Benchmark SolarChain-Eval dient der Evaluierung autonomer KI-Agenten in dezentralen Strommärkten. Da KI-Systeme in physischen Umgebungen Risiken wie Marktmanipulation oder instabile Governance bergen, kombiniert das Framework eine Markov-Entscheidungsprozess-Umgebung mit einer LLM-basierten Kontrollschicht. Diese überwacht Aktionen auf Basis physikalischer Grenzwerte und Transparenzregeln. Die Ergebnisse verdeutlichen einen Zielkonflikt zwischen Markteffizienz und Sicherheit, wobei physikalische Beschränku

arxiv.org · 13.07. 04:00

HERO: Eine Benchmark-Bibliothek für föderiertes kontinuierliches Lernen unter Berücksichtigung von Heterogenität

Föderiertes kontinuierliches Lernen steht vor der Herausforderung, dass verteilte Clients aus sich ändernden Datenströmen lernen und gleichzeitig Vorwissen bewahren müssen. Die neue Benchmark-Bibliothek HERO adressiert die mangelnde Vergleichbarkeit bisheriger Ansätze, indem sie Aufgabenaufteilung, Client-Datenverteilung und Aufgabenreihenfolge entkoppelt. Durch die gezielte Steuerung von Daten-Skew und Aufgaben-Mismatch ermöglicht das System eine präzisere Evaluierung von Modellen. Die Ergebnisse unterstreichen, d

The Decoder 3 Artikel News
the-decoder.com · 19.07. 11:32

Kimi K3 von Moonshot übertrifft Fable 5 bei Frontend-Code, schwächelt jedoch bei komplexer Mathematik

Das KI-Modell Kimi K3 hat als erstes chinesisches Modell die Spitzenposition im Code Arena-Ranking für Frontend-Programmierung erreicht und dabei Konkurrenzprodukte wie Claude Fable 5 und GPT-5.6 deutlich übertroffen. Tr

the-decoder.com · 19.07. 09:35

KI-Chatbots bei der Röntgenanalyse: Gefährliche Selbstsicherheit bei Fehldiagnosen

Der neue Benchmark RadLE 2.0 untersucht, inwieweit KI-Modelle in der Radiologie in der Lage sind, ihre eigenen Grenzen zu erkennen und Diagnosen gegebenenfalls an menschliche Experten zu übergeben. Dabei zeigt sich, dass

the-decoder.com · 16.07. 19:49

Kimi veröffentlicht multimodales Open-Weight-Modell K3 mit 2,8 Billionen Parametern

Das neue multimodale Modell K3 verfügt über 2,8 Billionen Parameter und ein Kontextfenster von einer Million Token. In internen Benchmarks erreicht das Modell Leistungsniveaus, die mit führenden internationalen KI-Systemen vergleichbar sind und diese in Teilbereichen übertreffen. Mit dieser Veröffentlichung zeichnet sich eine Abkehr von der bisherigen Strategie extrem günstiger chinesischer KI-Modelle ab, da K3 deutlich kostenintensiver positioniert ist. Die vollständigen Modellgewichte sollen Ende Juli zur Verfügu

arXiv – cs.CL 9 Artikel Forschung
arxiv.org · 17.07. 06:00

MAG: Ein Benchmark und Framework für multimodale Web-Agenten und Anleitungsgenerierung

MAG ist ein neuer Benchmark, der die Ausführung von Web-Aufgaben und die Erstellung von Benutzeranleitungen in einem einheitlichen multimodalen Ansatz zusammenführt. Anstatt sich auf textbasierte Repräsentationen wie den DOM-Baum zu stützen, arbeitet das System direkt mit Screenshots, um menschliches Interaktionsverhalten besser abzubilden. Das zugehörige Framework unterstützt den gesamten Prozess von der Annotation über das Training bis zur Evaluation in Live-Umgebungen. Durch eine spezielle Trainingsmethode mit E

arxiv.org · 17.07. 06:00

MedRealMM: Ein multimodaler Benchmark für medizinische Online-Beratungen in der Praxis

Der neue Benchmark MedRealMM adressiert die Lücke zwischen synthetischen Testdaten und der klinischen Realität in der medizinischen Online-Beratung. Basierend auf über 5.600 anonymisierten Interaktionen aus chinesischen Internet-Krankenhäusern integriert der Datensatz sowohl Text- als auch Bildinformationen, um die multimodale Entscheidungsfindung von Sprachmodellen zu bewerten. Die Untersuchung von 19 verschiedenen KI-Modellen zeigt, dass die Einbeziehung medizinischer Bilder für eine zuverlässige Diagnose essenzi

arxiv.org · 17.07. 06:00

Adversarial Pragmatics zur KI-Sicherheitsbewertung: Ein Benchmark für Anweisungskonflikte und eingebettete Befehle

Die Sicherheitsbewertung von Sprachmodellen stößt bei komplexen, mehrdeutigen Anweisungen oft an ihre Grenzen, da bisherige Benchmarks meist nur einfache Bestehen-oder-Nicht-bestehen-Bewertungen liefern. Ein neuer Ansatz namens Adversarial Pragmatics führt ein linguistisch fundiertes Protokoll ein, um das Modellverhalten bei Anweisungskonflikten, eingebetteten Befehlen und sprachlicher Ambiguität präzise zu analysieren. Durch eine differenzierte Taxonomie und ein Experten-Evaluationsprotokoll lassen sich Fehlerquel

arxiv.org · 17.07. 06:00

MSQA: Ein nativ erstellter Benchmark für mehrsprachige und multikulturelle KI-Modelle

Die Untersuchung stellt den Benchmark MSQA vor, der 1.064 nativ erstellte Fragen über elf Sprachgruppen und fünf kulturelle Dimensionen hinweg umfasst. Ziel ist es, die sogenannte Illusion der kulturellen Ausrichtung zu prüfen, bei der Sprachkompetenz fälschlicherweise mit kulturellem Verständnis gleichgesetzt wird. Die Evaluierung von 18 Sprachmodellen zeigt eine deutliche kulturelle Degradierung und einen starken Lokalitätseffekt, bei dem kulturelle Kompetenz eng an die Trainingsdaten geknüpft ist. Gängige Method

arxiv.org · 17.07. 06:00

Idea2Plan: Untersuchung KI-gestützter Forschungsplanung

Große Sprachmodelle besitzen das Potenzial, den wissenschaftlichen Erkenntnisprozess durch die Strukturierung von Forschungsideen zu beschleunigen. Um diese Fähigkeit systematisch zu bewerten, wurde das Idea2Plan-Framework entwickelt, das auf aktuellen wissenschaftlichen Publikationen basiert. Es umfasst Benchmarks zur Messung der Planungsqualität sowie ein Evaluationssystem für KI-basierte Beurteilungen. Die Ergebnisse zeigen, dass aktuelle Modelle zwar Fortschritte bei der Erstellung strukturierter Forschungsplän

arxiv.org · 17.07. 06:00

Benchmarking multimodaler Sprachmodelle für wissenschaftliche Visualisierungskompetenz

Die Fähigkeit multimodaler Sprachmodelle zur Interpretation wissenschaftlicher Visualisierungen wurde anhand eines standardisierten Tests mit 49 Aufgaben untersucht. Dabei wurden sechs verschiedene Modelle mit menschlichen Referenzdaten verglichen. Die Ergebnisse zeigen deutliche Leistungsunterschiede: Während einige Modelle bei wissenschaftlichen Illustrationen und räumlichem Verständnis überzeugen, scheitern sie häufig an quantitativen Schätzungen sowie komplexen, texturbasierten Darstellungen. Die Studie unterst

arxiv.org · 17.07. 06:00

MedFailBench: Ein von Klinikern entwickelter Open-Source-Benchmark zur Überprüfung von Sicherheitsgrenzen in der medizinischen KI

MedFailBench verfolgt einen neuen Ansatz bei der Bewertung medizinischer KI-Systeme, indem es nicht nur die Korrektheit der Antworten prüft, sondern gezielt Sicherheitslücken identifiziert. Das von Medizinern erstellte Framework kategorisiert KI-Fehler nach Schweregraden und spezifischen Sicherheitskriterien wie fehlerhaften Dosierungsempfehlungen oder erfundenen Beweisen. Die aktuelle Version umfasst 44 synthetische klinische Fälle, eine Taxonomie für Sicherheitsbarrieren sowie eine automatisierte Pipeline zur Ana

arxiv.org · 17.07. 06:00

OmniaBench: Benchmarking für allgemeine KI-Agenten in vielfältigen Szenarien

OmniaBench ist ein neuer Benchmark zur systematischen Bewertung von KI-Agenten, die über die reine Textgenerierung hinausgehen und komplexe Aufgaben durch den Einsatz externer Werkzeuge lösen. Das System basiert auf einer hierarchischen Taxonomie mit über 400 Anwendungsdomänen, die aus realen Industrieressourcen abgeleitet wurden. Mit einem Datensatz von 1.431 Aufgaben ermöglicht der Benchmark eine präzise Analyse von Fähigkeiten wie Planung, Einhaltung von Vorgaben und adaptiver Korrektur. Aktuelle KI-Modelle zeig

arxiv.org · 13.07. 04:00

Sind KI-Sprachmodelle bereit für die ärztliche Assistenz? PhysAssistBench für die interaktive Unterstützung von Arzt, Patient und elektronischer Patientenakte

Die Integration von großen Sprachmodellen in den klinischen Alltag erfordert mehr als nur isolierte Fähigkeiten wie medizinisches Fachwissen oder Kommunikation. Das neue Benchmark-System PhysAssistBench evaluiert die koordinierte Interaktion zwischen Ärzten, Patienten und elektronischen Patientenakten anhand realer klinischer Szenarien. Die Untersuchung zeigt, dass aktuelle Modelle bei der Bewältigung dieser komplexen, mehrstufigen Aufgaben noch unzuverlässig sind. Eine effektive Unterstützung erfordert eine nahtlo

arXiv ? cs.AI 2 Artikel Forschung
arxiv.org · 17.07. 06:00

Messen Benchmarks zur Leistungsoptimierung KI-Coding-Agenten zuverlässig?

Aktuelle Benchmarks zur Bewertung von KI-Coding-Agenten bei der Repository-Optimierung stehen in der Kritik, da ihre Ergebnisse durch Instabilitäten und methodische Schwächen verzerrt werden können. Eine Untersuchung zeigt, dass offizielle Referenz-Patches bei einer plattformübergreifenden Überprüfung oft die ursprünglichen Gültigkeitskriterien nicht erfüllen. Zudem hängen die Platzierungen in Ranglisten stark von den spezifischen Bewertungsregeln ab, die teilweise unausgewogene Gewichtungen aufweisen. Die Analyse

arxiv.org · 17.07. 06:00

Adversarial Pragmatics zur Sicherheitsbewertung von KI: Ein Benchmark für Anweisungskonflikte und eingebettete Befehle

Die Sicherheitsbewertung von Sprachmodellen stößt bei komplexen, mehrdeutigen Anweisungen oft an ihre Grenzen, da bisherige Benchmarks lediglich zwischen Erfolg und Misserfolg unterscheiden. Ein neuer Ansatz namens Adversarial Pragmatics führt ein linguistisch fundiertes Protokoll ein, um das Modellverhalten bei Anweisungskonflikten, eingebetteten Befehlen und mehrdeutigen Richtlinien präzise zu analysieren. Durch eine differenzierte Taxonomie und ein Experten-Evaluierungssystem werden Fehlerquellen wie Capability-

The Gradient 1 Artikel News
thegradient.pub · 09.09. 17:28

Was LLM-Chatbots fehlt: Ein Sinn für Zielorientierung

Die Leistungsfähigkeit von KI-Chatbots auf Basis großer Sprachmodelle wächst kontinuierlich, was primär durch standardisierte Benchmarks wie MMLU oder HumanEval belegt wird. Trotz dieser messbaren Fortschritte stellt sich die Frage, ob die tatsächliche Nutzererfahrung in gleichem Maße profitiert. Es zeichnet sich ab, dass die reine Optimierung auf Benchmark-Ergebnisse nicht ausreicht, um den Anforderungen an eine zielgerichtete und zweckorientierte Interaktion gerecht zu werden. Zukünftige Entwicklungen müssen dahe