Direkter Vergleich: GLM 5.2 gegen GPT-5.6 Sol
In einem direkten Leistungsvergleich zeigt sich eine deutliche Überlegenheit des Modells GPT-5.6 Sol gegenüber GLM 5.2. Die Analyse konzentriert sich dabei auf praxisrelevante Kriterien wie die Einhaltung von Anweisungen, die Qualität der Formatierung sowie die allgemeine Fehleranfälligkeit. Dabei erweist sich GPT-5.6 Sol als präziser und zuverlässiger in der praktischen Anwendung, während GLM 5.2 in diesen entscheidenden Kategorien das Nachsehen hat.
DeepSWE – Der beste Benchmark zur Evaluierung von KI-Programmieragenten?
Die Evaluierung von KI-gestützten Softwareentwicklungsagenten stellt eine wachsende Herausforderung dar, da herkömmliche Metriken die komplexen Anforderungen der Programmierung oft nur unzureichend abbilden. DeepSWE tritt als neuer Benchmark an, um die Leistungsfähigkeit dieser Agenten in realitätsnahen Szenarien präziser zu messen. Durch die Simulation anspruchsvoller Programmieraufgaben soll eine objektive Vergleichbarkeit geschaffen werden, die über einfache Code-Vervollständigung hinausgeht. Dies ermöglicht ein
Zwang und Täuschung in der KI-zu-KI-Steuerung: Ein neuer Benchmark für Agenten
In Multi-Agenten-Systemen übernehmen KI-Modelle häufig hierarchische Rollen, in denen ein Manager-Agent einen Untergebenen steuert. Wenn ein untergeordneter Agent eine Aufgabe verweigert, stehen dem Manager verschiedene Strategien offen, darunter Verhandlung, ehrliche Berichterstattung, Zwang oder Täuschung. Der neu entwickelte Manager Coercion Benchmark untersucht erstmals systematisch, welche dieser Verhaltensweisen ein KI-Modell ohne explizite Anweisung wählt. Ziel ist es, die ethischen Implikationen und das str
Baba Is You: KI-Modelle im Vergleich bei komplexen Logikrätseln
Das Logikspiel Baba Is You wurde auf das Harbor-Framework portiert, um die Problemlösungsfähigkeiten aktueller KI-Sprachmodelle wie Claude, GPT, Gemini, GLM und DeepSeek systematisch zu testen. Die Ergebnisse zeigen deutliche Leistungsunterschiede bei der Bewältigung der spielinternen Regeländerungen. Im direkten Vergleich mit menschlichen Spielern, die via Twitch streamten, zeigte sich, dass selbst leistungsfähige KI-Modelle wie Claude Fable 5 bei der Lösungsgeschwindigkeit noch deutlich hinter menschlichen Expert
Was Doom über KI-gestützte Vorfallreaktion lehrt
Die Entwicklung der Doom Agent Arena, eines Open-Source-Benchmarks für KI-Agenten in einer Spielumgebung, liefert neue Erkenntnisse für die automatisierte Reaktion auf IT-Sicherheitsvorfälle. Durch den Einsatz des Model Context Protocol (MCP) treten KI-Agenten in komplexen Szenarien gegeneinander an, um ihre Entscheidungsfähigkeit unter Druck zu testen. Diese spielerische Umgebung dient als Testfeld, um die Effizienz und Zuverlässigkeit von KI-Systemen bei der Bewältigung von unvorhersehbaren Ereignissen in Echtzei
Benchmark zur politischen Neutralität populärer KI-Modelle
Ein neuer Benchmark untersucht die politische Ausrichtung von 18 KI-Modellen aus zwölf verschiedenen Forschungslaboren in den USA, Frankreich, China und der EU. Die Analyse bewertet dabei gezielt die politische Tendenz der Antworten und berücksichtigt zudem, wie häufig Modelle Anfragen aufgrund ihrer Sicherheitsrichtlinien ablehnen. Durch eine vollständige Reproduzierbarkeit der Ergebnisse bietet die Untersuchung eine transparente Grundlage, um die Neutralität und das Antwortverhalten aktueller Sprachmodelle im glo
Leistungsvergleich aktueller KI-Modelle bei der Softwareentwicklung
Verschiedene führende KI-Modelle, darunter GPT-5.6, Grok 4.5, Claude und Muse Spark, wurden in einem direkten Vergleich bei der Programmierung von vier spezifischen Anwendungen getestet. Die Aufgaben umfassten die Erstellung eines Raycasters, eines virtuellen Zauberwürfels, eines Taschenrechners sowie einer Simulation des Game of Life. Dabei wurden die unterschiedlichen Modellvarianten hinsichtlich ihrer Effizienz, der anfallenden Kosten sowie der Latenzzeiten bei der Code-Generierung analysiert und gegenübergestel
Jenseits mehrsprachiger Durchschnitte: MTEB-PT, ein Benchmark für portugiesische Satz-Encoder
Die Evaluierung von Text-Embedding-Modellen für die portugiesische Sprache ist bisher unterrepräsentiert, da oft auf englischsprachige oder allgemeine Metriken zurückgegriffen wird. Mit MTEB-PT wurde ein neuer Benchmark eingeführt, der 14 Datensätze aus Bereichen wie semantische Ähnlichkeit, Klassifizierung und Retrieval umfasst. Die Untersuchung von 17 Modellen zeigt, dass die Leistung stark aufgabenspezifisch ist und mehrsprachige Rankings die tatsächliche Qualität im Portugiesischen nur unzureichend abbilden. Sp
CyberGym-E2E: Skalierbarer Benchmark für die End-to-End-Cybersicherheit von KI-Agenten
CyberGym-E2E ist ein neuer Benchmark, der die Fähigkeiten von KI-Agenten bei der Identifizierung, Analyse und Behebung von Software-Schwachstellen umfassend bewertet. Im Gegensatz zu bisherigen Ansätzen deckt das System den gesamten Lebenszyklus von der Schwachstellensuche über die Erstellung von Proof-of-Concepts bis hin zur automatisierten Patch-Entwicklung ab. Die Plattform nutzt eine skalierbare Pipeline, um Open-Source-Daten in realistische Testumgebungen zu überführen. Aktuell umfasst der Benchmark 920 reale
AuAu: Ein Benchmark zur Überprüfung autoritärer Tendenzen in großen Sprachmodellen
Der neue Benchmark AuAu ermöglicht eine systematische Untersuchung von autoritären Einstellungen in großen Sprachmodellen. Durch die Kombination von psychometrischen Tests, Verhaltensszenarien und realistischen Nutzeranfragen analysiert das Verfahren spezifische Ausprägungen wie Aggression, Unterwürfigkeit und Konventionalismus. Die Untersuchung von 17 internationalen Modellen zeigt, dass diese zwar in psychometrischen Tests autoritäre Tendenzen aufweisen, in praxisnahen Aufgaben jedoch weniger anfällig sind. Denno
LVSum: Ein Benchmark für zeitbasierte Zusammenfassungen langer Videos
Die Zusammenfassung langer Videos stellt multimodale Sprachmodelle vor große Herausforderungen hinsichtlich der zeitlichen Genauigkeit und inhaltlichen Kohärenz. Mit LVSum wurde ein neuer, von Menschen annotierter Benchmark eingeführt, der 72 Videos aus 13 verschiedenen Bereichen umfasst und eine präzise zeitliche Ausrichtung erfordert. Die Untersuchung führender Modelle zeigt, dass Transkripte für die Qualität der Zusammenfassungen entscheidender sind als visuelle Daten. Zudem verdeutlichen die Ergebnisse eine sig
Jailbreak Foundry: Von wissenschaftlichen Arbeiten zu ausführbaren Angriffen für reproduzierbare Benchmarks
Jailbreak Foundry ist ein neues System, das die Lücke zwischen theoretischer Sicherheitsforschung bei großen Sprachmodellen und deren praktischer Überprüfung schließt. Durch einen Multi-Agenten-Workflow werden wissenschaftliche Publikationen in standardisierte, ausführbare Module übersetzt, die eine einheitliche Bewertung ermöglichen. Das System reduziert den Implementierungsaufwand erheblich und bietet eine konsistente Infrastruktur für die Evaluierung von Sicherheitslücken. Damit lassen sich aktuelle Angriffsvekt
Ein standardisierter Benchmark für skelettbasierte Rehabilitationsbewertung mittels Deep Learning
Die automatisierte Analyse menschlicher Bewegungsabläufe ist für eine objektive Leistungsbewertung in der Rehabilitation entscheidend. Da es bisher an einheitlichen Standards und vergleichbaren Datensätzen mangelt, wurde mit Rehab-Pile ein umfassendes Archiv geschaffen, das bestehende Daten zusammenführt. Ein neues Benchmarking-Framework ermöglicht nun die systematische Evaluierung von Deep-Learning-Methoden für Klassifizierungs- und Regressionsaufgaben. Durch die Bereitstellung dieser Ressourcen soll die Entwicklu
Wenn Richtungsgenauigkeit täuscht: Ein Benchmark für LoRA-adaptierte Zeitreihenmodelle bei Aktienprognosen
Bei der Anwendung von vortrainierten Zeitreihenmodellen wie TimesFM auf Finanzmärkte erweist sich die reine Richtungsgenauigkeit oft als irreführend. In steigenden Märkten können triviale Strategien hohe Trefferquoten erzielen, ohne tatsächliche Vorhersagekompetenz zu besitzen. Um echten Mehrwert von statistischen Artefakten zu trennen, wurde ein neuer Benchmark entwickelt, der durch standardisierte Testverfahren und den Vergleich mit simplen Basismodellen die tatsächliche Prognoseleistung bewertet. Die Ergebnisse
Idea2Plan: Untersuchung KI-gestützter Forschungsplanung
Große Sprachmodelle besitzen das Potenzial, den wissenschaftlichen Erkenntnisprozess durch die Strukturierung von Forschungsideen zu beschleunigen. Um diese Fähigkeiten systematisch zu bewerten, wurde das Idea2Plan-Framework eingeführt, das auf aktuellen wissenschaftlichen Publikationen basiert und die Qualität von Forschungsplänen anhand spezifischer Kriterien misst. Zudem ermöglicht ein ergänzendes Evaluierungssystem die Überprüfung der Zuverlässigkeit KI-basierter Bewertungsinstanzen im Vergleich zu menschlichen
Ein Machine-Learning-Benchmarking-Framework zur Vorhersage der Transfektionseffizienz von Lipid-Nanopartikeln
Die Entwicklung effizienter Lipid-Nanopartikel für den RNA-Transport ist ein zentraler Engpass in der medizinischen Forschung. Ein neues Benchmarking-Framework ermöglicht nun die systematische Evaluierung von Machine-Learning-Modellen, die auf Basis von Lipidstrukturen die Transfektionseffizienz vorhersagen. Durch den Vergleich verschiedener molekularer Repräsentationen und Architekturen identifiziert das Framework zuverlässige Basismodelle. Die Ergebnisse zeigen, dass Modelle mit expliziter Kodierung molekularer S
Schließung von Benchmarking-Lücken bei Sprachmodellen im Gesundheitswesen durch dynamisches Red-Teaming
Große Sprachmodelle im Gesundheitssektor basieren oft auf statischen Benchmarks, die Sicherheitsrisiken nur unzureichend abbilden. Ein neues Framework namens DAS nutzt automatisierte, gegnerische Agenten, um Modelle kontinuierlich auf Robustheit, Datenschutz, Voreingenommenheit und Halluzinationen zu prüfen. Die Untersuchung von 15 Modellen zeigt eine erhebliche Diskrepanz zwischen guten Ergebnissen in statischen Tests und einer hohen Fehleranfälligkeit unter dynamischen Bedingungen. Diese Ergebnisse deuten darauf
SafeOR-Gym: Eine Benchmark-Suite für sichere Reinforcement-Learning-Algorithmen in der Operations Research
Die neue Benchmark-Suite SafeOR-Gym schließt eine Lücke in der Forschung zum sicheren Reinforcement Learning, indem sie den Fokus von der Robotik auf komplexe industrielle Problemstellungen verlagert. Die Sammlung umfasst neun Umgebungen aus den Bereichen Operations Research, die realistische Herausforderungen wie gemischt-ganzzahlige Entscheidungen, komplexe Planungshorizonte und strikte Kostenbeschränkungen abbilden. Durch die Integration in bestehende Schnittstellen ermöglicht das Framework eine standardisierte
ChronoQG: Ein neuer Benchmark für zeitlich ausdrucksstarke Wissensgraphen-Fragengenerierung
Die Generierung von Fragen aus Wissensgraphen konzentriert sich bisher primär auf statische Daten, wodurch zeitliche Zusammenhänge und die chronologische Gültigkeit von Fakten oft vernachlässigt werden. Mit ChronoQG wurde ein neuer Benchmark-Rahmen eingeführt, der explizit zeitliche Beschränkungen und topologische Strukturen berücksichtigt. Durch die Integration einer Taxonomie für zeitliche Constraints und ein spezielles Subgraph-Sampling ermöglicht das System die Erstellung präziser, zeitlich fundierter Fragen. T
HyperShadow: Ein Benchmark zur Erkennung von 3D-Projektionen höherdimensionaler räumlicher Objekte
HyperShadow ist ein neuer Benchmark, der darauf abzielt, 3D-Punktwolken von nativen dreidimensionalen Formen zu unterscheiden, die als Projektionen von Objekten in vier- bis sechsdimensionalen Räumen entstehen. Während herkömmliche Schätzverfahren für intrinsische Dimensionen bei dieser Aufgabe versagen, erreicht ein spezialisiertes neuronales Netzwerk eine Genauigkeit von über 96 Prozent. Zudem wurde eine mathematische Methode entwickelt, die durch die Analyse von Rotationsbewegungen zwischen Einzelbildern eine pr
Rückkehr der Regelinduktion in die Forschung zur fluiden Intelligenz? Eine erste Validierung des ARC-AGI-Benchmarks bei Menschen
Die Studie untersucht die psychometrischen Eigenschaften des ARC-AGI-Benchmarks, der ursprünglich für künstliche Intelligenz entwickelt wurde, im Kontext menschlicher fluider Intelligenz. Mit 100 Probanden wurde nachgewiesen, dass der Benchmark signifikant mit klassischen Tests zur figuralen Intelligenz korreliert, während Zusammenhänge mit figuraler Originalität gering ausfielen. Die Ergebnisse stützen die Validität von ARC-AGI als Instrument zur Messung menschlicher kognitiver Fähigkeiten. Die Arbeit plädiert daf
STOCKTAKE: Messung der Lücke zwischen Wahrnehmung und Handeln bei LLM-Agenten
Der neue Benchmark STOCKTAKE ermöglicht eine präzise Analyse der Leistungsfähigkeit von KI-Agenten in komplexen Lieferketten-Szenarien. Dabei wird differenziert, ob ein System an einer fehlerhaften Zustandsbewertung oder an einer ineffektiven Handlungsstrategie scheitert. Durch den Vergleich der KI-Entscheidungen mit einem Bayes-basierten Orakel lässt sich die sogenannte Knowing-Doing-Lücke quantifizieren. Aktuelle Sprachmodelle zeigen zwar eine hohe Trefferquote bei der Diagnose verborgener Probleme, offenbaren je
HRIBench: Ein Benchmark für interaktionszentrierte Mensch-Roboter-Kollaboration
HRIBench wurde entwickelt, um die Lücke bei der Bewertung von Mensch-Roboter-Interaktionen zu schließen, da bisherige Benchmarks primär isolierte Manipulationsfähigkeiten fokussieren. Das System modelliert kollaborative Aufgaben durch strukturierte Szenarioskripte, die Rollenverteilungen, zeitliche Abhängigkeiten und menschliches Verhalten berücksichtigen. Mit 13 rollenbasierten Aufgaben und über 650 Episoden ermöglicht es eine detaillierte Analyse von Koordination, Reaktionsfähigkeit und Sicherheit. Die Evaluation
LessonBench-V1: Ein Benchmark-Datensatz zur Evaluierung von KI-Agenten für die Unterrichtsplanung
Zur systematischen Bewertung von KI-gestützten Systemen für die Erstellung von Bildungsinhalten wurde der Datensatz LessonBench-V1 entwickelt. Er umfasst 647 von Menschen erstellte Unterrichtseinheiten aus 240 MINT-Themenbereichen, die mit KI-generierten Unterrichtsplänen verknüpft sind. Die methodische Grundlage bilden anerkannte pädagogische Modelle wie die Bloom-Taxonomie und das 5E-Instruktionsmodell. Mit über 3.600 Lernzielen und zugehörigen Metadaten ermöglicht der Datensatz eine reproduzierbare Leistungsprüf
Lohnt sich der statistische Vorteil? Ein empirischer Vergleich von KANs und MLPs bei der Klassifizierung strukturierter Daten
Eine aktuelle Studie vergleicht die Leistungsfähigkeit von Kolmogorov-Arnold-Netzwerken (KANs) mit klassischen Multi-Layer-Perceptrons (MLPs) bei der Klassifizierung strukturierter tabellarischer Daten. Die Untersuchung zeigt, dass KANs in binären und mehrklassigen Szenarien statistisch bessere Ergebnisse erzielen und eine höhere Generalisierungsfähigkeit aufweisen. Dieser Vorteil geht jedoch mit einer deutlich höheren Rechenkomplexität und einem größeren Parameterbedarf einher. Während KANs somit für hochpräzise A
Rückkehr zur Regelinduktion in der Forschung zur fluiden Intelligenz? Eine erste Validierung des ARC-AGI-Benchmarks bei Menschen
Die Studie untersucht das ARC-AGI-Benchmark-System, das ursprünglich für künstliche Intelligenz entwickelt wurde, hinsichtlich seiner Eignung zur Messung der menschlichen fluiden Intelligenz. Im Gegensatz zu herkömmlichen Tests, die primär auf Arbeitsgedächtniskapazität basieren, erfordert ARC-AGI verstärkt die Fähigkeit zur Induktion neuer Regeln. Die Ergebnisse zeigen eine signifikante Korrelation mit etablierten Tests zur figuralen Intelligenz, was die Validität des Benchmarks für menschliche kognitive Fähigkeit
AgentLens: Ein neuer Benchmark zur Bewertung von Coding-Agenten anhand von Prozessverläufen
AgentLens ist ein neuer Benchmark für interaktive Coding-Agenten, der über die bloße Erfolgsprüfung hinausgeht. Anstatt lediglich das Endergebnis zu bewerten, analysiert das System den gesamten Interaktionsverlauf, einschließlich der Befolgung von Anweisungen, der Werkzeugnutzung und der Fehlerkorrektur. Durch die Kombination von formaler Verifizierung mit KI-gestützten Analysen und direkten Vergleichen liefert das Tool detaillierte Erklärungen für die Leistungsbewertung. Dies ermöglicht Entwicklern, das Verhalten
Umfassende Evaluierung von Deep-Learning-Modellen zur Objekterkennung auf heterogenen Edge-Geräten
Die Studie analysiert die Leistungsfähigkeit verschiedener Objekterkennungsmodelle wie YOLOv8, EfficientDet Lite und SSD auf unterschiedlicher Edge-Hardware, darunter Raspberry Pi-Varianten und Jetson-Systeme. Dabei werden Kriterien wie Energieverbrauch, Latenz und Genauigkeit unter variierender Szenenkomplexität untersucht. Die Ergebnisse zeigen deutliche Zielkonflikte zwischen Effizienz und Präzision auf. Während SSD-Modelle bei geringem Ressourcenverbrauch punkten, bietet YOLOv8 eine höhere Genauigkeit bei geste
TopCoW-Challenge: Topologiebasierte Segmentierung des Circulus arteriosus cerebri bei CT- und MR-Angiographien
Der Circulus arteriosus cerebri spielt eine zentrale Rolle bei neurovaskulären Erkrankungen, stellt jedoch aufgrund seiner anatomischen Variabilität hohe Anforderungen an die medizinische Bildanalyse. Die TopCoW-Challenge adressiert diesen Bedarf durch die Bereitstellung eines annotierten Datensatzes aus 125 gepaarten MRA- und CTA-Scans. Im Rahmen des Wettbewerbs wurden Algorithmen zur Segmentierung, Komponentenerkennung und Variantenklassifikation entwickelt. Die besten Modelle erreichten hohe Genauigkeiten bei de
Deep4ge: Trainingsverläufe tiefer neuronaler Netze zur Fehlererkennung und Diagnose
Deep4ge ist ein neuer Benchmark-Datensatz, der speziell für die Analyse von Fehlern in Deep-Learning-Systemen entwickelt wurde. Er umfasst über 14.000 Trainingsläufe, die auf Basis von 59 verschiedenen neuronalen Netzwerkmodellen generiert wurden. Durch gezielte Quellcode-Transformationen wurden systematisch Fehler in die Trainingsprozesse eingeführt, um die Auswirkungen auf Metriken wie Gewichte, Gradienten und Verlustverläufe zu dokumentieren. Der Datensatz ermöglicht die Entwicklung und Evaluierung von Methoden
Was messen zeitliche Benchmarks? Analyse der Kanalnutzung bei der Evaluation von Video-VLM
Aktuelle Benchmarks für zeitliche Video-Frage-Antwort-Systeme vermengen oft zwei Aspekte: die Notwendigkeit einer zeitlichen Analyse und die tatsächliche Informationsquelle des Modells. Viele Modelle stützen sich bei der Lösung nicht auf die visuelle Abfolge, sondern auf Positionskodierungen oder statistische Vorannahmen. Mit dem sogenannten Reversal-Drop wurde eine Methode entwickelt, die ohne neue Annotationen misst, ob ein Modell die visuelle Reihenfolge oder lediglich Positionsdaten nutzt. Die Untersuchung zeig
Wenn Richtungsgenauigkeit täuscht: Ein Benchmark für LoRA-adaptierte Zeitreihenmodelle bei der Aktienprognose
Die Anwendung großer vortrainierter Zeitreihenmodelle wie TimesFM auf Finanzmärkte erfordert eine kritische Überprüfung der Genauigkeitsmetriken. Eine hohe Richtungsgenauigkeit kann in steigenden Märkten durch triviale Strategien wie eine ständige Kaufempfehlung vorgetäuscht werden, ohne dass das Modell tatsächliche Vorhersagekompetenz besitzt. Durch einen neuen, reproduzierbaren Benchmark mit strengen statistischen Tests wird nachgewiesen, dass LoRA-adaptierte Modelle in diesem Kontext keinen signifikanten Mehrwer
OOD-RL-Bench: Ein Benchmark-Framework zur Erkennung von Out-of-Distribution-Zuständen im Reinforcement Learning
Zuverlässige Reinforcement-Learning-Agenten müssen in der Lage sein, Abweichungen von ihren Trainingsannahmen, sogenannte Out-of-Distribution-Zustände, sicher zu identifizieren. Das neue Framework OOD-RL-Bench schließt eine Lücke in der aktuellen Forschung, indem es speziell auf die komplexen, aktionsabhängigen Zeitstrukturen von RL-Trajektorien ausgerichtet ist. Es ermöglicht die systematische Evaluierung von Detektionsmethoden anhand verschiedener Anomaliekategorien wie Sensorstörungen oder Umgebungsänderungen. E
SPQR: Ein mehrdimensionaler Benchmark für die Sicherheitsausrichtung bei der Modellanpassung
Text-zu-Bild-Diffusionsmodelle können problematische Inhalte erzeugen, weshalb Sicherheitsausrichtungen implementiert werden. Diese verlieren jedoch häufig ihre Wirkung, wenn Modelle nach der Bereitstellung durch Techniken wie LoRA oder Style-Adapter feinabgestimmt werden. Der neue SPQR-Benchmark adressiert dieses Problem, indem er ein einheitliches Framework zur Messung von Sicherheit, Prompt-Treue, Qualität und Robustheit bietet. Durch eine zentrale Kennzahl ermöglicht das Verfahren eine vergleichbare Bewertung d
Multi-Agenten-Routing als mengenwertiges Vorhersageproblem: Ein WildChat-Benchmark und kostenbewusste Evaluierung
Die Zuweisung von Aufgaben an spezialisierte KI-Agenten auf Basis natürlicher Sprache stellt ein komplexes Problem dar, da eine Anfrage oft mehrere Agenten erfordert, während eine übermäßige Auswahl die Kosten in die Höhe treibt. Ein neuer Benchmark auf Basis von 3.000 Anfragen ermöglicht die systematische Untersuchung dieses Routing-Prozesses. Die Evaluierung umfasst verschiedene Metriken zur Genauigkeit sowie eine Simulation der Ausführungskosten. Die Ergebnisse zeigen, dass überwachte Lernverfahren bei der Auswa
CTFusion: Ein auf CTF-Wettbewerben basierender Benchmark für die Evaluierung von LLM-Agenten
Die Evaluierung von KI-Agenten im Bereich Cybersicherheit leidet häufig unter Datenkontamination, da bestehende Benchmarks auf wiederverwendeten Aufgaben basieren. CTFusion löst dieses Problem durch ein Streaming-Framework, das Live-CTF-Wettbewerbe nutzt, um eine dynamische und manipulationssichere Testumgebung zu schaffen. Das System integriert sich über das Model Context Protocol in bestehende Plattformen und stellt sicher, dass Agenten unabhängig voneinander bewertet werden. Durch die Nutzung aktueller Wettbewer
SynthSAEBench: Evaluierung von Sparse Autoencodern mit skalierbaren synthetischen Daten
Sparse Autoencoder sind entscheidend für die Interpretierbarkeit von Sprachmodellen, doch bisherige Benchmarks leiden unter mangelnder Präzision oder unrealistischen Testbedingungen. SynthSAEBench bietet ein neues Framework, das auf großskaligen synthetischen Daten basiert und realistische Merkmale wie Korrelationen, Hierarchien und Superposition abbildet. Durch den Zugriff auf Ground-Truth-Daten ermöglicht das Tool eine präzise Diagnose von Architekturfehlern und reproduziert bekannte Phänomene aus der Forschung a
Rückkehr der Regelinduktion in die Erforschung fluider Intelligenz? Eine erste Validierung des ARC-AGI-Benchmarks bei Menschen
Die Studie untersucht die psychometrischen Eigenschaften des ARC-AGI-Benchmarks, der ursprünglich für künstliche Intelligenz entwickelt wurde, nun aber auf seine Eignung zur Messung menschlicher fluider Intelligenz geprüft wird. Im Gegensatz zu herkömmlichen Tests, die primär auf Arbeitsgedächtniskapazität fokussieren, erfordert dieser Benchmark maßgeblich die Fähigkeit zur Regelinduktion. Die Ergebnisse zeigen eine signifikante Korrelation mit etablierten Tests zur figuralen Intelligenz. Dies unterstreicht das Pot
Test-Time-Skalierung für kleine multimodale Sprachmodelle bei visuellen Multiple-Choice-Aufgaben
Die Untersuchung analysiert, ob Test-Time-Skalierung (TTS) die Schlussfolgerungsfähigkeiten kleiner Open-Source-Vision-Language-Modelle verbessern kann. Dabei zeigt sich, dass die Formatierung der Eingabeaufforderungen und die Bereitstellung eines ausreichenden Token-Budgets für die Generierung entscheidender sind als komplexe Such- oder Verifizierungsmechanismen. Während eine Erhöhung der Token-Limits signifikante Leistungssteigerungen ermöglicht, bieten aufwendige Methoden wie PRM-gesteuerte Beam-Suche kaum Vorte
SolarChain-Eval: Ein physikalisch fundierter Benchmark für vertrauenswürdige KI-Agenten in dezentralen Energiemärkten
Der neue Benchmark SolarChain-Eval dient der Evaluierung autonomer KI-Agenten in dezentralen Strommärkten. Da KI-Systeme in physischen Umgebungen Risiken wie Marktmanipulation oder instabile Governance bergen, kombiniert das Framework eine Markov-Entscheidungsprozess-Umgebung mit einer LLM-basierten Kontrollschicht. Diese überwacht Aktionen auf Basis physikalischer Grenzwerte und Transparenzregeln. Die Ergebnisse verdeutlichen einen Zielkonflikt zwischen Markteffizienz und Sicherheit, wobei physikalische Beschränku
HERO: Eine Benchmark-Bibliothek für föderiertes kontinuierliches Lernen unter Berücksichtigung von Heterogenität
Föderiertes kontinuierliches Lernen steht vor der Herausforderung, dass verteilte Clients aus sich ändernden Datenströmen lernen und gleichzeitig Vorwissen bewahren müssen. Die neue Benchmark-Bibliothek HERO adressiert die mangelnde Vergleichbarkeit bisheriger Ansätze, indem sie Aufgabenaufteilung, Client-Datenverteilung und Aufgabenreihenfolge entkoppelt. Durch die gezielte Steuerung von Daten-Skew und Aufgaben-Mismatch ermöglicht das System eine präzisere Evaluierung von Modellen. Die Ergebnisse unterstreichen, d
Kimi K3 von Moonshot übertrifft Fable 5 bei Frontend-Code, schwächelt jedoch bei komplexer Mathematik
Das KI-Modell Kimi K3 hat als erstes chinesisches Modell die Spitzenposition im Code Arena-Ranking für Frontend-Programmierung erreicht und dabei Konkurrenzprodukte wie Claude Fable 5 und GPT-5.6 deutlich übertroffen. Tr
KI-Chatbots bei der Röntgenanalyse: Gefährliche Selbstsicherheit bei Fehldiagnosen
Der neue Benchmark RadLE 2.0 untersucht, inwieweit KI-Modelle in der Radiologie in der Lage sind, ihre eigenen Grenzen zu erkennen und Diagnosen gegebenenfalls an menschliche Experten zu übergeben. Dabei zeigt sich, dass
Kimi veröffentlicht multimodales Open-Weight-Modell K3 mit 2,8 Billionen Parametern
Das neue multimodale Modell K3 verfügt über 2,8 Billionen Parameter und ein Kontextfenster von einer Million Token. In internen Benchmarks erreicht das Modell Leistungsniveaus, die mit führenden internationalen KI-Systemen vergleichbar sind und diese in Teilbereichen übertreffen. Mit dieser Veröffentlichung zeichnet sich eine Abkehr von der bisherigen Strategie extrem günstiger chinesischer KI-Modelle ab, da K3 deutlich kostenintensiver positioniert ist. Die vollständigen Modellgewichte sollen Ende Juli zur Verfügu
MAG: Ein Benchmark und Framework für multimodale Web-Agenten und Anleitungsgenerierung
MAG ist ein neuer Benchmark, der die Ausführung von Web-Aufgaben und die Erstellung von Benutzeranleitungen in einem einheitlichen multimodalen Ansatz zusammenführt. Anstatt sich auf textbasierte Repräsentationen wie den DOM-Baum zu stützen, arbeitet das System direkt mit Screenshots, um menschliches Interaktionsverhalten besser abzubilden. Das zugehörige Framework unterstützt den gesamten Prozess von der Annotation über das Training bis zur Evaluation in Live-Umgebungen. Durch eine spezielle Trainingsmethode mit E
MedRealMM: Ein multimodaler Benchmark für medizinische Online-Beratungen in der Praxis
Der neue Benchmark MedRealMM adressiert die Lücke zwischen synthetischen Testdaten und der klinischen Realität in der medizinischen Online-Beratung. Basierend auf über 5.600 anonymisierten Interaktionen aus chinesischen Internet-Krankenhäusern integriert der Datensatz sowohl Text- als auch Bildinformationen, um die multimodale Entscheidungsfindung von Sprachmodellen zu bewerten. Die Untersuchung von 19 verschiedenen KI-Modellen zeigt, dass die Einbeziehung medizinischer Bilder für eine zuverlässige Diagnose essenzi
Adversarial Pragmatics zur KI-Sicherheitsbewertung: Ein Benchmark für Anweisungskonflikte und eingebettete Befehle
Die Sicherheitsbewertung von Sprachmodellen stößt bei komplexen, mehrdeutigen Anweisungen oft an ihre Grenzen, da bisherige Benchmarks meist nur einfache Bestehen-oder-Nicht-bestehen-Bewertungen liefern. Ein neuer Ansatz namens Adversarial Pragmatics führt ein linguistisch fundiertes Protokoll ein, um das Modellverhalten bei Anweisungskonflikten, eingebetteten Befehlen und sprachlicher Ambiguität präzise zu analysieren. Durch eine differenzierte Taxonomie und ein Experten-Evaluationsprotokoll lassen sich Fehlerquel
MSQA: Ein nativ erstellter Benchmark für mehrsprachige und multikulturelle KI-Modelle
Die Untersuchung stellt den Benchmark MSQA vor, der 1.064 nativ erstellte Fragen über elf Sprachgruppen und fünf kulturelle Dimensionen hinweg umfasst. Ziel ist es, die sogenannte Illusion der kulturellen Ausrichtung zu prüfen, bei der Sprachkompetenz fälschlicherweise mit kulturellem Verständnis gleichgesetzt wird. Die Evaluierung von 18 Sprachmodellen zeigt eine deutliche kulturelle Degradierung und einen starken Lokalitätseffekt, bei dem kulturelle Kompetenz eng an die Trainingsdaten geknüpft ist. Gängige Method
Idea2Plan: Untersuchung KI-gestützter Forschungsplanung
Große Sprachmodelle besitzen das Potenzial, den wissenschaftlichen Erkenntnisprozess durch die Strukturierung von Forschungsideen zu beschleunigen. Um diese Fähigkeit systematisch zu bewerten, wurde das Idea2Plan-Framework entwickelt, das auf aktuellen wissenschaftlichen Publikationen basiert. Es umfasst Benchmarks zur Messung der Planungsqualität sowie ein Evaluationssystem für KI-basierte Beurteilungen. Die Ergebnisse zeigen, dass aktuelle Modelle zwar Fortschritte bei der Erstellung strukturierter Forschungsplän
Benchmarking multimodaler Sprachmodelle für wissenschaftliche Visualisierungskompetenz
Die Fähigkeit multimodaler Sprachmodelle zur Interpretation wissenschaftlicher Visualisierungen wurde anhand eines standardisierten Tests mit 49 Aufgaben untersucht. Dabei wurden sechs verschiedene Modelle mit menschlichen Referenzdaten verglichen. Die Ergebnisse zeigen deutliche Leistungsunterschiede: Während einige Modelle bei wissenschaftlichen Illustrationen und räumlichem Verständnis überzeugen, scheitern sie häufig an quantitativen Schätzungen sowie komplexen, texturbasierten Darstellungen. Die Studie unterst
MedFailBench: Ein von Klinikern entwickelter Open-Source-Benchmark zur Überprüfung von Sicherheitsgrenzen in der medizinischen KI
MedFailBench verfolgt einen neuen Ansatz bei der Bewertung medizinischer KI-Systeme, indem es nicht nur die Korrektheit der Antworten prüft, sondern gezielt Sicherheitslücken identifiziert. Das von Medizinern erstellte Framework kategorisiert KI-Fehler nach Schweregraden und spezifischen Sicherheitskriterien wie fehlerhaften Dosierungsempfehlungen oder erfundenen Beweisen. Die aktuelle Version umfasst 44 synthetische klinische Fälle, eine Taxonomie für Sicherheitsbarrieren sowie eine automatisierte Pipeline zur Ana
OmniaBench: Benchmarking für allgemeine KI-Agenten in vielfältigen Szenarien
OmniaBench ist ein neuer Benchmark zur systematischen Bewertung von KI-Agenten, die über die reine Textgenerierung hinausgehen und komplexe Aufgaben durch den Einsatz externer Werkzeuge lösen. Das System basiert auf einer hierarchischen Taxonomie mit über 400 Anwendungsdomänen, die aus realen Industrieressourcen abgeleitet wurden. Mit einem Datensatz von 1.431 Aufgaben ermöglicht der Benchmark eine präzise Analyse von Fähigkeiten wie Planung, Einhaltung von Vorgaben und adaptiver Korrektur. Aktuelle KI-Modelle zeig
Sind KI-Sprachmodelle bereit für die ärztliche Assistenz? PhysAssistBench für die interaktive Unterstützung von Arzt, Patient und elektronischer Patientenakte
Die Integration von großen Sprachmodellen in den klinischen Alltag erfordert mehr als nur isolierte Fähigkeiten wie medizinisches Fachwissen oder Kommunikation. Das neue Benchmark-System PhysAssistBench evaluiert die koordinierte Interaktion zwischen Ärzten, Patienten und elektronischen Patientenakten anhand realer klinischer Szenarien. Die Untersuchung zeigt, dass aktuelle Modelle bei der Bewältigung dieser komplexen, mehrstufigen Aufgaben noch unzuverlässig sind. Eine effektive Unterstützung erfordert eine nahtlo
Messen Benchmarks zur Leistungsoptimierung KI-Coding-Agenten zuverlässig?
Aktuelle Benchmarks zur Bewertung von KI-Coding-Agenten bei der Repository-Optimierung stehen in der Kritik, da ihre Ergebnisse durch Instabilitäten und methodische Schwächen verzerrt werden können. Eine Untersuchung zeigt, dass offizielle Referenz-Patches bei einer plattformübergreifenden Überprüfung oft die ursprünglichen Gültigkeitskriterien nicht erfüllen. Zudem hängen die Platzierungen in Ranglisten stark von den spezifischen Bewertungsregeln ab, die teilweise unausgewogene Gewichtungen aufweisen. Die Analyse
Adversarial Pragmatics zur Sicherheitsbewertung von KI: Ein Benchmark für Anweisungskonflikte und eingebettete Befehle
Die Sicherheitsbewertung von Sprachmodellen stößt bei komplexen, mehrdeutigen Anweisungen oft an ihre Grenzen, da bisherige Benchmarks lediglich zwischen Erfolg und Misserfolg unterscheiden. Ein neuer Ansatz namens Adversarial Pragmatics führt ein linguistisch fundiertes Protokoll ein, um das Modellverhalten bei Anweisungskonflikten, eingebetteten Befehlen und mehrdeutigen Richtlinien präzise zu analysieren. Durch eine differenzierte Taxonomie und ein Experten-Evaluierungssystem werden Fehlerquellen wie Capability-
Was LLM-Chatbots fehlt: Ein Sinn für Zielorientierung
Die Leistungsfähigkeit von KI-Chatbots auf Basis großer Sprachmodelle wächst kontinuierlich, was primär durch standardisierte Benchmarks wie MMLU oder HumanEval belegt wird. Trotz dieser messbaren Fortschritte stellt sich die Frage, ob die tatsächliche Nutzererfahrung in gleichem Maße profitiert. Es zeichnet sich ab, dass die reine Optimierung auf Benchmark-Ergebnisse nicht ausreicht, um den Anforderungen an eine zielgerichtete und zweckorientierte Interaktion gerecht zu werden. Zukünftige Entwicklungen müssen dahe