Glossareintrag
Wir denken. KI tippt mit.
BFCL steht für Berkeley Function Calling Leaderboard, eine öffentliche Rangliste der University of California in Berkeley, die misst, wie zuverlässig KI-Sprachmodelle externe Funktionen und Werkzeuge aufrufen. Gemessen wird das sogenannte Function Calling (auch Tool Use oder Werkzeugnutzung genannt), also die Fähigkeit eines Modells, auf eine Anfrage hin nicht nur Text zu schreiben, sondern strukturierte Befehle für Kalender, Datenbanken oder andere Software zu erzeugen.
Der KI-Benchmark stammt vom Gorilla-Projekt der Universität, startete im Februar 2024 und läuft aktuell in Version V4. (Hinweis: Verwechselbar mit der europäischen Ballonpilotenlizenz Part-BFCL aus der Luftfahrt, die mit KI nichts zu tun hat.)
Beim Function Calling führt das Sprachmodell keinen Code selbst aus, sondern erzeugt einen maschinenlesbaren Aufruf mit Funktionsname und ausgefüllten Parametern, den die angeschlossene Software dann ausführt. Beispiel: Fragt ein Kunde im Chat nach einem Termin am Dienstag, wählt das Large Language Model (LLM) aus den verfügbaren Funktionen „termin_anlegen" aus und trägt Datum, Uhrzeit und Kundennamen ein. Diese Fähigkeit ist die technische Grundlage jedes KI-Agenten, und genau sie prüft das Berkeley Function Calling Leaderboard.
Die erste Version startete laut der Start-Ankündigung des Berkeley-Teams im Februar 2024 mit 2.000 vom Berkeley-Team kuratierten Testaufgaben in Python, Java, JavaScript, SQL und für REST-APIs. Bewertet wird auf zwei Wegen. Der AST-Abgleich (Abstract Syntax Tree) zerlegt den erzeugten Funktionsaufruf und prüft Funktionsname und Parameter gegen die Musterlösung, ohne den Code auszuführen. Bei den ausführbaren Tests wird der Aufruf tatsächlich ausgeführt und das Ergebnis kontrolliert. Die Aufgaben reichen vom einfachen Einzelaufruf über die Wahl der richtigen Funktion aus mehreren Kandidaten bis zu mehreren parallelen Aufrufen. Eine eigene Kategorie namens Irrelevance Detection prüft, ob das Modell erkennt, wenn gar keine der angebotenen Funktionen passt, und den Aufruf dann korrekt verweigert.
Version V2 vom August 2024 ergänzte laut der Ankündigung der Live-Version 2.251 Aufgaben, die echte Nutzer beigesteuert haben, als Antwort auf den Verdacht, dass statische Testsätze in den Trainingsdaten der Modelle landen. V3 brachte im September 2024 mehrstufige Gespräche, bei denen erst der Endzustand des angebundenen Systems über Bestehen oder Scheitern entscheidet. Die aktuelle Version V4 vom Juli 2025 testet agentische Fähigkeiten wie Websuche, Gedächtnisverwaltung und die Empfindlichkeit gegenüber unterschiedlich formatierten Werkzeugbeschreibungen.
Hinter BFCL steht das Team um Shishir Patil mit den Berkeley-Professoren Ion Stoica und Joseph Gonzalez. Das begleitende ICML-2025-Paper bezeichnet BFCL als De-facto-Standard für die Bewertung von Funktionsaufrufen, der Code liegt quelloffen unter Apache-2.0-Lizenz im Gorilla-Repository auf GitHub, und Anbieter wie Meta zitieren BFCL-Werte in den offiziellen Modellkarten der Llama-Reihe. Die Rangliste selbst führt über 100 Modellvarianten und zeigt neben der Genauigkeit auch Kosten und Antwortzeit je Modell. Im Frühjahr 2026 lag Claude Opus 4.5 in der offiziellen BFCL-Rangliste mit 77,47 Prozent Gesamtgenauigkeit vorn (Stand April 2026).
Die einfachen Aufgabenkategorien gelten inzwischen als weitgehend ausgereizt, Spitzenmodelle liegen dort dicht beieinander. Eine Analyse von Databricks kommt zu dem Schluss, dass ein hoher BFCL-Wert notwendig, aber nicht hinreichend für zuverlässige Werkzeugnutzung in echten Anwendungen ist. Für mehrstufige Praxisabläufe mit simulierten Kunden existieren deshalb ergänzende Benchmarks wie Tau-Bench, mit denen etwa OpenAI und Anthropic ihre Modelle zusätzlich messen.
Für lokale Unternehmen und Handwerksbetriebe ist BFCL vor allem eine Entscheidungshilfe bei der Auswahl von KI-Werkzeugen, die selbstständig Aufgaben erledigen sollen. Sobald ein Chatbot Termine in den Kalender einträgt, eine Automatisierung Aufträge in die Warenwirtschaft schreibt oder ein KI-Agent E-Mails im Kundensystem ablegt, arbeitet im Hintergrund Function Calling. Der BFCL-Wert des eingesetzten Modells zeigt, wie zuverlässig es dabei die richtige Funktion wählt und die Felder korrekt ausfüllt.
Die Kategorie Irrelevance Detection misst, ob ein Modell den Aufruf verweigert, wenn keine passende Funktion existiert, statt auf Verdacht irgendetwas auszuführen. Für einen Betrieb bedeutet ein gutes Ergebnis in dieser Kategorie weniger falsche Kalendereinträge und weniger fehlerhafte Buchungen.
Verspricht eine Agentur einen „KI-Agenten, der alles automatisch erledigt", lohnt der Blick in die Rangliste, welches Modell dahintersteckt und wie es bei den mehrstufigen und agentischen Aufgaben abschneidet, denn diese Kategorien sagen über echte Dialog-Abläufe mehr aus als die einfachen. Die Spalten für Kosten und Antwortzeit helfen beim Preis-Leistungs-Vergleich, ein günstigeres Modell mit ausreichender Genauigkeit reicht für viele Automatisierungen aus.