Ich habe in öffentlichen Benchmark-Traces doppelte Ausführungen von Agents gemessen. Gezählt wurden Fälle, in denen dasselbe Tool mit denselben Parametern zweimal aufgerufen wurde und auch das Ergebnis identisch war.
In 6.780 Traces kamen 8.042 Fälle heraus; wenn man knapp die Hälfte wie wiederholte Erklärungen des Aufgabenabschlusses herausrechnet, blieben 4.249 Fälle übrig. Unter den 3.432 doppelten Aufrufen von Tools, die den Zustand verändern, habe ich die in der Antwort enthaltenen Entity-IDs verglichen; in 159 Fällen ließ sich bestätigen, dass tatsächlich zwei Objekte erzeugt wurden. Zum Beispiel wurden zwei Dokumente mit demselben Titel oder vier identische Spreadsheets erstellt.
Hier gibt es eine klare Einschränkung. Diese Zahlen stammen vollständig aus Benchmark-Traces. Es sind Aufzeichnungen dazu, wie 22 Modelle Aufgaben lösen, nicht aus real betriebenen Services. Ich habe acht öffentliche Datensätze durchsucht, und dies war der einzige, in dem sich dieses Phänomen beobachten ließ. Die meisten Benchmarks sind für die Bewertung der Genauigkeit entworfen, sodass Duplikate strukturell als falsche Antwort gelten.
Deshalb möchte ich die Leute fragen, die so etwas tatsächlich im Betrieb einsetzen.
- Wie viele MCP-Tools (oder Server) haben Sie angebunden?
In den zwei Datensätzen, die wir gesehen haben, unterschied sich die Duplikatrate um den Faktor 3 (0.80% vs 2.41%). Auch die Zahl der Tools war mit rund 20 gegenüber 523 stark unterschiedlich, aber da sich zugleich Aufgabencharakter und Modellkonfiguration unterschieden, konnten wir nicht isolieren, ob die Tool-Anzahl die Ursache ist.
Wenn man innerhalb des Benchmarks tatsächlich nach der Zahl der an eine Aufgabe angebundenen Server aufteilt, war die Rate bei 4 bis 5 am höchsten (etwa 2.5%) und darüber sogar wieder niedriger, also ein nichtmonotones Muster. Einen einfachen Zusammenhang wie „mehr Tools führen zu mehr Duplikaten“ haben wir nicht gesehen. Mich würde interessieren, wie das im realen Betrieb aussieht.
- Haben Sie schon doppelte Ausführungen erlebt? Wie haben Sie sie entdeckt?
In den Fällen, die wir gesehen haben, gab es meist keinen Fehler. Beide Aufrufe endeten mit 200, und auch die Logs waren sauber, sodass man es nachträglich nur anhand der Logs nicht erkennen konnte. Vermutlich erfährt man in der Praxis oft erst durch Kunden davon; wie ist das bei Ihnen?
- Geben die von Ihnen verwendeten Tools in der Antwort Entity-IDs zurück?
Das war der Punkt, der „wurde zweimal aufgerufen“ von „es wurden zwei Objekte erzeugt“ getrennt hat. APIs zum Erstellen von Dokumenten liefern meistens eine ID zurück, beim Versenden von E-Mails kommt dagegen oft nur eine „Erfolg“-Zeichenkette zurück. Von den 3.197 nicht beurteilbaren Fällen entfielen 2.011 auf genau diesen Fall, und es gab 24 Tool-Typen, die in der Antwort nie eine ID zurückgaben.
Ich suche keine endgültige Antwort, sondern möchte ein Gefühl dafür bekommen, wie stark sich Benchmarks und realer Betrieb unterscheiden. Auch reine Erfahrungsberichte wären eine große Hilfe.
Noch keine Kommentare.