Der rasante Anstieg von intelligenten Agenten, die auf großen Sprachmodellen (LLMs) basieren, verdeutlicht die Notwendigkeit robuster, skalierbarer Evaluierungsrahmen. Bestehende Methoden basieren auf statischen Benchmarks und arbeitsintensiver Datensammlung, was die praktische Bewertung einschränkt. Wir stellen MCPEval vor, ein Open-Source-Rahmenwerk, das auf dem Model Context Protocol (MCP) basiert und die End-to-End-Aufgabengenerierung sowie die tiefgehende Bewertung von LLM-Agenten in verschiedenen Domänen automatisiert. MCPEval standardisiert Metriken, integriert sich nahtlos mit nativen Agentenwerkzeugen und beseitigt den manuellen Aufwand beim Aufbau von Evaluierungs-Pipelines. Empirische Ergebnisse aus fünf realen Domänen zeigen die Effektivität bei der Offenlegung nuancierter, domänenspezifischer Leistungen. Wir veröffentlichen MCPEval öffentlich [https://github.com/SalesforceAIResearch/MCPEval], um reproduzierbare und standardisierte LLM-Agentenbewertungen zu fördern.
Liu et al. (Do,) untersuchten diese Frage.
Synapse has enriched 5 closely related papers on similar clinical questions. Consider them for comparative context: