Pith. sign in

Beyond accuracy: A multi-dimensional framework for evaluating enterprise agentic AI systems

4 Pith papers cite this work. Polarity classification is still indexing.

4 Pith papers citing it

citation-role summary

background 3

citation-polarity summary

fields

cs.AI 3 cs.SD 1

years

2026 4

verdicts

UNVERDICTED 4

roles

background 3

polarities

background 3

representative citing papers

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

cs.SD · 2026-05-13 · unverdicted · novelty 7.0 · 2 refs

EVA-Bench supplies a simulation engine for bot-to-bot voice dialogues plus two composite metrics (EVA-A for accuracy, EVA-X for experience) evaluated on 213 enterprise scenarios, showing no tested system exceeds 0.5 on both pass@1 scores.

citing papers explorer

Showing 4 of 4 citing papers.