Pith. sign in

Paper Citation Record · LEDGER

MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2402.14762.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2402.14762 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 33 of 33 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 33 of 33 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T10:29:58.982687Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

2
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 7f3d1380-8b99-4205-9ece-ebaec2a3b2ba · inbound

HashAttention: Semantic Sparsity for Faster Inference cites this paper.

HashAttention: Semantic Sparsity for Faster Inference MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T12:18:19.356017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T12:18:19.356017Z digest=sha256:791c46dc36b0ed50fefa14e5b7b4bd4e261174aa5c5da1e9ae284ddb18c46575

Observation fcb239eb-9466-422a-aa2d-3a257d5f1400 · inbound

SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training cites this paper.

SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T11:18:39.644586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T11:18:39.644586Z digest=sha256:f49a075f7cc72513bb100d794673f7a6e582875c682b8c8d29615f476a5d199d

Observation 4cc13d9a-a97f-4c64-b41a-cbefc34d5fc8 · inbound

LLMzSz{\L}: a comprehensive LLM benchmark for Polish cites this paper.

LLMzSz{\L}: a comprehensive LLM benchmark for Polish MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T22:18:19.184279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T22:18:19.184279Z digest=sha256:cd03eadc8efe2511040e1e91bdcac48a9ad55d9f27d4fe8b260428bd58d02ad0

Observation 6cf20da9-676f-4ec2-9ca0-b13072a7d0c8 · inbound

Mixed-Precision Graph Neural Quantization for Low Bit Large Language Models cites this paper.

Mixed-Precision Graph Neural Quantization for Low Bit Large Language Models MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T00:33:43.876475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T00:33:43.876475Z digest=sha256:fb541e577286e70dddd31a6adb96198519a67a58fcb2091b03f315ec09a0022e

Observation 633bc806-8686-4c0c-bb0e-16e5805b4fdd · inbound

Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities cites this paper.

Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T14:47:15.023992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T14:47:15.023992Z digest=sha256:298af4ed6377d2fa416948edd4236b97ee16094c7801a2345872d7eea065f5b4

Observation d2265866-541a-48bd-85de-94793a13743a · inbound

DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models cites this paper.

DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-16T10:29:58.982687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-16T10:29:58.982687Z digest=sha256:00f37adc1be20de4d9b07db51c6c1ee95a07c6d0c3b7ef194014eaa6678d9e11

Observation 211c39db-1a9e-44e8-952e-e3a33be7cf9e · inbound

Learning Safety Constraints for Large Language Models cites this paper.

Learning Safety Constraints for Large Language Models MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T12:30:14.985484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:30:14.985484Z digest=sha256:94df3818ef5fa956391b2368e8e07d24af8af7dc0d8824b1846211b85918abde

Observation d316c10c-5751-4cb2-a82f-c5351ec05453 · inbound

Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective cites this paper.

Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T11:32:30.761569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:32:30.761569Z digest=sha256:944997a737d4a2a33afb4e404018b1321a27ec4c8451326f044587c4affc7883

Observation 8b1f57c4-2a95-4836-94c0-2e0694b4156f · inbound

A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations cites this paper.

A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T10:17:44.214973Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:17:44.214973Z digest=sha256:a81bbf64da7364964e8f6a085bc6314d810dc1b779d753f05cdb01d1aa840e02

Observation 27e4bece-34d3-4655-b59c-ecbd55ba1e41 · inbound

CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards cites this paper.

CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T18:12:25.776024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:12:25.776024Z digest=sha256:5c0bce30f0ec9dd7207de3eaff66cdca99fe89a13fe7ec5ffe71a0bfdf157636

Observation cf649334-406c-4c7d-98bb-7ca48335d4ce · inbound

ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing cites this paper.

ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-19T03:17:00.807472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-05-19T03:14:05.109011Z digest=sha256:151f6813e1dc3f0dd76d6d72e6550912e5ebf25fcedec6ade2e013e65b987b65

Observation 6a187fa1-5fae-4d64-be44-61702cb8e1ae · inbound

Solution for Meta KDD Cup'25: A Comprehensive Three-Step Framework for Vision Question Answering cites this paper.

Solution for Meta KDD Cup'25: A Comprehensive Three-Step Framework for Vision Question Answering MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T12:44:49.134508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T12:44:49.134508Z digest=sha256:f44f834c83095e8ee592b60451b4e337ee082520eb006402960070cf12f75928

Observation d4ecc412-daae-4138-8cbb-188cac617ada · inbound

Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance cites this paper.

Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T11:44:04.847321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T11:44:04.847321Z digest=sha256:5b0bd261088210a25538f8a16a125026d1e63ec35c0e8c1019e9d7d219166cb6

Observation 7421eaa2-cb8c-4dfa-aca7-fffe265779ab · inbound

HAEPO: History-Aggregated Exploratory Policy Optimization cites this paper.

HAEPO: History-Aggregated Exploratory Policy Optimization MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T16:13:08.255287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T16:13:08.255287Z digest=sha256:a4fa4a7572b152ee817be04f8a6d4ec9b511122fff9fc778658661a6c6b337a1

Observation a18df4d1-2a4a-4f59-89be-946cb227ce9a · inbound

HEAL: A Hypothesis-Based Preference-Aware Analysis Framework cites this paper.

HEAL: A Hypothesis-Based Preference-Aware Analysis Framework MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T15:25:35.308051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T15:25:35.308051Z digest=sha256:afd0500ff4c9c1d60b3377f0c2976ddf8e793f67d4a42a5386cc122cc2333808

Observation 032f5bc1-5851-425b-9f95-bae93273db73 · inbound

On Robustness and Reliability of Benchmark-Based Evaluation of LLMs cites this paper.

On Robustness and Reliability of Benchmark-Based Evaluation of LLMs MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T10:31:02.085778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T10:31:02.085778Z digest=sha256:363519395a316bd501da2603d51ab03e34ae85aea002ce23fe6e0384cd75ebd7

Observation a9cc51ba-faca-438d-a7b4-6110a6626d3c · inbound

Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector cites this paper.

Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 62

Resolution
verified exact
arxiv_id, observed 2026-05-18T17:42:46.104690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-18T17:39:17.456350Z digest=sha256:9d72f586a2abeeea8145443cf004d6d18e0a2fb6b4430669bb398f4fa847cb95

Observation a00122ef-879c-4f4d-a762-b4d05b30c41f · inbound

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving cites this paper.

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:11:32.578215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-18T15:08:03.793304Z digest=sha256:c75a01dbdad55d53ffc15f4081272a587edf7e270908634b49bd5bacc468f96d

Observation 0c440476-c355-4a33-bea2-dd03f799a293 · inbound

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents cites this paper.

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T10:13:41.755937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T10:13:41.755937Z digest=sha256:9e7b5cf0ce984d434111f85af7416c5abab17006bf815487cae1f3ac36e94b91

Observation bf87898b-6604-476f-a8f0-09be40510a6f · inbound

TRINITY: An Evolved LLM Coordinator cites this paper.

TRINITY: An Evolved LLM Coordinator MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T01:21:24.841815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-17T01:19:10.420266Z digest=sha256:c5bb198810f723fd51fae3796b3718ec87737600dd83a421dbbdc276b116e8a7

Observation f85cb0a4-4ef9-4018-965d-66d156def34d · inbound

CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks cites this paper.

CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-13T17:08:00.753294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-13T17:06:46.917177Z digest=sha256:56052a0f7b02b6ba11f44294b92af59bd4ee5844030c9fcb380296bdde1d0f64

Observation 6b273d60-9fc3-4e0b-aa37-21701045d294 · inbound

SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding cites this paper.

SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-16T03:17:12.559891Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-05-16T03:13:37.202362Z digest=sha256:44d3c156b30ce72215185b4601572826fe799ba86263045347ccbb8a0fd28dc1

Observation 171e8e7a-e63f-423c-9429-0d528fa917c1 · inbound

SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding cites this paper.

SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-03T02:40:53.080312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T02:40:53.080312Z digest=sha256:3568130a9ad609f62e6258691a40027cc0c1768f589ffa92ed9695182f7804be

Observation 013ebd6f-8cd6-44b8-90bc-3107c13cf362 · inbound

Computational Hermeneutics: Evaluating generative AI as a cultural technology cites this paper.

Computational Hermeneutics: Evaluating generative AI as a cultural technology MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-13T23:48:27.139546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-13T23:48:24.354896Z digest=sha256:5aa21ea8a5448c7f67451879033859ea98eeb9ec5d49945d0a7f8e4214ebd23c

Observation 708f1963-d2b9-4cbe-9017-bac3f7bef479 · inbound

EditPropBench: Measuring Factual Edit Propagation in Scientific Manuscripts cites this paper.

EditPropBench: Measuring Factual Edit Propagation in Scientific Manuscripts MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-09T06:00:37.442146Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-08T19:07:57.029024Z digest=sha256:b998b9ed5d4c48fc2c82d2178161ef359ed0039985f632baa8c30c3473322464

Observation e64eb975-69de-4818-999b-0c7de8e4c887 · inbound

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback cites this paper.

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 60

Resolution
verified exact
arxiv_id, observed 2026-05-11T17:51:09.205723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-05-08T17:01:04.571087Z digest=sha256:1dc48a800ca550a8b3c4fe01b2a54d89a69c752be55856007cd1970733350ee3

Observation 66ea7f5d-b4a0-4328-a510-91626b9c075a · inbound

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback cites this paper.

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-07-01T00:35:10.421147Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-07-01T00:27:39.321158Z digest=sha256:c9958db9d6146251fc5f8b3513adfac233b592e21e7c5a0f8926dbb4e38f1e23

Observation f3a3d97e-f4e4-4b7a-a513-f30e3dad32b5 · inbound

SOMA: Efficient Multi-turn LLM Serving via Small Language Model cites this paper.

SOMA: Efficient Multi-turn LLM Serving via Small Language Model MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:42:04.166443Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-13T01:37:27.361504Z digest=sha256:950f82fbf906d1dc87a507e6f5b2773518ff6faf3b660f136a3e96aeaae7abac

Observation d694354c-ed2d-4217-88ab-b54dc64fc165 · inbound

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows cites this paper.

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-05-20T10:18:11.670047Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-20T10:16:38.920528Z digest=sha256:ff269097bd2877b258c396c5dd39f033778c985a1b4b6065207caf18860578a9

Observation fa98b5b0-fe77-41bf-9f14-4807a9748093 · inbound

Mechanistic Analysis of Alignment Algorithms in Language Models cites this paper.

Mechanistic Analysis of Alignment Algorithms in Language Models MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-01T13:35:46.306031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-30T23:06:38.297947Z digest=sha256:fbbe62623e7a0b201cfa8fa8f82e1d2c31071a060c8796ec30d6e95e2d597ff7

Observation 5d50b31a-19cb-464a-a26f-f169d91263c7 · inbound

Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging cites this paper.

Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-14T11:49:31.595873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-14T11:49:31.595873Z digest=sha256:d2c4bef6be3c16e179e135ee62158a031afab9e6c6eaa376eac0e585378bdc85

Observation 857cc624-b313-4e75-831d-b45d1c04ed67 · inbound

Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging cites this paper.

Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T07:20:31.426325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T07:20:31.426325Z digest=sha256:6755945dacca410b8ae753e591e4d27d6e47175e56982ab9d05066954f8c8cb1

Observation 0a22fc85-a5fe-456f-b43a-4d89dc2add11 · inbound

Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks cites this paper.

Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-04T01:16:15.396819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T01:16:15.396819Z digest=sha256:804f1fbccbc851bb9d4c1c067866f17be7460cdfc2ed8d757a850bbf0d668209