{"as_of":"2026-08-23T22:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f20edf606857475d9885f326c91dcd3f87d24acde8b7543e50245bcbdb755a7f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:29:58.982687Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-11T12:18:19.356017Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14468","last_updated":"2025-06-03T21:55:57Z","snapshot_observed_at":"2026-08-18T19:46:48.536700Z","submitted_at":"2024-12-19T02:34:15Z","title":"HashAttention: Semantic Sparsity for Faster Inference","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:18:19.356017Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2412.14468"},"observation_digest":"sha256:791c46dc36b0ed50fefa14e5b7b4bd4e261174aa5c5da1e9ae284ddb18c46575","observation_id":"7f3d1380-8b99-4205-9ece-ebaec2a3b2ba","resolution":{"observed_at":"2026-08-11T12:18:19.356017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-11T11:18:39.644586Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-12T05:23:04.133755Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T11:18:39.644586Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2412.15649"},"observation_digest":"sha256:f49a075f7cc72513bb100d794673f7a6e582875c682b8c8d29615f476a5d199d","observation_id":"fcb239eb-9466-422a-aa2d-3a257d5f1400","resolution":{"observed_at":"2026-08-11T11:18:39.644586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-10T22:18:19.184279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02266","last_updated":"2025-01-04T12:04:46Z","snapshot_observed_at":"2026-08-19T09:52:41.893972Z","submitted_at":"2025-01-04T12:04:46Z","title":"LLMzSz{\\L}: a comprehensive LLM benchmark for Polish","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:19.184279Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2501.02266"},"observation_digest":"sha256:cd03eadc8efe2511040e1e91bdcac48a9ad55d9f27d4fe8b260428bd58d02ad0","observation_id":"4cc13d9a-a97f-4c64-b41a-cbefc34d5fc8","resolution":{"observed_at":"2026-08-10T22:18:19.184279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-10T00:33:43.876475Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18154","last_updated":"2025-01-30T05:39:01Z","snapshot_observed_at":"2026-08-16T17:19:44.390960Z","submitted_at":"2025-01-30T05:39:01Z","title":"Mixed-Precision Graph Neural Quantization for Low Bit Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T00:33:43.876475Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2501.18154"},"observation_digest":"sha256:fb541e577286e70dddd31a6adb96198519a67a58fcb2091b03f315ec09a0022e","observation_id":"6cf20da9-676f-4ec2-9ca0-b13072a7d0c8","resolution":{"observed_at":"2026-08-10T00:33:43.876475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-09T14:47:15.023992Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05209","last_updated":"2025-07-24T21:34:54Z","snapshot_observed_at":"2026-08-17T23:06:23.320593Z","submitted_at":"2025-02-03T18:59:16Z","title":"Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:15.023992Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2502.05209"},"observation_digest":"sha256:298af4ed6377d2fa416948edd4236b97ee16094c7801a2345872d7eea065f5b4","observation_id":"633bc806-8686-4c0c-bb0e-16e5805b4fdd","resolution":{"observed_at":"2026-08-09T14:47:15.023992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-16T10:29:58.982687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18053","last_updated":"2025-06-05T16:13:05Z","snapshot_observed_at":"2026-08-18T00:01:48.383371Z","submitted_at":"2025-04-25T03:54:24Z","title":"DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T10:29:58.982687Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2504.18053"},"observation_digest":"sha256:00f37adc1be20de4d9b07db51c6c1ee95a07c6d0c3b7ef194014eaa6678d9e11","observation_id":"d2265866-541a-48bd-85de-94793a13743a","resolution":{"observed_at":"2026-08-16T10:29:58.982687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-07T12:30:14.985484Z","title":"Mt-bench-101: A fine- grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-18T09:57:42.767716Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:14.985484Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:94df3818ef5fa956391b2368e8e07d24af8af7dc0d8824b1846211b85918abde","observation_id":"211c39db-1a9e-44e8-952e-e3a33be7cf9e","resolution":{"observed_at":"2026-08-07T12:30:14.985484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-07T11:32:30.761569Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues.arXiv preprint arXiv:2402.14762, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-19T07:02:37.182654Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:30.761569Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:944997a737d4a2a33afb4e404018b1321a27ec4c8451326f044587c4affc7883","observation_id":"d316c10c-5751-4cb2-a82f-c5351ec05453","resolution":{"observed_at":"2026-08-07T11:32:30.761569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-07T10:17:44.214973Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-17T19:45:22.860227Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.214973Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:a81bbf64da7364964e8f6a085bc6314d810dc1b779d753f05cdb01d1aa840e02","observation_id":"8b1f57c4-2a95-4836-94c0-2e0694b4156f","resolution":{"observed_at":"2026-08-07T10:17:44.214973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-06T18:12:25.776024Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-19T09:05:37.302162Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.776024Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:5c0bce30f0ec9dd7207de3eaff66cdca99fe89a13fe7ec5ffe71a0bfdf157636","observation_id":"27e4bece-34d3-4655-b59c-ecbd55ba1e41","resolution":{"observed_at":"2026-08-06T18:12:25.776024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2507.21433","last_updated":"2026-05-14T02:27:46Z","snapshot_observed_at":"2026-08-17T11:18:04.705860Z","submitted_at":"2025-07-29T02:05:51Z","title":"ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-19T03:14:05.109011Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2507.21433"},"observation_digest":"sha256:151f6813e1dc3f0dd76d6d72e6550912e5ebf25fcedec6ade2e013e65b987b65","observation_id":"cf649334-406c-4c7d-98bb-7ca48335d4ce","resolution":{"observed_at":"2026-05-19T03:17:00.807472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-06T12:44:49.134508Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21520","last_updated":"2025-07-29T06:07:59Z","snapshot_observed_at":"2026-08-17T05:59:56.170851Z","submitted_at":"2025-07-29T06:07:59Z","title":"Solution for Meta KDD Cup'25: A Comprehensive Three-Step Framework for Vision Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:49.134508Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2507.21520"},"observation_digest":"sha256:f44f834c83095e8ee592b60451b4e337ee082520eb006402960070cf12f75928","observation_id":"6a187fa1-5fae-4d64-be44-61702cb8e1ae","resolution":{"observed_at":"2026-08-06T12:44:49.134508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-06T11:44:04.847321Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.847321Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:5b0bd261088210a25538f8a16a125026d1e63ec35c0e8c1019e9d7d219166cb6","observation_id":"d4ecc412-daae-4138-8cbb-188cac617ada","resolution":{"observed_at":"2026-08-06T11:44:04.847321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T16:13:08.255287Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18884","last_updated":"2025-08-26T09:59:44Z","snapshot_observed_at":"2026-08-16T12:52:44.628963Z","submitted_at":"2025-08-26T09:59:44Z","title":"HAEPO: History-Aggregated Exploratory Policy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T16:13:08.255287Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2508.18884"},"observation_digest":"sha256:a4fa4a7572b152ee817be04f8a6d4ec9b511122fff9fc778658661a6c6b337a1","observation_id":"7421eaa2-cb8c-4dfa-aca7-fffe265779ab","resolution":{"observed_at":"2026-08-05T16:13:08.255287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T15:25:35.308051Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19922","last_updated":"2025-08-27T14:30:08Z","snapshot_observed_at":"2026-08-21T11:37:58.613432Z","submitted_at":"2025-08-27T14:30:08Z","title":"HEAL: A Hypothesis-Based Preference-Aware Analysis Framework","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:35.308051Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2508.19922"},"observation_digest":"sha256:afd0500ff4c9c1d60b3377f0c2976ddf8e793f67d4a42a5386cc122cc2333808","observation_id":"a18df4d1-2a4a-4f59-89be-946cb227ce9a","resolution":{"observed_at":"2026-08-05T15:25:35.308051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T10:31:02.085778Z","title":"Bai et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04013","last_updated":"2025-09-04T08:43:27Z","snapshot_observed_at":"2026-08-14T16:00:37.515648Z","submitted_at":"2025-09-04T08:43:27Z","title":"On Robustness and Reliability of Benchmark-Based Evaluation of LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:31:02.085778Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2509.04013"},"observation_digest":"sha256:363519395a316bd501da2603d51ab03e34ae85aea002ce23fe6e0384cd75ebd7","observation_id":"032f5bc1-5851-425b-9f95-bae93273db73","resolution":{"observed_at":"2026-08-05T10:31:02.085778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2509.07177","last_updated":"2026-04-14T15:07:25Z","snapshot_observed_at":"2026-08-14T19:42:29.494099Z","submitted_at":"2025-09-08T19:48:52Z","title":"Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T17:39:17.456350Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2509.07177"},"observation_digest":"sha256:9d72f586a2abeeea8145443cf004d6d18e0a2fb6b4430669bb398f4fa847cb95","observation_id":"a9cc51ba-faca-438d-a7b4-6110a6626d3c","resolution":{"observed_at":"2026-05-18T17:42:46.104690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2509.17677","last_updated":"2026-05-02T16:35:12Z","snapshot_observed_at":"2026-08-11T17:50:43.839138Z","submitted_at":"2025-09-22T12:20:27Z","title":"EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T15:08:03.793304Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2509.17677"},"observation_digest":"sha256:c75a01dbdad55d53ffc15f4081272a587edf7e270908634b49bd5bacc468f96d","observation_id":"a00122ef-879c-4f4d-a762-b4d05b30c41f","resolution":{"observed_at":"2026-05-18T15:11:32.578215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-04T10:13:41.755937Z","title":"Jonathan Berant, Andrew Chou, Roy Frostig, and Percy Liang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11098","last_updated":"2026-07-06T08:06:32Z","snapshot_observed_at":"2026-08-13T08:09:34.499663Z","submitted_at":"2025-10-13T07:45:52Z","title":"VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:13:41.755937Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2510.11098"},"observation_digest":"sha256:9e7b5cf0ce984d434111f85af7416c5abab17006bf815487cae1f3ac36e94b91","observation_id":"0c440476-c355-4a33-bea2-dd03f799a293","resolution":{"observed_at":"2026-08-04T10:13:41.755937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2512.04695","last_updated":"2026-04-27T04:31:24Z","snapshot_observed_at":"2026-08-13T03:30:11.513394Z","submitted_at":"2025-12-04T11:45:21Z","title":"TRINITY: An Evolved LLM Coordinator","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T01:19:10.420266Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2512.04695"},"observation_digest":"sha256:c5bb198810f723fd51fae3796b3718ec87737600dd83a421dbbdc276b116e8a7","observation_id":"bf87898b-6604-476f-a8f0-09be40510a6f","resolution":{"observed_at":"2026-05-17T01:21:24.841815Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2604.04060","last_updated":"2026-04-05T11:06:13Z","snapshot_observed_at":"2026-08-18T00:04:26.598904Z","submitted_at":"2026-04-05T11:06:13Z","title":"CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T17:06:46.917177Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2604.04060"},"observation_digest":"sha256:56052a0f7b02b6ba11f44294b92af59bd4ee5844030c9fcb380296bdde1d0f64","observation_id":"f85cb0a4-4ef9-4018-965d-66d156def34d","resolution":{"observed_at":"2026-05-13T17:08:00.753294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2604.09557","last_updated":"2026-05-28T14:40:40Z","snapshot_observed_at":"2026-08-17T15:59:20.209304Z","submitted_at":"2026-02-10T16:19:56Z","title":"SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-16T03:13:37.202362Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2604.09557"},"observation_digest":"sha256:44d3c156b30ce72215185b4601572826fe799ba86263045347ccbb8a0fd28dc1","observation_id":"6b273d60-9fc3-4e0b-aa37-21701045d294","resolution":{"observed_at":"2026-05-16T03:17:12.559891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-03T02:40:53.080312Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.09557","last_updated":"2026-05-28T14:40:40Z","snapshot_observed_at":"2026-08-17T15:59:20.209304Z","submitted_at":"2026-02-10T16:19:56Z","title":"SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T02:40:53.080312Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2604.09557"},"observation_digest":"sha256:3568130a9ad609f62e6258691a40027cc0c1768f589ffa92ed9695182f7804be","observation_id":"171e8e7a-e63f-423c-9429-0d528fa917c1","resolution":{"observed_at":"2026-08-03T02:40:53.080312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2604.16403","last_updated":"2026-03-31T12:18:56Z","snapshot_observed_at":"2026-08-13T03:56:07.949173Z","submitted_at":"2026-03-31T12:18:56Z","title":"Computational Hermeneutics: Evaluating generative AI as a cultural technology","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T23:48:24.354896Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2604.16403"},"observation_digest":"sha256:5aa21ea8a5448c7f67451879033859ea98eeb9ec5d49945d0a7f8e4214ebd23c","observation_id":"013ebd6f-8cd6-44b8-90bc-3107c13cf362","resolution":{"observed_at":"2026-05-13T23:48:27.139546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2605.02083","last_updated":"2026-05-05T02:56:57Z","snapshot_observed_at":"2026-08-15T12:33:20.722905Z","submitted_at":"2026-05-03T22:46:47Z","title":"EditPropBench: Measuring Factual Edit Propagation in Scientific Manuscripts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T19:07:57.029024Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2605.02083"},"observation_digest":"sha256:b998b9ed5d4c48fc2c82d2178161ef359ed0039985f632baa8c30c3473322464","observation_id":"708f1963-d2b9-4cbe-9017-bac3f7bef479","resolution":{"observed_at":"2026-05-09T06:00:37.442146Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-08-16T14:50:01.201102Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-08T17:01:04.571087Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:1dc48a800ca550a8b3c4fe01b2a54d89a69c752be55856007cd1970733350ee3","observation_id":"e64eb975-69de-4818-999b-0c7de8e4c887","resolution":{"observed_at":"2026-05-11T17:51:09.205723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2605.04477","last_updated":"2026-06-20T08:22:31Z","snapshot_observed_at":"2026-08-16T14:50:01.201102Z","submitted_at":"2026-05-06T03:56:45Z","title":"Data-dependent Exploration for Online Reinforcement Learning from Human Feedback","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-01T00:27:39.321158Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2605.04477"},"observation_digest":"sha256:c9958db9d6146251fc5f8b3513adfac233b592e21e7c5a0f8926dbb4e38f1e23","observation_id":"66ea7f5d-b4a0-4328-a510-91626b9c075a","resolution":{"observed_at":"2026-07-01T00:35:10.421147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2605.11317","last_updated":"2026-05-11T23:07:33Z","snapshot_observed_at":"2026-08-14T04:29:49.634822Z","submitted_at":"2026-05-11T23:07:33Z","title":"SOMA: Efficient Multi-turn LLM Serving via Small Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:37:27.361504Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2605.11317"},"observation_digest":"sha256:950f82fbf906d1dc87a507e6f5b2773518ff6faf3b660f136a3e96aeaae7abac","observation_id":"f3a3d97e-f4e4-4b7a-a513-f30e3dad32b5","resolution":{"observed_at":"2026-05-13T01:42:04.166443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2605.19099","last_updated":"2026-05-18T20:37:14Z","snapshot_observed_at":"2026-08-15T09:55:37.227048Z","submitted_at":"2026-05-18T20:37:14Z","title":"DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T10:16:38.920528Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2605.19099"},"observation_digest":"sha256:ff269097bd2877b258c396c5dd39f033778c985a1b4b6065207caf18860578a9","observation_id":"d694354c-ed2d-4217-88ab-b54dc64fc165","resolution":{"observed_at":"2026-05-20T10:18:11.670047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":"2402.14762","doi":"10.48550/arxiv.2402.14762","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MT-Bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":"arXiv (Cornell University)","work_id":"759d28e6-9f1c-4043-a34b-2ddfd671d288","year":2024},"citing_paper":{"arxiv_id":"2606.09850","last_updated":"2026-05-09T06:36:06Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-05-09T06:36:06Z","title":"Mechanistic Analysis of Alignment Algorithms in Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T23:06:38.297947Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2606.09850"},"observation_digest":"sha256:fbbe62623e7a0b201cfa8fa8f82e1d2c31071a060c8796ec30d6e95e2d597ff7","observation_id":"fa98b5b0-fe77-41bf-9f14-4807a9748093","resolution":{"observed_at":"2026-07-01T13:35:46.306031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-07-14T11:49:31.595873Z","title":"arXiv preprint arXiv:2402.14762 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10428","last_updated":"2026-07-24T14:32:58Z","snapshot_observed_at":"2026-08-15T21:39:52.906936Z","submitted_at":"2026-07-11T18:22:49Z","title":"Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T11:49:31.595873Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2607.10428"},"observation_digest":"sha256:d2c4bef6be3c16e179e135ee62158a031afab9e6c6eaa376eac0e585378bdc85","observation_id":"5d50b31a-19cb-464a-a26f-f169d91263c7","resolution":{"observed_at":"2026-07-14T11:49:31.595873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-02T07:20:31.426325Z","title":"arXiv preprint arXiv:2402.14762 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10428","last_updated":"2026-07-24T14:32:58Z","snapshot_observed_at":"2026-08-15T21:39:52.906936Z","submitted_at":"2026-07-11T18:22:49Z","title":"Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:31.426325Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2607.10428"},"observation_digest":"sha256:6755945dacca410b8ae753e591e4d27d6e47175e56982ab9d05066954f8c8cb1","observation_id":"857cc624-b313-4e75-831d-b45d1c04ed67","resolution":{"observed_at":"2026-08-02T07:20:31.426325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14762","snapshot_observed_at":"2026-08-04T01:16:15.396819Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00134","last_updated":"2026-07-31T14:04:49Z","snapshot_observed_at":"2026-08-14T22:54:09.591958Z","submitted_at":"2026-07-31T14:04:49Z","title":"Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:15.396819Z"},"links":{"cited_paper":"/paper/2402.14762","citing_paper":"/paper/2608.00134"},"observation_digest":"sha256:804f1fbccbc851bb9d4c1c067866f17be7460cdfc2ed8d757a850bbf0d668209","observation_id":"0a22fc85-a5fe-456f-b43a-4d89dc2add11","resolution":{"observed_at":"2026-08-04T01:16:15.396819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.14762/citation-record","integrity":"/paper/2402.14762/integrity","json":"/paper/2402.14762/citation-record.json","paper":"/paper/2402.14762"},"outbound":[],"paper":{"arxiv_id":"2402.14762","last_updated":"2024-11-05T16:40:21Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T14:16:09.123077Z","submitted_at":"2024-02-22T18:21:59Z","title":"MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2402.14762."}