{"as_of":"2026-08-09T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d90093f30fc6ffbe13ddc5f59eddc8023903cf79fdaf69a7e1bb729b950a126","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:20:15.085691Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06329/citation-record","integrity":"/paper/2608.06329/integrity","json":"/paper/2608.06329/citation-record.json","paper":"/paper/2608.06329"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:13.564295Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:13.564295Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:1d8f4530997c6394b11ba377e2590e2d30482609f712c72ed1f7388e52fa14fe","observation_id":"6e8c73ef-a157-47f0-be59-8223d60498e9","resolution":{"observed_at":"2026-08-07T05:20:13.564295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.821241Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"0c9dbc30-de3a-445e-acc0-2498ba0fb5ba","year":2024},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:13.617659Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:974abe44b83b3f4b56b798462d12124abaa006e0d720decf2f057c9fdcd4146d","observation_id":"4321654b-8ad3-42f8-95c0-f28b5362a22f","resolution":{"observed_at":"2026-08-07T05:20:15.827288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.804470Z","title":"Biometrika , volume =","venue":null,"work_id":"5dfb8d2b-e3e9-48d1-b12e-10dbee39aa03","year":1945},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:13.694182Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:fcf68b68aeb1c6d81b4692e05dcbd9b6cc9a06eaa112cd8ca91fefda56a923f8","observation_id":"8040c8a6-c499-417a-8c05-6840c8e3878e","resolution":{"observed_at":"2026-08-07T05:20:15.809376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:13.736829Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:13.736829Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:980d209b650272c2f09d98f0f173ce0639105b4d0bc51d9d759ba6efa80891cd","observation_id":"33a569df-e775-487f-bb0a-c97a2bdc4d03","resolution":{"observed_at":"2026-08-07T05:20:13.736829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.772757Z","title":"2025 , eprint=","venue":null,"work_id":"9f9d2d7c-380c-42ae-a733-f15b8160cee1","year":2025},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:13.819650Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:8d3ac94a0b408dce9844ee5dc5d55bb908f2dfa8b73207f6fe19438ebd7bf11f","observation_id":"e04b2ca1-7090-40a4-a415-791ff2786571","resolution":{"observed_at":"2026-08-07T05:20:15.777958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.745302Z","title":null,"venue":null,"work_id":"b2b9efa4-92ba-411c-88db-61e1a17b5d62","year":null},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:13.897906Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:a70a0a4c45e3b3a7151fdfb95d2042ea3692cab01308c846b59d18dc3e5fb4da","observation_id":"cb609a9d-396d-4b08-853a-658f33a21848","resolution":{"observed_at":"2026-08-07T05:20:15.753484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.721758Z","title":"2024 , eprint=","venue":null,"work_id":"82c37c8a-3330-49f9-90b6-2981f56666b1","year":2024},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:13.967434Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:51ae0f80c663357b0435749abc851f43fe6b560e9aa4eb85161245900225cfc0","observation_id":"f0579000-f432-48ad-905b-a26e96170a52","resolution":{"observed_at":"2026-08-07T05:20:15.729328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:14.026399Z","title":"M ulti WOZ - A Large-Scale Multi-Domain W izard-of- O z Dataset for Task-Oriented Dialogue Modelling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.026399Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:aa28c73c84426c831529bb69d4e21db91c1b8404aa17c9409c7cd90cc1f23d7b","observation_id":"923874bb-2a78-4d38-b47c-ee4ca853ffa1","resolution":{"observed_at":"2026-08-07T05:20:14.026399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:14.089691Z","title":"Towards Enforcing Company Policy Adherence in Agentic Workflows","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.089691Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:63199de23413b1a5178090abef1074a5d806bc0cf1c5a08394ef492aa548fc58","observation_id":"3a990bcc-b74d-43c0-abf1-1d4e00836877","resolution":{"observed_at":"2026-08-07T05:20:14.089691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:14.151335Z","title":"2025 , isbn =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.151335Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:18f164ff1371e148191ee1c42bb505dea60cc964c10e0676e3924483810336cb","observation_id":"ec4e96bf-2dd3-4f30-8b55-83a75ea8116a","resolution":{"observed_at":"2026-08-07T05:20:14.151335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.694678Z","title":"2026 , eprint=","venue":null,"work_id":"ba6fe18b-9f1f-4ea4-a3bb-9618cc3ce05f","year":2026},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.233010Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:8f9a2610d3f59c2ec0ec6d2c7565a47dea86dbb5fcea00390a21ed6e87000df2","observation_id":"07bee70b-4dee-4424-a1eb-4815677def87","resolution":{"observed_at":"2026-08-07T05:20:15.709399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.676331Z","title":"2024 , howpublished=","venue":null,"work_id":"76ce5149-49ef-4585-9142-e2ffad32dc77","year":2024},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.289143Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:0e8d83dd950bf0211c9d2a40c91c9c822008357277c673767a0ade4b842f1d23","observation_id":"5aed78d5-ae0e-4233-8735-edbc776c98e4","resolution":{"observed_at":"2026-08-07T05:20:15.682363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:14.353384Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.353384Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:ab9f611e502e9a22cb3710ed3e9722a2610fb26ad1725120eac500fa7008fb96","observation_id":"a73f6982-9722-48bd-9a5c-5a2056b43704","resolution":{"observed_at":"2026-08-07T05:20:14.353384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:14.410620Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.410620Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:ed886f17ffe36821cf0adc08bbb93051cca6cba7593016701e031b422cdc168d","observation_id":"9d011802-59c6-41d8-8f56-d1b6d9833a72","resolution":{"observed_at":"2026-08-07T05:20:14.410620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.601521Z","title":"ArXiv , year=","venue":null,"work_id":"bb9b9884-f3f0-4f46-8145-53fc4288714b","year":null},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.467464Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:6acbf7c99455a028f194ffffff0104ac28c2e27b92572f95209bb19141f50382","observation_id":"42d4dd64-0b58-4ab4-9b0c-87ddca914997","resolution":{"observed_at":"2026-08-07T05:20:15.608631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-07T05:20:14.525116Z","title":"arXiv preprint arXiv:2307.13854 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.525116Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:9c958345bab5ba4bcc93c05bf629008c83385cc45c52ff22c90817c046004f92","observation_id":"65f94613-f33d-4790-b46e-859ed12cbb77","resolution":{"observed_at":"2026-08-07T05:20:14.525116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:14.590129Z","title":"A pp W orld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.590129Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:2e34e2b39d5660971848dbf7fa712be6d65735bc6f89957543912fc29b74b057","observation_id":"569c2335-0adc-4805-8838-fe1c4ae066e8","resolution":{"observed_at":"2026-08-07T05:20:14.590129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12115","last_updated":"2025-05-29T23:07:34Z","snapshot_observed_at":"2026-08-07T18:11:26.038748Z","submitted_at":"2025-02-17T18:41:16Z","title":"SWE-Lancer: Can Frontier LLMs Earn $1 Million from Real-World Freelance Software Engineering?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12115","snapshot_observed_at":"2026-08-07T05:20:14.667222Z","title":"arXiv preprint arXiv:2502.12115 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.667222Z"},"links":{"cited_paper":"/paper/2502.12115","citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:83fc5ce0af31e2ec4c563ba8ee852c544730620d9faadaf646a28f1a3c3d6079","observation_id":"e8662d9f-a520-4e7d-a1b0-f9b044b80802","resolution":{"observed_at":"2026-08-07T05:20:14.667222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.576216Z","title":"2024 , eprint=","venue":null,"work_id":"7bc037f5-8b66-4570-91ea-b81a3461cbb0","year":2024},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.747455Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:43cb7e58d65f230ff9f1ed6c90ab9a2e38f223f3b14b124c3a37d622147def50","observation_id":"8b8a38a0-df2f-48e9-ab09-ec4151a41e89","resolution":{"observed_at":"2026-08-07T05:20:15.585487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:14.813652Z","title":"and Zhang, Hao and Gonzalez, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.813652Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:e9c2a0f036c241ac2797c7fef04392eb7f78942d743d09bbcbbae72545c6f48e","observation_id":"33013a20-0739-4f9d-a0da-e56a09d54e18","resolution":{"observed_at":"2026-08-07T05:20:14.813652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.543655Z","title":null,"venue":null,"work_id":"b5eeecc1-f63c-4c50-922a-ed042044e90f","year":null},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.902068Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:5b225ef15c4392ae12ede357825c01b5711295a7098ee7c5843e9833e140cf0f","observation_id":"a668dfd3-b58e-4b32-98a8-f179a111838f","resolution":{"observed_at":"2026-08-07T05:20:15.548321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.524755Z","title":"2025 , eprint=","venue":null,"work_id":"bae6ba27-29e8-4c8c-ba7d-b14389e7eacf","year":2025},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:14.950594Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:1e5ceca3790a9c887964dbb84712085d018b0855552244481b939f8ddeb3a228","observation_id":"fd45945e-cf58-48d6-b002-9f6436f95937","resolution":{"observed_at":"2026-08-07T05:20:15.529234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.028255Z","title":"Proceedings of the 2023 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:15.028255Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:a40367ce8c9191cbe6289dacb63a71ee900a0a3f81a1f61584963135e2d02184","observation_id":"3805642d-3eed-4869-a7c6-8420e0da7aea","resolution":{"observed_at":"2026-08-07T05:20:15.028255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.062796Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:15.062796Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:d8d73a011e717715bbc2ddce8f89c57b0e5e5b3b22454b0299acdf9bbda32afd","observation_id":"ec17f9f3-bc3a-4b86-ada7-1936ac1ac5e9","resolution":{"observed_at":"2026-08-07T05:20:15.062796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:20:15.067564Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:15.067564Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:b71ebd37958879e9989be7d04a0e3b0c82cc83d749c04486d05db701e58e44dd","observation_id":"990bf10c-8a45-4186-a9b0-db48f839a5bc","resolution":{"observed_at":"2026-08-07T05:20:15.067564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.455900Z","title":"Proceedings of the 41st International Conference on Machine Learning , articleno =","venue":null,"work_id":"327226e9-fb6b-4abd-940d-ee5e5d6f8da0","year":2024},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:15.073683Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:c2a85fc631b0ce16c67c2a65f4e0750f23f7f27c48775e215d7af102a377f85a","observation_id":"aea02b38-81f3-4306-9d2c-e7f5699180e3","resolution":{"observed_at":"2026-08-07T05:20:15.468783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.079297Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:15.079297Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:b57439e4415a32bcdc66a21ea249faadfc11ccc53167028b5343c91f7ab1c2b9","observation_id":"931892eb-34c1-4a52-a619-51171f68ccb5","resolution":{"observed_at":"2026-08-07T05:20:15.079297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:20:15.085691Z","title":"Aligning Large Language Models through Synthetic Feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:15.085691Z"},"links":{"citing_paper":"/paper/2608.06329"},"observation_digest":"sha256:b1b0dd26f4807388281b0d5615bd5eb73cdaa04871c6d661a2a089db23d00dc4","observation_id":"5df0d76d-c106-4fb2-b600-e5bf2446b874","resolution":{"observed_at":"2026-08-07T05:20:15.085691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06329","last_updated":"2026-08-06T17:39:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T04:13:54.660419Z","submitted_at":"2026-08-06T17:39:21Z","title":"Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2608.06329."}