{"as_of":"2026-07-23T14:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99ae7bfb1e93b7d6d4c7a39ae7392e984f73b9c0ff40454093ff526c36307974","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T01:14:26.356160Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-23T06:31:01.910684+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T16:05:41.788680Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T16:07:20.325594Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"cited_work":{"arxiv_id":"2606.26429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.26429","snapshot_observed_at":"2026-07-10T16:07:20.325594Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","venue":"cs.LG","work_id":"fb9c7784-f119-4bf4-ab72-807e72d3005b","year":2026},"citing_paper":{"arxiv_id":"2607.07882","last_updated":"2026-07-08T19:35:17Z","snapshot_observed_at":"2026-07-12T23:18:08.129041Z","submitted_at":"2026-07-08T19:35:17Z","title":"Bug Report Specification Refinement with Trajectory Guidance for Automated Program Repair","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T16:05:41.788680Z"},"links":{"cited_paper":"/paper/2606.26429","citing_paper":"/paper/2607.07882"},"observation_digest":"sha256:48d21dd14021c3fb0f2cb747d8ea3dbc57193dd6a707ade0a3f6f00f529f9f84","observation_id":"1c17183e-e198-4ae5-b2d0-0daf2d4730e5","resolution":{"observed_at":"2026-07-10T16:07:20.327776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.26429/citation-record","integrity":"/paper/2606.26429/integrity","json":"/paper/2606.26429/citation-record.json","paper":"/paper/2606.26429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:4940ed8dd30970ff65aeaa50a5e5d1aa377975cc6f57aee319670ecc12122b23","observation_id":"1ccfddf6-26ec-4c79-88af-b54cabf3e3cc","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08242","last_updated":"2022-03-15T20:37:16Z","snapshot_observed_at":"2026-07-06T12:48:20.464521Z","submitted_at":"2022-03-15T20:37:16Z","title":"Data Contamination: From Memorization to Exploitation","version":1},"cited_work":{"arxiv_id":"2203.08242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.08242","snapshot_observed_at":"2026-07-04T15:49:58.246964Z","title":"Data contamination: From memorization to exploitation","venue":null,"work_id":"0334ffb2-b3d2-4066-9d07-8cd56418ea6c","year":2022},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2203.08242","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:c2f9360db5aaa963264f53c910e645d8e9ff6d315a2f3062a398e79d50879fbc","observation_id":"d318c180-a4be-4f7f-9432-e0dfe025a42c","resolution":{"observed_at":"2026-07-04T15:49:58.248277Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Nature Communications , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:980566f15b80b2faa14b948d2e8b3df862ba09ee676bfbe0fc201a6ba19ea844","observation_id":"7006b46c-66a3-4b39-9e7e-348a32b0f6d6","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-07-06T18:32:28.184208Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:89c061e3fbef3bca6686cc3f5371615e0efd5430fcf0e883e749320a56c3cd7b","observation_id":"55cfe3bd-196c-4919-abf4-5e08550773f7","resolution":{"observed_at":"2026-07-04T15:49:58.280215Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"the method of paired comparisons , author=","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:af9d28d6e9eb846dcb5036990cfa92a5ebb1b568a15bc4cba8ad2c946679b298","observation_id":"1f0a3836-84f9-489f-aa22-3e19cae5979a","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"2008 , publisher=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:41dba140741ff8de7e3c8b25213363cf7630325fd51112c19e914ba163eb1053","observation_id":"cddb38ad-1887-48f8-9225-fa08122fdde9","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Educational Measurement: Issues and Practice , volume=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:72b753e752cfd7921ecf6bdb72b69e1c915eeb511d9255ffe0e6f399d170d600","observation_id":"932600f6-e401-4ef2-8dfb-ef2562857349","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Statistical Science , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:454c45870aa0c82bc3d6c7830754d695c9efad630e82c070421ec336a68e4daf","observation_id":"3834d3aa-5bf6-4e3f-a311-3fb96ed422c8","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:ad9c04388740fd9d57ed5a17d33e57e18f4a817b6232d7a6e2bb49182b85a562","observation_id":"c63ec8d4-b2b7-40a0-9dbf-1ec627767a09","resolution":{"observed_at":"2026-07-04T15:49:58.259676Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:14.061878+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:14.061878+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-10T16:57:24.565388Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:cfda8d29b50661bf9164ebfa2f5f3cc4b39b7dbf01ed8e97a9e6cac91f517243","observation_id":"b02c6b0e-583a-4b47-8a62-6978ad7700b7","resolution":{"observed_at":"2026-07-04T15:49:58.277852Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:f2d392269584ee1994111bf0442a416be46a100a322177d97dc54f3ba6839f23","observation_id":"ef1bdfa6-9472-4242-91d3-084e3dc71feb","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":"1606.05250","doi":"10.48550/arxiv.1606.05250","metadata_source":"pith","pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","venue":"cs.CL","work_id":"0492dd16-26e8-48d9-874c-3dd90cae7b85","year":2016},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:3348e52fec65a13dbb7d9d18f60f0881924dc2fa4a4fdf214ea3f322e149e514","observation_id":"f714d820-4112-418c-b82e-e190103319dc","resolution":{"observed_at":"2026-07-04T15:49:58.261898Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the 2018 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:ff68fe316350da6593e799a7e096f6ad9f5d700203214026ffd48e5e4c1ebbc6","observation_id":"d4a32d6a-1054-463a-9ed8-fc5924b0ddd7","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:7db237322614d469d5b3623fe4c692f23b81889bac3ba69a293116109e8e73a4","observation_id":"3b68f834-cc3c-49d3-af0a-d232eee38211","resolution":{"observed_at":"2026-07-04T15:49:58.257368Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the 2015 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:e6e493a5c173ce4dc2c8bb26fb0b49e5079cf96130b4d90e45fa58a699731973","observation_id":"bd09cc4e-0987-4f74-a636-001460ca0419","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the 2018 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long papers) , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:ac3d0cf97f410053867f0d539748aa71495097f3258eb5037597fbbe8bb5de0e","observation_id":"e481baff-3803-4266-aab0-8190f3234a61","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the 2018 EMNLP workshop BlackboxNLP: Analyzing and interpreting neural networks for NLP , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:23effc29b4d37b8a128295298e04d4aee22a032d3ea85da477930055d031f4fd","observation_id":"a1d1f07e-3724-4663-b11f-7098fe330b44","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:34413c695c3969f16626dea3e8400e3bef4bc8d7137250179d10fb16ddd92811","observation_id":"180266dd-f50a-4d41-b524-92071757867a","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-07-06T14:19:27.593861Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:40044ae0bea140b036e0fdb072127dc246ec5de1cb1153a40b600ca776f94474","observation_id":"7c4a2a6a-60cd-4d59-9ad0-93cba028c5d3","resolution":{"observed_at":"2026-07-04T15:49:58.264058Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Handbook of statistics , volume=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:c112a39f88bd01800a02acc66ef5970c161af2d0b3c89f211b4e82c9b1254cea","observation_id":"b350b804-cfc1-4bd5-a8ac-6656a013f835","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"2013 , publisher=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:8009e638483244cea03eb141c8ea334ef4ce86024eff4c6e7a0a645a2d998a65","observation_id":"df8773dc-c4a7-4cab-b696-46940a66f01d","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:a5d579f9219d60ce81eac82ba33bed2b7161c3fc7f6f23e9c13717a7c8ae4c99","observation_id":"43f7c667-275a-47ec-afa1-f770cfb4edde","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Artificial intelligence , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:df67c28a1b8bfaad39461b991f4c71d6af701f20e418b2f093e4900fb604307b","observation_id":"51e9c071-aa89-4d4d-95c3-e99a40991ec5","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:49:58.267510Z","title":"arXiv preprint arXiv:2510.04051 , year=","venue":null,"work_id":"e6c04182-77e9-4f58-8e21-306263497439","year":2025},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:9e72d339c819395d9ba6b623a32b207676c501c8e9a1239349ce9e0c9436c2d3","observation_id":"ba47fbbd-40b6-4cc2-8203-e084f6ffd983","resolution":{"observed_at":"2026-07-04T15:49:58.268798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:e03419360684aaa382e5f87007585cfa27f1adf371df2f4644d62e0963c3d8d4","observation_id":"24721fe9-f405-4d74-a960-f6727dac347e","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:49:58.249301Z","title":"arXiv preprint arXiv:2510.14966 , year=","venue":null,"work_id":"33d33e3d-dca1-4189-803a-d6462e8020a3","year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:c02fb45ff564cddaad5f603fd89e7211b2a31d3543fd6d9d1d7526de746926d5","observation_id":"d1daf105-995a-48d0-b289-1f9ded24c6ae","resolution":{"observed_at":"2026-07-04T15:49:58.250580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:f1efba64589483e052bc7ba73c46d0e6e25ea72ec73a28a6d4d44778e9da5278","observation_id":"7a62f2c5-7bd4-452c-ad66-f6ade2147e8f","resolution":{"observed_at":"2026-07-04T15:49:58.252821Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-11T10:18:59.594684+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T10:18:59.594684+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:6fd844b954e2ee74ddfa3dbdd49a901bdc46bebef5d5979483bd3ca634b93a1c","observation_id":"2f24fda3-05b5-452b-9491-866dd4d69ca6","resolution":{"observed_at":"2026-07-04T15:49:58.270929Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:131b08a2abab22e1390ff5e89d2511edd170284239fc881d3345aa7fbe012265","observation_id":"f25ab560-0a33-4719-82cd-37e1bf4d79d0","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04689","last_updated":"2026-07-13T22:56:21Z","snapshot_observed_at":"2026-07-17T23:17:53.273174Z","submitted_at":"2025-10-26T03:54:12Z","title":"Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks","version":3},"cited_work":{"arxiv_id":"2511.04689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.04689","snapshot_observed_at":"2026-07-15T01:20:49.385427Z","title":"Frederic M","venue":null,"work_id":"84eb4ef4-b147-4b98-a271-127b0a97d297","year":2025},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2511.04689","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:0a993781a1ecd6a2af0baf23e531ec8bc8eea8fe5de3433209b4f330305759e7","observation_id":"279d9781-488e-41bb-bca2-a93605aea6a9","resolution":{"observed_at":"2026-07-15T01:20:49.385427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:72a83167345def567ca7ab6f6a4cb7eccf1728760ad5925dc6cf49bf78b2e393","observation_id":"905e5a3a-99ef-46d3-9dcc-e65403a8928a","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:49:58.253902Z","title":"Rethinking llm evaluation: Can we evaluate llms with 200x less data?arXiv preprint arXiv:2510.10457","venue":null,"work_id":"0f5cbf2d-976b-4944-8bbf-b0a824c9e0a1","year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:6b5ba4ac2a6cb1058c6f9240ab4abfd72247909505ff80badef1002f97becae9","observation_id":"ff679207-a8b8-400e-b497-ffd21b12a42e","resolution":{"observed_at":"2026-07-04T15:49:58.255096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of Machine Learning Research , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:45b755db29ce3d258ae45b734ad0ec5b3e06ef4e0972a33abd889ccc212f6a53","observation_id":"e4dd826f-c775-411b-a82b-f9e4ef6b7489","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-07-10T19:57:33.802494Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:4f444c8c129cc0cefada1b9892c1a0831dd5c185c1f9b75ed563478000e589fb","observation_id":"8416edd7-a460-495a-be28-9de5f9792b2c","resolution":{"observed_at":"2026-07-04T15:49:58.273229Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:03246c850efcd59ab136b98c02c79c8f0b6de593ee6540ada46c2bfa801ddc09","observation_id":"5c74ef1d-97e9-40b0-aece-4f8ace94720b","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the 12th international conference on natural language generation , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:8fcdac2b80036d492e38a750cae772b69ef06f59e4ccbdc36312e6035d463292","observation_id":"ddc59372-a33f-425d-916a-af262d8da50b","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the 1st workshop on benchmarking: past, present and future , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:9e675c1c5f25b0f2b2fcbf61cfeae14f7c840325478ac3669506105d1ab01344","observation_id":"7f8c0343-eb32-43fd-a7d6-0fc0cd8a11e9","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:766e2e176cbd897b8b5b12710ddd0f0620024c1db95c5f2687f5ef787514ac43","observation_id":"88ae9e67-0ba4-47ee-9ea4-1d3face42b6b","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":"2501.14249","doi":"10.1038/s41586-025-09962-4","metadata_source":"pith","pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Humanity's Last Exam","venue":"cs.LG","work_id":"59ea00d4-16a8-45e1-aafc-290a6f91d9f4","year":2025},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:dc2522c942e0b37d3f1642d5888b0e5adc4c8a4ca648d9a3605e86a66b4f6662","observation_id":"84652388-98e8-4a29-b7a6-1aa76ff34d75","resolution":{"observed_at":"2026-07-04T15:49:58.245588Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:52:33.672413+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:52:33.672413+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:59e1381eda10d3d0794b696cb0791ff36bc8c922fcf249519e3c94eaeb28cd05","observation_id":"c0ca4663-e1c4-49ec-93db-77df631ccf51","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:76b773449445c79ac5b94d41f12760903bdd213ad95dfbce6a303e3108e1c6fc","observation_id":"28794ce1-a3df-42ff-8f00-9d91e372ff60","resolution":{"observed_at":"2026-07-04T15:49:58.266350Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:e9d7ccd6b1e5e36ee96208b56b19add3bf7565582773fc87b1b6c4f718d7975a","observation_id":"78756b5c-460a-4e82-bc85-fe2dd192b7bf","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T01:14:26.356160Z","title":"2026 , howpublished=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T01:14:26.356160Z"},"links":{"citing_paper":"/paper/2606.26429"},"observation_digest":"sha256:97c28ef373495fe776becf0b30de7ba01e5433cc2851432259075c72d1af95f9","observation_id":"0f8facc7-978f-41d5-8d6d-c91e8094eaaf","resolution":{"observed_at":"2026-06-26T01:14:26.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.26429","last_updated":"2026-06-24T22:40:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-07T00:00:46.505337Z","submitted_at":"2026-06-24T22:40:46Z","title":"DualEval: Joint Model-Item Calibration for Unified LLM Evaluation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":27,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-23T06:31:01.910684+00:00","source":"crossref"},{"observed_at":"2026-07-23T06:30:56.940895+00:00","source":"retraction_watch"}],"thesis":"As of 23 July 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2606.26429."}