{"as_of":"2026-08-13T10:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a99c6733d7adbb77ae49bbf58cf40ba5c91a0d0fd7aece507dc46a1f71cbe294","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:05:54.291216Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-02T12:38:54.249632Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-14T01:35:50.992477Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2410.09024"},"observation_digest":"sha256:f93700a11a9748453bb02a76c81cc5e9f41d8bea57f4b396dddeee2c47a00374","observation_id":"e8c32b91-489c-43ac-b4fa-8f140d97ad27","resolution":{"observed_at":"2026-05-14T01:35:51.204544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-12T20:05:54.291216Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10055","last_updated":"2024-11-15T09:17:40Z","snapshot_observed_at":"2026-08-12T19:59:11.163443Z","submitted_at":"2024-11-15T09:17:40Z","title":"Towards unearthing neglected climate innovations from scientific literature using Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T20:05:54.291216Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2411.10055"},"observation_digest":"sha256:f31acc77ade3e0f99bafc5430b1f84d55669205b76ff1c16364b84acb41b8d51","observation_id":"2784833e-994f-4b3d-b42f-4c80756c79fb","resolution":{"observed_at":"2026-08-12T20:05:54.291216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-12T11:59:18.339313Z","title":"Calibrating llm-based evaluator,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17793","last_updated":"2024-11-26T17:43:32Z","snapshot_observed_at":"2026-08-12T20:18:05.272256Z","submitted_at":"2024-11-26T17:43:32Z","title":"Engineering AI Judge Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:59:18.339313Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2411.17793"},"observation_digest":"sha256:1c22fe62da4f504f18419ac1de2f8df4d52f7c984112bb7776c8b2538d404180","observation_id":"a57f28fd-7676-4364-9c5f-b975c931315e","resolution":{"observed_at":"2026-08-12T11:59:18.339313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-12T11:15:44.970534Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18444","last_updated":"2024-11-27T15:35:32Z","snapshot_observed_at":"2026-08-12T16:14:41.035802Z","submitted_at":"2024-11-27T15:35:32Z","title":"Is my Meeting Summary Good? Estimating Quality with a Multi-LLM Evaluator","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T11:15:44.970534Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2411.18444"},"observation_digest":"sha256:fee505a763c0ef30683732243540267f5f37a2d8c31ed99f0a3d65e306ab570b","observation_id":"ff2cbbb3-7af3-4f8b-927d-6c210e994160","resolution":{"observed_at":"2026-08-12T11:15:44.970534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-11T20:37:54.919951Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05563","last_updated":"2025-07-01T22:08:39Z","snapshot_observed_at":"2026-08-12T01:48:12.089703Z","submitted_at":"2024-12-07T06:56:01Z","title":"A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-08-11T20:37:54.919951Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2412.05563"},"observation_digest":"sha256:8247e47e9ca415c60bccd4f7d26dbac3c416826d495c2864ce0df37db28c4cb3","observation_id":"4ecfa734-88d1-454a-9f7f-1d66f2b609a9","resolution":{"observed_at":"2026-08-11T20:37:54.919951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-11T23:22:45.789386Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:1f1853f840e443fd77d5ec1d6bb72e5def351f12ab34591a9ee5887eee1a9964","observation_id":"d7b9ddb2-75e4-42d3-903a-7ffacf660847","resolution":{"observed_at":"2026-05-11T23:08:37.331051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-08T22:36:35.260875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04498","last_updated":"2025-02-06T20:57:36Z","snapshot_observed_at":"2026-08-13T05:00:36.654030Z","submitted_at":"2025-02-06T20:57:36Z","title":"Verifiable Format Control for Large Language Model Generations","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:36:35.260875Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2502.04498"},"observation_digest":"sha256:bd5270114e394eb26098a001fdb93fa0e94df71b15e332ac5e04b29d0b030e4d","observation_id":"90b2acb0-4145-43dc-98de-32ca74b6b5e4","resolution":{"observed_at":"2026-08-08T22:36:35.260875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2506.21582","last_updated":"2026-05-07T20:27:26Z","snapshot_observed_at":"2026-08-12T16:17:13.752430Z","submitted_at":"2025-06-17T05:24:58Z","title":"VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T09:36:50.323723Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2506.21582"},"observation_digest":"sha256:104a9bd9d2b8a90f51fcfa7bf768b9fa47239c2129f36249ff64a62854bc01aa","observation_id":"8a8ceceb-ed1b-4e88-874f-d08af2c85220","resolution":{"observed_at":"2026-05-19T09:37:13.894987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T12:52:55.567886Z","title":"Calibrating llm-based evaluator, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01186","last_updated":"2025-09-01T07:10:22Z","snapshot_observed_at":"2026-08-07T23:29:49.490186Z","submitted_at":"2025-09-01T07:10:22Z","title":"Statutory Construction and Interpretation for Artificial Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:55.567886Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2509.01186"},"observation_digest":"sha256:9fbde05075e5aaca407b642f9ee65373986e9561eb4df0a41e9df18224950e69","observation_id":"5d5550e5-0e70-4a49-92f3-1286aa587f9c","resolution":{"observed_at":"2026-08-05T12:52:55.567886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2604.17200","last_updated":"2026-04-19T02:04:14Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T02:04:14Z","title":"Calibrating Model-Based Evaluation Metrics for Summarization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-10T06:36:55.334742Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2604.17200"},"observation_digest":"sha256:14f5397894fa84ddcd737b5225f1a31139220c5a92f83ef8acc49650a770e37a","observation_id":"3e8a5565-b587-45dd-90df-fa8a37b56243","resolution":{"observed_at":"2026-05-10T06:41:36.954717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator","version":1},"cited_work":{"arxiv_id":"2309.13308","doi":"10.48550/arxiv.2309.13308","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13308","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Calibrating llm-based evaluator","venue":"arXiv (Cornell University)","work_id":"5f9e8311-a01d-4c62-a69d-de002e890d8d","year":2023},"citing_paper":{"arxiv_id":"2606.22329","last_updated":"2026-06-21T04:35:43Z","snapshot_observed_at":"2026-07-31T23:50:31.635694Z","submitted_at":"2026-06-21T04:35:43Z","title":"BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T11:06:07.303335Z"},"links":{"cited_paper":"/paper/2309.13308","citing_paper":"/paper/2606.22329"},"observation_digest":"sha256:d0ab11c6d095e35811ac3b6662ddd30a877dbddde27e93866c0faaf12c523135","observation_id":"3ae689bf-abfe-4479-937f-c253e9ab8569","resolution":{"observed_at":"2026-07-04T08:49:41.496695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2309.13308/citation-record","integrity":"/paper/2309.13308/integrity","json":"/paper/2309.13308/citation-record.json","paper":"/paper/2309.13308"},"outbound":[],"paper":{"arxiv_id":"2309.13308","last_updated":"2023-09-23T08:46:11Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T10:07:09.184755Z","submitted_at":"2023-09-23T08:46:11Z","title":"Calibrating LLM-Based Evaluator"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2309.13308."}