{"as_of":"2026-08-08T00:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63c0b78dabae311542e31e47da662139a5944f6bdb059cdc959ce2bf61c8cd58","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:17:47.053105Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:13189edd201cfc7be13f75667a3ebb51bffdf85f04e3a6144974fed8da6a257e","observation_id":"11e491a1-2bd6-455c-abe7-d4b56addf389","resolution":{"observed_at":"2026-05-11T23:08:37.341931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-07T10:17:47.053105Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-07T20:45:05.929732Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":232,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:47.053105Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:589f178fe39b15c1538e223e2dafddebd8e2ae8c518b1b3c8920dba0115281ad","observation_id":"079f109e-1ebb-443b-b672-28b8b4f858e0","resolution":{"observed_at":"2026-08-07T10:17:47.053105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-07T04:39:07.186704Z","title":"arXiv preprint arXiv:2402.15754 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10146","last_updated":"2025-06-11T19:51:06Z","snapshot_observed_at":"2026-08-07T04:30:51.674037Z","submitted_at":"2025-06-11T19:51:06Z","title":"Balanced Hyperbolic Embeddings Are Natural Out-of-Distribution Detectors","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:39:07.186704Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2506.10146"},"observation_digest":"sha256:75cd14b39ff5392879219bc12020081fe7fe1dde62467ea0706acd2bb6daed6c","observation_id":"38b7b8a5-fa1b-472f-83df-95981658ea5c","resolution":{"observed_at":"2026-08-07T04:39:07.186704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-04T12:44:15.092166Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06242","last_updated":"2025-10-03T08:37:33Z","snapshot_observed_at":"2026-08-07T15:14:11.527146Z","submitted_at":"2025-10-03T08:37:33Z","title":"Transparent Reference-free Automated Evaluation of Open-Ended User Survey Responses","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T12:44:15.092166Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2510.06242"},"observation_digest":"sha256:5b60ec7e13765c628c477994ae3ace20e40dc0ca07ea21820178536a82dfd38f","observation_id":"369c7027-b1ad-4fd9-98bb-0f23ec2edc62","resolution":{"observed_at":"2026-08-04T12:44:15.092166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2601.03013","last_updated":"2026-04-08T16:28:19Z","snapshot_observed_at":"2026-08-02T17:59:54.247831Z","submitted_at":"2026-01-06T13:37:50Z","title":"LLMs, You Can Evaluate It! Design of Multi-perspective Report Evaluation for Security Operation Centers","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T17:01:47.603706Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2601.03013"},"observation_digest":"sha256:d61eb73abdd3c9532a663ff76b5fb24070486dfdda4e2b9a48d7780ed56c8fcf","observation_id":"874e96cb-6304-4471-93d0-70d302bc59ba","resolution":{"observed_at":"2026-05-16T17:03:08.140918Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2605.16615","last_updated":"2026-05-15T20:33:52Z","snapshot_observed_at":"2026-08-02T08:13:51.251374Z","submitted_at":"2026-05-15T20:33:52Z","title":"Learning What Evaluators Value: A Reliable Approach to Modeling Evaluator Preferences","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-20T20:04:53.983505Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2605.16615"},"observation_digest":"sha256:c50767fc690aec7bde3c16fc0a222600ff40dddce9f7a0b004aab74bab29c3ac","observation_id":"fc689107-5c00-4232-8359-19832d7ab9e6","resolution":{"observed_at":"2026-05-20T20:08:58.747674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2605.16615","last_updated":"2026-05-15T20:33:52Z","snapshot_observed_at":"2026-08-02T08:13:51.251374Z","submitted_at":"2026-05-15T20:33:52Z","title":"Learning What Evaluators Value: A Reliable Approach to Modeling Evaluator Preferences","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-20T20:04:53.983505Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2605.16615"},"observation_digest":"sha256:6eb5785d7eaaf45452844006ac4667d1b51e10074a615f63efa5e1b0f055676c","observation_id":"f9173bd3-91a0-434b-99ee-354f45b8bb77","resolution":{"observed_at":"2026-05-20T20:08:59.301022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition","version":1},"cited_work":{"arxiv_id":"2402.15754","doi":"10.48550/arxiv.2402.15754","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HD - Eval : Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition , February 2024","venue":"arXiv (Cornell University)","work_id":"18e668b5-0860-495a-94d0-654a7076aa08","year":2024},"citing_paper":{"arxiv_id":"2606.07936","last_updated":"2026-06-09T12:36:24Z","snapshot_observed_at":"2026-08-07T22:03:51.528110Z","submitted_at":"2026-06-06T01:55:56Z","title":"Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-27T20:20:08.996005Z"},"links":{"cited_paper":"/paper/2402.15754","citing_paper":"/paper/2606.07936"},"observation_digest":"sha256:b406e14c161144eddb38a0bc154fe365c5bc9e233694d47fd300c9d66579bd69","observation_id":"b8eb6e69-c084-4c87-b914-610b0f4c24ba","resolution":{"observed_at":"2026-07-02T20:37:22.686429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T23:53:01.460548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.15754/citation-record","integrity":"/paper/2402.15754/integrity","json":"/paper/2402.15754/citation-record.json","paper":"/paper/2402.15754"},"outbound":[],"paper":{"arxiv_id":"2402.15754","last_updated":"2024-02-24T08:01:32Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T08:01:32Z","title":"HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2402.15754."}