{"as_of":"2026-08-23T07:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17ca31e6f08bdf02b942aaba01c977292968d7ad55fa7c058de0368363f71466","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:21:00.661770Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:18:14.014731Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T05:30:12.796894Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00543","snapshot_observed_at":"2026-08-07T05:18:14.014731Z","title":"Evaluating the consistency of llm evaluators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08320","last_updated":"2025-07-02T23:34:36Z","snapshot_observed_at":"2026-08-19T07:45:28.346285Z","submitted_at":"2025-06-10T01:12:31Z","title":"How Good LLM-Generated Password Policies Are?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:14.014731Z"},"links":{"cited_paper":"/paper/2412.00543","citing_paper":"/paper/2506.08320"},"observation_digest":"sha256:93766a8487088c46de9170245c1c3e36a042d84f0ab0ceea8f52b8e9e2168950","observation_id":"7e0a3ad0-2182-4cdc-8996-a3434a27037d","resolution":{"observed_at":"2026-08-07T05:18:14.014731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"cited_work":{"arxiv_id":"2412.00543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.00543","snapshot_observed_at":"2026-08-05T05:30:12.796894Z","title":"Evaluating the Consistency of LLM Evaluators","venue":"cs.CL","work_id":"24b4f452-4506-45b6-8a5c-9100378f041d","year":2024},"citing_paper":{"arxiv_id":"2509.09705","last_updated":"2025-09-05T17:31:14Z","snapshot_observed_at":"2026-08-18T15:07:05.826261Z","submitted_at":"2025-09-05T17:31:14Z","title":"The Non-Determinism of Small LLMs: Evidence of Low Answer Consistency in Repetition Trials of Standard Multiple-Choice Benchmarks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T05:30:11.935278Z"},"links":{"cited_paper":"/paper/2412.00543","citing_paper":"/paper/2509.09705"},"observation_digest":"sha256:ec4f8313355cc7db624eb2639a845781e38f912f2e714213d0a215f9e0431aeb","observation_id":"8c171ac4-f432-4ce3-9ba7-6edd5f4bac2f","resolution":{"observed_at":"2026-08-05T05:30:12.810095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00543/citation-record","integrity":"/paper/2412.00543/integrity","json":"/paper/2412.00543/citation-record.json","paper":"/paper/2412.00543"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.532973Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.532973Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:2274e348380131938fdec612a1b5804973d0d68515d3f6ad9e74defb5e9dd36a","observation_id":"f02f586a-ac2c-4705-bc40-fdce5ffbec0c","resolution":{"observed_at":"2026-08-12T05:21:00.532973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.538404Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.538404Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:9af1156d0578ea9e089889788598df41a86e63b01cf879617c426a5d53ef4a00","observation_id":"ee5cb207-4f47-4d05-8e1e-79dc13cae2e8","resolution":{"observed_at":"2026-08-12T05:21:00.538404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T05:21:00.542992Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.542992Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:6f2f8ab6009298b1be55ea9fa16d4c286592fd607d50f5cfd5a4714be9db429c","observation_id":"e2d3d6cb-6d28-4b96-b101-8a6b36488b08","resolution":{"observed_at":"2026-08-12T05:21:00.542992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.547934Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.547934Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:ca313b6e323c8d79b21db17330308be6b14f24d51162259d33d0f6ae38a9a79f","observation_id":"b4cfbef2-3a7f-4fce-bbfd-8c02a1461542","resolution":{"observed_at":"2026-08-12T05:21:00.547934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.552659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.552659Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:fafc34c401abfc7e076a97f3dca585228280c0444d74c7b017331980da1d5653","observation_id":"dec05faf-a604-4c6f-b930-12e9b53f1ec2","resolution":{"observed_at":"2026-08-12T05:21:00.552659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.556913Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.556913Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:5d63c7f39a26927b011eb6cacf30a9a28ee4795a3e46dc7116673669879b6bdf","observation_id":"ecf3fa2e-9581-4994-8317-2ce3947202f3","resolution":{"observed_at":"2026-08-12T05:21:00.556913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.561079Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.561079Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:fe2ecff624076aeb543ca7e51efb6b271e5cd94b2c9408ce492f76cbf29b7f53","observation_id":"af05694a-8af7-4bfc-b730-c7464a6afffe","resolution":{"observed_at":"2026-08-12T05:21:00.561079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.565731Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.565731Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:462f4700c4c7bc9b1685d59e1f7945ff7f56cfc2a89bf7dbd067035b1bd30fac","observation_id":"fe635d56-dca2-481d-a158-95048e733389","resolution":{"observed_at":"2026-08-12T05:21:00.565731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.570139Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.570139Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:35b266eb5e01e517c22b848b7a91f65a40fcc204e39b1c9dc89855c601a213cf","observation_id":"5a0390a3-4065-47a3-9f0e-abf281b2470b","resolution":{"observed_at":"2026-08-12T05:21:00.570139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-18T15:11:49.913463Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-12T05:21:00.573930Z","title":"Smith, Iz Beltagy, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.573930Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:a436e5a86e4a6ca0d4ba1bd05a51f17ba0605a30df9917382195c1bca9af722d","observation_id":"e60f3545-b04c-49ab-b407-cbf7bbcf8103","resolution":{"observed_at":"2026-08-12T05:21:00.573930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06273","last_updated":"2023-11-14T00:20:20Z","snapshot_observed_at":"2026-08-16T15:49:05.566064Z","submitted_at":"2023-03-11T01:19:01Z","title":"Consistency Analysis of ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06273","snapshot_observed_at":"2026-08-12T05:21:00.578036Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.578036Z"},"links":{"cited_paper":"/paper/2303.06273","citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:5f423e435b7450265996a5ba517ad81ad33f3f24a55d1460551d9327ededdfd9","observation_id":"f0a82819-098c-4011-b992-19096d49aa7e","resolution":{"observed_at":"2026-08-12T05:21:00.578036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T05:21:00.582517Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.582517Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:c640b92405e1f6801f01cf8a6114534e65c0e038542d1a8b7057f1d750e841e8","observation_id":"88edd7b9-a9b1-49f3-b3d3-e4560d5b9d1a","resolution":{"observed_at":"2026-08-12T05:21:00.582517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.945643Z","title":null,"venue":null,"work_id":"2090873a-6055-4e51-b232-5788c202b268","year":2024},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.586927Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:d9715be132559d71809ff4e05a25b442db376a507b48a4f9d7dae13b3952d0f2","observation_id":"e4556369-3056-47f8-a882-86ba43a5707f","resolution":{"observed_at":"2026-08-12T05:21:00.950835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.931032Z","title":null,"venue":null,"work_id":"fbc133ef-5777-4ed2-b380-4b1c3323f543","year":2024},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.590580Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:d816d5791611b008129c82ee5caebf6c0cedfc892d40c019cf84484e2339e00c","observation_id":"3f54db1c-3273-49ee-bfa2-2112c8cb5143","resolution":{"observed_at":"2026-08-12T05:21:00.936603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.594537Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.594537Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:6405e42ea430509a4f5c5b93e0f424aa1ba7b574bd520267936f9fc2ff1c12d1","observation_id":"e9030555-2e1c-4133-a91c-1d9126769faf","resolution":{"observed_at":"2026-08-12T05:21:00.594537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.598539Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.598539Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:7f405961bd1c4b221ba8c53768804f481adc055b8db89bac1f184498003f3a61","observation_id":"020c47b3-be67-44a6-bb27-8e5b09342cfd","resolution":{"observed_at":"2026-08-12T05:21:00.598539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.602406Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.602406Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:0ec75cf692f71057bfdcadf99b086b9c4c2fbed6166ca3a0286be6722ded01aa","observation_id":"e733e48c-8172-4cf3-9466-d3a42a76bf27","resolution":{"observed_at":"2026-08-12T05:21:00.602406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.606909Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.606909Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:4d8eb3faf0a5d2a1af74b124b16d448cf5ff9f2a4285a05aea785276cfeaffad","observation_id":"4ff371e4-d1aa-466b-90b9-e91694247319","resolution":{"observed_at":"2026-08-12T05:21:00.606909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.610914Z","title":"Smith, and Yejin Choi","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.610914Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:bf1029c345f575b35e47084eb1ad251250aee38ba53e7d0cb5ac5a8ecdef720f","observation_id":"a1ce2c1b-5821-4a26-9c72-a428877e6450","resolution":{"observed_at":"2026-08-12T05:21:00.610914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-12T05:21:00.619176Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.619176Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:12c706aaf0f07c146fbc6625731bfd8dddafb9c9518b93bdba44b8b9f8f95b21","observation_id":"881ecd2d-e9e1-4738-a270-2507dd34b657","resolution":{"observed_at":"2026-08-12T05:21:00.619176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T05:21:00.624108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.624108Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:bae949ae45bea8bb0c607639b83471006449fcfbc61f7166ea3548a0a284caee","observation_id":"984fdc1b-27cb-4b9a-9e97-9fd9867253e2","resolution":{"observed_at":"2026-08-12T05:21:00.624108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01724","last_updated":"2024-05-02T20:42:28Z","snapshot_observed_at":"2026-08-19T07:52:50.883828Z","submitted_at":"2024-05-02T20:42:28Z","title":"Large Language Models are Inconsistent and Biased Evaluators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01724","snapshot_observed_at":"2026-08-12T05:21:00.629509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.629509Z"},"links":{"cited_paper":"/paper/2405.01724","citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:ee9204f5a94ff70313c6926b099c4989f292413fdaed4be0da465eafacce78a8","observation_id":"411e0cb7-329c-431d-aa13-1581c3680244","resolution":{"observed_at":"2026-08-12T05:21:00.629509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.636147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.636147Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:07d64a56ed48b56fa65d359c02a65534677e94f0a81c3bc6754ad8a27dbedbb9","observation_id":"3fa44808-6211-48bd-96e9-8af1af73c2fb","resolution":{"observed_at":"2026-08-12T05:21:00.636147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T05:21:00.640487Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.640487Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:1275d5913fdf9248996dc01be8ea3396e1dae40a507633afd1af5013d40e4210","observation_id":"26312f29-7c84-4122-8924-7177c04dfb13","resolution":{"observed_at":"2026-08-12T05:21:00.640487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-08-18T22:05:54.705341Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-12T05:21:00.644737Z","title":"Rush, and Thomas Wolf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.644737Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:43d4ccba15c0c278130c6f9450ef546df81270def0a056c54e2e1403e7d5734a","observation_id":"d8f45be9-35c7-4710-8c3a-10a84786261f","resolution":{"observed_at":"2026-08-12T05:21:00.644737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.648924Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.648924Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:ec38ef5728c0f15587d14a9e490e9c13c9b28dae9fcc778c7a11ccf8e3edab1c","observation_id":"4ebe779d-b341-4695-abcb-dd69ba907ab8","resolution":{"observed_at":"2026-08-12T05:21:00.648924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.879676Z","title":null,"venue":null,"work_id":"add4686b-0a60-44f4-9e19-358b4993896b","year":2024},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.653018Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:3a43c0713e134d4c143034a8083c8af79e82eb0186256a74428d73d486af4550","observation_id":"ee888c34-c71e-417d-97c1-2737cbc5be2b","resolution":{"observed_at":"2026-08-12T05:21:00.883708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.657278Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.657278Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:cf54d662a093fd4d71dcb02760a3c5c521ff16545731821c594dcdb153f405bc","observation_id":"3209731e-694a-4029-a1b5-2fd6947eca75","resolution":{"observed_at":"2026-08-12T05:21:00.657278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:21:00.857278Z","title":null,"venue":null,"work_id":"bcf9c381-36ac-48dc-9039-a3df2b58a700","year":2023},"citing_paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T05:21:00.661770Z"},"links":{"citing_paper":"/paper/2412.00543"},"observation_digest":"sha256:68f1c05645a49978d476cd549e378a46000897d436c80eda5e85fb80958af8e2","observation_id":"bde427b2-f757-4074-b8a5-eb0c4601fff5","resolution":{"observed_at":"2026-08-12T05:21:00.862475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00543","last_updated":"2024-11-30T17:29:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T18:39:29.502729Z","submitted_at":"2024-11-30T17:29:08Z","title":"Evaluating the Consistency of LLM Evaluators"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 2 inbound Pith citation observations for arXiv:2412.00543."}