{"as_of":"2026-08-08T01:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a04f8eda39087bd895638635b678832a5d37067a3ce579fec9f8639e960bc9dd","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:31:54.652219Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05142/citation-record","integrity":"/paper/2506.05142/integrity","json":"/paper/2506.05142/citation-record.json","paper":"/paper/2506.05142"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:55.158500Z","title":null,"venue":null,"work_id":"0ac4b333-86af-4de9-848a-5dbc789fca1a","year":1993},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.520546Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:b53dd3ba41905a24918d4e26d830c27b07d6d6d0de1b842801e6bea226b72d8a","observation_id":"23e28b88-8d3b-46b1-9b99-c3f0e1dba8f9","resolution":{"observed_at":"2026-08-07T10:31:55.163265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:55.143804Z","title":null,"venue":null,"work_id":"153b51d8-5e37-4c55-9a73-b99c6b9ab30d","year":2024},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.525813Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:042458f169ab637e15af9a046d49e085be64ba26c53c00caaefbba4670bf94bd","observation_id":"1f6c0407-0538-41c2-8fab-18ab5bad2ca9","resolution":{"observed_at":"2026-08-07T10:31:55.148449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:55.129030Z","title":null,"venue":null,"work_id":"663f9055-8570-442d-a1e2-d76a6672f692","year":2024},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.530604Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:31d548a3e14df75f205135e06a6186ec5a14a1f6bed6518948f7c0e94688e9b3","observation_id":"95096cb4-f49b-4eb4-a0b8-b9d2020dea69","resolution":{"observed_at":"2026-08-07T10:31:55.133540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:55.112464Z","title":null,"venue":null,"work_id":"98f12c00-adda-40da-92c6-6c4a70993a30","year":1996},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.535909Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:2e0c5631272f732634bcb145ca870302167dc2098c181929a59b84e75fca4cc6","observation_id":"489e0593-877f-44ed-9f2b-d35daac3b446","resolution":{"observed_at":"2026-08-07T10:31:55.117544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18403","last_updated":"2025-06-02T11:31:19Z","snapshot_observed_at":"2026-07-06T18:37:21.973331Z","submitted_at":"2024-06-26T14:56:13Z","title":"LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18403","snapshot_observed_at":"2026-08-07T10:31:54.541102Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.541102Z"},"links":{"cited_paper":"/paper/2406.18403","citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:78b6e42027850574ab4fb3f008074acd6f63855fb9e154b7084841dad42c8415","observation_id":"538c5280-8f31-4ead-84f0-46f36e653094","resolution":{"observed_at":"2026-08-07T10:31:54.541102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w19-8667","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.708691Z","title":null,"venue":null,"work_id":"9447cb1e-aac4-4677-af19-e7b1d8137b6f","year":2019},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.546447Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:a022c1f97db6e16171d750df48cd554fe75fce20dfdf9f56d8ceb27c63f978ad","observation_id":"8f3dcd97-fecf-4efb-a0c3-c93b30946d3d","resolution":{"observed_at":"2026-08-07T10:31:54.713324Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:55.097107Z","title":null,"venue":null,"work_id":"c1e179e2-6e4b-4dc3-82a4-95fb0e269d01","year":2007},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.551925Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:3d65cd72993f3d7692db0c010f0f637bb77f38dd4bc5f45cfc1ad21426cd0530","observation_id":"1c9d168f-68ac-4789-9e93-da2e676a5d45","resolution":{"observed_at":"2026-08-07T10:31:55.101594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:55.080534Z","title":null,"venue":null,"work_id":"5193a570-b67c-4655-8c05-d53ddfcdd80a","year":2006},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.556447Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:aaa5d6ee4498419a2d7ea1ee39885f808a8fd8b75922b94dc05f67f6d3b86bfe","observation_id":"d8f5341d-b763-4673-bef0-8667d56d22b9","resolution":{"observed_at":"2026-08-07T10:31:55.085846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:55.064386Z","title":null,"venue":null,"work_id":"1b861aad-c149-4c7e-a2ff-289c26998b75","year":2025},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.561031Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:51051e5ac3a37fcdf1a66505430864a30577df42d548996a0ea9c11da39e677d","observation_id":"8bced555-f814-4944-914d-a9153b1f8a7d","resolution":{"observed_at":"2026-08-07T10:31:55.069817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T10:31:54.565468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.565468Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:284f7bad3028df4cd0425ea1b2835520c7a2a248aec9212c1be86f6409bc3391","observation_id":"da06e200-e497-4967-9fdc-13a25827909f","resolution":{"observed_at":"2026-08-07T10:31:54.565468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:55.047411Z","title":null,"venue":null,"work_id":"94503e9b-57db-4c20-a593-1c302321dbdc","year":2024},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.570566Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:60504c4acfe15d19a000326756920e16237fd524b0c7157848238aa80d8be168","observation_id":"35e5b12f-1318-459e-995a-535adbe21f63","resolution":{"observed_at":"2026-08-07T10:31:55.053107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:31:54.575005Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.575005Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:054f030cf37c578e69f4ea47f6b044e80a2eb86cd6da08681ac15780ad5df562","observation_id":"75c367c4-6f58-4df0-8fc7-ab9ba014645c","resolution":{"observed_at":"2026-08-07T10:31:54.575005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:55.031955Z","title":null,"venue":null,"work_id":"fc24951b-f280-45cf-8226-72641116a138","year":1979},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.580279Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:b614e9d9a1d8829dd09147099a67735971c3ad8099de1e0e54097bc925a70874","observation_id":"043b73b8-63ac-4819-8010-b3b72f9d51a1","resolution":{"observed_at":"2026-08-07T10:31:55.036558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:31:54.584906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.584906Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:e4cd8acc2f2ed327e55c655b5bce22aa163882c76e3427437b52ec9c95c411d2","observation_id":"08a0e908-5509-4bdb-885d-04962e1e23d7","resolution":{"observed_at":"2026-08-07T10:31:54.584906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.590438Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.590438Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:baf23f76d7554d761f456d35282027c4172e7f960c7050e6a0e1c9a21577b238","observation_id":"c85c8a38-8cc4-4434-964d-beb7e1f6fc9a","resolution":{"observed_at":"2026-08-07T10:31:54.590438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.594921Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.594921Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:eab9b53caa6a5779a8d940bd281bd6793dac213163fd8168839bf333c43d80e6","observation_id":"1411bdf0-d6ab-4a8f-9155-261076f5ad36","resolution":{"observed_at":"2026-08-07T10:31:54.594921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T10:31:54.599156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.599156Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:189adfbdf06bd879c16d36ba00452f6fdb10caa7b2d7667d58ee3a59b8470532","observation_id":"5cfe1b8f-f9e2-4edc-8849-2b66467e5277","resolution":{"observed_at":"2026-08-07T10:31:54.599156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.992846Z","title":null,"venue":null,"work_id":"ea5947f7-b0f7-452e-b1b3-c8a7eea1a0c1","year":2024},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.603855Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:c72503b64c0e7dd2bc2a808742e3f1049968900816e403e5dced13a88af9e48c","observation_id":"f55ecfef-b332-4b57-bb84-381e851bb831","resolution":{"observed_at":"2026-08-07T10:31:54.998296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.608201Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.608201Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:24760d3d54661653e8e307b134e980df6bc373046059370345000ae3caf309cc","observation_id":"d3438b11-d351-49b1-bb24-5570e39c17f5","resolution":{"observed_at":"2026-08-07T10:31:54.608201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.612813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.612813Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:0d414a412b4e2747a273209cf957570d6f5aa6a88142f36289da5187d3cd3927","observation_id":"d294be5a-72d8-4e99-a28e-75a2f8f1e959","resolution":{"observed_at":"2026-08-07T10:31:54.612813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.618689Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.618689Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:2be321c47214de5e62c1d7d65fbc4111ad4a27efb63baf82f27125544cf28ee4","observation_id":"90f9e6ab-fe22-4fd1-8302-55a5eb06cef1","resolution":{"observed_at":"2026-08-07T10:31:54.618689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.965408Z","title":null,"venue":null,"work_id":"973955d7-35f0-4cb5-af47-861df4cd1e45","year":2022},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.623265Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:da04765a3b4fd1f2a37e8ce0464df16420273749c28c11979537df27a94e903f","observation_id":"156ef62c-5135-4d10-87d7-414d4b2654cb","resolution":{"observed_at":"2026-08-07T10:31:54.970791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.947674Z","title":null,"venue":null,"work_id":"62492bd8-98d4-402a-b0e6-a1f35eb341a2","year":1949},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.627635Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:2b496f647877ea84c4a49c2191e3a768650e0d0896a85abd14094284b3296453","observation_id":"dda6c5df-a67a-4818-a97c-d7e49b525460","resolution":{"observed_at":"2026-08-07T10:31:54.953141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04198","last_updated":"2017-04-13T16:21:18Z","snapshot_observed_at":"2026-07-06T05:37:47.218771Z","submitted_at":"2017-04-13T16:21:18Z","title":"Room for improvement in automatic image description: an error analysis","version":1},"cited_work":{"arxiv_id":"1704.04198","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.04198","snapshot_observed_at":"2026-08-07T10:31:54.728373Z","title":"Room for improvement in automatic image description: an error analysis","venue":"cs.CL","work_id":"af52a6dd-ce48-40da-8b84-b9d281ed9e5f","year":2017},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.632681Z"},"links":{"cited_paper":"/paper/1704.04198","citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:976a11849acb5219ed420dbe09c42b51317451122c28330c8fed5b1a33f41aef","observation_id":"e2624fef-0de2-4ca7-a184-acbb150bed80","resolution":{"observed_at":"2026-08-07T10:31:54.734049Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.inlg-1.45","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.682911Z","title":null,"venue":null,"work_id":"f4e30fd9-65bf-4e09-97cf-b14acf09915d","year":2020},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.637345Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:20faba129e6ae694fdc4e05e7b8c03df0ecb0fbac8a26e6462a171007f77f9b6","observation_id":"19b432ca-5063-4c77-bf13-f61522a6e01d","resolution":{"observed_at":"2026-08-07T10:31:54.688687Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.932484Z","title":null,"venue":null,"work_id":"f79db9b8-9df5-4636-ad38-936fc303fe92","year":2023},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.642016Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:953b731b4c28150c450c81ee56ca20167c9afd5740b669310a221f774a0e9a9c","observation_id":"e185a3f3-63a4-4659-a469-e68948136b7c","resolution":{"observed_at":"2026-08-07T10:31:54.937319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.646925Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.646925Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:533396e21b923f8304882c8c1944dbaf6b2845e42a16d1f8569c9d9627725945","observation_id":"eb84a8ee-9524-4d72-ac2d-5a5add128bff","resolution":{"observed_at":"2026-08-07T10:31:54.646925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:31:54.652219Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:31:54.652219Z"},"links":{"citing_paper":"/paper/2506.05142"},"observation_digest":"sha256:547e88b22e23a2703fea406fd11700836643b5f1c2bd3d087aac1e850beb6343","observation_id":"53314b21-949d-494c-b398-17b19163128d","resolution":{"observed_at":"2026-08-07T10:31:54.652219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05142","last_updated":"2025-06-09T03:37:59Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:39:21.814751Z","submitted_at":"2025-06-05T15:24:33Z","title":"Do Large Language Models Judge Error Severity Like Humans?"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2506.05142."}