{"as_of":"2026-08-09T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ca80c256c386d68d5c25694fa6cc40bdfac370cbebbf90583b7c2f431b10429","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:45:46.434071Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.04997/citation-record","integrity":"/paper/2502.04997/integrity","json":"/paper/2502.04997/citation-record.json","paper":"/paper/2502.04997"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.245898Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.245898Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:0daebcde040d6d799ea46b7a29a83637056c64ea10c85651233527876004fb34","observation_id":"4483f975-684c-4823-a6f1-580ead32d782","resolution":{"observed_at":"2026-08-08T20:45:46.245898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.251217Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.251217Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:0cca930ee9b07fabfdec0d71bd1df743f155e25417105d589f0a12c704bfb7bd","observation_id":"a1da4f4e-ef0a-4d90-8a36-63ef976f40ad","resolution":{"observed_at":"2026-08-08T20:45:46.251217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.135490Z","title":null,"venue":null,"work_id":"76055ff8-ccb7-4126-b735-8ca3e9438642","year":2022},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.255883Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:f0d5d2e8e7e413e37a224c3f65b79e7af530dd547f4e1de8b66d8f462ee21fa9","observation_id":"93990ef9-6206-4c1d-9299-5ab10a4df999","resolution":{"observed_at":"2026-08-08T20:45:47.140190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.122646Z","title":null,"venue":null,"work_id":"4c5da730-0671-4cb5-8538-ac05d1769550","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.260470Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:a9e568d2d15e2e6992cb4b17516b9fa5d1c7cd6838692e34d30b2d4a288414da","observation_id":"0f59a00b-bb6a-4a42-b6cc-1335c515cae0","resolution":{"observed_at":"2026-08-08T20:45:47.126706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18403","last_updated":"2025-06-02T11:31:19Z","snapshot_observed_at":"2026-07-06T18:37:21.973331Z","submitted_at":"2024-06-26T14:56:13Z","title":"LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18403","snapshot_observed_at":"2026-08-08T20:45:46.264867Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.264867Z"},"links":{"cited_paper":"/paper/2406.18403","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:5bd60cfa45caf3f50f5f398da75feb416f3c434b815c32f33dfbfa777d1a212f","observation_id":"d9f24b30-7e2e-45d4-8b78-2e170cd8f140","resolution":{"observed_at":"2026-08-08T20:45:46.264867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T20:45:46.269564Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.269564Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:bbe28ff788fd270f449a3ea5036db0436bf995f4009d55be06d165657e4d3739","observation_id":"2e6a1d5a-7e15-4314-908e-6217626a7550","resolution":{"observed_at":"2026-08-08T20:45:46.269564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.109622Z","title":null,"venue":null,"work_id":"7614b1e9-2edd-4eee-898d-19a34c9246b0","year":2018},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.274492Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:1a2fdd26a7e316002b52d4e9bb08674d799bed43afeae3eaec983900d4bb05d0","observation_id":"d141ca34-f822-48da-8bea-8b7a98572119","resolution":{"observed_at":"2026-08-08T20:45:47.113710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.278677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.278677Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:a4ac714a895e56f1ca6ff8a12a7368bcf9a06acecb87315e76c03611d8479c4b","observation_id":"fbff8ad6-8164-4a0c-857f-3db836924bc3","resolution":{"observed_at":"2026-08-08T20:45:46.278677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T20:45:46.283385Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.283385Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:0faebd304c8754e1c9443046301106e4a81b0986aa2caa2fe8f431ebeeae8570","observation_id":"622ef66a-81aa-4255-bf52-020aafbd6f7a","resolution":{"observed_at":"2026-08-08T20:45:46.283385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.287833Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.287833Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:0130f7f100bc1759a21bf1484d0e6d4fb6a09eb6d4ef4148df18d1107dc82bfb","observation_id":"90649c17-889e-47d0-b6c5-4760afbe896e","resolution":{"observed_at":"2026-08-08T20:45:46.287833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T20:45:46.292008Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.292008Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:6f12506b0842d1ad6f7ec6ecae03a8fc8c9da2158102b57dcaa1086c708b4e56","observation_id":"254441ba-aa16-4be5-9dac-dd0bdcad13f0","resolution":{"observed_at":"2026-08-08T20:45:46.292008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.095193Z","title":"Clarke, Gianluca Demartini, Matthias Hagen, Claudia Hauff, Noriko Kando, Evangelos Kanoulas, Martin Potthast, Benno Stein, and Henning Wachsmuth","venue":null,"work_id":"cce32e23-ea24-497a-8016-fdacfa02095f","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.296642Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:86c61d38bf5cb3627dd5162e59710b2783db673ee7f26197d2adde5794c81866","observation_id":"5aa9b96f-c02a-4d9e-a43a-ab4988b7f0ff","resolution":{"observed_at":"2026-08-08T20:45:47.100523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.300819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.300819Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:6bfa38b03898b5338edd7b384f9fb919d23d876966a34a2a49e58d0f324fa98d","observation_id":"86ab0998-45d3-4b91-a598-1b287848c2a9","resolution":{"observed_at":"2026-08-08T20:45:46.300819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.304959Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.304959Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:25a66aacbbec3b00a65b1811a44efd291e1c06d0687d1b597c5836eefc3f3351","observation_id":"cf4e09c5-8204-4563-add3-4cc4a5f5c0bb","resolution":{"observed_at":"2026-08-08T20:45:46.304959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.081431Z","title":null,"venue":null,"work_id":"edbcb404-68c7-4489-a96d-834fd72e17a5","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.309139Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:fc19962f4c997a80bc7e951ccd906e7f51ef1e31e80363a6e478987fab1f89a6","observation_id":"99d68814-44f6-464a-aeb0-a2aff91eade3","resolution":{"observed_at":"2026-08-08T20:45:47.085821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.313150Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.313150Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:f20028a7c5bd1b347b8c496804edc2b2d3c0fda9d966478b981a9a7cd1a1b046","observation_id":"f06b3004-d2b2-4e73-8dd0-1c7123850d1a","resolution":{"observed_at":"2026-08-08T20:45:46.313150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.317112Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.317112Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:8f095c13388d5e43f3aafe5cf70207a99bd72f3230512a9c776264b01350feb8","observation_id":"a71a05ad-45d4-480d-9d0d-c68b76c11208","resolution":{"observed_at":"2026-08-08T20:45:46.317112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.058352Z","title":null,"venue":null,"work_id":"c77289ae-858f-4504-8c05-611e50799797","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.321106Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:ac8bf4a0918cfd5a3e2d4e7cffe851bb81f3ff3e35410d9a451e63ec9a68360f","observation_id":"82745105-bcef-4e67-97a7-f12fc685acbb","resolution":{"observed_at":"2026-08-08T20:45:47.062614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.045348Z","title":null,"venue":null,"work_id":"92c68fd5-a82b-4787-ac1c-8764c772dde2","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.325123Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:d03fab06dd7298732b1f19863c916a7c1818fb9cb1429c758a0310bbfbd86c49","observation_id":"a338e2ff-0fb5-421f-8db3-b07b930aa97e","resolution":{"observed_at":"2026-08-08T20:45:47.049538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.031993Z","title":null,"venue":null,"work_id":"39e35596-5b58-45b4-b0f3-50a04f3ba811","year":1970},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.329412Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:a2a3e6a426b99ce637570059a345e54464bf5fbd674c1c257e95d961e8ac463b","observation_id":"82cff5a0-1a12-4155-b359-df1a249e99cb","resolution":{"observed_at":"2026-08-08T20:45:47.036428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.018238Z","title":null,"venue":null,"work_id":"dcb4c23f-9243-4258-be78-a7501e029961","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.333419Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:0b16165606f8e6813ee40cedafe3fe49ab246b4ccf16c47dcb361accfb95c861","observation_id":"f4dff6d2-90ac-417d-aac5-4378cb9e6f98","resolution":{"observed_at":"2026-08-08T20:45:47.022738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.337470Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.337470Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:4402925da3eabdd2b2e84a5616f4949d285389d145472dfded28aca6d98fee26","observation_id":"d8cd5b4c-db56-4737-9dd3-7c9460c3acd8","resolution":{"observed_at":"2026-08-08T20:45:46.337470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:47.004238Z","title":"Jackson and Samuel Messick","venue":null,"work_id":"94bad356-eefc-4edc-8b50-169e7fc3accb","year":1958},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.341626Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:b4b3d1503184cdd920950dc9c38080b438c4625913da6613e207573b0315c125","observation_id":"52fe548e-7fff-4ad9-8c59-fea8efc72f2b","resolution":{"observed_at":"2026-08-08T20:45:47.008645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-08T20:45:46.345893Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.345893Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:fc91db061a78ab11cab48d6680dcd02bf9dd3692c8b709658340284e8143b905","observation_id":"f3fca404-8e47-4d62-b12a-8392ce254678","resolution":{"observed_at":"2026-08-08T20:45:46.345893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.350732Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.350732Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:819379e24f160d1d5ea7e6212a74742461ca6f5d01f4a074de69622736c74126","observation_id":"a1919819-2f27-428a-8ac0-b4e7979c6ef1","resolution":{"observed_at":"2026-08-08T20:45:46.350732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.354777Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.354777Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:2a805923babe62034830dd1cafda1b8d6de255333e16f3a17e912c57009624b1","observation_id":"3feaad36-890d-4b79-ba74-fe87121fbcc3","resolution":{"observed_at":"2026-08-08T20:45:46.354777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03025","last_updated":"2022-04-06T18:17:09Z","snapshot_observed_at":"2026-08-05T03:06:12.951600Z","submitted_at":"2022-04-06T18:17:09Z","title":"Using Interactive Feedback to Improve the Accuracy and Explainability of Question Answering Systems Post-Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03025","snapshot_observed_at":"2026-08-08T20:45:46.358882Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.358882Z"},"links":{"cited_paper":"/paper/2204.03025","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:5f196e0973bb4e4074f2692b55ff509df74cacff6f0c4abbb79213c305e5f34f","observation_id":"388a265d-6e1e-4e32-98a7-d39cfb7941f4","resolution":{"observed_at":"2026-08-08T20:45:46.358882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.364356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.364356Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:f4dcbd9d8ae142368c1f4bfd1974731ad1cd0dbf1f931958381155b826e89aea","observation_id":"35cb33a1-32a8-4b63-bb6c-cd9e976f61eb","resolution":{"observed_at":"2026-08-08T20:45:46.364356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.982113Z","title":null,"venue":null,"work_id":"d83a9c58-0e70-4539-a968-158583dd97cb","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.368610Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:922743a1a294fe1fa7d60d713b9be646284f1b2eb3f52c3ec90b6dbf5d7c037e","observation_id":"12311ef5-463a-4ee5-bac2-c3cc8ca55ef1","resolution":{"observed_at":"2026-08-08T20:45:46.986303Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/b978-0-12-590241-0.50006-x","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.499004Z","title":null,"venue":null,"work_id":"c6a6f26a-5105-4408-a8ad-8061e70904ba","year":1991},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.372947Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:e37349ad9d7b85b126f892d9d5ea160c1e669c4ba00a0e703b0da5e59f3fde43","observation_id":"cdd79145-d381-4534-806d-679522d6871b","resolution":{"observed_at":"2026-08-08T20:45:46.503759Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.968891Z","title":null,"venue":null,"work_id":"a2f6e5f9-4496-4cdc-964d-e7deb3641417","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.377307Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:ff81b55e743278f8c4f08d1b4d531bd19f77e42f250f7111710585ef2d86fcb5","observation_id":"05435747-f404-4008-a800-993c5aaf28ba","resolution":{"observed_at":"2026-08-08T20:45:46.973000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.381451Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.381451Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:70f8b50c9a713a3773968ce42679f05e72188153a0c39bb48dc97b5dfc069bfb","observation_id":"eedd96ea-abe7-4b26-8ace-32fac4e5a6fd","resolution":{"observed_at":"2026-08-08T20:45:46.381451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11336-015-9458-9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.474031Z","title":"Schoonees, Michel Van de Velden, and Patrick J","venue":null,"work_id":"058406cb-02a6-4911-b0e7-3c2b89293a42","year":2015},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.385722Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:36dbd5de77f1de7bea1d9be962274c829332531838531c0d7454e938d10afb63","observation_id":"86c3da3e-3219-4f24-99df-5cbc9e41eda6","resolution":{"observed_at":"2026-08-08T20:45:46.480160Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.389924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.389924Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:44e04a34e528cb1d14dc980a1f14388d770030a743764b1c4bd671a4a33c0f25","observation_id":"1c9658af-d635-4474-8a35-a7f2fb7d51a3","resolution":{"observed_at":"2026-08-08T20:45:46.389924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06588","last_updated":"2023-04-13T14:51:40Z","snapshot_observed_at":"2026-08-08T00:45:12.774951Z","submitted_at":"2023-04-13T14:51:40Z","title":"ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06588","snapshot_observed_at":"2026-08-08T20:45:46.394502Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.394502Z"},"links":{"cited_paper":"/paper/2304.06588","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:2346b4d22dcb32e1b01de49bafa248c116a8dfe2f03361cc21a607997703143e","observation_id":"10260a13-2b83-484f-a1f7-109376bdedc8","resolution":{"observed_at":"2026-08-08T20:45:46.394502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2061896","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.795110Z","title":null,"venue":null,"work_id":"dd5ec9e0-40ad-4a66-bd62-284d7cec5b73","year":2010},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.399414Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:83b21a4e86d7bc753427abd17f40ba6bf9c0eba3ad01371c10463490fc8ca980","observation_id":"70b19d40-96e2-4285-b35c-c635bd64dbc0","resolution":{"observed_at":"2026-08-08T20:45:46.803135Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-08T20:45:46.404348Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.404348Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:b2a3f30a576329e405dfc1034dbbf96096e1c06eda196cfb98c7bf93ab533250","observation_id":"e4d132d8-f832-42b3-a66b-1aa75b111845","resolution":{"observed_at":"2026-08-08T20:45:46.404348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-08T03:32:23.667881Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-08T20:45:46.408949Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.408949Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:70663fccc0d305b47152d47e811c377d70b71e638ef3960dff6825f4bbfc67ab","observation_id":"096b69a6-1795-4ca5-990c-0896087c9502","resolution":{"observed_at":"2026-08-08T20:45:46.408949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03025","last_updated":"2023-11-12T06:25:32Z","snapshot_observed_at":"2026-08-09T07:53:52.799976Z","submitted_at":"2023-07-06T14:42:01Z","title":"Style Over Substance: Evaluation Biases for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03025","snapshot_observed_at":"2026-08-08T20:45:46.413279Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.413279Z"},"links":{"cited_paper":"/paper/2307.03025","citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:f37bc883ed66a2efa486fe5e15d3fd25d14b2a5ad69a6893910d9a7936d2a93e","observation_id":"ac8ee51a-41a3-4b1b-87e6-4d869c392b52","resolution":{"observed_at":"2026-08-08T20:45:46.413279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.417726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.417726Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:00ac6ec8b3789877fbc0839064856ac5748632fb558a4ab4e55ee05a8d26af59","observation_id":"ad7cfba8-1b75-4f1e-ae68-23e7c00c00c7","resolution":{"observed_at":"2026-08-08T20:45:46.417726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.947263Z","title":null,"venue":null,"work_id":"aa81ea29-68f6-4caa-8540-327a58c8488c","year":2021},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.421751Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:451acfdd76d85a31edb0530b70be608cd1d7c4d5df62e0611968407332f2e16f","observation_id":"bb051c28-8f83-4cc8-91e0-e0f03f417a23","resolution":{"observed_at":"2026-08-08T20:45:46.951570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.933939Z","title":null,"venue":null,"work_id":"fc80eb2d-2db9-4b96-aa1b-0346822d9b6c","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.425747Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:811c503c7b3adec7d010436cbe262d5e797a4718acbe4f6fdb8b681b4d0fddd6","observation_id":"23dc06c6-6fbc-4fc7-b80f-0b99b109b789","resolution":{"observed_at":"2026-08-08T20:45:46.938246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.920884Z","title":null,"venue":null,"work_id":"2fbe7fe7-7191-4c78-b1c0-8930dcb5c5ff","year":2023},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.429744Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:8626c35ff20eefccee70806af7dff1a7e2c69061d8861a567e24ee035f18051b","observation_id":"2566f1ff-3245-4fa0-a4d9-18fb10246fed","resolution":{"observed_at":"2026-08-08T20:45:46.925107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:45:46.907651Z","title":null,"venue":null,"work_id":"199b1f5d-e3fc-4584-91d5-5f156fee0ff2","year":2024},"citing_paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T20:45:46.434071Z"},"links":{"citing_paper":"/paper/2502.04997"},"observation_digest":"sha256:10eebb4e38b95fd4ccb1132ef1447219036eb994e4d4b0f24633a44f9f2c5b27","observation_id":"9632e177-9f44-490e-ad70-27ea20562360","resolution":{"observed_at":"2026-08-08T20:45:46.911916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.04997","last_updated":"2025-02-07T15:19:40Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T20:38:01.831053Z","submitted_at":"2025-02-07T15:19:40Z","title":"Aligning Black-box Language Models with Human Judgments"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":3,"verified_fuzzy":2},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2502.04997."}