{"as_of":"2026-08-20T15:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:958dd0d446509d1b45b42879c8aa4d12b72e46f44fb782768dba6ce9c9f110f2","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T05:41:56.435040Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.29784/citation-record","integrity":"/paper/2606.29784/integrity","json":"/paper/2606.29784/citation-record.json","paper":"/paper/2606.29784"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Nuanced metrics for measuring unintended bias with real data for text classification,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:a4d4d3c7842c451efe5cdcee04e8842d19c6098f8ebed4d3c4835904115a9fa6","observation_id":"8930321a-5022-41e7-a325-c30f7235164f","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Mllm-as-a-judge: Assessing multimodal llm-as-a-judge with vision-language benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:69b2c207e46fd516932239b96f3ee9dda56ded4a13bf89b20231f197be2f97fd","observation_id":"8a62762d-3055-4f84-963e-b4a593dbe85a","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":"2403.04132","doi":"10.1007/s11336-009-9136-x","metadata_source":"pith","pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","venue":"cs.AI","work_id":"a1eb83da-5727-4b63-977f-81c6fdd33936","year":2024},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:5a6a4eaea398780a074c0cc42f27f401fdb8fc7564e496161ffd87a17a1d0b4a","observation_id":"667234eb-960d-40bd-80e8-99a2519905b3","resolution":{"observed_at":"2026-06-30T13:54:44.499146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"A Coefficient of Agreement for Nominal Scales,","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:e7a316e1753cd980f9871f21cdd60d7049f7c48d70b1b1564c881a98289bf5a9","observation_id":"339d2873-2cce-4696-83b0-c60c997ec6bb","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Maximum Likelihood Estimation of Observer Error-Rates Using the EM Algorithm,","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:cde7a643012a4218adee1dc27e37ee8206c5c38d9a072c06a563a1426bb5d931","observation_id":"6e413cf8-56e5-46ce-b2ba-b98c8473f04a","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Maximum likelihood from incomplete data via the EM algorithm,","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:f5edee496321c8cdcd4e918c356182aaccf9bd08b7656a7009e32623a145b64e","observation_id":"b2a1f518-c3fd-40f8-b1f4-28381f220679","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Improving the sensitivity of online controlled ex- periments by utilizing pre-experiment data,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:9458276047696f0b840d7570d184eee7e04629d5145ed3a829590f6b3ae747fd","observation_id":"b2c8a07d-f209-432e-ba50-2f0ce4578ad6","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Measuring Nominal Scale Agreement Among Many Raters,","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:7f8e9e1f17e68bd38d87cbcf2208c5e0bb24617aedbf46db7415ed018fd4c5c7","observation_id":"aedef17a-002e-4a22-a2af-f894a9bc6ec1","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Classification in the presence of label noise: a survey,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:0e9f8f68f41d29036da2c5ed09c8e4906f2ee1e6b6947fea960b244a829935d0","observation_id":"3ffe8712-b068-48be-b53f-1c937d2f0e05","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Realtoxicityprompts: Eval- uating neural toxic degeneration in language models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:01ef3f16872bce9a84d50deb82ac6b4a0bfec5875403abc0a92688d1ed550523","observation_id":"cc39b2e8-1b9d-48b8-b798-e8046b194951","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"(2004).Monte Carlo methods in financial engineering,53: Springer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:479da1963bb263b22bc4ec2c44378b9b7e7028a7154504b0e110e4c1f0487b44","observation_id":"5fc3011a-b3a6-431f-8171-82d740b74be8","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"A survey on llm-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:f0856b187734d93c0d91083ef7ff73760864e03fd82f431da36b7b77ff946056","observation_id":"4b5c7a33-17a8-443c-a34b-f5a29e86fcee","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:9efa4c8cda8e260a373552680e0e73a286e14cd45c4ced630716ee3ba57e9026","observation_id":"e076f9c0-b773-4c49-9a80-f12973768470","resolution":{"observed_at":"2026-06-30T13:54:44.496914Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Agnostic notes on regression adjustments to experimental data: Reexamining Freed- man’s critique,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:b09778232d07d2e034e7a3ddb0e9cb5b60e701a4cae3643dd99f9bd97808a255","observation_id":"4d2f0ddf-7731-46b7-af6a-4c5ababd72d7","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Confident learning: Estimating uncertainty in dataset labels,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:f35ed26c99b94156f731df1951d9644bcae9b4c7623684437d0b332bb0ff0849","observation_id":"5f1d5b3f-3790-4d53-addd-29738465aa68","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:e93e846c14919bb7612b160dc1f0534b273914ac43aacc820b9311a91891489d","observation_id":"b262923b-dbf8-4c97-a316-6bf156b8ba27","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Learning from crowds.,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:a455c890b02af1c5cd94d885b892812fa413f38c72975b263c5b9c3e4ed818f8","observation_id":"3bd3ba48-5f6f-47b1-b61d-22cc1e7950b0","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Learning From Crowds,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:849ff8779771c07ae7c8f9cf3df1b71c15617b8bcda352f9f4ebd6e355c7cbfe","observation_id":"f8ad6d80-83c5-4fda-9d6c-559f1d53613f","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Get another label? improving data quality and data mining using multiple, noisy labelers,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:5a4236faa07e83d2a40df9c79735f1113a0a42741ecb3a85af2c4ce952c48ed7","observation_id":"6af76126-a76e-442a-8375-90db9996c5a1","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Cheap and Fast—But is it Good? Evaluating Non-Expert Annotations for Natural Language Tasks,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:ebb0606086be0ddd3348312d033b6f4925b539dde24808c9622dc2a8beaffb02","observation_id":"362ddcc2-bc21-4bae-8535-cb93b51a882d","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Cheap and fast–but is it good? eval- uating non-expert annotations for natural language tasks,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:a700c8b9c19422a7179881f56c534d948497d339a753e62f8955a092bc6840e7","observation_id":"f9e28ac7-8026-4007-b63c-4f1a3763a9ac","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Exposing flaws of generative model evaluation metrics and their unfair treatment of diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:005956888e33c9b5a2e680b7f260de6e3acd9af24482ca962b912bafaae6bb53","observation_id":"bc6b0f54-30b6-46c8-8725-e0d68b5db499","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:7080248e7bc98b1c3e56b3393ba95fd4974da60d64565677b923765e76c42a3e","observation_id":"00acb5c9-0c8b-4a25-afe5-aee987b96c11","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"An Algorithm for the Validation of Image Segmentation,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:8cfe48950038e20d3f1f640a0dd29981e85d3fc078cedf4832b35b854e3beba5","observation_id":"d977f61b-0acd-4377-94fa-d7616d432a21","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05336","last_updated":"2025-03-13T00:09:08Z","snapshot_observed_at":"2026-08-16T12:52:12.235289Z","submitted_at":"2025-03-07T11:23:48Z","title":"Toward an Evaluation Science for Generative AI Systems","version":3},"cited_work":{"arxiv_id":"2503.05336","doi":"10.48550/arxiv.2503.05336","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05336","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"evaluating student performance","venue":"ArXiv.org","work_id":"794d22ad-94ff-4917-b0a8-2885c9e4a810","year":2025},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"cited_paper":"/paper/2503.05336","citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:63537299c9bdacf4ac2e26c63ae02e55a826ec7e8228f27e68fe0acd35d0643d","observation_id":"6f756615-b9db-4248-ba42-eb1faca750f8","resolution":{"observed_at":"2026-06-30T13:54:44.494494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"The multidimensional wisdom of crowds,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:7572616bf17fab847c1144f65eeea01205e9ab2e97eb4697bc2b80d8ba58b3ac","observation_id":"5e2a9976-fd1c-406e-bd4c-ddf93737fdc5","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Whose Vote Should Count More: Optimal Integration of Labels from Labelers of Unknown Expertise,","venue":null,"work_id":null,"year":2035},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:431a3b3c378b70018d7638270a547d7ec5568a3c68404b87f1c8e52667e75b95","observation_id":"15afc851-9250-4a15-aae7-6f34323a3b7e","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Whose vote should count more: Optimal integration of labels from labelers of unknown expertise,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:7014d62e8b11ecd538968b8726e6cf20176854343db71e6f37dc19e43be87383","observation_id":"4c049112-1f97-4c72-87c5-edcbfaa50f9e","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"On the convergence properties of the EM algorithm,","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:3aa08a02bc096d6bba3dd946d5070cd69e349df3cb7a657c5d637733881140d7","observation_id":"2b9dd796-8d29-4643-af25-f4e809665a0c","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T05:41:56.435040Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T05:41:56.435040Z"},"links":{"citing_paper":"/paper/2606.29784"},"observation_digest":"sha256:0941ac1c221d158d7d78407e14d471dc20cefd12df9b0a28343c29d3b6430eef","observation_id":"e76243c8-4001-472b-b575-1527a56cfeb7","resolution":{"observed_at":"2026-06-30T05:41:56.435040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.29784","last_updated":"2026-06-29T05:04:57Z","latest_version":1,"primary_category":"stat.ME","snapshot_observed_at":"2026-08-14T15:16:35.076323Z","submitted_at":"2026-06-29T05:04:57Z","title":"HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2606.29784."}