{"as_of":"2026-08-05T16:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c986fd1f5353677e17975e7333578e1ee3100169c9fc34ed9754a7468ae13c94","coverage":[{"denominator":220,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T18:35:58.177516Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:08:39.405870Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01168","snapshot_observed_at":"2026-08-01T22:08:39.405870Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15870","last_updated":"2026-07-17T11:34:30Z","snapshot_observed_at":"2026-08-01T22:08:35.591488Z","submitted_at":"2026-07-17T11:34:30Z","title":"How Much Human Label Variation Does Formal Semantic Structure Explain?: Group-Level Effects and Item-Level Ceilings in NLI","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T22:08:39.405870Z"},"links":{"cited_paper":"/paper/2605.01168","citing_paper":"/paper/2607.15870"},"observation_digest":"sha256:bdb6c406c78647d2086c4771868520e2f3ee485c63bc21ccb092357f040a423d","observation_id":"93c846f6-8c33-4485-b814-7638ba7de141","resolution":{"observed_at":"2026-08-01T22:08:39.405870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.01168/citation-record","integrity":"/paper/2605.01168/integrity","json":"/paper/2605.01168/citation-record.json","paper":"/paper/2605.01168"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.494382Z","title":"Attention is All you Need , url =","venue":null,"work_id":"fa4d7178-75f8-4139-9b39-41030a2917db","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:edfbf8cabfdbf63646837c7aa110f4dce805b3d24ee10f8af56850c4ca0ed3c4","observation_id":"4040fad5-9d13-4290-8cbe-1b7979585771","resolution":{"observed_at":"2026-05-25T23:01:20.226579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seventeenth Symposium on Usable Privacy and Security (SOUPS 2021) , pages=","venue":null,"work_id":"a6bc8aae-aa06-4039-87ae-6cea6307bfa1","year":2021},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:157be5496d5ad007927a9a20ce688a4142d34f6120f8055d8236f15f857cba86","observation_id":"c71688ce-0a74-4770-a2b1-ba6da0e174a2","resolution":{"observed_at":"2026-05-25T23:01:20.209942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.124","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stop measuring calibration when humans disagree","venue":null,"work_id":"574f7cd2-9ae8-44b5-a591-bf2140c70120","year":2022},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:505106cb85be4b8573f7f3d20281255366c0cd55018deb04c37381af3af50573","observation_id":"c99b66c2-f1b8-4cda-a55b-c55b54894354","resolution":{"observed_at":"2026-05-09T19:40:40.223394Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T11:49:40.672292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T11:49:40.672292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive psychology , volume=","venue":null,"work_id":"91bbb099-a06b-4c01-b07b-0212fa881add","year":1973},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:7f7643baf778debb7b5ec139f26255e32467fb27c260e21311d2fe51fd01ef5c","observation_id":"7a7adb1e-426e-4e57-a555-6f6ceaacf944","resolution":{"observed_at":"2026-05-25T23:01:20.206084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive development and acquisition of language , pages=","venue":null,"work_id":"352d72d3-f423-4f51-a1f6-463ba452283f","year":1973},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:df368c0cd1f9794ee71e36f10a7aa9b7700b1c26b6799db86683dc6591dea85b","observation_id":"a8ef98cc-28b6-4ef9-8ecf-50bdb4f21128","resolution":{"observed_at":"2026-05-25T23:01:20.213527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Annual review of sociology , volume=","venue":null,"work_id":"1c02bb02-9553-40a7-a15e-d1e87ed6abe4","year":2001},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:e77bd411d95b86be0bbd6caa1f9dc038b39c40a37f5c9410efe91c148f23a0cb","observation_id":"230426ef-67ac-4e3c-ae53-c4beff17b302","resolution":{"observed_at":"2026-05-25T23:01:20.193176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 4: Student Research Workshop) , pages=","venue":null,"work_id":"bfac2a01-1a9e-4148-b18f-93b7019b220c","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:f33fc91fa6b29b6aa3dde716b056023fa9078a1a290d2d7e56e30ffae373a301","observation_id":"42df467b-e3c0-496b-a27e-5ee953c55782","resolution":{"observed_at":"2026-05-25T23:01:20.186096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.240","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Modular pluralism: P luralistic alignment via multi- LLM collaboration","venue":null,"work_id":"29f85f4b-a5f6-4c32-9157-6971d043c259","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:fc2156cc2fb9f7f8b1297d7e514c2a92b4e1d5ea9970221a2a9c1c68922adfb7","observation_id":"f58554b5-1056-4729-8379-81546549b5a0","resolution":{"observed_at":"2026-05-09T19:40:40.215766Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:30.740221+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:30.740221+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mobile DNA , volume=","venue":null,"work_id":"91909208-46d4-4253-9356-94bcfbab6e72","year":2021},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:5c12f383fa606dad8940a2b85c890705ba477b7f8ddb9c617bd9bfe4bbd3b2ce","observation_id":"bac57fa7-6630-4ff3-b168-57852407d056","resolution":{"observed_at":"2026-05-25T23:01:20.172693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13563","last_updated":"2021-09-28T08:55:04Z","snapshot_observed_at":"2026-07-06T11:52:05.458983Z","submitted_at":"2021-09-28T08:55:04Z","title":"Agreeing to Disagree: Annotating Offensive Language Datasets with Annotators' Disagreement","version":1},"cited_work":{"arxiv_id":"2109.13563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.13563","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2109.13563 , year=","venue":null,"work_id":"afacf8e6-668d-4570-95fa-f950f2f203c6","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2109.13563","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:9cf9c25f239eef09bbcf643b18128eb0338ce93dd8f6e4570d639e7350ad2b65","observation_id":"821bf2f4-6e03-4289-8db5-60d26274adc3","resolution":{"observed_at":"2026-05-11T16:11:08.872113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CEUR WORKSHOP PROCEEDINGS , volume=","venue":null,"work_id":"a6fadaeb-84ec-4ee1-b089-0d2f1572122f","year":2019},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:8d98612b633c6412d59388288aa11e721d4e073a25363c7fc4cc84c78fa1f314","observation_id":"67bb24c3-b836-45ee-a8b0-83bcbf89441a","resolution":{"observed_at":"2026-05-25T23:01:20.164528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2a1c1b07-675c-40ab-8a8c-478e02f02684","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:c506f17f0b22aa56c95d4217a1dd7c4e9d722c51709a89052d6d8acb8fa579fe","observation_id":"0d4a6f71-815c-4e2d-a4a3-f860f12908de","resolution":{"observed_at":"2026-05-25T23:01:20.180088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European Conference on Information Retrieval , pages=","venue":null,"work_id":"5c489b2e-819e-480a-9560-043b7d6c6e1c","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:a90a6e338c4fe236ea5ddc26fa451a09ce37c6d217497e7e22337c7104f3a59f","observation_id":"89922f2b-8494-41a8-96fd-8344ee69ea28","resolution":{"observed_at":"2026-05-25T23:01:20.202044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Working Notes of CLEF , year=","venue":null,"work_id":"baf8de22-23ac-4d50-adce-b6cb63995434","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:7296f3b34fd863fd7b8216e91f15815f7d8847f308be6220afa1cb2ea7036a07","observation_id":"e0876879-c7e4-49df-87b5-f9fdfa0c4260","resolution":{"observed_at":"2026-05-25T23:01:20.217604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 3rd Workshop on Perspectivist Approaches to NLP (NLPerspectives)@ LREC-COLING 2024 , pages=","venue":null,"work_id":"e06e9a6e-5b88-4421-bca2-93a4a994eef2","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:fff24843f4a55be0f1a2784536436e7ae44acbec319abbe7f0fa8316a57915dd","observation_id":"fef0a16a-067b-4d69-9b38-fbe5cf7a522d","resolution":{"observed_at":"2026-05-25T23:01:20.235435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 9th ACM Multimedia Systems Conference , pages=","venue":null,"work_id":"1d03c843-2d42-4490-8f15-b3ead1fba0fd","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:d8b4692834fa0d2b94c1f1837e3f8e2834c25c5306558377b2a09233b6ebed33","observation_id":"50023a21-246b-4dce-93cc-d7dc97cb7cd6","resolution":{"observed_at":"2026-05-25T23:01:20.277857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing , volume=","venue":null,"work_id":"d073c1af-5c08-475a-a29a-b697ef18509e","year":2017},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:ecc41d8e9b3eca3e08f583c9401bf79852cb5256a8921d8ea55ffe1c0cd8625b","observation_id":"d4728c83-3dd9-4343-9d9a-fec2686c342c","resolution":{"observed_at":"2026-05-25T23:01:20.358063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Search of Basic Units of Spoken Language , pages=","venue":null,"work_id":"13363060-7074-4631-a1b1-f2323a2b9da8","year":2020},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:04d5eff3d78ecb60177e8905a649f12fef3dd02944850c59379ba66118c48d6f","observation_id":"1f0454a3-fe70-47d5-bb12-c53cf0566c81","resolution":{"observed_at":"2026-05-25T23:06:19.632168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author=","venue":null,"work_id":"632817c2-f343-479c-8d30-4d01d93e2e60","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:1d9b32c3cb0dba4cdb57b8f7d709263ca5ae8b94b93416e50f7fe8af28f614ce","observation_id":"a4697f60-5fd1-49ed-8ca6-7a29ded4513c","resolution":{"observed_at":"2026-05-25T23:06:19.696108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural Computing and Applications , volume=","venue":null,"work_id":"7317ac36-7524-4547-bd3f-402857391db4","year":2020},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:37422b052e1d66c240ac48bc0606ebd2f6db39aa19c952cc7ec3ceab21aef1f9","observation_id":"98a0a5a8-6697-4b47-ae85-cb5005fd2bb0","resolution":{"observed_at":"2026-05-25T23:06:19.639527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of New Music Research , volume=","venue":null,"work_id":"1010a245-5dcd-48f6-8e67-ba41b5340443","year":2019},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:faa096200aeceef33f5a034e16c31960f7321742555f2979d50271429a9a4ba9","observation_id":"0fdaf6f8-dfd5-4096-b444-fb27eb07d5cf","resolution":{"observed_at":"2026-05-25T23:01:20.720552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"5b39bb94-407b-479f-ac7a-669b31e1cd36","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:14d86ddbb9a280b71ca4b018d959c76ea689fd1d6db1c583857eda476e7760c8","observation_id":"f67d1f7a-bdb0-49d8-ae75-aec78b0e28e0","resolution":{"observed_at":"2026-05-25T23:01:20.731546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d0e97af1-5660-4f27-8397-b9e1f8fcaf53","year":2007},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:ac758d53ef83a0f060efc70ee04414108ee849359cd09bd25801aac81fd0dc1e","observation_id":"c36e6b09-99ea-4cde-aa63-e8a6afcf5c9a","resolution":{"observed_at":"2026-05-25T23:01:20.197733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Essentials of language documentation , volume=","venue":null,"work_id":"c6894071-37ce-4a8b-92d8-b58ee222f006","year":2006},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:9a4660619af544010a0e46fb2270f9fda5535c971f8ef15b43223afce62c4a5e","observation_id":"212a94c2-64ec-4c7d-9fae-c57dcef48c15","resolution":{"observed_at":"2026-05-25T23:01:20.739436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computational linguistics , volume=","venue":null,"work_id":"3c479760-1f42-45f8-9f51-fdbc686ee5a4","year":2008},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:8ec0d6810ee9a400ae83f860b5fb49d65ae21c5c800922520e0672d66087e17d","observation_id":"7323b5e2-2adc-40b0-844b-c60feec11fdd","resolution":{"observed_at":"2026-05-25T23:06:19.691340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d17-1204","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Finding Patterns in Noisy Crowds: Regression-based Annotation Aggregation for Crowdsourced Data","venue":null,"work_id":"fcab85c7-0639-4f84-bfea-a8fdc274ad6b","year":2017},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:562c2bdf9ff8cb8e929435a31125639489e77a47931346a21a10a63f3d85c662","observation_id":"f71faaa9-235e-411b-aca2-576c1343db68","resolution":{"observed_at":"2026-05-09T19:40:40.213985Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of The Web Conference 2020 , pages=","venue":null,"work_id":"3e574943-a5dc-4217-9ca3-1d901ce56fae","year":2020},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:de99c11867660b12a13f117a1896f7c613697b979a9355ca7a2a75d29b785094","observation_id":"902f49a8-fa09-425c-83ce-5f4f023b3400","resolution":{"observed_at":"2026-05-25T23:06:19.717616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02368","last_updated":"2024-12-03T10:52:06Z","snapshot_observed_at":"2026-07-06T20:00:52.614478Z","submitted_at":"2024-12-03T10:52:06Z","title":"ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?","version":1},"cited_work":{"arxiv_id":"2412.02368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02368","snapshot_observed_at":"2026-06-30T06:54:20.682844Z","title":"arXiv preprint arXiv:2412.02368 , year=","venue":null,"work_id":"e070508d-e5af-423f-b3b8-692eeadb9ef5","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2412.02368","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:ec779ab8b7e8ed17dd15ad3ffc1c1d5b3f67f73d1210fddfce94ddd5a3f7c96a","observation_id":"79eff9a3-0a08-4a2d-9908-10ce9e71b0e3","resolution":{"observed_at":"2026-05-11T16:11:08.840823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:54.543821Z","title":"2009 IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"0287b3d7-3294-4d36-bdf0-64add6c6c84b","year":2009},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:796d8ee1bf1a79925a54e5dab376bcd2c102cf3da18472eae105a1de58212762","observation_id":"c1ccacc8-fb01-4c11-ad25-4761f57ff9e9","resolution":{"observed_at":"2026-05-25T23:06:19.709624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The state-of-the-art in","venue":null,"work_id":"58721f8f-503d-4be0-831e-80fbff536ca4","year":2018},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:3eba7e492ae40b239eca28229c8200381b62caffea32f089058375f88854ff4f","observation_id":"ecc82332-8535-4d81-99c7-1c0b6921db9a","resolution":{"observed_at":"2026-05-25T23:01:20.688925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Procedia Computer Science , volume=","venue":null,"work_id":"1b4fde9c-f5a6-4214-8004-9806ab429eaa","year":2021},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:96f19283e6faa777ab071b665cb2dff474a5a8924fbadcae857d7e2903992f9b","observation_id":"3106dd56-4522-4f92-b052-bc16dc452b49","resolution":{"observed_at":"2026-05-25T23:01:20.635825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving Label Variation in Scientific Information Extraction via Multi-Task Learning","venue":null,"work_id":"f7a598ad-7ed7-43b9-9b88-1d38709ceba9","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:2fc3a7e58a8105bf4a6c381dc150c4d50b4427ce000b082442b0f99a8049bebc","observation_id":"98dc51f2-8ee1-42e9-9726-e1b4e21b3da6","resolution":{"observed_at":"2026-05-25T23:01:20.643423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Proceedings of the 3rd Workshop on Perspectivist Approaches to NLP (NLPerspectives)@ LREC-COLING 2024 , pages=","venue":null,"work_id":"4bc95299-ebcf-4e69-b70d-3f056e0cff2b","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:5051fc21895c769261d5ee46c8907c650a3f2f1d27fe46292b1aec5df02efaea","observation_id":"d9eae6d9-b37c-4e07-ba96-a37b75614529","resolution":{"observed_at":"2026-05-25T23:01:20.685661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08820","last_updated":"2025-05-28T13:59:23Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:02:42Z","title":"Which Demographics do LLMs Default to During Annotation?","version":3},"cited_work":{"arxiv_id":"2410.08820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.08820","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2410.08820 , year=","venue":null,"work_id":"94bd4d47-21e2-4731-be7f-2d80f70d52bd","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2410.08820","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:49dd3ddc44df137243a617208efb1729a5144a99ff2497b5d67a5bd7821bf540","observation_id":"4795be37-3ac0-489c-ac05-30747bf7cb75","resolution":{"observed_at":"2026-05-11T16:11:08.993072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"0bed6337-cc0a-434f-a270-1a874eda9b7c","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:78891afb440f77b689ecc578f7b5abbc22be58d1b947e7ccbfd7ad9284228070","observation_id":"b0b0edd9-47d0-4e9e-981e-c732861571e8","resolution":{"observed_at":"2026-05-25T23:01:20.691942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13853","last_updated":"2025-02-19T16:18:44Z","snapshot_observed_at":"2026-08-04T17:30:58.776938Z","submitted_at":"2025-02-19T16:18:44Z","title":"Fine-grained Fallacy Detection with Human Label Variation","version":1},"cited_work":{"arxiv_id":"2502.13853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13853","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.13853 , year=","venue":null,"work_id":"21af3c2e-08c1-4e94-b58f-d4be61963d5e","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2502.13853","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:51f3c61972961b8df7cbbb1b955dfe6807e09e652a0696f8162dc4a94fe4c326","observation_id":"79a7bfa4-4b6a-499b-b68f-69da167e298e","resolution":{"observed_at":"2026-05-11T16:11:08.818082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13788","last_updated":"2023-10-27T11:25:00Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:55:34Z","title":"Can Large Language Models Capture Dissenting Human Voices?","version":2},"cited_work":{"arxiv_id":"2305.13788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13788","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.13788 , year=","venue":null,"work_id":"690ab835-fc09-4a2a-a70e-a2b3afac85e2","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2305.13788","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:add69ae5621cfbb1b8d0e3f00248d563265c7ededa735aa148ea667f6e6813c3","observation_id":"d311c6e3-0f33-4056-a6b8-da97bdf74d83","resolution":{"observed_at":"2026-05-11T16:11:08.757356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Third Workshop on Understanding Implicit and Underspecified Language , pages=","venue":null,"work_id":"64910fe0-e8ec-4ef4-b424-bf9df143b4fd","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:293153fcc558d00b99b3a825da2d5e51ecfbc9dc85e2105645b17968c830b54e","observation_id":"edeb581c-9094-4cab-9722-f6b4fdb7f355","resolution":{"observed_at":"2026-05-25T23:06:19.687057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.781208Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"6acafb32-d8dd-4841-b7b7-fdd7a2a82eda","year":2019},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:e12a358daa4aa72a303d524add36246c7e683a035cc9308c0b836851b788a42a","observation_id":"061b7f92-624e-469a-862d-3645a983a948","resolution":{"observed_at":"2026-05-25T23:01:20.315910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"e0b3635b-7734-4c2f-ac55-831d14c1c8cd","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:f2ba4dd41e109b73336f53d0325874762bb2f2e90a518da14ddbaabaecff3419","observation_id":"e0d85500-cfbf-4079-8299-f01b7bab4495","resolution":{"observed_at":"2026-05-25T23:01:20.349967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04085","last_updated":"2024-03-06T22:30:04Z","snapshot_observed_at":"2026-07-06T17:40:41.642236Z","submitted_at":"2024-03-06T22:30:04Z","title":"Don't Blame the Data, Blame the Model: Understanding Noise and Bias When Learning from Subjective Annotations","version":1},"cited_work":{"arxiv_id":"2403.04085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04085","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2403.04085 , year=","venue":null,"work_id":"6e0fce7f-7f3b-4ddd-9cb3-863c1944b5f3","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2403.04085","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:28c89579befa2bcdfa903b93c73ecfd6b02acbbcea880df0f8a1b2b065b09de6","observation_id":"a64d4595-b0b2-45b5-a8c8-750575ab7b0f","resolution":{"observed_at":"2026-05-11T16:11:08.984140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14803","last_updated":"2023-04-28T12:20:35Z","snapshot_observed_at":"2026-08-01T21:08:51.079672Z","submitted_at":"2023-04-28T12:20:35Z","title":"SemEval-2023 Task 11: Learning With Disagreements (LeWiDi)","version":1},"cited_work":{"arxiv_id":"2304.14803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14803","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2304.14803 , year=","venue":null,"work_id":"65947e83-eccc-4bb7-9be2-b99bbd753fcb","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2304.14803","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:bba190e1e031cc9499e60e22d1b7bda3be5926366f983ca5867c224aa06c31ac","observation_id":"7069cacb-1931-4526-bf8b-3feabc0fc00d","resolution":{"observed_at":"2026-05-11T16:11:08.792976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computational Linguistics , volume=","venue":null,"work_id":"568cc399-69c9-4ff0-95c5-d50b69a7ef6a","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:828d9ca00d28c144286408b5cedb796e194d0ffeb5999e4c1c7c99152c9ad332","observation_id":"2e29bcd9-1428-45a8-b6f0-8b0093e16676","resolution":{"observed_at":"2026-05-25T23:01:20.452953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"8eb329fd-5b70-4025-b918-e15fecb2a43f","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:f0b688b1cb6f150639b30ff225aa3dc967a69b436c8cadc81e3e65925066922c","observation_id":"e7f9dbf5-df03-416a-a609-1d4e0de78d60","resolution":{"observed_at":"2026-05-25T23:01:20.506934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computational Linguistics , volume=","venue":null,"work_id":"b7611b00-e4cd-4e57-a2fa-13cb78199f0b","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:86a9c6a5f18d43856343b967243290784d595100cf1bb0d638d4185135c7845b","observation_id":"e98a6fb4-a83c-402a-9952-c29e45ae8a81","resolution":{"observed_at":"2026-05-25T23:06:19.725333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language resources and evaluation , volume=","venue":null,"work_id":"5ddea6e4-9a1e-40ff-8fa5-b1625a9c1bfd","year":2005},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:ed74d345b527f6aaee3941b643b33b5ace6ca62626cd536b3e729c413db9eda3","observation_id":"dbc918ba-b997-462f-879e-4991c192d261","resolution":{"observed_at":"2026-05-25T23:06:19.672620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning with Annotation Noise","venue":null,"work_id":"145b0b53-b92d-49b2-bb1c-a74cd53ea328","year":2009},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:6309879d3147de51123648e27fe453f9d4dee28e86b2f5e66612a0a47ea9a6f4","observation_id":"6f31983c-640c-4563-a82f-1fcce9cfab58","resolution":{"observed_at":"2026-05-25T23:06:19.667728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.505","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NLP ositionality: Characterizing Design Biases of Datasets and Models","venue":null,"work_id":"f08bded6-0cb0-46b0-816a-1b06415ce959","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:448ad0b914d65e0b138d81a419885cef990a97088665b387374855daefe71f75","observation_id":"e32dd7e1-6b80-4763-8d35-396ac5f110a8","resolution":{"observed_at":"2026-05-09T19:40:40.217496Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"2ed27059-9be1-457e-8edf-12f51a10788e","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:62c141cd470fc82de5a085f4dce3e237451edb8ea668918c8eb2d58750f1307f","observation_id":"2bc9f035-de32-4c53-b4c5-a39842938868","resolution":{"observed_at":"2026-05-25T23:06:19.655209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.399","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"L a MP : When Large Language Models Meet Personalization","venue":null,"work_id":"604caff8-4cf0-49ed-ba76-c35136c7b6f0","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:4e9bc3db27670a995f52f902d66932176840e3fe8080e20dfc178c8b4d7c96be","observation_id":"ecec3f8c-7bd3-4535-a938-6af91fef85c7","resolution":{"observed_at":"2026-05-09T19:40:40.219119Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alfonso and Martin, Maite","venue":null,"work_id":"d261f45f-fa37-4102-a992-d390a0db1715","year":2020},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:b793c41b7b874697a262509d11a2add26a7d8d7e242dbbc7a6e9e6cbbb81cfeb","observation_id":"fa3eca97-e4fd-46ff-94f2-68f1c7dc9424","resolution":{"observed_at":"2026-05-25T23:06:19.649368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2301.10684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2301.10684 , year=","venue":null,"work_id":"8905d3df-c69f-4d76-8eac-76e2ac19a3b2","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:3c4480027575aa85f23f2d870e5480d4ac7594d3dbc073db9fb2b659f02e5d52","observation_id":"092257f9-d31c-4503-9ed1-f045cad86f76","resolution":{"observed_at":"2026-05-11T16:11:08.765681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disagreement in Argumentation Annotation","venue":null,"work_id":"40f94332-cfca-473c-a086-343ca4276bd4","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:b8195dca58ebd7949dcb97a8866fa35765d09c893058fc8072c553529b802fe1","observation_id":"05faa2b3-0722-4698-b143-901c2812c05a","resolution":{"observed_at":"2026-05-25T23:01:20.727223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06826","last_updated":"2023-08-28T21:14:35Z","snapshot_observed_at":"2026-07-06T15:41:24.976531Z","submitted_at":"2023-06-12T02:26:00Z","title":"When Do Annotator Demographics Matter? Measuring the Influence of Annotator Demographics with the POPQUORN Dataset","version":2},"cited_work":{"arxiv_id":"2306.06826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.06826","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2306.06826 , year=","venue":null,"work_id":"c52c60fd-a83b-4cb3-8473-05b1437f311e","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2306.06826","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:ee4af55fea9de727f12c1e98ca25e7e2eae6415a959b6d003cae5d005a9838a8","observation_id":"02540f8b-aa42-4c5d-a677-5073e04e0518","resolution":{"observed_at":"2026-05-11T16:11:09.006148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00664","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Victoria and Herrera, Francisco","venue":"Transactions of the Association for Computational Linguistics","work_id":"bb5bfda9-4b77-4c69-9d8c-d8144c3b3afc","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:67ba48c149694e63ebe3b1b420a7151ccd4c75e5de67ff146050862fd1fb7306","observation_id":"711c9314-9f73-4406-9a8a-35a62522dfd3","resolution":{"observed_at":"2026-05-09T19:40:40.210425Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 1st workshop on benchmarking: past, present and future , pages=","venue":null,"work_id":"4ca16522-ad62-4b0c-a762-5624a38979d8","year":2021},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:a36150ccddce7a1d9248b5580e1bdd3eac65e1853d5c99fec02a2e9b541830b8","observation_id":"d51b3aed-5706-4a85-81ff-57822f98fe5d","resolution":{"observed_at":"2026-05-25T23:01:20.735931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sensitivity, Performance, Robustness: Deconstructing the Effect of Sociodemographic Prompting","venue":null,"work_id":"d53db510-6ff3-4708-a772-31e177efebe0","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:7c16c51edf2a974e37ff1cb5f778a35357a3483077b2d8fc1674859cf44899e9","observation_id":"77b89ef4-b76d-425b-9e36-6131721332d9","resolution":{"observed_at":"2026-05-25T23:01:20.716677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.554","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying the persona effect in LLM simulations","venue":null,"work_id":"696fa771-c37f-45d9-b330-5762bd79d06a","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:691d8056fef4a05541935c4e38c90b3be6a40c9c74a18d67631a18235626f65a","observation_id":"758f0ab1-3ddd-4e7a-806a-634784ff45c9","resolution":{"observed_at":"2026-05-09T19:40:40.212155Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:22:49.44581+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:22:49.44581+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:21:43.795800Z","title":"Proceedings of the ACM on Human-Computer Interaction , volume=","venue":null,"work_id":"4a4fa10b-19ab-4f3b-8cf5-d24bb5bbace5","year":2022},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:4752ca3789f9f9cfd6692d719da9c06bbead42b231c4882681be8fd473156835","observation_id":"4b45e202-eca6-40cf-8d05-8b2da0a79aa5","resolution":{"observed_at":"2026-05-25T23:06:19.700654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PloS one , volume=","venue":null,"work_id":"848cba8a-67ca-4d1e-95c3-aba16c302eb2","year":2019},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:f8f4b3375bdc00379ee638e4298e783bc244502a000ec2ecd4269faf83f9d3e5","observation_id":"10a0e9fa-2380-4369-a2cb-11d4301d860e","resolution":{"observed_at":"2026-05-25T23:01:20.713263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of Communication Inquiry , volume=","venue":null,"work_id":"5fc1b084-ce02-484b-acab-2395237bfabe","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:0e210b12932e963b4b47706f2328bbae0c49a1cb8a335dacdfe70635d4970d2e","observation_id":"20e93271-47e7-4aba-b27e-6179cb045f7b","resolution":{"observed_at":"2026-05-25T23:01:20.724144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Ninth International Workshop on Natural Language Processing for Social Media , pages=","venue":null,"work_id":"2057c355-322d-44e2-9fc8-d3c6c24a3057","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:1e713706cdb584cada6ba87ccb5155610773b98a378395e0d18600a196c30b6a","observation_id":"230ebfa3-eeed-404b-9d14-187bfb479880","resolution":{"observed_at":"2026-05-25T23:06:19.721723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Annotating","venue":null,"work_id":"181abfe6-ab6f-4bc5-b3db-d9150abccb77","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:8f8ce1f7373e7f7a20377cb930dd9bd6f7d7a554a62aa0deabc5a4bac75707c3","observation_id":"5a672512-ff5b-4a39-93c4-f510ebf27823","resolution":{"observed_at":"2026-05-25T23:06:19.611498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 7th International Conference on Natural Language and Speech Processing (ICNLSP 2024) , pages=","venue":null,"work_id":"9d354357-34b1-406f-8026-7d9a486ddda5","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:c3a92de9d3faa93106e894637faf87f2040c21a11fdc300d7a85fc9c667bce08","observation_id":"3ffedcd1-f1f8-43a1-a502-ccf0d8aa44f5","resolution":{"observed_at":"2026-05-25T23:01:20.695242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 15th ACM Web Science Conference 2023 , pages=","venue":null,"work_id":"4f9850cc-1d35-477a-9e2a-544d0b029e19","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:f37e9f8c574b20821f2142b613a9b92d95fce504c4f89fa6baa01c13b3c43e04","observation_id":"d6bb5643-e38a-4daa-ac0e-9c911e71e739","resolution":{"observed_at":"2026-05-25T23:01:20.709241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1st Workshop on Perspectivist Approaches to NLP , pages=","venue":null,"work_id":"e8340be3-6b6b-4628-ac35-0049da3fba5f","year":2022},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:9c5c24701984c4aaf0a4c0aec1023cb4c6af08f71318e7dfccfb71e0a889c309","observation_id":"b218f7b7-0812-4447-b54d-8d7e0294d400","resolution":{"observed_at":"2026-05-25T23:01:20.666666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bcdc5724-0311-4ad6-8e21-74ace5827008","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:58b8a7ccc6bee62786ed8d1d95b236dbaef17694fcdfa6ff360f48f987b9f876","observation_id":"62043f19-17fb-48bc-922b-c019423ff1f1","resolution":{"observed_at":"2026-05-25T23:01:20.669731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dialogue & Discourse , volume=","venue":null,"work_id":"a502af67-7751-4e21-b3fb-18e9db2870d9","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:4054e7a1fae39433526d0cd9c4a8a300e962f28272ffa5535dc67e0189bbad4f","observation_id":"99e0877b-5691-4d0f-a93b-6c15f6cd0f89","resolution":{"observed_at":"2026-05-25T23:01:20.675988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploiting ` Subjective ' Annotations","venue":null,"work_id":"0b8fe59f-414c-42fa-b958-c428797e4df2","year":2008},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:054e07f3ecd554dcd5505878e44ba074ce73a199d42282a76908028d3825be8b","observation_id":"3b380d06-56bf-4e93-9de5-cfd7c5f38883","resolution":{"observed_at":"2026-05-25T23:01:20.678850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language Resources and Evaluation , pages=","venue":null,"work_id":"2bb3bdd9-5371-4e09-ba3b-65103585a420","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:f237b28e792740868653d39bbd452836154d1741b415938c2bcd18f117af8aab","observation_id":"22a1ff07-f5c6-47fa-b02b-d3ff05e4616d","resolution":{"observed_at":"2026-05-25T23:01:20.652110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Perspectivist Paradigm Shift: Assumptions and Challenges of Capturing Human Labels","venue":null,"work_id":"586694a0-4784-44bc-8708-6b2cd98a4c35","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:b9e44ff327af3d6547090599c63e6c5033201645d4cba59e59240a6e11d80754","observation_id":"6025bcd7-361b-4dc9-bf9c-5550a28e8615","resolution":{"observed_at":"2026-05-25T23:01:20.659551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of LAW X: The 10th Linguistic Annotation Workshop , pages=","venue":null,"work_id":"8b9cff09-b24e-4a3c-a96c-612225ec6c16","year":2016},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:52b3df3207fcb8767b08598136cadbbdf2215f1511b6369a8c76252bfe8033c8","observation_id":"ffda838c-0053-4a40-a74f-4d6ecf3d4725","resolution":{"observed_at":"2026-05-25T23:01:20.655821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Annotate","venue":null,"work_id":"abaa79e7-6b01-4c02-bd20-86620a697832","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:17da6090e19d4cc2137778a01ffbe414a751cf03146cad16b7ea7c0c76df997d","observation_id":"25ca8f1a-00f5-48fd-991f-8a9d6830080d","resolution":{"observed_at":"2026-05-25T23:01:20.698422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language Resources and Evaluation , volume=","venue":null,"work_id":"4ba78ffa-e744-4f47-a4ee-6850ce095fe5","year":2012},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:ed672e927b90f495e0176c9ba1279090eb1a88f8f401f29528e748fa36c2ccc7","observation_id":"5f7ef0d1-be94-44da-baa5-4443e78cf4e4","resolution":{"observed_at":"2026-05-25T23:01:20.682266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2013 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":"a52a2c08-504a-4d4f-83c3-9c59357886f2","year":2013},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:b2dfe14248e03505013907e2bfeb77f83940668a9908eda8e2355edf0892959d","observation_id":"14bfe11c-d403-40a7-ae2b-a3004a33e3aa","resolution":{"observed_at":"2026-05-25T23:01:20.701668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01423","last_updated":"2024-02-02T14:08:34Z","snapshot_observed_at":"2026-08-05T15:56:03.759100Z","submitted_at":"2024-02-02T14:08:34Z","title":"Different Tastes of Entities: Investigating Human Label Variation in Named Entity Annotations","version":1},"cited_work":{"arxiv_id":"2402.01423","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01423","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2402.01423 , year=","venue":null,"work_id":"838f54a7-fcd9-4322-ad17-6b6688937d03","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"cited_paper":"/paper/2402.01423","citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:4eef2057a3be2b36caac3a575bd992a6146061ecfc2d076a20fcb1d8272031b7","observation_id":"79d8e997-69e9-472f-998b-824f3ca66ea9","resolution":{"observed_at":"2026-05-11T16:11:08.801213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.687","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Architectural Sweet Spots for Modeling Human Label Variation by the Example of Argument Quality: It`s Best to Relate Perspectives!","venue":null,"work_id":"73e20707-cf3d-4e15-a2d0-d98182a4cf99","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:c7b02c2c29e2ed807ccc5a92e3b5888b23e14ed902c8406e47d5501aa26ccd57","observation_id":"b5507d3d-6a4d-4efe-907e-b878ad33653b","resolution":{"observed_at":"2026-05-09T19:40:40.208631Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of Information Processing , volume=","venue":null,"work_id":"61d39d09-9953-4e43-ae88-e0aae07b93ad","year":2017},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:fb97f8a81d449319ffe1ccc7dc377df1a0cca9b2ac92a3f5c7289938ab048853","observation_id":"7c0b641b-ac4d-4599-bd88-12e1e8a6d5d4","resolution":{"observed_at":"2026-05-25T23:01:20.623874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Human Computation and Crowdsourcing , volume=","venue":null,"work_id":"65c4ddaf-57a8-47a9-98fd-8b5c27e5c5c4","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:8df1a675b6c8bd721a8034bba30eaf894678795c8317cd481f7a34d063d285a4","observation_id":"aa45c7ee-25af-4756-8b62-8154508f2eec","resolution":{"observed_at":"2026-05-25T23:01:20.610435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.naacl-main.49","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Importance of Modeling Social Factors of Language: Theory and Practice","venue":null,"work_id":"b61986ee-3c74-4964-bb8c-c337ca75c803","year":2021},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:52ac4ce69f7b0113921f9dc44d8dce3dae93a2dc83ebf77ac36df0882d73d24e","observation_id":"ced4cf50-6975-461e-9573-5edbb534dcf7","resolution":{"observed_at":"2026-05-09T19:40:40.227412Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.alw-1.21","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Identifying and Measuring Annotator Bias Based on Annotators ' Demographic Characteristics","venue":null,"work_id":"bd5fb9aa-0f26-41a3-ae1b-4f5c5622c2a7","year":2020},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:d631920eb5db62607fefb2f2d88ad1ae6266c1a15023833b85dd2906e19e46f9","observation_id":"dabca256-e075-4fd2-90d8-7c82bf3b265b","resolution":{"observed_at":"2026-05-09T19:40:40.221182Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T02:51:37.035415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T02:51:37.035415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Information Processing & Management , volume=","venue":null,"work_id":"94a8423a-a3b8-4cce-a777-77871628efa6","year":2021},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:dd3c77e6ea5aaf7117ec2c7e393045565e849dbc521d26b8ff789f5d0ea4585c","observation_id":"fb7650da-d9e5-4a4d-bcdd-aa57ddcdef72","resolution":{"observed_at":"2026-05-25T23:01:20.614092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"9ca3c3f8-00bb-4498-98dd-af2ff481c865","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:e5f3a34c7f20e4ddca1be538796def48c2882ab2bb18880b248b1500ec7ec003","observation_id":"d074b9c9-89dc-422b-9a20-39922129b0c3","resolution":{"observed_at":"2026-05-25T23:01:20.601155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computational Linguistics , volume=","venue":null,"work_id":"8dce055b-7e76-4ada-bb83-9cdd313ed693","year":2008},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:dc4fb607a6304038963fb9a920fc86c62404e8f0fa623ce568b78dcd96c2ca29","observation_id":"9778caef-3bf8-4298-a2ff-7705a73b7ae6","resolution":{"observed_at":"2026-05-25T23:01:20.597313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Subjective Natural Language Problems: Motivations, Applications, Characterizations, and Implications","venue":null,"work_id":"2065c64a-d089-4f54-a129-80f652b769ea","year":2011},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:1af2a01efb8e0f3570b88c57b8a5c0e98286a8908fe67df4ccb33e1508ba7b9f","observation_id":"1f73d892-8e37-4d53-8647-680a022e1f7b","resolution":{"observed_at":"2026-05-25T23:01:20.605571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Artificial intelligence and law , volume=","venue":null,"work_id":"bc01e042-7a5e-4b05-87e5-ea4f52be32c1","year":2024},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:443934c7a2148fdab8ed6cad0f198a6fced277dda3b459f5000564a70ed88185","observation_id":"500be185-81be-40dc-afaf-373af35b5cdf","resolution":{"observed_at":"2026-05-25T23:01:20.617570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Applied Clinical Informatics , volume=","venue":null,"work_id":"f71db7e9-6549-468e-a364-7f8a276ae99d","year":2021},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:a18585ea3458484ab0a5b227403ba0c694503239a56a24ea1e1a5fb4372118ba","observation_id":"74c5a8e1-7faa-4d2f-a977-ca3124a18a87","resolution":{"observed_at":"2026-05-25T23:01:20.620740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author=","venue":null,"work_id":"db7fa218-30fb-439f-a363-7d2f9197980f","year":2016},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:c12d3490d276faf8351aab9a2ccffccbbf2bfdafd4011ad1be991b620468e4aa","observation_id":"41684f7e-bd17-4e7f-9243-04cc63fa1677","resolution":{"observed_at":"2026-05-25T23:01:20.639674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plos one , volume=","venue":null,"work_id":"cd3fc84d-c13a-4f9b-8c3e-3b482c192fe8","year":2018},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:1f9c81e30311b95fc3fda744f53655060f4bd470b5ab6e6eeaf63ec2e8ecca62","observation_id":"1cbbffb5-055d-4bcb-9669-588792ddc20d","resolution":{"observed_at":"2026-05-25T23:01:20.705334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computational linguistics , volume=","venue":null,"work_id":"d813e1e6-0a95-4534-af70-91a97bff71d7","year":2012},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:79cfa8c8e1257fcdf7541495b9af739668365b0dcbc9361eb2262ac4c267efbd","observation_id":"c8cb3227-08f1-43cb-a78d-daf48614a241","resolution":{"observed_at":"2026-05-25T23:01:20.581380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language resources and evaluation , volume=","venue":null,"work_id":"6617b9b9-518b-4c04-8595-067824af8b25","year":2009},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:9b3018bdbe8babfd0e45ea7c1a2f3339b9a12dfb403ba2cbffc1ad065eaee988","observation_id":"c6198c39-13fa-4d46-a664-872daffb8f3d","resolution":{"observed_at":"2026-05-25T23:01:20.589425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why Don ' t You Do It Right? Analysing Annotators ' Disagreement in Subjective Tasks","venue":null,"work_id":"cc931155-c8ad-477f-baed-4735b70e074f","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:3a2971ebaf6a0248ff30ce0d11c1f156b4b3e21046d3d05c30a1ca0f013122f7","observation_id":"0ced1c8c-c6ad-4e30-acf2-2ae91c07142f","resolution":{"observed_at":"2026-05-25T23:01:20.585740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AI Magazine , volume=","venue":null,"work_id":"19f6b3c1-e966-4712-8ade-ccdd5644e15f","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:80570b645711de3635dcb60f4c977cb3a25d72daa5960bae1671fd30fe9eab8f","observation_id":"29ec9b8e-1863-4a73-81ae-5e9e6d49e926","resolution":{"observed_at":"2026-05-25T23:01:20.648579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Semantic Web","venue":null,"work_id":"5f6e3293-1a15-40f0-9387-c08e3b5ab2f9","year":2015},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:3dcd3fd66cd3028720c388fa2b0694bb4ad8f9ecea8c05f943bd2f6d8f504826","observation_id":"f164d148-04f3-40dd-bc64-4535d4606257","resolution":{"observed_at":"2026-05-25T23:06:19.682956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating Reasons for Disagreement in Natural Language Inference","venue":null,"work_id":"2a81d253-cfe0-4331-89a3-1f2a24e038d1","year":2022},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:f666ad4f92215d27d8a068d5184adefb906e9a598af02a43f08fa765f3585190","observation_id":"de3e7bea-2103-48d0-9231-780c43fe5a50","resolution":{"observed_at":"2026-05-25T23:01:20.397550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , booktitle=","venue":null,"work_id":"1282f41b-8980-454f-b321-7513f5f89d9d","year":2023},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:0258bea50733f27d6c55262965eea10379b6baee78b35372d1cabd8f0bcdfec5","observation_id":"d61525ff-dff1-4832-949f-b3947ba96325","resolution":{"observed_at":"2026-05-25T23:06:19.713967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Would you describe a leopard as yellow? Evaluating crowd-annotations with justified and informative disagreement","venue":null,"work_id":"241cfbd3-1ab4-499f-abb9-a0afa9179d45","year":2020},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:643b0d08d1f79ff0ed0f81cbb125f2cb72da7ce9bfebf70f5040971b5006d128","observation_id":"723106d1-76f5-4304-9b18-a72aab84a15d","resolution":{"observed_at":"2026-05-25T23:06:19.678618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embracing Ambiguity: A Comparison of Annotation Methodologies for Crowdsourcing Word Sense Labels","venue":null,"work_id":"fd3455e2-97c9-444a-b14e-aa17d09798e9","year":2013},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:1e44faf1f830fcd12730658fb21c47f86ee3fbc02a4ff4eeab8e075de18ae8f7","observation_id":"89da5b02-f38d-4ca3-a324-c27423569f59","resolution":{"observed_at":"2026-05-25T23:06:19.705291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Annotating","venue":null,"work_id":"85e4f221-07f3-4aa3-a7a5-b4188a7ad8cc","year":null},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:f812d4b7d2f93ae968974a75bd7c4dddd2192e1c896d10fc6750209b368dc746","observation_id":"77d0a823-7b9f-4069-96bd-2eded1c8e300","resolution":{"observed_at":"2026-05-25T23:06:19.644256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are You a Racist or Am I Seeing Things? Annotator Influence on Hate Speech Detection on T witter","venue":null,"work_id":"a5c5359b-ac11-4743-8faa-97f3618089db","year":2016},"citing_paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-09T18:35:58.177516Z"},"links":{"citing_paper":"/paper/2605.01168"},"observation_digest":"sha256:01d4804fc3a8d2c13a7a1b80a12c82bc28a15bf2a63d5edec02c429dc17e43c2","observation_id":"2442e8d6-e8f5-447c-87ec-704f91c5f149","resolution":{"observed_at":"2026-05-25T23:06:19.729383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.01168","last_updated":"2026-05-01T23:56:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-01T23:56:19Z","title":"Quantifying and Predicting Disagreement in Graded Human Ratings"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":20,"verified_fuzzy":77},"total_outbound_references":220},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 220 outbound references and 1 inbound Pith citation observation for arXiv:2605.01168."}