{"as_of":"2026-08-15T17:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7fb41e344330cac71ef51796d8d5120a795394e457f29cb37ca083c0e1f82967","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:48:03.739749Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29252/citation-record","integrity":"/paper/2607.29252/integrity","json":"/paper/2607.29252/citation-record.json","paper":"/paper/2607.29252"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-03T10:48:03.532338Z","title":"K.; Wei, J.; Hicks, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.532338Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:17bccaac5c591de1237c257b14f49febfc46cfdaeafd0d431b546decfd5b182f","observation_id":"75e759e8-8ff8-421f-900e-ecf1361568cf","resolution":{"observed_at":"2026-08-03T10:48:03.532338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.536911Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.536911Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:f7cccae7508ba50a5bb6b8fb756040e7329a74a7f298dbdff0667e83fc7044cd","observation_id":"ef717ff6-3a70-4a63-b0c5-b1c52925f5f4","resolution":{"observed_at":"2026-08-03T10:48:03.536911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.539794Z","title":null,"venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.539794Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:ccdadf358021a3190059be6e7f695f3820e17974d0fc8bba1842c0c8ef0efd85","observation_id":"9d244ff6-c764-4ef0-b84f-09ce2ca14120","resolution":{"observed_at":"2026-08-03T10:48:03.539794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.542774Z","title":"D.; and Aitkin, M","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.542774Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:0c94a00e39fe07cac0147ba058c980e0b2fd1aa1417ab15e41dcd423c9e3d495","observation_id":"b88f9c7a-6bd0-48c1-9669-a6f0562ae638","resolution":{"observed_at":"2026-08-03T10:48:03.542774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.546132Z","title":"J.; Ashktorab, Z.; Geyer, W.; Li, T.; and Gomez-Zara, D","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.546132Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:489cf95b3c9005d8eee98c92d9ab0cc2cdcf81c41521f045eb29c172fc2e51fc","observation_id":"829101d0-e9cc-4717-810e-ce7667549444","resolution":{"observed_at":"2026-08-03T10:48:03.546132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03608","last_updated":"2024-10-04T17:09:08Z","snapshot_observed_at":"2026-08-13T16:21:44.289832Z","submitted_at":"2024-10-04T17:09:08Z","title":"TICKing All the Boxes: Generated Checklists Improve LLM Evaluation and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03608","snapshot_observed_at":"2026-08-03T10:48:03.548949Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.548949Z"},"links":{"cited_paper":"/paper/2410.03608","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:1743a3c61d7bf991c693c97e88ca2df026d986986069e5b8f7576f441f175581","observation_id":"7dc63dd1-d2d4-4162-867f-2d2b099196d5","resolution":{"observed_at":"2026-08-03T10:48:03.548949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.552272Z","title":"P.; and Skene, A","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.552272Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:006f0115767e759d2b1bb53afcdba5ded36616cc17163b0bf74d37548afe5549","observation_id":"2a4ba9ed-a106-46db-9182-c6ba22703678","resolution":{"observed_at":"2026-08-03T10:48:03.552272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.554924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.554924Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:138ad42164ff6c4f20eddd31a071bf7d58e988335feeb9480ab5575ae5472292","observation_id":"8b33e511-4c66-45e8-9f4e-ca390faba2fb","resolution":{"observed_at":"2026-08-03T10:48:03.554924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.557671Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.557671Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:d88abbe98c4c63bd4d2601086a7b152f2dcd932e68a544ff39c84c1530a10df1","observation_id":"4c421167-75f0-4bce-84dd-6a5c18393115","resolution":{"observed_at":"2026-08-03T10:48:03.557671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.560348Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.560348Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:f44b0332c208f906974dbcde23210b672d386a0f5a3add4666eee6119b9164e1","observation_id":"4eca3c83-8126-4010-b859-ea1a1af66bcf","resolution":{"observed_at":"2026-08-03T10:48:03.560348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.563605Z","title":"P.; Wu, H.; and Yu, H","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.563605Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:6bf56bb456993905f4a2ea77bb61942a7636e54db72f9135227881986939cacb","observation_id":"317f9939-765a-48fe-a500-35bfcbe8bc23","resolution":{"observed_at":"2026-08-03T10:48:03.563605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.566567Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.566567Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:5a92c7cf2c2b99dd1f7042673a1c71ed23fe1fe96971da376456d92def60a5e9","observation_id":"3400470b-e0c1-40a3-805a-d68572e8acdc","resolution":{"observed_at":"2026-08-03T10:48:03.566567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.569453Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.569453Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:c38c3dfd0e9a95f09561bdc10c53f06a9c3a72b30b64cc462e88d06e0a38a3fa","observation_id":"3c2813c0-8094-4d8d-8928-9daf00ad0d3a","resolution":{"observed_at":"2026-08-03T10:48:03.569453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.572106Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.572106Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:c9ba2561aa316957d838533abe9d9f9ecc5f72acc1001db874dc7ccf544f18f8","observation_id":"5c431ee1-3b94-44ce-a028-b28dd581bde3","resolution":{"observed_at":"2026-08-03T10:48:03.572106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.574950Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.574950Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:d470332f3f8a8591c6f470fc6d6b6f469cf168b344287f519592e990e8667a3c","observation_id":"9fe2909b-eb6e-4071-8688-d35e59d492cf","resolution":{"observed_at":"2026-08-03T10:48:03.574950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02368","last_updated":"2026-04-21T02:53:40Z","snapshot_observed_at":"2026-08-14T16:04:28.742412Z","submitted_at":"2026-03-27T11:28:15Z","title":"Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02368","snapshot_observed_at":"2026-08-03T10:48:03.577806Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.577806Z"},"links":{"cited_paper":"/paper/2604.02368","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:1284aff694f1da78ed80270f9ce6601fb6ba14ca851b0125c45991caec0627fb","observation_id":"3a5c0a76-0579-47bb-ac66-2c78c60215e2","resolution":{"observed_at":"2026-08-03T10:48:03.577806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.580895Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.580895Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:b15ec5b6efb2f8bc0628960229f8a8753e773b1d9a622bbd515007bec382024e","observation_id":"5fe5f946-2a63-4620-a5e2-1180b13d4b1e","resolution":{"observed_at":"2026-08-03T10:48:03.580895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.583689Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.583689Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:73bb157288a7687a836c9408d684a1889d3a591d77f77fa32881442cbbe560f4","observation_id":"fa53738f-1647-4bde-9410-1ce7a05057dd","resolution":{"observed_at":"2026-08-03T10:48:03.583689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.12252","last_updated":"2026-07-15T01:47:03Z","snapshot_observed_at":"2026-08-15T06:29:59.077676Z","submitted_at":"2026-07-14T01:31:20Z","title":"FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.12252","snapshot_observed_at":"2026-08-03T10:48:03.586532Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.586532Z"},"links":{"cited_paper":"/paper/2607.12252","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:2259f45407f56a1b1b47551e3d1a0373b48cf83c0dae9404b4f317791f2363b0","observation_id":"40b7bff8-2aa2-4a06-b5be-46f5a3f9164a","resolution":{"observed_at":"2026-08-03T10:48:03.586532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.589599Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.589599Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:7d2c817ef8d6fd6c3247ebe7b95ad5171c1af559149cee730fb0fea10611e5c0","observation_id":"ce8e2457-5ad7-4be1-a64e-f94596cb232c","resolution":{"observed_at":"2026-08-03T10:48:03.589599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.592662Z","title":"L.; Wolsey, L","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.592662Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:f569b928ffcd0c2d7cd0a98b30806c1de8de8b79897e85dc3a87094ec10208e2","observation_id":"1f2579bc-a248-4d2b-a475-458cdb54ec24","resolution":{"observed_at":"2026-08-03T10:48:03.592662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.595812Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.595812Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:814bc77b2230045666ce2faaa2eb7685d9a82edb246af2b5e8e86c519af868c4","observation_id":"6044626b-1752-4649-8662-3adbaa316549","resolution":{"observed_at":"2026-08-03T10:48:03.595812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16191","last_updated":"2024-09-24T15:38:11Z","snapshot_observed_at":"2026-08-12T22:38:31.274535Z","submitted_at":"2024-09-24T15:38:11Z","title":"HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16191","snapshot_observed_at":"2026-08-03T10:48:03.598751Z","title":"M.; Yang, J.; Zhang, G.; Peng, J.; Zhang, Z.; Zhang, S.; and Chen, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.598751Z"},"links":{"cited_paper":"/paper/2409.16191","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:ca03d2a645eb62beda05c01815362610b6a2cc3eed70f4ea62777a8f6f3a19e5","observation_id":"3fef81e1-de4f-40bb-8d71-2efd6f262d58","resolution":{"observed_at":"2026-08-03T10:48:03.598751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.601905Z","title":"M.; Lalor, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.601905Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:44770c94ba219af4e4890ea21cc0298359d229a616697e0394d11239887c35bf","observation_id":"87489607-cd40-440a-9696-09bec5f7650f","resolution":{"observed_at":"2026-08-03T10:48:03.601905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.604789Z","title":null,"venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.604789Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:aeed45bc64bac9f4a50db27d9a09b6e7350ade292d7dbf2471f46cdcbc0fc831","observation_id":"91166cd3-f62b-4843-bdba-bc53ef734097","resolution":{"observed_at":"2026-08-03T10:48:03.604789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.607404Z","title":"J.; and Glas, C","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.607404Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:0e0913c9d6dcab2a36ae3a430e56e5dec3a096f3373d45a4bbe42eef60b9ee96","observation_id":"77301f3a-3727-4868-bfc9-34d863fee224","resolution":{"observed_at":"2026-08-03T10:48:03.607404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.609876Z","title":"M.; Huang, W.; Mungra, D.; Pang, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.609876Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:e636b0c5049d84ea7ad319c661703359ed0c42354505f98400d8b3433b2fd7f1","observation_id":"002c2bad-1e3c-4b19-894f-49decdb0ec5e","resolution":{"observed_at":"2026-08-03T10:48:03.609876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.612369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.612369Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:089db2c927aab4abc0e2a3efe0fbe39680c12813b83867c81f203eb12e2aec8c","observation_id":"252f140d-dc0b-40ef-979c-09c1696f5c61","resolution":{"observed_at":"2026-08-03T10:48:03.612369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.614823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.614823Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:8a6779c8dd991fd4b9193be62edd31d9d7b1eb338eb2741b240f4cc1a886acc8","observation_id":"25de9877-a64b-45b0-85e9-62dbf99be0f0","resolution":{"observed_at":"2026-08-03T10:48:03.614823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30568","last_updated":"2026-05-28T20:59:45Z","snapshot_observed_at":"2026-08-05T07:59:56.379790Z","submitted_at":"2026-05-28T20:59:45Z","title":"Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30568","snapshot_observed_at":"2026-08-03T10:48:03.617339Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.617339Z"},"links":{"cited_paper":"/paper/2605.30568","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:43c0cdf5f3a4cf34cf36ac88bffa00194695b519ef757afec5b16153e0358b64","observation_id":"469f513a-bdb0-44da-be48-9582f28cb620","resolution":{"observed_at":"2026-08-03T10:48:03.617339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.620287Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.620287Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:6be4c90f964a417be65192f00c10dedc0f12591ef2ffaafe7aedc54e01930301","observation_id":"1720b4ae-72b9-4fe6-9669-257ebf22f959","resolution":{"observed_at":"2026-08-03T10:48:03.620287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25240","last_updated":"2026-06-04T00:43:30Z","snapshot_observed_at":"2026-08-13T20:40:49.205215Z","submitted_at":"2026-05-24T19:52:39Z","title":"JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25240","snapshot_observed_at":"2026-08-03T10:48:03.623022Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.623022Z"},"links":{"cited_paper":"/paper/2605.25240","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:9d9715b0173479434e441889275c9d1d6d716e9ccac7813737eea7a1368ce387","observation_id":"5193d62e-be6d-478e-9223-fa5380faf488","resolution":{"observed_at":"2026-08-03T10:48:03.623022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.625909Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.625909Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:7fbca92a83f5824bc1f44ee6db4e5d793969d0ec186e4b5e9849c1f5ffe9291b","observation_id":"00b5f7d9-3125-40c6-9d42-d015320ffdd3","resolution":{"observed_at":"2026-08-03T10:48:03.625909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.628499Z","title":null,"venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.628499Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:7acf1f117bbe23def3c8f71127e9534640f07a53014ab49e629375ebe6a0fa1f","observation_id":"b5da96f2-b5ae-4ab3-8f3e-08fd20e2524b","resolution":{"observed_at":"2026-08-03T10:48:03.628499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.631084Z","title":"Q.; and Artzi, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.631084Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:bbaf60782c19d8aa6b1f1473310ce23a69532605d45ccfe71f75767019ab5a73","observation_id":"93863592-a1d1-41cd-ad0a-be28b77cb3c0","resolution":{"observed_at":"2026-08-03T10:48:03.631084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.633596Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.633596Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:5eb39bc6fac98217171ba58b342cb41bbb679ec9e76665f69bf27b343d66b5e1","observation_id":"fdde5eda-3e79-47b6-b012-1389188ea6d2","resolution":{"observed_at":"2026-08-03T10:48:03.633596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.636537Z","title":"2026 , publisher =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.636537Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:885f69c4f33f3a0a63d7edcd806818dfb9aa5e6bf02005807a58ebfa744b7d1e","observation_id":"df4f022f-b012-4485-b7c6-9cf7474d6399","resolution":{"observed_at":"2026-08-03T10:48:03.636537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03608","last_updated":"2024-10-04T17:09:08Z","snapshot_observed_at":"2026-08-13T16:21:44.289832Z","submitted_at":"2024-10-04T17:09:08Z","title":"TICKing All the Boxes: Generated Checklists Improve LLM Evaluation and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03608","snapshot_observed_at":"2026-08-03T10:48:03.639031Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.639031Z"},"links":{"cited_paper":"/paper/2410.03608","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:fe18268afdf3069982d99b54861ee6771ebad8141b0c53c330d39a96ce4f3536","observation_id":"1d207cd3-136a-4b84-9d9f-135c2a925809","resolution":{"observed_at":"2026-08-03T10:48:03.639031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.143","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages =","venue":null,"work_id":"f8c36f6a-afaa-4c4a-81d1-c27891323df5","year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.641623Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:ddf4f313a9cf8068af7f712ef94aec3055ae6eb9f7eca9d0ca07e0080e7ea228","observation_id":"baf721b7-ad64-45cb-ae47-e1bfbf1ffac3","resolution":{"observed_at":"2026-08-03T10:48:31.408647Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.644114Z","title":"2024 , publisher =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.644114Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:71538944acb69b49774a28c60f659d75accdb5a3c96df22430e8b588653bb673","observation_id":"36a6b3a8-16bf-4345-832e-98e959dcef4c","resolution":{"observed_at":"2026-08-03T10:48:03.644114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.findings-acl.1282","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:30.999102Z","title":"2026 , publisher =","venue":null,"work_id":"03c78d35-75fe-467b-b005-80d1655663d8","year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.646916Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:c2536c2140f4b34400a8075ff63c2026e907dca235af6ed8355c899f01450715","observation_id":"5b44ffc4-c5e9-4788-8889-1bd5c1af7d6e","resolution":{"observed_at":"2026-08-03T10:48:31.062772Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.649555Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.649555Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:9f71105c5ef538c2dbfab90388cec66c5dc677b1181008a4a1373f0301a9d497","observation_id":"0a79f43f-9c32-4f0e-affb-a36614754d4a","resolution":{"observed_at":"2026-08-03T10:48:03.649555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.652206Z","title":"Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing , pages =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.652206Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:a9783a1725ef8c09d08795af5a35a03eb5b32bc404d787fa03523a8dd35d5e1d","observation_id":"1d1d17c6-eefa-4fc8-b8e2-6dcc298a2af1","resolution":{"observed_at":"2026-08-03T10:48:03.652206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.654790Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.654790Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:23b8018e95b06c025fcac666984872d6f251803034c51bdcf73d0d1febb452ee","observation_id":"03f726dc-67ee-4dcf-95f1-69d6d9dc3bac","resolution":{"observed_at":"2026-08-03T10:48:03.654790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.1445","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:30.729605Z","title":"2026 , publisher =","venue":null,"work_id":"0b8f7aa5-3eef-469d-986d-d98301847a0e","year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.657541Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:c96d48bc036c0d66bbd88ff01086af2aa8745714b1d9b94c1145aea126b625bd","observation_id":"cb31c9f8-688e-4f87-9dd3-5ad3ebed8df0","resolution":{"observed_at":"2026-08-03T10:48:30.835414Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.660134Z","title":"2004 , publisher =","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.660134Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:c03c430c196dbf97ab35a7ebc1b128b23e8736037a83d076465db5522e41089a","observation_id":"bdba5bea-7998-47d7-9c53-cde119c73875","resolution":{"observed_at":"2026-08-03T10:48:03.660134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02368","last_updated":"2026-04-21T02:53:40Z","snapshot_observed_at":"2026-08-14T16:04:28.742412Z","submitted_at":"2026-03-27T11:28:15Z","title":"Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02368","snapshot_observed_at":"2026-08-03T10:48:03.662639Z","title":"doi:10.48550/arXiv.2604.02368 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.662639Z"},"links":{"cited_paper":"/paper/2604.02368","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:1c4424d0c3b5c949a12a4924090b6afd5f53943241f4478ab332435ce09c1c91","observation_id":"20965482-de95-4089-b076-e7c6c5e1007a","resolution":{"observed_at":"2026-08-03T10:48:03.662639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.12252","last_updated":"2026-07-15T01:47:03Z","snapshot_observed_at":"2026-08-15T06:29:59.077676Z","submitted_at":"2026-07-14T01:31:20Z","title":"FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality","version":2},"cited_work":{"arxiv_id":"2607.12252","doi":"10.48550/arxiv.2607.12252","metadata_source":"pith","pith_arxiv_id":"2607.12252","snapshot_observed_at":"2026-08-03T12:16:14.848390Z","title":"FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality","venue":"cs.CL","work_id":"506f652c-264a-4a76-98b3-c803213486f4","year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.665912Z"},"links":{"cited_paper":"/paper/2607.12252","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:10a560ee6659a00a60671c501ade9f9473e479c43899fb71ae1e9786c93e9e19","observation_id":"0fb45fc1-202e-410e-ada6-66e1282fb769","resolution":{"observed_at":"2026-08-03T10:48:30.603281Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.669010Z","title":"tinyBenchmarks: Evaluating","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.669010Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:18a401af22c5e5f784cae0d53da7f685611ae0fd50ac5c05a6da2dae7cd28e48","observation_id":"9d5d8e2c-c3b2-46d8-93d5-b33dba27f461","resolution":{"observed_at":"2026-08-03T10:48:03.669010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.671540Z","title":"and Jia, Robin and Boyd-Graber, Jordan , booktitle =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.671540Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:f7702c0fe14e6920ca3ee17448d4f2943e2f5b73c6fb2ae63b2177a1a4d8ebae","observation_id":"be710825-b427-4ebd-9969-a5ee0e308f01","resolution":{"observed_at":"2026-08-03T10:48:03.671540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.674091Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.674091Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:e755711ead1572adb7dc088cf611df711c97985ddccfcefd2bd3fdd77fe38cd0","observation_id":"38d7c741-9467-46aa-b7ee-d5f1f02de8f6","resolution":{"observed_at":"2026-08-03T10:48:03.674091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.676760Z","title":"Frontiers of Computer Science , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.676760Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:2e8268a843aff3b9f5ba85ee2e137b86c2a46290b33fe9e2f1ccfec66116802d","observation_id":"7f606dc4-160c-41db-8fd9-ff74bb110c66","resolution":{"observed_at":"2026-08-03T10:48:03.676760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30568","last_updated":"2026-05-28T20:59:45Z","snapshot_observed_at":"2026-08-05T07:59:56.379790Z","submitted_at":"2026-05-28T20:59:45Z","title":"Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2605.30568","doi":"10.48550/arxiv.2605.30568","metadata_source":"pith","pith_arxiv_id":"2605.30568","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge","venue":"cs.CL","work_id":"1ca11cf3-c5b2-4671-85d5-270c7de64385","year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.679246Z"},"links":{"cited_paper":"/paper/2605.30568","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:e843cfeb4389f2580a287e661f4498333e0c279717940fd3746c0a2822f1fce6","observation_id":"9789c53b-4201-4ec3-8781-69c1b4eda3a9","resolution":{"observed_at":"2026-08-03T10:48:30.420992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.682000Z","title":"Science China Information Sciences , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.682000Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:a17e57e84ad4bef61eecab2e349f13f0a158d6df3e094dd5e06ff6a73af1c2c5","observation_id":"1124fe74-3702-45b2-9a30-d83698f908bf","resolution":{"observed_at":"2026-08-03T10:48:03.682000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.684338Z","title":"2024 , url =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.684338Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:7b77c6297625aca28eacd1fc2e56b26120a2f40fb7ef348749f024d04c5d3a92","observation_id":"acfc22dd-47df-4f27-b67a-063082b6e04b","resolution":{"observed_at":"2026-08-03T10:48:03.684338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.686943Z","title":"and Artzi, Yoav , booktitle =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.686943Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:dd59dbe469844d504a8aaf8ffcc9f58e5c0c06840b52eb82e664ece6dcdc21c5","observation_id":"5f972540-1c47-4676-982f-f504dc0a91ed","resolution":{"observed_at":"2026-08-03T10:48:03.686943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.689578Z","title":"2001 , publisher =","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.689578Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:98fa20a75d6516b287ea309fe07690b35a326cac3a5aa1fa42d7e157eafbcd3c","observation_id":"950e7fe4-8bc8-4750-bd71-b8e064f20456","resolution":{"observed_at":"2026-08-03T10:48:03.689578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.692076Z","title":"1980 , publisher =","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.692076Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:581fbfc2a897926e3442ba4c9875ea4c7af8232f812e551da4c00412bb4ce7ba","observation_id":"2031d595-4aa9-4988-8e3b-2748e1b39d44","resolution":{"observed_at":"2026-08-03T10:48:03.692076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.694501Z","title":"Statistical Theories of Mental Test Scores , pages =","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.694501Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:59ca72c6b72bd35658315e69b03892641f0fcb66c897961f04a00a2817f3ed91","observation_id":"06337101-783e-4b47-82af-acd747fefdc1","resolution":{"observed_at":"2026-08-03T10:48:03.694501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.697007Z","title":"Psychometrika , volume =","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.697007Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:7efb4e085327664c19eee089c7b7120bba116ec80c831f006d494cb461f2a3eb","observation_id":"acbcef2f-1c1b-4bb9-9e1b-35e8eaca78bb","resolution":{"observed_at":"2026-08-03T10:48:03.697007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.699752Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.699752Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:e3822147ba9d4dda7aca38e7374a845c72579cdf44eb157add4a9cb36bc63fcb","observation_id":"7208ec48-8ba6-4ca8-b65a-fe7be2c45dbf","resolution":{"observed_at":"2026-08-03T10:48:03.699752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/0-306-47531-6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2000 , publisher =","venue":null,"work_id":"5e2123b3-eea4-4be6-a4d6-63999564757f","year":2000},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.702311Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:1749714010ceddd17b87ea57d4454a7176ee864455d2085531cdedaf5a3e0b74","observation_id":"68e9a36d-37e2-4d47-b112-e6297c0d37b1","resolution":{"observed_at":"2026-08-03T10:48:30.270191Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.704916Z","title":", journal =","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.704916Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:31ebab84f5915c3715c336fccd0cec92cded812432938fdabdcda4e147341f2a","observation_id":"7e254d65-580d-4a61-8aeb-da72c22cfbfa","resolution":{"observed_at":"2026-08-03T10:48:03.704916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.707438Z","title":"Applied Psychological Measurement , volume =","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.707438Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:59b7ad24d0a3b8ab0223f11c473af087ea93be1e0a19600312a14383115447de","observation_id":"8e0031f7-6580-41f5-9693-05de752fa74f","resolution":{"observed_at":"2026-08-03T10:48:03.707438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.710430Z","title":"2002 , publisher =","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.710430Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:6ef3848815189321ac933ce158ffc2461102f3a46477fa107708a013d5c5cb2d","observation_id":"117ff05b-f76f-4c6e-ac34-762cfa5297c8","resolution":{"observed_at":"2026-08-03T10:48:03.710430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.712940Z","title":"Darrell and Aitkin, Murray , journal =","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.712940Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:f7ad7462e7d7446010471c8adc7ec627fce4a0a664c8eb71941e666c10cf6ad6","observation_id":"11aa5d3d-35be-499c-890f-c39ed08b265d","resolution":{"observed_at":"2026-08-03T10:48:03.712940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1112.5745","last_updated":"2011-12-24T17:53:19Z","snapshot_observed_at":"2026-08-15T04:24:32.276881Z","submitted_at":"2011-12-24T17:53:19Z","title":"Bayesian Active Learning for Classification and Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1112.5745","snapshot_observed_at":"2026-08-03T10:48:03.715474Z","title":"2011 , eprint =","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.715474Z"},"links":{"cited_paper":"/paper/1112.5745","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:1f6b79aeed237017ec8d5d9a2f3334224c490b7f3f32454244b9934fd51d366d","observation_id":"90f151ea-090a-4b72-a431-264dd60fd997","resolution":{"observed_at":"2026-08-03T10:48:03.715474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-03T10:48:03.718279Z","title":"and Wei, Jason and Hicks, Rebecca Soskin and Bowman, Preston and Qui","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.718279Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:d9ee6b563d482e523d629e14e4a71f228f6a813d01b18067b252189e72d75b56","observation_id":"c0ea36d7-dadc-47bc-938c-925fff9ff592","resolution":{"observed_at":"2026-08-03T10:48:03.718279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16191","last_updated":"2024-09-24T15:38:11Z","snapshot_observed_at":"2026-08-12T22:38:31.274535Z","submitted_at":"2024-09-24T15:38:11Z","title":"HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16191","snapshot_observed_at":"2026-08-03T10:48:03.720838Z","title":"doi:10.48550/arXiv.2409.16191 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.720838Z"},"links":{"cited_paper":"/paper/2409.16191","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:26b7a21f338c49f719b246968f117202021134a5cd64087cf2db07e20bd6de7a","observation_id":"de7ea579-3df9-4822-af36-3a7ae9be67e4","resolution":{"observed_at":"2026-08-03T10:48:03.720838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25240","last_updated":"2026-06-04T00:43:30Z","snapshot_observed_at":"2026-08-13T20:40:49.205215Z","submitted_at":"2026-05-24T19:52:39Z","title":"JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment","version":3},"cited_work":{"arxiv_id":"2605.25240","doi":"10.48550/arxiv.2605.25240","metadata_source":"pith","pith_arxiv_id":"2605.25240","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment","venue":"cs.CL","work_id":"67af4f71-c55a-484e-a2cf-003abc36954d","year":2026},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.723888Z"},"links":{"cited_paper":"/paper/2605.25240","citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:7e0879a76735cfed232f9c7e9e0b867bae21141fb4387a6d54ff41e2c3647cad","observation_id":"425b3bf3-3ab0-4e95-93a5-6d2d47ce56aa","resolution":{"observed_at":"2026-08-03T10:48:29.919221Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.726511Z","title":"Mathematical Programming , volume =","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.726511Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:48f08784f77c4e8f783b06790f615eab7a8b977f2d7e7cf8b36d2d04185fce60","observation_id":"d688b950-60db-49c1-83e0-a6a4393ab5d2","resolution":{"observed_at":"2026-08-03T10:48:03.726511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.728944Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.728944Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:94639c786f051fb2e46de4a009a828d6e202ddfd8c713305a4b1586d30997320","observation_id":"0a2328c9-3d34-476e-b743-15706c610301","resolution":{"observed_at":"2026-08-03T10:48:03.728944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.731639Z","title":"2023 , publisher =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.731639Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:3cf4719097bf5fa87a81158aab9c71500afbf7e4d46a7556938c4f969fa25b83","observation_id":"143fd599-0b45-4f5f-ae8e-fc7f70bd2bcc","resolution":{"observed_at":"2026-08-03T10:48:03.731639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.734384Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.734384Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:80edd61891c2a7aeb619f74b8656168cea8815266fdfb51119f4a4d79ec9d1c7","observation_id":"76b1595b-6b4b-42ef-b64a-c7fcce486b0c","resolution":{"observed_at":"2026-08-03T10:48:03.734384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.808","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025 , publisher =","venue":null,"work_id":"916e0e06-50bc-4cad-bcab-7f930c0ed3f1","year":2025},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.737088Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:fb5ac7cf6cc9c520adb7603262ddcd645f7883c6fd9130edf6d889b6a1dc11bd","observation_id":"87dad149-0542-46e5-ab73-e59e41ac137c","resolution":{"observed_at":"2026-08-03T10:48:29.621429Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:48:03.739749Z","title":"Educational and Psychological Measurement , volume =","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-03T10:48:03.739749Z"},"links":{"citing_paper":"/paper/2607.29252"},"observation_digest":"sha256:70364e4bf33c46c2cf96857827ee9c3d452f587cf87268d2d7e194a0028cf9b5","observation_id":"d8fc1130-a03a-443e-957f-a461d19f1ac2","resolution":{"observed_at":"2026-08-03T10:48:03.739749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.29252","last_updated":"2026-07-31T10:21:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T03:23:45.914339Z","submitted_at":"2026-07-31T10:21:56Z","title":"CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":68,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2607.29252."}