{"as_of":"2026-08-12T10:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5908b79529bcb04bb8a367ee366d9032277c134d56d4d3a81f35b26cd77b125","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:28:11.576647Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.03968/citation-record","integrity":"/paper/2606.03968/integrity","json":"/paper/2606.03968/citation-record.json","paper":"/paper/2606.03968"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":"2212.10560","doi":"10.1145/3209978.3210080","metadata_source":"pith","pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","venue":"cs.CL","work_id":"d0018767-775d-406e-861d-539ed681ff73","year":2022},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:5977a7b7b6356316c4bb6a3dfe7804b5615c3a1a3b8f1c1f2fc84dd365e37f23","observation_id":"06d64da3-bd7a-49dd-9064-a0825d78fbf1","resolution":{"observed_at":"2026-07-02T02:56:29.407739Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T23:23:20.678+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T23:23:20.678+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:33420b0d37a0a12e92d05d41a5d545015161b4bd149fa18462f2dd76bfe9d0d7","observation_id":"1716ce42-1bf3-406e-a2cd-2d01322f88d6","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:81bff54925ae2247b4b042050d9d38c2570637cd57d3bef6cf7bbf094df512bf","observation_id":"37f333f5-0407-41ee-a54f-6d43a16a88da","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:16fd05312089ee886faf47f591fb082ff492ba93780c5cc740c2f270cc7fb056","observation_id":"af7c8c2d-5bbc-4808-a35f-35a2738226e8","resolution":{"observed_at":"2026-07-02T02:56:29.413226Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:35f849933d1a230f29acb370bde6956023a59453c55b9ecd4f25c4f005c2d531","observation_id":"b3c776b5-2423-4a83-803b-efefa4a9e408","resolution":{"observed_at":"2026-07-02T02:56:29.417054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"Second Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:5b237cf1c92ceef99b2472abdeb5d9d71195f2b6d08853238b60df6c515f23dc","observation_id":"361e35a6-76c6-4167-a131-8413bd593bfa","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:1e0a665946a3c211c6e6127d930035b5a5f5559ba19ebe8fa55e00dc0c5caf04","observation_id":"79f3e6e2-4947-4c79-ab49-9f8c40782f61","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:d8f77127a40381b22238317024df8675682cfcb21544b0898837ecdfb61054ff","observation_id":"cb44c6b8-65bb-4795-92cd-5d4970eb5e1d","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:050428e0a486c82f0cc1c1b4706a1b78cfc4f2337df1fa98b06b78d0b25306d4","observation_id":"6be73878-8eb7-47d1-839e-507213c340db","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:af620ba875e5cd4691adefa3cc97f628473e779e2f66e7e4d514faa01f8da6ac","observation_id":"f9f9bb86-de55-4c3e-805e-16391d0b0cab","resolution":{"observed_at":"2026-07-02T02:56:29.423384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"Checklists are all you need for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:32c2f06f77f21b4e140c38f20c1a5deed491629190ebe76bba252def12086e9a","observation_id":"557975b2-33c5-405b-a94d-823510a624ff","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:317b044b7ea062bf6784f68cc9b127c82125e9ca96fa49eec1454c8d6289aaa1","observation_id":"375ee9a9-407d-4655-92f9-0283bf0639a5","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:55dbfb5353ce1bbdf97e431b006d2e73f3c0ff0c082db73ee65c9f9d3a36bafa","observation_id":"1de58dc7-da81-4603-a0af-700c7462b0b7","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:8a2b6e157bf6a5d2b97d29beb8c3ab6fd6f4d04b24098c948c6eb4bef514781a","observation_id":"9a6ef9e6-4412-4c3a-ba52-1a00b620f58a","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:5914dff9205984b88d4c51fd59fdd1e5963a8beea431325d015f38eca9cbec3c","observation_id":"8db1ffa3-97ca-49c9-830e-cf89db5f2efa","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"and Zhang, Hao and Gonzalez, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:17712e8ac962b6377b4d61065ddf3c0b34b7f4394cf479f9f4a9072671577f1a","observation_id":"77a147c3-cdc9-443b-b808-b9c58c7debc3","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:716da124682bd664ce759658503b8508e2a70b7fc0c4891607d209d1461e41b7","observation_id":"3005972c-2ee8-4876-a2ec-de3ef1e28791","resolution":{"observed_at":"2026-07-02T02:56:29.404464Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"From Crowdsourced Data to High-quality Benchmarks: Arena-Hard and Benchbuilder Pipeline , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:ba29b94af9bf197553d5d3697dba369a2e3a798d1bb0cffd6e793838e74cf834","observation_id":"bfebfb3f-65eb-422b-9473-e482fd423210","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:f86e966937a7a2b0fcc10d95f04f7529ccb5830a6013508d089ba2d382e50cf2","observation_id":"ae075f8b-dcae-4153-acc8-cbc07af988fe","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:e48bb4eb81f6b1c72adf673aae01a64425580cd02dbb75c9115d677205137afa","observation_id":"defb8d7d-7c9f-40ea-b8bc-a42460128445","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:5c28c4027358fec03c8611e8a7c67905af4696101456678332ed9d4d95fac39d","observation_id":"f13fc7cc-bf9c-4998-ada8-a5ee7475cc45","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:37a8a7531bd43a28c8a929a265995249d5d31a898e9945e801391e6611f3722a","observation_id":"e05bda4c-243e-49f8-b770-889b56c29157","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:e53204ee8946cf438c5fac54630ed327909637cc831178459da4f45f8df85b75","observation_id":"68952e38-7fed-482b-8b85-d701a435c86b","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:7a4155c254d9ccc1ddefbddcf76807bfb4597653fae881f743043800b579e913","observation_id":"e03ad516-79e5-40c6-a69e-d91b10e54d9e","resolution":{"observed_at":"2026-07-02T02:56:29.403298Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:ce2e1c48bfefd8f6de298924136b8b463c3d64b1fe5304006dc654483b4f275b","observation_id":"9e23ad2a-db1b-40c1-8592-d98a5c50d125","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:b1f23734ccb5f181116b469617b19a3c0c31c495a68e84ae2883f1138bb0b33b","observation_id":"5831c2cd-7e30-440e-b2f7-c23843efaa8d","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:601f80f74dc9fcbea052c16dae411a28d401e0705e95bdbcfc0abf5f6516f5b3","observation_id":"d2b80d79-bb41-4bf3-a99d-8bf89116c5b8","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16949","last_updated":"2026-08-01T14:42:28Z","snapshot_observed_at":"2026-08-06T23:10:34.815079Z","submitted_at":"2025-08-23T08:47:31Z","title":"Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning","version":7},"cited_work":{"arxiv_id":"2508.16949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16949","snapshot_observed_at":"2026-08-04T02:23:17.018487Z","title":"Breaking the exploration bottleneck: Rubric-scaffolded reinforcement learning for general llm reasoning.arXiv preprint arXiv:2508.16949","venue":null,"work_id":"ca755e28-afae-49ff-addc-7f3dbaca0baa","year":2025},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/2508.16949","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:e868690a61e16e9c5787fd9623c9c4e365d7c9230b477a56e172aa3b53b49c69","observation_id":"c0048b37-2b4a-456c-abc6-69e169172bce","resolution":{"observed_at":"2026-08-04T02:23:17.018487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14069","doi":"10.48550/arxiv.2602.14069","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open rubric system: Scaling reinforcement learning with pairwise adaptive rubric.CoRR, abs/2602.14069","venue":"Open MIND","work_id":"733be8df-2800-45d9-abac-fb3e4f24bc72","year":2026},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:5c6e6b44c946281bf85675d877c83ab2aea8499fd308a5ca2ef195750ab97141","observation_id":"7268ab2b-8daa-47d6-ae76-72de9b755719","resolution":{"observed_at":"2026-07-02T02:56:29.419035Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"Alternating reinforcement learning for rubric-based reward modeling in non-verifiable","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:df85d5cd6747d0e47987957012b42215b589e5afc7f7811816063a0b806a14cc","observation_id":"778eebd3-ea2e-444d-9855-14a36866c302","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":"2511.19399","doi":"10.48550/arxiv.2511.19399","metadata_source":"pith","pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","venue":"cs.CL","work_id":"86a914ac-f3fc-46c4-92f6-9ae10d186533","year":2025},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:769026442732d688b7bf3c4704e644663a691c4b258c5c3d75bdfc1d2d8d0e68","observation_id":"566618c2-1d4d-4459-bb48-fb0fe3a82e7f","resolution":{"observed_at":"2026-07-02T02:56:29.410829Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.27044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:56:29.412157Z","title":"arXiv preprint arXiv:2510.27044 , year=","venue":null,"work_id":"48f8636a-a7a0-44fa-9255-6652790d28c0","year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:33b49a0028fc86e081d2c1ea007c24d764311fba809d5ba46a457cd8837c57b2","observation_id":"0d9de1a4-9a80-480a-be37-540a06665f05","resolution":{"observed_at":"2026-07-02T02:56:29.413885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:39.783188Z","title":"Xueguang Ma, Qian Liu, Dongfu Jiang, Ge Zhang, Zejun Ma, and Wenhu Chen","venue":null,"work_id":"d77c39f5-ed6c-44b7-89cd-ea63cdb8a066","year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:0b599f491fa97495d5f29f28d03ff92d868796363123e2e9fa76235acd980d11","observation_id":"db6581a8-a5a4-436a-87df-5756631b8c9c","resolution":{"observed_at":"2026-07-02T02:56:29.427264Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.920901Z","title":"arXiv preprint arXiv:2601.18533 , year=","venue":null,"work_id":"4599e88c-04ad-48e2-a23e-e9d45c9f2eea","year":null},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:c53439f7e88dcadbd5f6ed380f847a4b36528e59c192786b908ae17512578e6a","observation_id":"a3116a65-6899-4cf1-aea7-4d6c1259bd32","resolution":{"observed_at":"2026-07-02T02:56:29.401958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21500","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.641795Z","title":"Does this image satisfy this rule?","venue":null,"work_id":"29a787cd-2797-4d47-96a6-fdcc322ee8b5","year":2025},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:c135d0ebeea3874aec5f47e15929384b6193debeaf96807d7f346ad168d157c8","observation_id":"af8b2437-80bd-4e9c-bad2-449aa52cdd59","resolution":{"observed_at":"2026-07-02T02:56:29.395911Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-09T22:44:41.131484Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:e05ad69f7b3daa1501dbd1970420697af5ed9bc8c134c87778557e31753beb44","observation_id":"4f8e58e2-58a4-4a08-950f-7dca9e664cd2","resolution":{"observed_at":"2026-07-02T02:56:29.409752Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:28:11.576647Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:59ee599562f218872e1c5c0c6841d9ddef197321be7dc90371899fae7af26dba","observation_id":"53dc99bf-10ae-482e-988d-5d64ccaee132","resolution":{"observed_at":"2026-06-28T10:28:11.576647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":10,"parse_uncertain":1,"unresolved":22,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2606.03968."}