{"as_of":"2026-08-19T16:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b1854743a61e5ab369b90bb5103d2c025562e91596cd12ca8e089823b834911","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:37:05.672998Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11669/citation-record","integrity":"/paper/2608.11669/integrity","json":"/paper/2608.11669/citation-record.json","paper":"/paper/2608.11669"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-16T00:37:05.564839Z","title":"Amodei, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.564839Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:2d8e9f9dbd813d15218624ce34af1b3cb28c835420588350cc9cb8667e6ae9e7","observation_id":"6076add9-e9e3-4203-ae74-70a2349023c4","resolution":{"observed_at":"2026-08-16T00:37:05.564839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-16T00:37:05.569266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.569266Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:a3c1ef7e26329f0300570d79067bccf448c4f266692960c7908ddba1b953dbb6","observation_id":"1229a9f9-4182-4fa0-8c45-cb302b0e0911","resolution":{"observed_at":"2026-08-16T00:37:05.569266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.993456Z","title":null,"venue":null,"work_id":"ba0e085f-e9c7-45a7-b43f-48639f81d92c","year":2024},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.573200Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:b097c5a723144c53226bccf9185a456c26c7c69bd608d2dd6ecbbdbf5dcd1d39","observation_id":"ee9d6a7f-2923-4527-ab46-ac0ba53f04b7","resolution":{"observed_at":"2026-08-16T00:37:05.996668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.984227Z","title":"Coste, U","venue":null,"work_id":"15811b92-7cb4-4ac5-88b2-cf7bc5b19197","year":2024},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.577011Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:8465e230142a1d78bc743a5d8dbd861bc1a979967e2bb4db7a30be4e47d802de","observation_id":"007d6dc4-72f5-4e33-876a-cfc420800f44","resolution":{"observed_at":"2026-08-16T00:37:05.987657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.974550Z","title":"Eisenstein, C","venue":null,"work_id":"680c8bbd-3053-4a5c-a3dc-8bedfae85022","year":null},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.581451Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:cb3593c37611b4c3537e09ce4775ee0ef99ded93e55f4d93dee9673a5a61bfd2","observation_id":"ced520a8-744b-4b80-8959-ce0ca8a4cdaf","resolution":{"observed_at":"2026-08-16T00:37:05.978178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.955762Z","title":null,"venue":null,"work_id":"066516c2-b9e8-4a92-9579-a66e5b1a00f4","year":2023},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.588470Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:69915af6879183ac47b9661b17dbd7f9ad63e7ce32ffb3456c7f73d8b33038bb","observation_id":"42c0dbc4-12b6-4669-8433-38a21224cd87","resolution":{"observed_at":"2026-08-16T00:37:05.959017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.946002Z","title":"Gunjal, A","venue":null,"work_id":"d5fc121f-7051-4c47-8b92-24f8e54ed266","year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.591973Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:7b83d378530c9132b5bffe3f0962437bac156efacbf7a35d02550248bd9287f0","observation_id":"ca764b38-6218-491a-a97b-63a2a052ade1","resolution":{"observed_at":"2026-08-16T00:37:05.949178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.595958Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.595958Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:024791c4e4014c268a438e513dee448f217773b4981ba15d8f1cfaa3d1b6fccf","observation_id":"56f7a73b-780f-4f02-b303-2b4e83b859ae","resolution":{"observed_at":"2026-08-16T00:37:05.595958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.935957Z","title":null,"venue":null,"work_id":"442f8dd9-7532-4070-91dc-7898259c6ed7","year":null},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.599679Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:8513d6820104b87b81f90ca4cc4a4eddc830f4f7a943f1b74d7d09a834c4c605","observation_id":"e7a8a977-6946-4011-a458-df5887736b60","resolution":{"observed_at":"2026-08-16T00:37:05.939720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-16T00:37:05.606844Z","title":"Huang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.606844Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:03eda7df4d45ca1b5a9a700607db74250b243ced907fc036bb194bfbe9ec5c54","observation_id":"4831f5a2-441e-4dab-8509-26f24275999b","resolution":{"observed_at":"2026-08-16T00:37:05.606844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.926321Z","title":"Lambert, J","venue":null,"work_id":"e24cd0b3-552a-4f78-8d38-ff3cd9756cc2","year":2025},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.610803Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:6360b176bc98a84de0d66f1487326674e580f10bdaa96abe60215c46498fddb1","observation_id":"2f6a6381-8ce0-4888-bcfb-da7c5973bd8d","resolution":{"observed_at":"2026-08-16T00:37:05.929724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-16T00:37:05.614047Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.614047Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:a18d62ddfa757dae097eb3685a7806e409490dd8cf8d702901455b8552794756","observation_id":"22637153-0fda-483c-bd5b-8490bac47e25","resolution":{"observed_at":"2026-08-16T00:37:05.614047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.791","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.707039Z","title":null,"venue":null,"work_id":"335a6180-e56b-44aa-9e31-45b4edbd2d29","year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.617604Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:f9b2e65683fe1010888e782d8c01830e92a913634c143ba76fef01f2750eb17e","observation_id":"c5819290-48a4-4806-b1d8-bf66fbc48dd8","resolution":{"observed_at":"2026-08-16T00:37:05.711565Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-11T10:04:43.760904Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12474","snapshot_observed_at":"2026-08-16T00:37:05.621586Z","title":"Mahmoud, M","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.621586Z"},"links":{"cited_paper":"/paper/2605.12474","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:8e6f959c76f838e80af45e6613a161880f263f84fb0326404e20b0cc17d79648","observation_id":"e3b88169-1226-4e53-acce-9e0bda678ccc","resolution":{"observed_at":"2026-08-16T00:37:05.621586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.914602Z","title":null,"venue":null,"work_id":"a141f14e-21e5-4b64-91e4-0c7a89e9700f","year":2022},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.625153Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:32f943bf64612e5f3d828820c496666408c62c0122782699ff29391fa98f813e","observation_id":"672aea35-8bbd-4819-8d64-217f64f42f2e","resolution":{"observed_at":"2026-08-16T00:37:05.918328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.903439Z","title":null,"venue":null,"work_id":"ed12d717-93d2-4e95-83dd-7a4c1d74c9fa","year":2024},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.628456Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:270f029926b125cbeea6998786d2d00c833e2b7f55036a81f6b723a9cb4ca0c4","observation_id":"cc0e314b-ec0c-487c-a7bc-7b92d9742de3","resolution":{"observed_at":"2026-08-16T00:37:05.907089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.893478Z","title":"Rezaei, R","venue":null,"work_id":"fd3e328b-f670-4abe-99ac-57d3efb7abaa","year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.632518Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:2136d8d8de14c2f785fc59c17ec0b3bc958a07077dafb8181646b36829137fcc","observation_id":"4f14d95a-421d-4949-83e4-6da04feceabb","resolution":{"observed_at":"2026-08-16T00:37:05.897136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T00:37:05.636116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.636116Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:313fa47d3f35f1b42b80e2b7f8b23907209c4c7cd1cd69ed801c14d2caa78801","observation_id":"34c42794-77fc-408c-b28c-80aa1079a90c","resolution":{"observed_at":"2026-08-16T00:37:05.636116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.882902Z","title":"Skalse, N","venue":null,"work_id":"4b71b8e6-1aba-48db-b4e0-c1d95d380c97","year":2022},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.639713Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:7d8be5f61ff8441c85977825a7317bea4c078f7a17f9a2d485961ebb63ed6e86","observation_id":"d07ce2c7-1ec5-46f0-9d6d-9d86ff2ec7e3","resolution":{"observed_at":"2026-08-16T00:37:05.886428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.870226Z","title":"Srivastava, G","venue":null,"work_id":"d016bb72-c0f0-4bec-b2e2-d036cb492241","year":1929},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.643289Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:58977f3e6110af6888cb2fb332300ae62a3b4e156aae6e19dd6823dbe30acb7c","observation_id":"6d580ad2-bebe-49b9-b82c-1afcf262ae1e","resolution":{"observed_at":"2026-08-16T00:37:05.874691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20164","last_updated":"2026-05-19T17:50:18Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:18Z","title":"Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20164","snapshot_observed_at":"2026-08-16T00:37:05.647070Z","title":"Tyagi, X","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.647070Z"},"links":{"cited_paper":"/paper/2605.20164","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:10d65b5104e860ee58a533e35c126b737f17aaa7a6afb385d84ece8917933d11","observation_id":"3ce44013-14c0-4e54-a4ca-64e4e0d56b28","resolution":{"observed_at":"2026-08-16T00:37:05.647070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.859432Z","title":"Viswanathan, Y","venue":null,"work_id":"0629aca3-6fd9-464c-8985-877b590f24b6","year":2025},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.650849Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:f861e2fc5d8530ae1b6b7929d73617e9af78c573c447e0d4d361e83f15636e2f","observation_id":"cd98d3d7-7071-4401-bba9-14d43339ba2f","resolution":{"observed_at":"2026-08-16T00:37:05.863032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04923","last_updated":"2026-08-12T03:06:52Z","snapshot_observed_at":"2026-08-15T23:09:29.358314Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2606.04923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.04923","snapshot_observed_at":"2026-08-16T00:37:05.749397Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","venue":"cs.LG","work_id":"f8eb258f-fd05-4d07-a5cb-937792a3cd6f","year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.654184Z"},"links":{"cited_paper":"/paper/2606.04923","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:47146d5f8bd22322809df61485997dc530ddd774bc241753635cb78c1cc57d9e","observation_id":"572c7b44-7e8b-4bd0-be20-9f7b5a46feca","resolution":{"observed_at":"2026-08-16T00:37:05.753462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-16T00:37:05.657912Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.657912Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:763a6882326c016edec3d2e59d40feb3a04cd13697a5ef9c77d6bb94630f5fea","observation_id":"4002b202-817c-4d1e-b228-9d41a8226779","resolution":{"observed_at":"2026-08-16T00:37:05.657912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.661644Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.661644Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:2b93946455616577d093d07e3599a4045c7daa8649485a9d8ae1c5b47a9524b1","observation_id":"795661d2-e781-466b-b7bf-8bfba468692a","resolution":{"observed_at":"2026-08-16T00:37:05.661644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.665892Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.665892Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:84124a28836bd1dace13ad2ae54b21c758fea6484833c2090fd70e64d06b34b7","observation_id":"1a8db004-f0bf-4fb3-825f-e333030514c0","resolution":{"observed_at":"2026-08-16T00:37:05.665892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.841184Z","title":"Zheng, W.-L","venue":null,"work_id":"d48e12dd-c0f8-42fe-a4d0-607b18677203","year":2023},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.669447Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:ae15636418d5da8b2648cac6088c5f12b3c368bbff6215419965a429c573906c","observation_id":"d4f4e1cd-bf53-415f-8462-0d20e50edcf4","resolution":{"observed_at":"2026-08-16T00:37:05.845679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.829454Z","title":"never optimize the same rubric twice","venue":null,"work_id":"ef2d7161-185f-44c3-bece-4739951346e6","year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.672998Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:3ba6bf49f44b7204a4c26883d81dfd5d20bd67eb733bf6e37ca42f274fdb0bb8","observation_id":"5802a5c6-d03c-48c5-adc0-b6544f1982c0","resolution":{"observed_at":"2026-08-16T00:37:05.833730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.965729Z","title":null,"venue":null,"work_id":"cd56a2e7-0395-477b-b6eb-1bf34eceb771","year":null},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.584938Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:1823caa8352e2a044744c36f62407abac257c47913146d88a4a30ce3b0f860de","observation_id":"0d71aa7d-18ac-47b7-bbe6-239dc779810e","resolution":{"observed_at":"2026-08-16T00:37:05.968878Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.820","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.718494Z","title":"doi: 10.18653/v1/2026.acl-long.820","venue":null,"work_id":"a02a7ec6-41b6-4fac-a3ef-6ae8e149ac55","year":2026},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.603218Z"},"links":{"citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:d06ed72a769878b5af3d04c090affb9e0458be6f952c2e9b801f86bf56ebcb93","observation_id":"f98d6d96-eed1-44be-9725-88ea1be5f86b","resolution":{"observed_at":"2026-08-16T00:37:05.721818Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2608.11669."}