{"as_of":"2026-08-06T01:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0704cc61a2d4c52f9804595336416a9937f1232b0a02fa6e7b50ba4eac9acaf6","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T07:28:09.142557Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:38:21.327505Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04923","snapshot_observed_at":"2026-07-12T05:47:14.970921Z","title":"Repro- ducing, analyzing, and detecting reward hacking in rubric-based reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02966","last_updated":"2026-07-09T05:23:35Z","snapshot_observed_at":"2026-08-03T16:28:26.579827Z","submitted_at":"2026-07-03T05:17:48Z","title":"Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T05:47:14.970921Z"},"links":{"cited_paper":"/paper/2606.04923","citing_paper":"/paper/2607.02966"},"observation_digest":"sha256:be7e925ade865c577fd77e28bf00d6c5dc7b3a4c97935e3b45c714874a15f82c","observation_id":"39b18520-87ef-48b5-bbd2-b0891ff74f9c","resolution":{"observed_at":"2026-07-12T05:47:14.970921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04923","snapshot_observed_at":"2026-08-01T03:38:21.327505Z","title":"Reproducing, analyzing, and detecting reward hacking in rubric-based reinforcement learning.arXiv preprint arXiv:2606.04923, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23124","last_updated":"2026-07-25T09:58:24Z","snapshot_observed_at":"2026-08-01T21:13:06.083655Z","submitted_at":"2026-07-25T09:58:24Z","title":"AgentOmnia: Scaling Agentic Models for Full-Scenario Applications","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T03:38:21.327505Z"},"links":{"cited_paper":"/paper/2606.04923","citing_paper":"/paper/2607.23124"},"observation_digest":"sha256:c113ad101986fb9599a4dff089774840220e26f30135915849266c2dac581cd0","observation_id":"71c07a45-7329-4c20-9d61-7033f69c75d2","resolution":{"observed_at":"2026-08-01T03:38:21.327505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.04923/citation-record","integrity":"/paper/2606.04923/integrity","json":"/paper/2606.04923/citation-record.json","paper":"/paper/2606.04923"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:1cfbff98aeeae6de7def6677223030d65cbbf031d00e8af448ffd617bc1a341b","observation_id":"c5d30149-2e59-4ef0-8a2e-e1e49bc48d1d","resolution":{"observed_at":"2026-07-02T06:16:43.760659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:59965fed22ee954168a354268c0bbdcd58d8acaaea8f7dc8cb3b10c252cff7ab","observation_id":"ad52b475-2f43-40fa-8336-a6c0647e623e","resolution":{"observed_at":"2026-07-02T06:16:43.763323Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-05T19:15:41.254461Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:7e221bc2fc9a6f646efafeadcb59d7b654dac15fac12b4715959e16cfb5b217b","observation_id":"5e4e8840-30f9-4b58-a5c2-a0bbfe3639b0","resolution":{"observed_at":"2026-07-02T06:16:43.765955Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00103","last_updated":"2025-06-11T14:56:19Z","snapshot_observed_at":"2026-08-02T19:05:32.884019Z","submitted_at":"2025-05-30T14:34:57Z","title":"Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards","version":2},"cited_work":{"arxiv_id":"2506.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00103","snapshot_observed_at":"2026-07-10T09:26:59.706507Z","title":"Ezra Karger, Houtan Bastani, Chen Yueh-Han, Zachary Jacobs, Danny Halawi, Fred Zhang, and Philip E","venue":"cs.CL","work_id":"9ec3e1cc-d38c-4160-88d8-bfcd0d34e69c","year":2025},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2506.00103","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:1e9aa51a856c3991d548a3783dfbb0ff5120bd5828bb98b71ba2889ab54db8f3","observation_id":"59e0214f-51f5-4fa5-823b-493cf344dea2","resolution":{"observed_at":"2026-07-02T06:16:43.768695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14660","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T06:16:43.751014Z","title":"Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu, and Yunzhong He","venue":null,"work_id":"c665a4cc-457b-490e-ac91-09554048dedb","year":null},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:4a537fbd779f40dc3c0d1bb9a213b2d818103ca3c1a88701cb360a932cf084cb","observation_id":"116c76d7-88de-4864-9b42-03a1213eeced","resolution":{"observed_at":"2026-07-02T06:16:43.752573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-03T08:00:52.890954Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2605.12474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12474","snapshot_observed_at":"2026-07-03T10:07:56.262937Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","venue":"cs.AI","work_id":"4c7cd701-7d64-4261-b594-6c110b91cc9c","year":2026},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2605.12474","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:2b0ab307e2eec5039efbae6e9c6ae80627977a167dc735ae0c9d62c38bbdb3b5","observation_id":"13a3e2c0-5970-4d88-b2e2-3c943be9f22d","resolution":{"observed_at":"2026-07-02T06:16:43.741991Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:28:09.142557Z","title":"LMSYS Arena technical blog and evaluation suite","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:73bbde3138cdb1f8efcaed6b7c147b83e2efda4c6919b1cd2585d9a92f2a3b2f","observation_id":"21f02363-1a98-43df-8bac-c410e831d4b1","resolution":{"observed_at":"2026-06-28T07:28:09.142557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-07-06T18:02:53.240463Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:8cca0db9a2e0c3dc90a37c4a2c0a5f3531fc4d2f7833d1221a81bcac33960b17","observation_id":"0c048db2-ceb2-4b26-9b35-27f32a6b8f03","resolution":{"observed_at":"2026-07-02T06:16:43.747093Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":"2511.19399","doi":"10.48550/arxiv.2511.19399","metadata_source":"pith","pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","venue":"cs.CL","work_id":"86a914ac-f3fc-46c4-92f6-9ae10d186533","year":2025},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:32a75d8a03573f62a9e1e6572626e45b3818bfba06f9a7bfdbe6978565343ef1","observation_id":"20efc244-71ef-4cca-9c38-d5b0e1d48a46","resolution":{"observed_at":"2026-07-02T06:16:43.744531Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.15034","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:08:21.683264Z","title":"Rl tango: Reinforcing generator and verifier together for language reasoning","venue":null,"work_id":"04c8e187-91d1-45a2-80f0-f1fd4cbc92ba","year":2025},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:be695e1812348f9f0c65ee028d71dce3b52824ae54c734d3d056c231ad2abaa7","observation_id":"69298f13-a195-40c1-a79c-7c4ee426a8c6","resolution":{"observed_at":"2026-07-02T06:16:43.755400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.06021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:39:31.175791Z","title":"Chaining the evidence: Robust reinforcement learning for deep search agents with citation-aware rubric rewards","venue":null,"work_id":"96709fe2-18eb-40b5-85aa-701ea86e19e4","year":2026},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:813167d7ab8d3402b77c84912b709b96e91c6a371dbd7f9e6d514883c73cc057","observation_id":"a74f70af-1f51-4db6-bf16-5eb7f8d15b90","resolution":{"observed_at":"2026-07-02T06:16:43.749812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.08091","last_updated":"2026-08-01T14:08:22Z","snapshot_observed_at":"2026-08-06T01:14:18.840134Z","submitted_at":"2026-03-09T08:32:21Z","title":"Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization","version":2},"cited_work":{"arxiv_id":"2603.08091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.08091","snapshot_observed_at":"2026-08-04T02:24:30.324324Z","title":"A Glossary of Epistemological Terms","venue":null,"work_id":"654e8804-7c6d-4ea7-91c0-2e94f5512a28","year":2025},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2603.08091","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:deab47561b0da5f8b730921819670d1561785aede44d7b2de5484ee4b1d5fce3","observation_id":"c43b644e-7461-4f5e-9e52-fc598aa0b036","resolution":{"observed_at":"2026-08-04T02:24:30.324324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T07:28:09.142557Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:771feef9a37ba7e86116fb15cfa148254d4c708f574239ef3e139629f913e744","observation_id":"e33b69e7-b985-4035-8a2b-6466063fd67c","resolution":{"observed_at":"2026-06-28T07:28:09.142557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.04923","last_updated":"2026-06-03T14:18:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":2,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 2 inbound Pith citation observations for arXiv:2606.04923."}