{"as_of":"2026-08-19T10:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40d06b0ab65c791455ec5b19b492ed84b20a02756be848cfd8e31b442a34c79d","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:22:55.544927Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:37:05.606844Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T11:50:15.856760Z","title":"Reinforcement learning with rubric anchors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02208","last_updated":"2025-09-02T11:23:35Z","snapshot_observed_at":"2026-08-17T11:13:51.858687Z","submitted_at":"2025-09-02T11:23:35Z","title":"Baichuan-M2: Scaling Medical Capability with Large Verifier System","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:15.856760Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2509.02208"},"observation_digest":"sha256:84391fc16f438104a9a0ed7baa780d871ec360f67f3c05bca851b7d03f4efa2e","observation_id":"b6326af1-e0f9-4191-a4e2-04bd455e6ecc","resolution":{"observed_at":"2026-08-05T11:50:15.856760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":215,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:9cbd56f481445383c7990733cced738aade34ba39b7fc9a0871e217dfafc081d","observation_id":"018b4547-fad7-4e0d-8e7b-7e451f2ebff9","resolution":{"observed_at":"2026-05-18T00:05:31.565658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-15T15:49:15.974500Z","title":"Reinforcement learning with rubric anchors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.21842","last_updated":"2026-07-14T07:09:16Z","snapshot_observed_at":"2026-08-15T18:14:23.096354Z","submitted_at":"2025-09-26T04:03:52Z","title":"DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:49:15.974500Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2509.21842"},"observation_digest":"sha256:d33f1b2756bf6147aafbdd56b9fb58d259f05c3537bd0512427940c7eea6c56d","observation_id":"9de7eea5-c94b-4642-b31b-8ed74e67d626","resolution":{"observed_at":"2026-08-15T15:49:15.974500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-03T20:15:28.323243Z","title":"Reinforcement learning with rubric anchors.arXiv preprint arXiv:2508.12790, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20651","last_updated":"2026-07-21T00:23:00Z","snapshot_observed_at":"2026-08-14T13:42:29.127732Z","submitted_at":"2025-11-25T18:59:55Z","title":"RubricRL: Simple Generalizable Rewards for Text-to-Image Generation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:28.323243Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2511.20651"},"observation_digest":"sha256:47b60d37012e839845c339a0097d9279375f016c2bce6e53b766b5b0a4906479","observation_id":"4746e6f1-f1f0-4529-ab0b-84912315f37c","resolution":{"observed_at":"2026-08-03T20:15:28.323243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-02T18:31:25.099015Z","title":"eacl-long.143/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.10396","last_updated":"2026-07-30T08:43:12Z","snapshot_observed_at":"2026-08-06T18:16:46.388379Z","submitted_at":"2026-03-11T04:21:04Z","title":"Verbalizing LLM's Higher-order Uncertainty via Imprecise Probabilities","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T18:31:25.099015Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2603.10396"},"observation_digest":"sha256:8547104eee5b2f1c5817a1984ae99e3c4ac0a6d3dc261bf4ea2c971a2cf773d4","observation_id":"6488fe73-7c94-4a9a-8407-0c4765c06b47","resolution":{"observed_at":"2026-08-02T18:31:25.099015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2603.15646","last_updated":"2026-05-07T09:27:24Z","snapshot_observed_at":"2026-08-19T06:27:07.602328Z","submitted_at":"2026-03-04T04:18:39Z","title":"Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T17:08:23.269275Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2603.15646"},"observation_digest":"sha256:8b718ed35c2c714040442888aed105bcfff29ba38c82055ca3969c96d5c29e6d","observation_id":"e85495b3-c760-4a36-93ab-334b15bc8a38","resolution":{"observed_at":"2026-05-15T17:10:10.378397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-13T00:16:00.739066Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:19.955943Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:9150ec49de4c9fad7847061161c85c9d3492a5b772adc052d9205f640548ef7a","observation_id":"a7e05a27-7df6-4208-9dac-f1a9d3ef5e80","resolution":{"observed_at":"2026-05-11T00:50:50.499815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-02T16:40:55.419909Z","title":"Reinforcement learning with rubric anchors.arXiv preprint arXiv:2508.12790,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-13T00:16:00.739066Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T16:40:55.419909Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:84a55382fe1c7f01d9416b0fb3be635e251c865c0ab9bb030d04355c0d94826f","observation_id":"65507374-b0d4-4cc0-b6b6-3bfae866d82b","resolution":{"observed_at":"2026-08-02T16:40:55.419909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-04T05:36:43.322784Z","title":"Reinforcement learning with rubric anchors.arXiv preprint arXiv:2508.12790,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-13T00:16:00.739066Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T05:36:43.322784Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:bf997ada37971d8967fdfd828ac44a2d46cdf103beb8c4b222eaf61312d13cab","observation_id":"0674eb1b-f6aa-4b87-ac43-a269823d2265","resolution":{"observed_at":"2026-08-04T05:36:43.322784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-08-18T18:51:16.967540Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:52.980881Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2604.13029"},"observation_digest":"sha256:f08e30b225c8b641879587b656c44db2b17348330d728752120246264e7daffa","observation_id":"38f57d8b-89ed-46d4-ba32-3d9c730b232f","resolution":{"observed_at":"2026-05-11T09:56:00.726563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2604.13618","last_updated":"2026-04-15T08:33:55Z","snapshot_observed_at":"2026-08-14T14:03:38.731512Z","submitted_at":"2026-04-15T08:33:55Z","title":"C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:38:37.580448Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2604.13618"},"observation_digest":"sha256:0bea29b4eaeebef04bc6ec1077f0d12cd630f705eba280c2257b32be2583c280","observation_id":"8e8d9f12-3a28-4b71-b19a-11c4ed0d7be1","resolution":{"observed_at":"2026-05-10T13:40:26.979653Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-08-12T18:52:05.625394Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T05:24:00.503836Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2604.18292"},"observation_digest":"sha256:e634fe37b01da80daa10063c1e4795c12b95bb0b0a48b0f4d79e51a235a5e185","observation_id":"16d76370-e6f3-4204-bb10-96dbd490a6b7","resolution":{"observed_at":"2026-05-10T05:25:54.256422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-08-11T07:05:08.289927Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:60fbc7aac894b5cff3c2ca7883f7d6055a36739f75a364e4ed4857f8d36ce57c","observation_id":"df2ee1d2-1693-4e1f-85b2-8b40ec090896","resolution":{"observed_at":"2026-05-11T13:21:15.766370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.02819","last_updated":"2026-05-04T16:56:01Z","snapshot_observed_at":"2026-07-06T23:15:51.008483Z","submitted_at":"2026-05-04T16:56:01Z","title":"SCPRM: A Schema-aware Cumulative Process Reward Model for Knowledge Graph Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T17:57:18.130401Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.02819"},"observation_digest":"sha256:6962f8c218a2414c297d3dc868d365f31939c71115407d465391c3113d1e923d","observation_id":"88c56139-5a71-4347-88e6-e8ab5c921788","resolution":{"observed_at":"2026-05-09T06:55:43.638055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.06822","last_updated":"2026-05-07T18:23:44Z","snapshot_observed_at":"2026-08-11T05:12:34.397974Z","submitted_at":"2026-05-07T18:23:44Z","title":"SHARP: A Self-Evolving Human-Auditable Rubric Policy for Financial Trading Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T00:51:53.252358Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.06822"},"observation_digest":"sha256:82f834af07e8280119bdf2814ad0151a7826e2e5460291b88691c8d10cd98269","observation_id":"c3918a16-8ba2-42a6-8562-cd5a1e8e0d23","resolution":{"observed_at":"2026-05-11T05:06:04.001409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.07396","last_updated":"2026-05-08T07:52:15Z","snapshot_observed_at":"2026-08-17T02:32:12.643547Z","submitted_at":"2026-05-08T07:52:15Z","title":"Rubric-based On-policy Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:48.615352Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.07396"},"observation_digest":"sha256:6aca5358deca8c02821a2934910692bd61b7cb8aff894172c7f305ca52e2c6f6","observation_id":"d3e350a5-deb2-4130-8035-99bf15500bf3","resolution":{"observed_at":"2026-05-11T03:50:57.003709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.08061","last_updated":"2026-05-08T17:48:58Z","snapshot_observed_at":"2026-08-11T11:45:24.431326Z","submitted_at":"2026-05-08T17:48:58Z","title":"Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:33.057569Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.08061"},"observation_digest":"sha256:1b66596ef5a9484c77b96153db516aa980229b3f473dcce5ee67ecdaa13f246c","observation_id":"42bde171-b5d2-459e-89e8-bb95268ecd7d","resolution":{"observed_at":"2026-05-11T03:45:58.166891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-08-14T13:14:10.140627Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:3f837c9e361d68a4afe1447c5accd2d598842b6739bed9d0d68821a8e0eb3179","observation_id":"51564e78-31fb-4dc0-a3a0-559410604284","resolution":{"observed_at":"2026-05-12T06:01:24.455347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.09584","last_updated":"2026-05-10T14:51:31Z","snapshot_observed_at":"2026-07-06T23:21:39.966502Z","submitted_at":"2026-05-10T14:51:31Z","title":"CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T04:32:16.930291Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.09584"},"observation_digest":"sha256:76377a22f4027b62ab203af37d8b8a1be00c2650074eb924e18be9fb9a28015b","observation_id":"9d8d874a-d852-4e7a-ae23-d1f197eeb25b","resolution":{"observed_at":"2026-05-12T06:11:23.637013Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.09808","last_updated":"2026-05-10T23:06:24Z","snapshot_observed_at":"2026-08-16T10:00:09.673723Z","submitted_at":"2026-05-10T23:06:24Z","title":"Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:13.317630Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.09808"},"observation_digest":"sha256:0bb505ce2eca36ef8de71baa1157fc89b19a75b48fd52318d225dc14e6cf333a","observation_id":"42c593ff-22f8-4dfc-8afb-e8052569f067","resolution":{"observed_at":"2026-05-12T07:36:47.868358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-11T10:04:43.760904Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T04:08:51.578772Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.12474"},"observation_digest":"sha256:f6df339fc9415310e09b578616b08aa12b8beb90549f1962be7752ad5c00d619","observation_id":"81591429-6b5e-4b23-85e2-969e3ab1a6d9","resolution":{"observed_at":"2026-05-13T04:12:14.026353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T12:11:23.775843Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:1cf88be7ef575650a45c66a01bf34aa24643956a3987b50d2e90aeaf5384f8e0","observation_id":"021d35ac-1a5e-407d-9ce2-1bfe14bf133d","resolution":{"observed_at":"2026-05-20T12:13:16.068131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T09:19:39.848194Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:b04db65d4391ffbdb6a5fc2eee23606e891c7819dbcbfe38a1a8c5af1ad2a856","observation_id":"48721ea1-1005-40b4-91ed-325c4ec024ad","resolution":{"observed_at":"2026-05-22T09:21:21.490340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.21573","last_updated":"2026-05-20T17:59:58Z","snapshot_observed_at":"2026-08-17T07:50:54.819992Z","submitted_at":"2026-05-20T17:59:58Z","title":"Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T09:34:14.596976Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.21573"},"observation_digest":"sha256:1d7e6c46725bec2ec13a49ddd8612e6a139d7b3ee74f289e1a8e479b184cfc71","observation_id":"a5ff79c8-0193-4555-926d-0264d28a58ea","resolution":{"observed_at":"2026-05-22T09:34:46.719351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.29275","last_updated":"2026-05-28T02:52:06Z","snapshot_observed_at":"2026-08-17T14:32:55.874287Z","submitted_at":"2026-05-28T02:52:06Z","title":"Prompt-Level Reward Specifications for Open-Ended Post-Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T08:04:49.358966Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.29275"},"observation_digest":"sha256:b639b0f03219329a91162f4949533130fd75e524721c0bfb075b8c2d455bc03f","observation_id":"0cd010db-204d-4801-9824-627fd227dd98","resolution":{"observed_at":"2026-06-29T08:13:15.885637Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2605.30244","last_updated":"2026-05-28T17:11:03Z","snapshot_observed_at":"2026-08-14T15:44:46.064802Z","submitted_at":"2026-05-28T17:11:03Z","title":"Reinforcement Learning with Robust Rubric Rewards","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T07:39:21.677389Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2605.30244"},"observation_digest":"sha256:27ade39a8065b563f4231c4b5b8e14d96ff6ed5f3c32b3dcee695f11737f12ca","observation_id":"c8279687-10cd-4ea4-98f6-a15847dc1e38","resolution":{"observed_at":"2026-06-29T07:43:13.790780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-15T17:43:24.603364Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:576f556f4140770daf89a87cc215a60b62786dc83243f8496065910ce5d91d4a","observation_id":"3941bab8-d0b9-40f1-bfed-1402aadd0e4f","resolution":{"observed_at":"2026-06-28T17:22:25.224950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":184,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:8ee9953ee263cd154f7651178556c73cb65f16efd2a483d293a1ff539a1b516f","observation_id":"96b9cdbc-9019-4bc3-9646-98fd34835cc5","resolution":{"observed_at":"2026-07-01T20:56:13.632639Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.03829","last_updated":"2026-06-02T16:12:34Z","snapshot_observed_at":"2026-08-13T01:44:59.169839Z","submitted_at":"2026-06-02T16:12:34Z","title":"BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T09:35:28.694416Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.03829"},"observation_digest":"sha256:7745b9176d18a420e110fe02476b6aa35138ae8ecc7fb527fe871861148036e5","observation_id":"07f74a91-5a3c-4680-8b02-058efe9fb726","resolution":{"observed_at":"2026-07-02T03:56:34.686496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.03968","last_updated":"2026-06-02T17:53:04Z","snapshot_observed_at":"2026-08-03T03:34:10.412391Z","submitted_at":"2026-06-02T17:53:04Z","title":"QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T10:28:11.576647Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.03968"},"observation_digest":"sha256:055d64cceb193bbb4f2779a773b046351508a86b078fd72ce1dba9d04553a4a2","observation_id":"4f8e58e2-58a4-4a08-950f-7dca9e664cd2","resolution":{"observed_at":"2026-07-02T02:56:29.409752Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.04051","last_updated":"2026-06-02T09:02:14Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-02T09:02:14Z","title":"RUBAS: Rubric-Based Reinforcement Learning for Agent Safety","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:47.814115Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.04051"},"observation_digest":"sha256:b6c3a8bbbc79827c793c738ebc44e9e6258b6834f7f7ac17d7e73b9749f6d2a1","observation_id":"dfd3c8c5-b0dc-411a-a051-e7bb251a8bea","resolution":{"observed_at":"2026-07-02T02:16:26.549345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-08-12T03:06:52Z","snapshot_observed_at":"2026-08-15T23:09:29.358314Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:ae6975c2ebe4bacefbd00808c4e8d1f9129e61f7712d95d234f6d459d6c630cf","observation_id":"5e4e8840-30f9-4b58-a5c2-a0bbfe3639b0","resolution":{"observed_at":"2026-07-02T06:16:43.765955Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.07705","last_updated":"2026-06-05T10:00:19Z","snapshot_observed_at":"2026-08-03T12:09:42.759574Z","submitted_at":"2026-06-05T10:00:19Z","title":"SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T22:39:36.238242Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.07705"},"observation_digest":"sha256:19647ed0e2b4d4aa2df1e4590f41a8b01c0560d29596e5134474173aee828c4b","observation_id":"20f00e88-edfb-4634-be64-74dcfead656b","resolution":{"observed_at":"2026-07-02T16:27:09.446012Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.08982","last_updated":"2026-06-08T03:27:05Z","snapshot_observed_at":"2026-08-03T20:51:10.860334Z","submitted_at":"2026-06-08T03:27:05Z","title":"Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:54.293859Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.08982"},"observation_digest":"sha256:480f16dc080e3a661bef1febd4370d6c282d7e3ff62e74efd99d979c207cbcd7","observation_id":"13feac50-cbab-421b-9a7d-61a4161e476b","resolution":{"observed_at":"2026-06-27T17:01:07.401905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.21262","last_updated":"2026-07-23T15:28:36Z","snapshot_observed_at":"2026-08-16T17:04:24.121480Z","submitted_at":"2026-06-19T09:38:02Z","title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T14:33:50.123077Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.21262"},"observation_digest":"sha256:5275d65e8acca811ae140549162a407ee19b67191c5006e137471d44e3112bb6","observation_id":"e63d44ae-0109-4635-a1ee-d950a41873e6","resolution":{"observed_at":"2026-07-04T06:19:38.643902Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-02T10:43:53.683485Z","title":"Changxin Huang, Yanbin Chang, Junfan Lin, Junyang Liang, Runhao Zeng, and Jianqiang Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21262","last_updated":"2026-07-23T15:28:36Z","snapshot_observed_at":"2026-08-16T17:04:24.121480Z","submitted_at":"2026-06-19T09:38:02Z","title":"ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T10:43:53.683485Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.21262"},"observation_digest":"sha256:21ad05d55e292cc86997039e1115ee9dd3171e48fc1410006371a1d6df974bf5","observation_id":"1fdf1afe-73ec-4da6-a950-c733a942c6f2","resolution":{"observed_at":"2026-08-02T10:43:53.683485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning with rubric anchors","venue":"ArXiv.org","work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2606.25407","last_updated":"2026-06-24T05:07:41Z","snapshot_observed_at":"2026-08-07T15:30:17.098748Z","submitted_at":"2026-06-24T05:07:41Z","title":"Teach-to-Reason: Competition-Guided Reasoning with a Self-Improving Teacher","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-25T20:59:22.132943Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2606.25407"},"observation_digest":"sha256:9bb358ec93b9d823742c271472f479929546e45cd07714a6686bd4e6aa71b2df","observation_id":"985a6654-89ee-4175-a9ba-f9daad0930ae","resolution":{"observed_at":"2026-07-04T19:50:10.678512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-07T00:14:38.445310Z","title":"Arnav Kumar Jain, Gonzalo Gonzalez-Pumariega, Wayne Chen, Alexander M Rush, Wenting Zhao, and Sanjiban Choudhury","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01804","last_updated":"2026-08-04T02:24:08Z","snapshot_observed_at":"2026-08-12T13:08:26.566127Z","submitted_at":"2026-08-03T07:12:52Z","title":"LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:38.445310Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2608.01804"},"observation_digest":"sha256:e7f49c958650356cc4b0de699b2a3f21ba99dce3eb0159e3d0d8c6205040d7da","observation_id":"5ef81299-f809-4b3c-8eaf-dc99e5af92e2","resolution":{"observed_at":"2026-08-07T00:14:38.445310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-08-16T00:37:05.606844Z","title":"Huang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11669","last_updated":"2026-08-12T05:29:21Z","snapshot_observed_at":"2026-08-18T16:01:49.315537Z","submitted_at":"2026-08-12T05:29:21Z","title":"Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.606844Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2608.11669"},"observation_digest":"sha256:03eda7df4d45ca1b5a9a700607db74250b243ced907fc036bb194bfbe9ec5c54","observation_id":"4831f5a2-441e-4dab-8509-26f24275999b","resolution":{"observed_at":"2026-08-16T00:37:05.606844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12790/citation-record","integrity":"/paper/2508.12790/integrity","json":"/paper/2508.12790/citation-record.json","paper":"/paper/2508.12790"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:55.336572Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.336572Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:3cdafc81febde9f977e6293bd76294dd6cc818b34b053a91690892d60c7b11d8","observation_id":"39a79538-4557-480e-82b3-c0a67eda5aab","resolution":{"observed_at":"2026-08-15T17:22:55.336572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-08-14T05:14:19.224957Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-15T17:22:55.343159Z","title":"Healthbench: Evaluating large language models towards improved human health","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.343159Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:33833412c62ef86b2c3a9bb081f267e2779bde3704f51bce70edfae97e6865df","observation_id":"dfcc1da7-b2b6-4590-90d9-aac1e127e120","resolution":{"observed_at":"2026-08-15T17:22:55.343159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T17:22:55.350400Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.350400Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:024c854c5a9b36a28d148ab734a651c5d5153686b849ed3071bd41fce3d9c21b","observation_id":"56b95a8e-0acf-4eaf-98c2-86988a458fdb","resolution":{"observed_at":"2026-08-15T17:22:55.350400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.427601Z","title":"Tombench: Benchmarking theory of mind in large language models, 2024","venue":null,"work_id":"292f9563-7133-4687-932b-b744aa841770","year":2024},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.355350Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:6856f4955b601d560861299870e62c4e5a2d317e669339ef1b33c88ee8806815","observation_id":"33dd6bd7-fb08-497e-b1dc-f728faa53080","resolution":{"observed_at":"2026-08-15T17:22:56.432877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.411546Z","title":"Gemini models, 2025","venue":null,"work_id":"4a329d7d-74b7-438e-b4f0-b41df200f6ea","year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.359946Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:abc2881b6eea320b242b7abd91cd8db9b32d0910860a21ed41698fdac1f309c6","observation_id":"d7a7ed89-1313-40c7-b47a-303bc73f3ed2","resolution":{"observed_at":"2026-08-15T17:22:56.416452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T17:22:55.365391Z","title":"Deepseek-v3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.365391Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:36e00454716b75f032d71c77192aefb5e9c30c9fc546180a83db102bcd1dc130","observation_id":"d9febb96-9ebc-45eb-a6e1-4030d16fbd70","resolution":{"observed_at":"2026-08-15T17:22:55.365391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-15T17:22:55.370681Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.370681Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:88365e37dcb69dcf1891b8638e5b8f333a82e13ca4a302d4428c1402f68b226f","observation_id":"00e6d183-f73c-4242-bcad-ac5f48f1fa04","resolution":{"observed_at":"2026-08-15T17:22:55.370681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-17T07:21:20.458339Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-15T17:22:55.376142Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.376142Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:a23077c67a7a112a98353ef4ecc530946e54a057e5655d847f4f6cf133d3c858","observation_id":"c708330f-c051-4878-a747-a64b4c76c3c0","resolution":{"observed_at":"2026-08-15T17:22:55.376142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-08-12T14:23:22.826603Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-15T17:22:55.380630Z","title":"Rubrics as rewards: Reinforcement learning beyond verifiable domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.380630Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:d3a0fc078adb615242bf460385034336bab78a5d9e189f8c62c48eacc1538a56","observation_id":"8b6277b4-526c-4de3-88d5-67dac0393577","resolution":{"observed_at":"2026-08-15T17:22:55.380630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T17:22:55.385201Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.385201Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:f4ef29367ad1c7e7b72bee8f3c8d25e90c9d05e0f78a2151f05011aa5ad65e1d","observation_id":"43d70c7b-a10d-464a-b549-a71c0710435d","resolution":{"observed_at":"2026-08-15T17:22:55.385201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T17:22:55.390625Z","title":"Measuring massive multitask language understanding, 2021 a","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.390625Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:deba63acf23a726c45f08bc6076b2f2ddc4f24a8052b33305d1841ec036b1593","observation_id":"233ec089-8316-49eb-b9cf-280e084359db","resolution":{"observed_at":"2026-08-15T17:22:55.390625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T17:22:55.395475Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.395475Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:24f4080815aafe96e7cb420d6c4c3b4ee738401bd42ab7226e64d41497cc80fa","observation_id":"69026bb4-5363-4548-bd3e-219769e5e705","resolution":{"observed_at":"2026-08-15T17:22:55.395475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:55.400964Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.400964Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:114c7c98077d03faff320c4d7416bb39cf3a75b551b4d99f46b145a8df66a012","observation_id":"e53c6a11-816d-4e1f-bd6d-e29450ec4153","resolution":{"observed_at":"2026-08-15T17:22:55.400964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-15T17:22:55.405357Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.405357Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:512b739b5319c16bbcf2576cefb5817943d6534a8df36f7f2eb999a8b05fd2f9","observation_id":"8a46c880-32ad-4fee-9c00-cb67ae67964a","resolution":{"observed_at":"2026-08-15T17:22:55.405357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11538","last_updated":"2025-07-15T17:59:42Z","snapshot_observed_at":"2026-08-15T18:12:56.213319Z","submitted_at":"2025-07-15T17:59:42Z","title":"How Many Instructions Can LLMs Follow at Once?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11538","snapshot_observed_at":"2026-08-15T17:22:55.411192Z","title":"How many instructions can llms follow at once?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.411192Z"},"links":{"cited_paper":"/paper/2507.11538","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:e9b4df9ef339120e8f91fc821b8478f28a5b5420a5518b0c2e9ea7f6418a3727","observation_id":"07ddeaf5-2bc5-4939-a046-627a98985364","resolution":{"observed_at":"2026-08-15T17:22:55.411192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-15T17:22:55.416169Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.416169Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:aa05921201c732507a60ab266dddcba903538509c476229de821ff0578962ce8","observation_id":"d0d81586-06cb-4d39-adce-cef428eb8b83","resolution":{"observed_at":"2026-08-15T17:22:55.416169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T17:22:55.421350Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.421350Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:bb63b2b42facbde7a46ca71671b2082b08c265b14b11490d991701be35146b26","observation_id":"f2550a10-00ec-47ba-85c9-31b0de1f457a","resolution":{"observed_at":"2026-08-15T17:22:55.421350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:55.426205Z","title":"Omni-think: Scaling cross-domain generalization in llms via multi-task rl with hybrid rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.426205Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:52bba47bb05446c6014ef59b5da54eb4dadc2e5f1f7b45a9012258b1bec3826a","observation_id":"060eb61e-5f5e-4e77-9b81-04d8dd8e9471","resolution":{"observed_at":"2026-08-15T17:22:55.426205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.383617Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level, 2025 a","venue":null,"work_id":"30f99a25-db6b-4791-9151-888588902eb2","year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.431184Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:79be770b2d54083fdb55d6bcadd930cb70e2850d6f7562d806fb5f059a52818b","observation_id":"a48aa7df-3b35-4581-af6c-40f5f09c88d0","resolution":{"observed_at":"2026-08-15T17:22:56.389978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.367495Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"d9085daf-4939-41ed-8ea8-02272a498ba4","year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.435886Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:df1ed911bd85db608c8b35ad3ac2d96d4c1fff13a3b5a8799b22988f2ae6a779","observation_id":"9515a252-8ddc-4115-8839-b6d01915192b","resolution":{"observed_at":"2026-08-15T17:22:56.372314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.351166Z","title":"Aime 2024","venue":null,"work_id":"7876e35b-0d02-4888-9d8a-adca31ce108d","year":2024},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.440494Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:059fd46e4a7a21a2d68dee91106062d15ed4dca8ce2d66153da6115de96d9b3e","observation_id":"9519b6ff-a7ad-4619-984b-af40aca38658","resolution":{"observed_at":"2026-08-15T17:22:56.356308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.334595Z","title":"Aime 2025","venue":null,"work_id":"ae5e3f4a-23a5-4141-90ee-f09a57cb74ca","year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.444921Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:38a0287056347d0cf63cc0db33cb8f97dfac438c6d3a1f280a376a15ec5d9ed5","observation_id":"dc61ebf7-5bdc-4c5c-ab5d-af87efbe20a4","resolution":{"observed_at":"2026-08-15T17:22:56.339508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-16T13:38:37.638259Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-15T17:22:55.449553Z","title":"Llm critics help catch llm bugs, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.449553Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:21e705ff978ab8f432d60e83f34d746e518a86086f47222c34a8fe6036a0765c","observation_id":"e1347977-d5ef-4634-a2c0-d3068ce5e254","resolution":{"observed_at":"2026-08-15T17:22:55.449553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.318780Z","title":"Rule based rewards for language model safety","venue":null,"work_id":"e1ec33af-852d-4228-b42c-82f8d30e50e7","year":2024},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.454605Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:88a1b99e5f956188f15269cffda18d35ed42ddc17ec3423f1c590d755cec284c","observation_id":"9d0fd8fa-4d9b-47be-8774-13def922938a","resolution":{"observed_at":"2026-08-15T17:22:56.323716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:55.459222Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.459222Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:876bdadb1e69db44b0b89dffd5012687a3d6a1b40cf41238a988258daf122068","observation_id":"39c4c190-44fc-4bc3-b0a2-7ae0148ac381","resolution":{"observed_at":"2026-08-15T17:22:55.459222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.293705Z","title":"Introducing openai o3 and o4-mini, 2025","venue":null,"work_id":"14ecf4de-7de0-43c9-8f8d-40511463dc04","year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.463807Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:f7a19627715d2e2bbdeea2e90d02d91b0255cc67a3e88584e6d52a5163d9710e","observation_id":"9e94348b-0999-4453-a83b-ee51f5279948","resolution":{"observed_at":"2026-08-15T17:22:56.298387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06281","last_updated":"2024-01-03T12:20:35Z","snapshot_observed_at":"2026-08-18T06:46:59.964050Z","submitted_at":"2023-12-11T10:35:32Z","title":"EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06281","snapshot_observed_at":"2026-08-15T17:22:55.468458Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.468458Z"},"links":{"cited_paper":"/paper/2312.06281","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:e72980037154adef5cd1b948d895d229074702091ba553c885475eff142ee428","observation_id":"20e50f6c-f468-41c6-bc90-a888b4054189","resolution":{"observed_at":"2026-08-15T17:22:55.468458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.07042","last_updated":"2019-03-29T20:50:21Z","snapshot_observed_at":"2026-08-14T18:38:43.776838Z","submitted_at":"2018-08-21T17:52:02Z","title":"CoQA: A Conversational Question Answering Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.07042","snapshot_observed_at":"2026-08-15T17:22:55.473270Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.473270Z"},"links":{"cited_paper":"/paper/1808.07042","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:db9788030475d59ff200cb7a5e8528969482b0a14bcdfd77fffbbfde104086b2","observation_id":"add607c4-1b27-4eda-a868-cc8e81c7cc84","resolution":{"observed_at":"2026-08-15T17:22:55.473270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-15T17:22:55.477827Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.477827Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:e4e1df527310f4c2f776a62f50c5b2b3921090cbb4256d5c0c205c1e6d7350a3","observation_id":"78cd5978-417d-4a9b-9d09-af04dfd7a264","resolution":{"observed_at":"2026-08-15T17:22:55.477827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-15T17:22:55.482483Z","title":"Socialiqa: Commonsense reasoning about social interactions, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.482483Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:ad031b37a176cb51fed4c17ee3de384b92a38756bef2ac0fe986c50fb2dba7e6","observation_id":"ea9bb1af-918a-4428-bffa-c97eef429118","resolution":{"observed_at":"2026-08-15T17:22:55.482483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-08-17T23:43:35.193190Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-15T17:22:55.487329Z","title":"Self-critiquing models for assisting human evaluators, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.487329Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:9d926364948e44e05742bad6c01ab48334b225fb3821d6b4db53969f4c1ef96e","observation_id":"9ae255f6-9a31-4457-91a9-ecefdb2e7460","resolution":{"observed_at":"2026-08-15T17:22:55.487329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05547","last_updated":"2018-03-15T00:16:43Z","snapshot_observed_at":"2026-08-14T19:36:02.185792Z","submitted_at":"2018-03-15T00:16:43Z","title":"A Simple and Effective Approach to the Story Cloze Test","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05547","snapshot_observed_at":"2026-08-15T17:22:55.492196Z","title":"A simple and effective approach to the story cloze test, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.492196Z"},"links":{"cited_paper":"/paper/1803.05547","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:12a2f5ff238d196c630987d4a186e81f2d76c48faf6a8cc567c93bf5c43176cd","observation_id":"45bace34-c9a9-4c44-9866-975703c5cb55","resolution":{"observed_at":"2026-08-15T17:22:55.492196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.278568Z","title":"Salmon: Self-alignment with instructable reward models","venue":null,"work_id":"cb22e7ef-e87e-4b6a-a2f9-5ec8ebe212d1","year":2023},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.497019Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:02fa7e268a88cba24c631f042dd521c21facecaaa664f6b8414a111a8cc007f3","observation_id":"81c21057-2345-4e1a-89cc-6eb9278261ac","resolution":{"observed_at":"2026-08-15T17:22:56.283635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-08-11T03:34:09.767397Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-15T17:22:55.501479Z","title":"Glm-4.5: Agentic, reasoning, and coding (arc) foundation models, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.501479Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:eab16a08edeee5c3aeb1f98dd1321e7e1bf7f3cf88a8717137611c7306b26ba0","observation_id":"e43ff105-eee4-4971-bbe6-e99d87fb61cd","resolution":{"observed_at":"2026-08-15T17:22:55.501479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T17:22:55.506644Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.506644Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:f4065010b26c63a476c675fa4af1ddf468859b82b7a97b176c4609ac278395a6","observation_id":"15a57863-b5aa-493a-bb07-fe8b52374975","resolution":{"observed_at":"2026-08-15T17:22:55.506644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:55.511371Z","title":"Checklists are better than reward models for aligning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.511371Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:3905623952610cac80929c362725f77ea34237a1e1d48d5256b6058bd7b17e40","observation_id":"36f69961-1b8d-4950-808f-010774c0c55f","resolution":{"observed_at":"2026-08-15T17:22:55.511371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:56.261499Z","title":"Safety reasoning with guidelines","venue":null,"work_id":"36cb9804-cf88-498d-a54c-b5f84df1e1d8","year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.515811Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:4289ab4fb3c6393681c4bc2ee15c3598e8c3f70d255f7e017c31387c30144903","observation_id":"be3ff487-5f58-4715-8462-abebdf9164d1","resolution":{"observed_at":"2026-08-15T17:22:56.268139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:22:55.520571Z","title":"Writingbench: A comprehensive benchmark for generative writing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.520571Z"},"links":{"citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:08868fcb3a2e20c0c270c921e649053642a32d94460f4d7fa3e81264fb3c479e","observation_id":"68c2858d-672c-48e9-89b2-208d25e43fb8","resolution":{"observed_at":"2026-08-15T17:22:55.520571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-15T17:22:55.525007Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.525007Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:953cd75dc9c3c1816d2c29456fab71b6b734fe42daa4aa159165f3c853225124","observation_id":"97d6c44e-0dda-467e-a7b9-26593fbbe8f1","resolution":{"observed_at":"2026-08-15T17:22:55.525007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T17:22:55.530083Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.530083Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:c8644470c5d4eb097a9aa284be9db95950b448b76fa8f7b9d283882cf5b01463","observation_id":"1e72979b-b199-4153-a6cd-8a8f76563f1a","resolution":{"observed_at":"2026-08-15T17:22:55.530083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08689","last_updated":"2023-07-17T17:48:51Z","snapshot_observed_at":"2026-08-16T15:15:36.280421Z","submitted_at":"2023-07-17T17:48:51Z","title":"COLLIE: Systematic Construction of Constrained Text Generation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08689","snapshot_observed_at":"2026-08-15T17:22:55.534857Z","title":"Hanjie, Runzhe Yang, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.534857Z"},"links":{"cited_paper":"/paper/2307.08689","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:1fb5d27fafa8c7726a0cddbe94a1d3f969f24978eb1de7b668e724c53e5171ce","observation_id":"05dbad6d-3e2e-45c7-93ca-b827ff3ec3af","resolution":{"observed_at":"2026-08-15T17:22:55.534857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-15T17:22:55.539628Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.539628Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:cb116561dddb6256dc2d74310f26f5e5073e93d0331e28ffc2dca95b9c5cfa45","observation_id":"dcbd5eb4-cd14-4cc7-94a3-1a28c43a3bb3","resolution":{"observed_at":"2026-08-15T17:22:55.539628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T17:22:55.544927Z","title":"Instruction-following evaluation for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.544927Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:f4d6786cf0db9916b882efe3e1d632a5343bbfaacbe288953991b755daba7f6f","observation_id":"41e378f6-6c00-4e67-8c5f-ef872e0ad9d1","resolution":{"observed_at":"2026-08-15T17:22:55.544927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 39 inbound Pith citation observations for arXiv:2508.12790."}