{"as_of":"2026-08-15T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c8a3eb8af374810c3177798a0746deb80b33f142d1f84c405c9886ed5deadeb","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:55:19.365804Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:07:42.225595Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.705912Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":262,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:2e19838cb9065e04e88df386674ab2fb404f38151ddbff6c61d40da54f193c4f","observation_id":"eb9dc29b-af21-4a33-837f-297378dc94bc","resolution":{"observed_at":"2026-05-14T22:23:15.294691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-08-04T16:07:42.225595Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-14T21:41:31.710262Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:42.225595Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:2f8efe12c59eece17e143c5ad21ff51f2558b9bcd566732e2cb6b507e6917a5f","observation_id":"ada27720-584f-40ab-a0a2-a0c9f39baa49","resolution":{"observed_at":"2026-08-04T16:07:42.225595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2604.18131","last_updated":"2026-04-20T11:54:20Z","snapshot_observed_at":"2026-08-14T06:23:01.737989Z","submitted_at":"2026-04-20T11:54:20Z","title":"Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T04:36:27.381942Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2604.18131"},"observation_digest":"sha256:ca3900eb83f0e37ee72c0744890ead7dc5f3ab1207b90220f1bfa94b24e0c286","observation_id":"0ca00ec7-4d2a-4e55-9fcd-e12388adae42","resolution":{"observed_at":"2026-05-10T12:10:23.451741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2604.19341","last_updated":"2026-04-21T11:24:09Z","snapshot_observed_at":"2026-08-13T08:23:53.899364Z","submitted_at":"2026-04-21T11:24:09Z","title":"Evaluation-driven Scaling for Scientific Discovery","version":1},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-05-10T03:39:52.204043Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2604.19341"},"observation_digest":"sha256:11e98bfa44cd328c288a17b5aca518722a747b0bab1ec5c65a87593e3a9a644a","observation_id":"bfb0290e-40fb-4bfc-a48a-58a088745556","resolution":{"observed_at":"2026-05-11T12:26:05.330212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T12:11:23.775843Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:a004c74dbd9ec858c5fbfecfaf8de6f0d17797a80a33d5efd4d81f885eae1260","observation_id":"abdb9b9b-5c93-48c9-94f5-4a5ab4fc5248","resolution":{"observed_at":"2026-05-20T12:13:16.112770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2605.17602","last_updated":"2026-05-20T20:58:48Z","snapshot_observed_at":"2026-08-02T06:34:30.012151Z","submitted_at":"2026-05-17T19:00:44Z","title":"AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:19:39.848194Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2605.17602"},"observation_digest":"sha256:44d4fe9990a08517d85eb5ff6f1f968a3ba6a38151a9eab6ae26476cc8d7778f","observation_id":"cee7903f-9cbe-4bc3-b9c4-dbedb0d01671","resolution":{"observed_at":"2026-05-22T09:21:21.439793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2605.30568","last_updated":"2026-05-28T20:59:45Z","snapshot_observed_at":"2026-08-05T07:59:56.379790Z","submitted_at":"2026-05-28T20:59:45Z","title":"Generating and Refining Dynamic Evaluation Rubrics for LLM-as-a-Judge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T07:21:37.937934Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2605.30568"},"observation_digest":"sha256:5b7188f0bdfc520b005d1af90ac1404213054e4b5e53ca5c849f86ed99385a52","observation_id":"e2dc734c-b2b6-479d-9a4c-e9bd28f1bad1","resolution":{"observed_at":"2026-06-29T07:23:12.618105Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"cited_work":{"arxiv_id":"2506.15651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15651","snapshot_observed_at":"2026-07-04T08:09:40.705912Z","title":"Autorule: Reasoning chain-of-thought extracted rule-based rewards improve preference learning","venue":null,"work_id":"b8f39669-586f-4bf6-b41c-7e80bfca8595","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":219,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2506.15651","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:0adeb0803c7f90d67e9dfd12192390a4681b3bb55b0e7e0c874adc9e40fff896","observation_id":"2107dac5-c1d6-48f2-8801-6c2dd0e50e20","resolution":{"observed_at":"2026-07-04T08:09:40.707284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15651/citation-record","integrity":"/paper/2506.15651/integrity","json":"/paper/2506.15651/citation-record.json","paper":"/paper/2506.15651"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:23.720774Z","title":"The claude 3 model family: Opus, sonnet, haiku, 2024","venue":null,"work_id":"3306a2c0-f318-4c35-8e80-acaec784d959","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.078806Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:116766664ab01a129f1687e6393e1bec58cb6c503ae1a72ac8bd122ddb398fe2","observation_id":"5d924e4a-6e1c-4a66-a136-cfe0b695ed8a","resolution":{"observed_at":"2026-08-06T23:55:23.878456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:23.592052Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback,","venue":null,"work_id":"b2d45f56-44a4-40b5-b96c-9a7e3a7df47b","year":null},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.146217Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:7d4092d64dd6e5b37dc6caeb0e46ce8172f20c13f0dada12c849e84461ae78b9","observation_id":"6c02a401-4af8-4245-ac7f-1578f504b921","resolution":{"observed_at":"2026-08-06T23:55:23.627779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T23:55:16.515092Z","title":"E., Fort, S., Lanham, T., Telleen-Lawton, T., Conerly, T., Henighan, T., Hume, T., Bowman, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.515092Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:6f78edc4826f933f2aab9326aeb6353b281027b2ead3a5631a1ff161e86031ed","observation_id":"d409543e-9789-4a80-a823-91960e13630e","resolution":{"observed_at":"2026-08-06T23:55:16.515092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:23.376698Z","title":"Odin: disentangled reward mitigates hacking in rlhf","venue":null,"work_id":"1c2b3261-42f6-45e5-9494-555659c52b36","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.653707Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:dec350d49761537c8a3011e5110edc786dc8c90f7eb16aeddbc88fb525201809","observation_id":"bf3ebc87-f99e-47ec-bca2-45f2ea52e711","resolution":{"observed_at":"2026-08-06T23:55:23.516900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:23.098759Z","title":"Ultrafeedback: Boosting language models with high-quality feedback, 2024","venue":null,"work_id":"61d005bc-6b42-4aab-bda7-5bb4a48be5df","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.808290Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:3d40bef22bd920ecd901eef71abe7d6ec4c983b1f25b775dd166c588d06951fe","observation_id":"8e933ef1-de09-41c8-b638-2b2aa1613da6","resolution":{"observed_at":"2026-08-06T23:55:23.220705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:55:16.919221Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.919221Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:c673cadb3309f96d5e1c63ffe4a7966e4462c3c5c4858c5791eaca2d7baf0c61","observation_id":"dc5c5bfc-8105-49c2-a982-d9c7d62efdea","resolution":{"observed_at":"2026-08-06T23:55:16.919221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:22.797444Z","title":"Length-controlled alpacaeval: A simple debiasing of automatic evaluators","venue":null,"work_id":"a0722879-e502-4cb3-86bb-5f418b92ccf0","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.098160Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:3d79e6b190c32bda48c918d398a9bb5cc28b7251f96602800c5d72cd23fa6df8","observation_id":"6c38fd67-dc42-46cd-b62f-8d1ad1879e81","resolution":{"observed_at":"2026-08-06T23:55:22.952432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:17.220976Z","title":"Reward shaping to mitigate reward hacking in rlhf, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.220976Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:a2231e362274211b6a357a913e1719e78f9ef0a811568afbdd2e7a10e57c5cdf","observation_id":"1632e14a-4c0e-4f8b-a419-19fc043d74dc","resolution":{"observed_at":"2026-08-06T23:55:17.220976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:22.561550Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"29b2ae9a-4524-450a-9847-e089aef130c3","year":2023},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.370411Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:0f96dc1894b01bd5a76740d5f3320f1a85b95396bcb4362965ca19399278e25f","observation_id":"a17db659-2111-4ca2-a188-08f38718066a","resolution":{"observed_at":"2026-08-06T23:55:22.687833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:22.283636Z","title":"S., Green, R., Mokrá, S., Fernando, N., Wu, B., Foley, R., Young, S., Gabriel, I., Isaac, W., Mellor, J., Hassabis, D., Kavukcuoglu, K., Hendricks, L","venue":null,"work_id":"22c46d02-4ffd-408b-868a-058d4a34bce4","year":2022},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.475196Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:fd3208fd517eb08884769196860e53f3923b240950bb1086051cebe5b7dab696","observation_id":"3b3496ff-6536-4ee3-8b78-27e842cb7a96","resolution":{"observed_at":"2026-08-06T23:55:22.395484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:55:17.559872Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.559872Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:58a800c90c22b1f09035c71f2b01b2c91dca7f30d5ff7409dd22186ea94a0eb2","observation_id":"33486952-d28f-4202-89ff-01085059ccad","resolution":{"observed_at":"2026-08-06T23:55:17.559872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:21.938215Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework, 2024","venue":null,"work_id":"a2fc7ac8-df33-40a5-9b91-7003b933fd62","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.694338Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:3421a4fccbcf69f9cf189c9c1175d16dd64f98991475ca4b5899d7c6abee5eac","observation_id":"e46063c1-7856-4808-89d6-2be2185331d0","resolution":{"observed_at":"2026-08-06T23:55:22.089056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:55:17.770085Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.770085Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:3a7ded1ede530c98bb0c0d2fda6cb10cfd57195f0312badddfeb20d4f3f9e425","observation_id":"2c941af4-2b1b-46cc-81cb-7852c8327d7c","resolution":{"observed_at":"2026-08-06T23:55:17.770085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:21.636847Z","title":"Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling","venue":null,"work_id":"d5f618dd-1963-414b-b99f-8f6e26a4e5e2","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.841397Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:bb8bf2d8c77b8c44b80b827515828a0ca35a6d11eae89b8df86e66a4f0532d87","observation_id":"168800b7-45b3-482e-883a-7fb8975cd15d","resolution":{"observed_at":"2026-08-06T23:55:21.776544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:21.298846Z","title":"Rule based rewards for language model safety","venue":null,"work_id":"1a51536c-ff6d-4995-9c9a-339e69a45dab","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:17.907897Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:be30961adf125978b58c228e5c8cae0df8b3c94ac610cde01c42df5de3acd259","observation_id":"96037b73-3393-4f8f-9b99-617ffb2e20f2","resolution":{"observed_at":"2026-08-06T23:55:21.471082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:55:18.001414Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.001414Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:5832a0c3fe8f1251d2757c4cf8725753ce2d1defc236c48e4583028fe385f85b","observation_id":"3be88102-f3ab-457f-a736-06037b856f0e","resolution":{"observed_at":"2026-08-06T23:55:18.001414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:21.135371Z","title":"F., Leike, J., and Lowe, R","venue":null,"work_id":"b5070efb-c96f-4739-a4d2-23eac20e0db2","year":2022},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.056217Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:b17be308cc2f7e9c4afaca4133ee600d0b7ecbed1dd23a5173603cca66ae910d","observation_id":"6baabdaf-39d8-49c0-9a0a-198d02f2d057","resolution":{"observed_at":"2026-08-06T23:55:21.197182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.943616Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":"b6e57cf4-c571-4144-a867-dda8633586a5","year":2023},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.139566Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:9955e0b9bec8c43372f2779b305e237c99c3ee57d3e1f23a7ce0fd6d00d68a93","observation_id":"f4682ebe-c9bd-4415-aa2b-018b7cde02f4","resolution":{"observed_at":"2026-08-06T23:55:21.034443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.720598Z","title":"Warm: on the benefits of weight averaged reward models","venue":null,"work_id":"079d17e3-f7e0-4bb4-bef2-38ea1a418921","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.263261Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:73514c6fdb95ba9ad7014c22644272fbc961ef576c85a81636a60670638b5a5b","observation_id":"aef2970b-9987-4889-a699-3eeb389b82eb","resolution":{"observed_at":"2026-08-06T23:55:20.818159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:55:18.379988Z","title":"Proximal policy optimiza- tion algorithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.379988Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:4219212696841cbc292858d1c20c382c0617a38bba5b693dcd276d0f6a5245ee","observation_id":"91244e0a-5e96-480d-92cc-fd7a69542366","resolution":{"observed_at":"2026-08-06T23:55:18.379988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:55:18.568219Z","title":"K., Wu, Y ., and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.568219Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:d9cf115d52f9345e732a05596a0389ed345cd58f86c8274e4688947e735f9acd","observation_id":"1a06f961-8d08-4459-8a29-ff3f0708672a","resolution":{"observed_at":"2026-08-06T23:55:18.568219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.560185Z","title":"A long way to go: Investigating length correlations in RLHF, 2024","venue":null,"work_id":"09faeb52-78a2-430e-aed0-39495736d6cd","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.684210Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:e1efded1734b617e6b5af9df1dbb616c8349b5c01a5864179afaa383d6090146","observation_id":"38a3a96d-3812-48de-9d11-7143f4d24650","resolution":{"observed_at":"2026-08-06T23:55:20.621509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-12T00:02:16.697336Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-06T23:55:18.885733Z","title":"M., Lowe, R., V oss, C., Radford, A., Amodei, D., and Christiano, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.885733Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:008c0727b1decea64aed7008e88ee79de19be761c511b2da9a4fafd24acf7350","observation_id":"f1bce08e-2765-4650-ad99-e26236de101d","resolution":{"observed_at":"2026-08-06T23:55:18.885733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:18.993349Z","title":"Interpretable preferences via multi- objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:18.993349Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:491fe0a421f924c577724970db27a1f4aa985120836f0d5ecb11a9de8ed9bbf7","observation_id":"fe93116b-d111-474a-a295-271f3d6f21d5","resolution":{"observed_at":"2026-08-06T23:55:18.993349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.412911Z","title":"Transforming and combining rewards for aligning large language models","venue":null,"work_id":"90b3a182-666d-4452-bef0-8d9328e17f25","year":2024},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:19.143851Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:c8f4f2ea0a77bc37e138ecd72bf4880958f1cde2f2ddf8344f5b94fb3cbf0596","observation_id":"5f3038dd-c30c-4500-b988-cc7392c35913","resolution":{"observed_at":"2026-08-06T23:55:20.466949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:20.167211Z","title":"E., and Stoica, I","venue":null,"work_id":"f4adf9e9-cb24-44bf-b2f8-bea00c34eca9","year":null},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:19.259824Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:491c8c1de236b8415b87bcc70d5abf41ca04787214e3e6244923993e51e5dd58","observation_id":"2bfa2f02-2fad-454c-b3c1-0db4f0351f45","resolution":{"observed_at":"2026-08-06T23:55:20.274208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T23:55:16.329410Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:16.329410Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:da9ab951dbbf10d38b36392ac68f2b9932612cd1bc65c51cb493c748857dac08","observation_id":"3e40a4df-025b-4e51-bfef-1be957b8cf7f","resolution":{"observed_at":"2026-08-06T23:55:16.329410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:55:19.860287Z","title":"confidence","venue":null,"work_id":"3285a89e-47af-4e02-8826-f848fb08f153","year":2023},"citing_paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:55:19.365804Z"},"links":{"citing_paper":"/paper/2506.15651"},"observation_digest":"sha256:4e0c9f124c23d71fbd1cc0dd6c1133d004998a156421eb1d47d07b51cb930276","observation_id":"29deb25a-cbbc-4ee4-ba28-98eb74ad27e1","resolution":{"observed_at":"2026-08-06T23:55:19.995163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.15651","last_updated":"2025-06-18T17:29:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T04:42:39.346400Z","submitted_at":"2025-06-18T17:29:19Z","title":"AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 8 inbound Pith citation observations for arXiv:2506.15651."}