{"as_of":"2026-08-23T09:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8bc0c35dc7447d68219732884965ed593c0c502aba46af0ae3482d14d7232eda","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:09:46.121588Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:29:00.494940Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:59:51.882252Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":180,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:024ebbebcecb5be5da9c450ef61487cdea58d3cc69c00c0a59cf9c4fd4c68584","observation_id":"29319d30-5e71-4196-a3bf-7d2e642e1d67","resolution":{"observed_at":"2026-05-14T22:23:14.968757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-08-04T19:29:00.494940Z","title":"Consistent paths lead to truth: Self-rewarding reinforcement learning for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-12T18:24:04.714959Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.494940Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:e215aad88fdd4ab54da46107ac5659812ccd46c02f23f21bfb2fa58719682718","observation_id":"9cadc56b-68ff-4aa3-b874-4412ffc301f0","resolution":{"observed_at":"2026-08-04T19:29:00.494940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2604.07484","last_updated":"2026-04-20T15:02:36Z","snapshot_observed_at":"2026-08-17T15:51:38.368282Z","submitted_at":"2026-04-08T18:25:02Z","title":"ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:55.726473Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2604.07484"},"observation_digest":"sha256:7932b17a85ea4794ec74fadda34bad6c1243fecb3eb067f2bfbef26515884544","observation_id":"5ecaf77b-8d39-4576-b78f-eca6fc09c686","resolution":{"observed_at":"2026-05-11T05:20:57.469347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-08-17T00:04:41.050676Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:8da08880bdfb6ea5036a75191ea10259846ad869059d761887ba7b106bea3e1a","observation_id":"24083e58-3a7d-4795-ad66-57b4b709d172","resolution":{"observed_at":"2026-05-10T05:36:01.961406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2605.14358","last_updated":"2026-05-14T04:35:45Z","snapshot_observed_at":"2026-08-13T05:39:32.597467Z","submitted_at":"2026-05-14T04:35:45Z","title":"Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T21:04:02.263300Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2605.14358"},"observation_digest":"sha256:34c04d0c254a2798ff5e6c857270c4c26248648556559fd98b4332081e72a113","observation_id":"10de83ea-bbcd-421c-9cd4-af79fe64ff8e","resolution":{"observed_at":"2026-06-30T21:05:03.819469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2605.25864","last_updated":"2026-05-25T13:55:12Z","snapshot_observed_at":"2026-07-06T23:35:46.157653Z","submitted_at":"2026-05-25T13:55:12Z","title":"When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:46.313028Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2605.25864"},"observation_digest":"sha256:2ef5680cc5106d9ca8566a66015fc043621dde3102e5ff970c11e05c6c4cb3ac","observation_id":"2b93e0d7-a109-4f6d-b3a5-c4f04b6f73ab","resolution":{"observed_at":"2026-06-29T23:04:01.335231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:e7ddfbdc91f1878107c234b68b1970816acd3f0904e78b3410d79eec19e91c65","observation_id":"87aaad09-9d25-4276-aa0a-da8b8d618830","resolution":{"observed_at":"2026-07-01T20:46:14.369084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2606.04503","last_updated":"2026-06-03T06:34:42Z","snapshot_observed_at":"2026-08-14T13:19:33.029253Z","submitted_at":"2026-06-03T06:34:42Z","title":"Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T06:55:09.927034Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2606.04503"},"observation_digest":"sha256:ad1584161f4fb2e107a98eb452dbfab060215072d884bfc2ae06c5bc5b22c008","observation_id":"cd01867c-1484-4581-9ce0-6109352f8bd9","resolution":{"observed_at":"2026-07-02T07:26:46.234876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:2af11fa93f64a0ca2d7e5a5cf03ea3e250f5c1293b34d3b88b78602c91c1ec73","observation_id":"3c3e53ac-6859-4942-a940-366d111b5910","resolution":{"observed_at":"2026-07-02T06:06:40.790106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2606.13176","last_updated":"2026-06-11T10:44:50Z","snapshot_observed_at":"2026-08-12T17:43:46.479966Z","submitted_at":"2026-06-11T10:44:50Z","title":"Mental-R1: Aligning LLM Reasoning for Mental Health Assessment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T07:15:00.398111Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2606.13176"},"observation_digest":"sha256:bf49b3b2d1ed04e25e077d9a8d64931cabc57d77304ef306c65e3aacf8971e4f","observation_id":"ed2c3dae-401c-4cf9-9c43-135827c3186a","resolution":{"observed_at":"2026-07-03T14:08:21.659582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08745","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-04T13:59:51.882252Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":"61329d50-659f-42f1-a035-541f1f425e91","year":2025},"citing_paper":{"arxiv_id":"2606.27369","last_updated":"2026-06-25T17:59:36Z","snapshot_observed_at":"2026-08-14T02:54:31.610293Z","submitted_at":"2026-06-25T17:59:36Z","title":"Reinforcement Learning without Ground-Truth Solutions can Improve LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-26T04:47:47.691913Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2606.27369"},"observation_digest":"sha256:751a50af6f82cb44c3e1ead53c3b6ce3d7dbd1a6ec0686c7046187354930c07c","observation_id":"ddbafa54-e33e-4dc9-9f48-ee9e5c8f1759","resolution":{"observed_at":"2026-07-04T13:59:51.883679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08745","snapshot_observed_at":"2026-07-12T09:29:14.105502Z","title":"arXiv preprint arXiv:2506.08745 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02592","last_updated":"2026-07-01T07:37:10Z","snapshot_observed_at":"2026-08-18T11:09:10.221848Z","submitted_at":"2026-07-01T07:37:10Z","title":"H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-12T09:29:14.105502Z"},"links":{"cited_paper":"/paper/2506.08745","citing_paper":"/paper/2607.02592"},"observation_digest":"sha256:ab5adeb89a75dbc1d3a531fe64689c13239fa52bbdb7ffc53745d021c0e4edaa","observation_id":"0c0481c5-6659-4e70-a0b2-28879ea86c06","resolution":{"observed_at":"2026-07-12T09:29:14.105502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08745/citation-record","integrity":"/paper/2506.08745/integrity","json":"/paper/2506.08745/citation-record.json","paper":"/paper/2506.08745"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.919707Z","title":"Kakade, Jason D","venue":null,"work_id":"29457a72-b2c4-4340-a23c-7246401d6603","year":2021},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.214409Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:fb14ec4bc431a4d6c53073cf1f468698c345e4d76d88ec6263d8a5a70c96159b","observation_id":"b6ffe7a6-8cd9-4dea-9d5d-dd5cad7aa535","resolution":{"observed_at":"2026-08-07T05:09:46.922731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.910584Z","title":"Open r1: Evaluating llms on uncontaminated math competitions, 2025","venue":null,"work_id":"71951c95-0d5d-483d-a212-5c623d14e51b","year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.272800Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:e4bd196f39548e5cd7049593385374529246a6437e0f877f2cc2f0b73a7b1e24","observation_id":"33bb0019-910d-4abe-974c-3fdef402e725","resolution":{"observed_at":"2026-08-07T05:09:46.913745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T05:09:42.339097Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.339097Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:0f48ccf1722b8c3954fbe5d43e96182178343fcfbd6ce618f4ec0563b801e380","observation_id":"349a80c7-031e-4bf9-b36e-80b6ca054ddd","resolution":{"observed_at":"2026-08-07T05:09:42.339097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T05:09:42.395768Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.395768Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:8fbbaa6d4f739e29da5393126621abeb16906887196d01ff212ed154d2e62390","observation_id":"a028dc47-6b3c-461a-b440-d01b6c095bd8","resolution":{"observed_at":"2026-08-07T05:09:42.395768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T05:09:42.459366Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.459366Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:7438ba1af4f4c19efb902824a713c37527fdd33b36bed547db3b4f3d35844315","observation_id":"126ac31b-a149-4f20-a242-22e69feca703","resolution":{"observed_at":"2026-08-07T05:09:42.459366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-16T12:52:27.817776Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T05:09:42.527494Z","title":"An empirical study on eliciting and improving r1-like reasoning models.arXiv preprint arXiv:2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.527494Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:3febcea3d89269eac481ae56bb75f2a5203f99678190933a6533e8b054be9a42","observation_id":"f7a66c95-c231-4ac5-800a-9fb4f645469d","resolution":{"observed_at":"2026-08-07T05:09:42.527494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T05:09:42.531213Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.531213Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:e085f2c50d64ae6f94f95b8c7ec48d6e598e2d6254f7f020af037d915f2ab147","observation_id":"a96f279b-e9e2-4748-8db7-cbbe8ca149b3","resolution":{"observed_at":"2026-08-07T05:09:42.531213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:09:42.533735Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.533735Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:3fe0c1bb2b79901cbbcfac7cdc1ef2fb73a17575214360f3f07eb1a38180ac43","observation_id":"6ace5b57-f3d8-47b4-854e-7baf906a026f","resolution":{"observed_at":"2026-08-07T05:09:42.533735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-14T13:46:28.086398Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-07T05:09:42.537444Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars.arXiv preprint arXiv:2503.01307, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.537444Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:39a15355859a24bedc26574f1368417491fc9d7fd55a853c06debfa9d173b070","observation_id":"de5575b2-157c-4405-a3db-3e040724983f","resolution":{"observed_at":"2026-08-07T05:09:42.537444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:09:42.613608Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.613608Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:5368603ae84100946869685f31149ffd073dcccfd88c3091d41a98868812ee5b","observation_id":"f6f8b083-dc55-41ed-aaa8-cce6433666c1","resolution":{"observed_at":"2026-08-07T05:09:42.613608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.900731Z","title":"Olympiadbench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"4444b118-07f2-417c-b98e-163baa42f35b","year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.727320Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:2b4b69b4d5a8c29678609335ee15d450e955da1478420ddfff309928abf1779c","observation_id":"740110bb-d645-412c-a1e5-969cf9887c27","resolution":{"observed_at":"2026-08-07T05:09:46.903681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.892287Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"5bedb702-69cf-4a7f-beaa-747c4fa5c3e7","year":2021},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:42.897467Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:1a282ad42b5f51df3cc8309de2c81cfc5227460e6a2d548677cafa0318c0abac","observation_id":"47db5fb1-f488-460d-a6a4-2b79b25aeae2","resolution":{"observed_at":"2026-08-07T05:09:46.895231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T05:09:43.068905Z","title":"Reinforce++: A simple and efficient approach for aligning large language models.arXiv preprint arXiv:2501.03262, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:43.068905Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:6da54b98fbc503a68d0dfd6c4203fd7b95117ba3017c087bb9268dc98bbd18d1","observation_id":"8f58d985-37a9-48c1-be99-122ef30061de","resolution":{"observed_at":"2026-08-07T05:09:43.068905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-21T13:23:40.871665Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-07T05:09:43.246700Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework.arXiv preprint arXiv:2405.11143, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:43.246700Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:0a0b436c6dd2c8ede43e1198f242a517a249ecc4ef5ae430533bafcede5337f3","observation_id":"e1a9ab83-840e-422d-820b-e131a5396b53","resolution":{"observed_at":"2026-08-07T05:09:43.246700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T05:09:43.415963Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:43.415963Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:66a739559aa58e7a418df8a5e84ca483ce1b8cdd11e9e3c251ad44058a3e37c9","observation_id":"f59237a1-bee6-407f-a99b-ea33077367e3","resolution":{"observed_at":"2026-08-07T05:09:43.415963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T05:09:43.589672Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:43.589672Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:510babe7d1e6f530e53f3303f2647a04871f7ae8fb6d7a9bcaf7abb45ac20498","observation_id":"68bf5204-e622-4186-a76a-b84f075529da","resolution":{"observed_at":"2026-08-07T05:09:43.589672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.881976Z","title":"Buy 4 REINFORCE samples, get a baseline for free! In Deep Reinforcement Learning Meets Structured Prediction, ICLR 2019 Workshop, 2019","venue":null,"work_id":"4da0a142-b5db-4520-a6a8-fcd60314ebfb","year":2019},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:43.711859Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:ba2971161bd591406ceb9ee39af4198e3793886b4a8b8a6dd9c8598bdd7d024d","observation_id":"8d0e0c34-3cd6-4d97-ab62-faadd798ef38","resolution":{"observed_at":"2026-08-07T05:09:46.886118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.871387Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"0226bf93-e2a5-4fc0-a644-7438b72d3555","year":2023},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:43.850545Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:08570e3110f3230844967196c2e104ea0b17505a478cea1b3df7078c5dc1eabc","observation_id":"ba7da1c7-439b-41fe-a38b-b24b3222e832","resolution":{"observed_at":"2026-08-07T05:09:46.874897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T05:09:43.878319Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:43.878319Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:a9afaceb825f4e429fd58ef00a7b3dee11ec3d35250de01756c7f069ce03b782","observation_id":"1d58092d-d4fc-4dee-97c8-cca1226af5c6","resolution":{"observed_at":"2026-08-07T05:09:43.878319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:43.926312Z","title":"Numinamath, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:43.926312Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:ad0234e86310dec0b0808e25925057e19261386d8db55f4c04457f3478866c17","observation_id":"0d523d22-44c7-4159-8605-808ce22af111","resolution":{"observed_at":"2026-08-07T05:09:43.926312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.857706Z","title":"Let’s verify step by step","venue":null,"work_id":"05737969-0317-4b5e-b346-55b93c693dfb","year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.039561Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:d34869e0953d89496482a2af077c7d9d1b59bebf0e4af76b63fd716619d4bb8a","observation_id":"c71c6a20-c3f8-4038-9297-01d8d6730a0b","resolution":{"observed_at":"2026-08-07T05:09:46.860484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11701","last_updated":"2025-03-12T08:45:15Z","snapshot_observed_at":"2026-08-20T04:29:45.260563Z","submitted_at":"2025-03-12T08:45:15Z","title":"A Survey of Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11701","snapshot_observed_at":"2026-08-07T05:09:44.129023Z","title":"A survey of direct preference optimization.arXiv preprint arXiv:2503.11701, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.129023Z"},"links":{"cited_paper":"/paper/2503.11701","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:9cfb940a55d89089ff9ec32041e8474b42ccdd34f12109cecb944b672574a898","observation_id":"e1c935f6-3a28-48d5-aa9a-b50a8efa91e9","resolution":{"observed_at":"2026-08-07T05:09:44.129023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-16T03:56:33.383172Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-07T05:09:44.200132Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.200132Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:d74e6b88a75bd40d88aee4eb7ab2d4eda9a9f8fc83c23e4de9fc30d5c28af438","observation_id":"59a01924-d375-4698-afa9-7e01cd44e84c","resolution":{"observed_at":"2026-08-07T05:09:44.200132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-07T05:09:44.269991Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction.arXiv preprint arXiv:1802.03426, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.269991Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:69947b6d8aedd4d5f9f643d45c32ab0ec2ae324bd558043d30851777c5c74be4","observation_id":"ac2164ab-115b-4381-b36e-a55838303da1","resolution":{"observed_at":"2026-08-07T05:09:44.269991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.847554Z","title":"On the global convergence rates of softmax policy gradient methods","venue":null,"work_id":"cd41b74b-4dc6-465a-add1-c105a7d8d76b","year":2020},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.340424Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:185b4728bc7993948c02bbb9c11bb481eb1011a2d3edc9ee119655dbda145285","observation_id":"85670879-67ff-43f4-9d9c-f41cc542d951","resolution":{"observed_at":"2026-08-07T05:09:46.851299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.757765Z","title":null,"venue":null,"work_id":"91652536-4561-439d-9102-117da34a2573","year":2022},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.397534Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:684d2509b5c0d849596d8e835c52b3d67a7da9eb728607c63758c670d9c57572","observation_id":"a7d0a55c-b43f-4d58-98ad-299082650a33","resolution":{"observed_at":"2026-08-07T05:09:46.761702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.747720Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":"a18af542-b35c-4b78-b428-55ebf2afa207","year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.452991Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:45cc73669f4b44abadd39702825e6670e078cb2b6a65fcfe7bc54d930f4a2ddf","observation_id":"dfad0528-64af-4b13-bad9-d394c6b8df70","resolution":{"observed_at":"2026-08-07T05:09:46.751714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.737451Z","title":"Are NLP models really able to solve simple math word problems? InNorth American Chapter of the Association for Computational Linguistics, 2021","venue":null,"work_id":"6908b59f-baa6-4095-9915-6c253df6dcec","year":2021},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.519249Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:ff9cb634931c832f78d718609130bb1825b60127769845dfee809b0112f0fff2","observation_id":"0d617e2b-74d7-46c1-8a74-dda527e8d774","resolution":{"observed_at":"2026-08-07T05:09:46.741637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.727420Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":"267207bc-c178-4cd9-964f-d4f67ff432f0","year":2023},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.589116Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:1afd1567892f0c2c676d5488eb076cf1dc251a63f252b745f2552d03f8202663","observation_id":"d553303b-f8d8-4160-b70d-91155988e8dc","resolution":{"observed_at":"2026-08-07T05:09:46.731168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.718886Z","title":"Semantic cosine similarity","venue":null,"work_id":"0765aa63-1675-4668-a341-d1f9d041a9ef","year":2012},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.644626Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:f76926523c1e26888d7fd484ccad0c4b6d2f8fa957d97a48690a82696b83d8b0","observation_id":"0fab6a5d-2b04-45ea-97a3-48a1e71374dd","resolution":{"observed_at":"2026-08-07T05:09:46.722065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:44.700943Z","title":"What makes a reward model a good teacher? an optimization perspective.arXiv preprint arXiv:2503.15477, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.700943Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:57da4380ec99e43ffea6eedb29227ce9a85083634967d4de452206734f5a91ee","observation_id":"ddc33db8-3652-4bdf-8cbd-be304684d6a0","resolution":{"observed_at":"2026-08-07T05:09:44.700943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:44.769436Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.769436Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:dcb20e970c602a7cfb3e2a8c0adadb2f6382c8d4b5e9e2aa7e40fa9e8a384341","observation_id":"7b4faffc-9300-4686-b4b0-3249f98dd90d","resolution":{"observed_at":"2026-08-07T05:09:44.769436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.704861Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"f5076faa-9795-4a69-b3cb-6099afef9eca","year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.827505Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:14648b550b5e8d4dc373121f26b2906bbc59013ca12641a0c59d964edf0bbd6d","observation_id":"6d3ca9b9-f63c-42e7-bb4b-d15eb909844e","resolution":{"observed_at":"2026-08-07T05:09:46.709087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:09:44.871042Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.871042Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:a4e6586e2f541e7aec4e9b791e20f0e8b37a1e2aa956750b5838a7d107aa3e71","observation_id":"af519356-a0cd-44dd-98d6-0ae87e455b75","resolution":{"observed_at":"2026-08-07T05:09:44.871042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.695539Z","title":"A mathematical theory of communication.The Bell system technical journal, 1948","venue":null,"work_id":"f5cee150-e504-4bc6-88cb-367d58509575","year":1948},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:44.951161Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:5adb3350e6d66a9aee5bcf900d6a50b737c69f5bea04c4625d879ca9b210a6ee","observation_id":"bca96c70-9f78-4100-bbdf-d6bd0ef41128","resolution":{"observed_at":"2026-08-07T05:09:46.698740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:09:45.000333Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.000333Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:d55c3408c369d6e625d985fa49c89ca662e307425e6eb99f3c0deb2a0b71b932","observation_id":"6ce762ba-95d2-4297-88e7-3e04074a7a03","resolution":{"observed_at":"2026-08-07T05:09:45.000333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-18T08:44:38.466468Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T05:09:45.062113Z","title":"Cross- ing the reward bridge: Expanding rl with verifiable rewards across diverse domains.arXiv preprint arXiv:2503.23829, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.062113Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:299a45266fe8a06a5dd1f4e1013901bfe1c7713cddec94f8b5a9c5f204d29d69","observation_id":"89f5da95-4b79-4e1e-ba65-f83acba760b6","resolution":{"observed_at":"2026-08-07T05:09:45.062113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:45.112502Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.112502Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:3be9680150e316c9a8b268f4430c324bb5db9d47220df6b662e78953197d032f","observation_id":"255ae497-a8d3-4e96-987b-23795bdf76c8","resolution":{"observed_at":"2026-08-07T05:09:45.112502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.681418Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":"d7174152-b73e-4d52-89e2-3e937ccac784","year":2019},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.174942Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:47d0dbda16a01cd1afb7a4e949ee14699e4cdb82859d51ca94dbf9f5e012b20e","observation_id":"e5a48ae3-e6ce-46a4-9b33-513fc885edc4","resolution":{"observed_at":"2026-08-07T05:09:46.684681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.671206Z","title":"Le, Ed H","venue":null,"work_id":"fbbd8ed0-51f7-4ea7-b441-a0bb52980990","year":2023},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.241174Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:cdbaaa166cb12b27daee1a78ccc3fb6c5cb8c48626b6c59b10a9e7d1d26db00c","observation_id":"ed5c02dc-80b9-4fe9-9eb3-558a69b6038d","resolution":{"observed_at":"2026-08-07T05:09:46.675301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13640","last_updated":"2025-03-13T16:16:12Z","snapshot_observed_at":"2026-08-20T03:20:29.530337Z","submitted_at":"2024-10-17T15:09:24Z","title":"Latent Space Chain-of-Embedding Enables Output-free LLM Self-Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13640","snapshot_observed_at":"2026-08-07T05:09:45.364256Z","title":"Latent space chain-of-embedding enables output-free llm self-evaluation.arXiv preprint arXiv:2410.13640, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.364256Z"},"links":{"cited_paper":"/paper/2410.13640","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:fe8dae295c798a5964b41d499708ee3b1537ce0aeab2811af573c010769ecccb","observation_id":"baf741f9-462f-4292-aa7b-819939d4589a","resolution":{"observed_at":"2026-08-07T05:09:45.364256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.661696Z","title":"Wong, Zhuosheng Zhang, and Rui Wang","venue":null,"work_id":"3a451799-2dbe-462a-ad67-bcb064667766","year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.411810Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:df5ad5391371f9b4d176f4ca57da3ded96e5b5f6e5be21c4c78a11ca0db2c364","observation_id":"706440a4-c0a9-47c8-96af-1477ac5189b2","resolution":{"observed_at":"2026-08-07T05:09:46.665635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.651613Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"08f6e0cc-5e13-4cc0-8651-49f4127ba283","year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.462434Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:df0bb585c1d91a94f6b2710c0472e823e438efee4f56abe0477149cab364ef62","observation_id":"c10d9300-976e-4ae8-8d9f-0ba9d28f4d26","resolution":{"observed_at":"2026-08-07T05:09:46.655371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12735","last_updated":"2025-04-26T15:42:47Z","snapshot_observed_at":"2026-08-18T19:38:51.342001Z","submitted_at":"2024-10-16T16:51:01Z","title":"CREAM: Consistency Regularized Self-Rewarding Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12735","snapshot_observed_at":"2026-08-07T05:09:45.503921Z","title":"Cream: Consistency regularized self-rewarding language models.arXiv preprint arXiv:2410.12735, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.503921Z"},"links":{"cited_paper":"/paper/2410.12735","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:541a29f93a24355212b6b1ad3b56a7b60ce5a273efe31d4c661494e946a9e41d","observation_id":"84ddd584-f7dc-4d90-beb6-3439d62ea7a8","resolution":{"observed_at":"2026-08-07T05:09:45.503921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.642741Z","title":"Chi, Quoc V","venue":null,"work_id":"0dce3b46-5141-4b95-8da9-74d9990be67d","year":2022},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.544523Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:032b536fb198c865f4677637b6ccf2afccc6b11c18c5729198fade0c30dbd87b","observation_id":"89ff06b2-70d6-4386-b387-4bacf9fbf833","resolution":{"observed_at":"2026-08-07T05:09:46.645771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-20T11:42:05.593922Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-07T05:09:45.585513Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta- judge.arXiv preprint arXiv:2407.19594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.585513Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:df7511ebe5a721ccf925619c21f4239fb18194b75ca07df7dadb07db20613efa","observation_id":"1fef196a-87d2-4433-a6a7-37af59368ef7","resolution":{"observed_at":"2026-08-07T05:09:45.585513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T05:09:45.619823Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2502.14768, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.619823Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:e53f546c444eb3379d75f813f8cf1ebdf6496a8b707adda09325aba49b689678","observation_id":"b844e0e9-3376-412c-89aa-c3ac0f50d2bd","resolution":{"observed_at":"2026-08-07T05:09:45.619823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19613","last_updated":"2025-02-26T23:01:16Z","snapshot_observed_at":"2026-08-16T12:54:50.426920Z","submitted_at":"2025-02-26T23:01:16Z","title":"Self-rewarding correction for mathematical reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19613","snapshot_observed_at":"2026-08-07T05:09:45.657899Z","title":"Self-rewarding correction for mathematical reasoning.arXiv preprint arXiv:2502.19613, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.657899Z"},"links":{"cited_paper":"/paper/2502.19613","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:5e56093759b30eb5ec53a1dc31f4b009a5d6b610c14e758cd3672b9857289343","observation_id":"3d8ec851-bcbe-4610-825e-f5be039ea645","resolution":{"observed_at":"2026-08-07T05:09:45.657899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T05:09:45.688442Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.688442Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:bec8137a491be785d03b5f62856183545a004644b7f294da28ae9c4172e01a39","observation_id":"ea577258-48cf-4c2f-b79d-f26916e0f3e0","resolution":{"observed_at":"2026-08-07T05:09:45.688442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:09:45.745522Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.745522Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:d1c1d227c17dc0986081a0cd28482839f65a820c15843fe2c041759e15f87b5c","observation_id":"56f7a275-2495-411c-a8cd-15faa612de94","resolution":{"observed_at":"2026-08-07T05:09:45.745522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.631920Z","title":"Self-rewarding language models","venue":null,"work_id":"4241ee45-3178-4f38-ad77-0b53e17ae793","year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.777807Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:c81adb0920e8ad1fe8b052f77a89431e8526b22e2e6f1f5c928bffb95535f79b","observation_id":"62e43cf3-1427-4cee-a808-e6800a55c9ed","resolution":{"observed_at":"2026-08-07T05:09:46.635670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T05:09:45.798657Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.798657Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:ea4a9f2dab8589404f71d9a7f3a2fb20d3a77eebdacb5f63dd4ecc5fdc459d41","observation_id":"85a54cc2-bdcb-4eea-9f1e-d18d4b028f3a","resolution":{"observed_at":"2026-08-07T05:09:45.798657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T05:09:45.826337Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.826337Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:e9b12b44c09b3f190a3e0d77e05681a09f9b84a460b94e692280f9bea4fbfc5d","observation_id":"6e11b935-4602-4260-818a-7337de2eb813","resolution":{"observed_at":"2026-08-07T05:09:45.826337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T05:09:45.849450Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.849450Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:f3dc1040a34901d2b4d8ca2f13b659af482cd4d7971a64b1711938bfeb248cdf","observation_id":"5d2ffa49-c387-402e-bb6f-05bb86a0dde2","resolution":{"observed_at":"2026-08-07T05:09:45.849450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-13T01:30:54.104133Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T05:09:45.877654Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.877654Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:385347a3d255cc77af077ad4c8c338fb77f644f903923b688195d425af18ac0d","observation_id":"f99f6ab8-b206-410d-9992-fa579703938d","resolution":{"observed_at":"2026-08-07T05:09:45.877654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.621461Z","title":"Sample efficient reinforcement learning with reinforce","venue":null,"work_id":"58e7f150-ba64-47cb-8e72-3c6bd027e4a0","year":2021},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.898683Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:9d59ac3cf54fd9abcfa54afe15eb32b4b4806bdab730fb05bb29608546707d4c","observation_id":"e6ca236c-8010-4364-b52b-f308d2ab6a58","resolution":{"observed_at":"2026-08-07T05:09:46.626201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13389","last_updated":"2025-02-19T02:59:42Z","snapshot_observed_at":"2026-08-22T07:14:43.265532Z","submitted_at":"2025-02-19T02:59:42Z","title":"Reasoning with Reinforced Functional Token Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13389","snapshot_observed_at":"2026-08-07T05:09:45.933741Z","title":"Reasoning with reinforced functional token tuning.arXiv preprint arXiv:2502.13389, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.933741Z"},"links":{"cited_paper":"/paper/2502.13389","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:6fe81a4da8cfcdd8573e0dedce63e20b2c1293655e91e24734e6248143d49f83","observation_id":"871a9734-5061-49f7-98a0-123e3038f3d5","resolution":{"observed_at":"2026-08-07T05:09:45.933741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-18T04:26:01.321574Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-07T05:09:45.969598Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.969598Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:38d47e7a387799a62588a824a7cbc661b267450d76c7f4b01db49fdce0d428d5","observation_id":"d96c8c71-2b16-4466-af1d-22da45d8d444","resolution":{"observed_at":"2026-08-07T05:09:45.969598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03746","last_updated":"2025-03-05T18:58:44Z","snapshot_observed_at":"2026-08-18T21:40:43.317084Z","submitted_at":"2025-03-05T18:58:44Z","title":"Process-based Self-Rewarding Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03746","snapshot_observed_at":"2026-08-07T05:09:46.000207Z","title":"Process-based self-rewarding language models.arXiv preprint arXiv:2503.03746, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:46.000207Z"},"links":{"cited_paper":"/paper/2503.03746","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:bce1dc194618b4ff6ae54ce2f51d69c79c378e8dfa808f699e5451423b7b3b4f","observation_id":"30fd01d9-4a5a-4067-8c7f-6140ea62cb82","resolution":{"observed_at":"2026-08-07T05:09:46.000207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08922","last_updated":"2025-02-13T03:15:31Z","snapshot_observed_at":"2026-08-17T03:26:10.203526Z","submitted_at":"2025-02-13T03:15:31Z","title":"Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08922","snapshot_observed_at":"2026-08-07T05:09:46.031769Z","title":"Self-consistency of the internal reward models improves self-rewarding language models.arXiv preprint arXiv:2502.08922, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:46.031769Z"},"links":{"cited_paper":"/paper/2502.08922","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:0b477fd69b44d68a9fd26e04fedebf79a334494a99ff7f2446677d7951bb8b78","observation_id":"97b1f075-2d3f-4a02-bc76-f2266f53f3a7","resolution":{"observed_at":"2026-08-07T05:09:46.031769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.609880Z","title":"Calibrated self-rewarding vision language models","venue":null,"work_id":"cef77067-f45f-48f8-a7d3-e7518c977a0b","year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:46.063365Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:bb9a854745562803ded1338914c34e7cd6789a82042d39603346691a48f0b120","observation_id":"0f1fcc14-1af2-4ead-8c0c-fe95686c89db","resolution":{"observed_at":"2026-08-07T05:09:46.614123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.096209Z","title":"Landscape of thoughts: Visualizing the reasoning process of large language models.arXiv preprint arXiv:2503.22165, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:46.096209Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:2c833899939c5a1885c453d8634f450bd1e2b8e311f0338a1d4fbd3b9f248b21","observation_id":"b4962ff6-9a42-4688-8290-a53355ebb185","resolution":{"observed_at":"2026-08-07T05:09:46.096209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:09:46.596196Z","title":"Texygen: A benchmarking platform for text generation models","venue":null,"work_id":"bddba409-c9eb-4ad0-a69b-822b9dcb7f9a","year":2018},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:46.103070Z"},"links":{"citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:94265e6f1ddc9daaa14481964c264d3752ef33b899730d65211cad5e14331c51","observation_id":"2ba2c7f2-b2cc-4807-8c01-8a8bf8181b62","resolution":{"observed_at":"2026-08-07T05:09:46.601801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-08-21T04:02:37.589002Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-07T05:09:46.113846Z","title":"Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions.arXiv preprint arXiv:2406.15877, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:46.113846Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:311d2c4e2813dbf8a841d4670f63f7e01fc7b0a660eac69b9e33793e1e5cb5a3","observation_id":"e93e34ce-8ff9-4559-8d0c-652a94ae0a90","resolution":{"observed_at":"2026-08-07T05:09:46.113846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-08-18T00:41:23.294797Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-07T05:09:46.121588Z","title":"ground-truth","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:46.121588Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:5d970f6f26d69d10e78a2dbb48d75d2670348ab680e2ef88bcf5559c4908e04c","observation_id":"b2d13d38-dc1c-46a8-8c78-dbf3c121cc03","resolution":{"observed_at":"2026-08-07T05:09:46.121588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T19:31:07.499130Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 12 inbound Pith citation observations for arXiv:2506.08745."}