{"as_of":"2026-08-07T17:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc5744c4cb80dd5892478f7f150fe52e5e06e5e2a4405fe2ee08aa1260a22d8d","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:28:52.581372Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:36:25.998787Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:56:30.028956Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-08-04T10:36:25.998787Z","title":"Zhang, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09517","last_updated":"2026-07-02T09:56:45Z","snapshot_observed_at":"2026-08-07T12:26:20.465762Z","submitted_at":"2025-10-10T16:28:43Z","title":"StatEval: A Comprehensive Benchmark for Large Language Models in Statistics","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T10:36:25.998787Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2510.09517"},"observation_digest":"sha256:f71e0c7b1f507f14617f91ef2599144b48db2cf7b894f7b9eaffd8be3d514494","observation_id":"4cb5c848-dc4a-4312-8813-dc690d41f70b","resolution":{"observed_at":"2026-08-04T10:36:25.998787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2512.07461","last_updated":"2026-05-14T12:43:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T11:39:43Z","title":"Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T01:11:26.411893Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2512.07461"},"observation_digest":"sha256:08a17ad618275ee890ebbef0370b45e070496807c0ba9ab7b878e8c68e1f945e","observation_id":"35545380-d09f-42e0-aa19-7af9659e144f","resolution":{"observed_at":"2026-05-17T01:13:47.999081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2512.17445","last_updated":"2026-04-08T21:08:41Z","snapshot_observed_at":"2026-07-06T22:39:33.919723Z","submitted_at":"2025-12-19T10:57:03Z","title":"LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T20:56:58.770875Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2512.17445"},"observation_digest":"sha256:e1a9ae8d506d815483329fdef7d790b3103073bec837d94b619acf5c78e2ddf6","observation_id":"101c8fcc-0766-4ad4-937a-0f5757a1c1a7","resolution":{"observed_at":"2026-05-16T20:58:31.796120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2601.21619","last_updated":"2026-05-09T01:57:30Z","snapshot_observed_at":"2026-07-06T22:43:30.761426Z","submitted_at":"2026-01-29T12:22:45Z","title":"On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T10:38:09.875786Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2601.21619"},"observation_digest":"sha256:4ded9a80a831bcab703b5f5bd7d8ad6c0dde58403db5699f45d69d260cac9056","observation_id":"1e4f5c74-0e8f-4a1c-bbc1-d90185439540","resolution":{"observed_at":"2026-05-16T10:40:51.382604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-13T23:28:12.790404Z","title":"Parallel-r1: T owards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16867","last_updated":"2026-06-03T09:37:20Z","snapshot_observed_at":"2026-08-06T21:47:33.826393Z","submitted_at":"2026-03-17T17:59:51Z","title":"Efficient Reasoning on the Edge","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-13T23:28:12.790404Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2603.16867"},"observation_digest":"sha256:b2c3c7ed6f6b5af950677571f36f749bb463941afb3f8e55ffb55d6dd8581b87","observation_id":"0050ce8a-a01e-4356-bc8e-2e84d34e485d","resolution":{"observed_at":"2026-07-13T23:28:12.790404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2604.05868","last_updated":"2026-04-07T13:28:09Z","snapshot_observed_at":"2026-08-02T07:08:59.060388Z","submitted_at":"2026-04-07T13:28:09Z","title":"Understanding Performance Gap Between Parallel and Sequential Sampling in Large Reasoning Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T18:36:01.200412Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2604.05868"},"observation_digest":"sha256:1c9880d6d067c44001c055eb07b31c4a57f2b3b7bc9a30ac039cfc88258f7e19","observation_id":"1a452e8f-2252-4f76-a376-3f16b8a823dc","resolution":{"observed_at":"2026-05-11T00:20:52.481619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2604.15529","last_updated":"2026-05-11T04:41:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T21:19:35Z","title":"LACE: Lattice Attention for Cross-thread Exploration","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-10T10:24:16.283375Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2604.15529"},"observation_digest":"sha256:870080a2c1f753baa62006920139808353ed2bf4ecde8dc5052cfe3d28282b10","observation_id":"d33036cc-7cf4-4082-92ae-3eff1461b24f","resolution":{"observed_at":"2026-05-10T10:24:21.243161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2604.15529","last_updated":"2026-05-11T04:41:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T21:19:35Z","title":"LACE: Lattice Attention for Cross-thread Exploration","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-11T00:47:51.440441Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2604.15529"},"observation_digest":"sha256:9e977d463f628451f462d261b299c1c5b1d1526a41e5247344a1d7b29720775f","observation_id":"87bd6cf4-27ac-4581-98b7-e984461203ab","resolution":{"observed_at":"2026-05-11T00:50:50.152538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2604.15529","last_updated":"2026-05-11T04:41:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T21:19:35Z","title":"LACE: Lattice Attention for Cross-thread Exploration","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T04:05:35.063305Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2604.15529"},"observation_digest":"sha256:5d9bada34b8c9bcdedc08e30a6f1f2568e4f362dd1a21aec8a3551c85e637b7b","observation_id":"27be7139-36e9-413a-bbc7-69b562b1b901","resolution":{"observed_at":"2026-05-12T06:36:28.484141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-08-07T12:08:03.856446Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:0b0f73c079ee2633ce32e6cf4351373ba5d0931f337a0e5a491e6c8fbfb20104","observation_id":"4bf022af-6523-4e8d-b7b2-2929d433f2d5","resolution":{"observed_at":"2026-05-10T05:36:02.009207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2605.04330","last_updated":"2026-07-28T13:38:20Z","snapshot_observed_at":"2026-08-02T14:54:11.118297Z","submitted_at":"2026-05-05T22:35:46Z","title":"The Scaling Properties of Implicit Deductive Reasoning in Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T16:56:53.056292Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2605.04330"},"observation_digest":"sha256:cbbf9f87327e8600a99c3b94b800ae5c5a02fb0cf27ea6c0f091fae60b906bca","observation_id":"cf37284b-4403-415a-868c-d46f9d7fc1e8","resolution":{"observed_at":"2026-05-11T17:56:06.362781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-08-02T14:54:16.625002Z","title":"Parallel-R1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.04330","last_updated":"2026-07-28T13:38:20Z","snapshot_observed_at":"2026-08-02T14:54:11.118297Z","submitted_at":"2026-05-05T22:35:46Z","title":"The Scaling Properties of Implicit Deductive Reasoning in Transformers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T14:54:16.625002Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2605.04330"},"observation_digest":"sha256:e546485d9faa40c7dc378e6130cea2b1205799db3e7c61c8af794c748e1bd9f6","observation_id":"fd7d90a0-e220-4ac0-9b16-9863a5e3d58e","resolution":{"observed_at":"2026-08-02T14:54:16.625002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2605.06914","last_updated":"2026-05-07T20:23:32Z","snapshot_observed_at":"2026-08-02T05:38:27.537862Z","submitted_at":"2026-05-07T20:23:32Z","title":"Regulating Branch Parallelism in LLM Serving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T01:00:53.308946Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2605.06914"},"observation_digest":"sha256:f8190d2e89343e604a44f3c02c5f21f87cdd5cdb46a16bea11c94757ebfd398d","observation_id":"6dc354b1-2c7a-42b3-823a-96c3d3d4d9f8","resolution":{"observed_at":"2026-05-11T04:50:58.350558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2605.09262","last_updated":"2026-05-10T02:17:14Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:17:14Z","title":"Reinforcing Multimodal Reasoning Against Visual Degradation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T04:37:21.451146Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2605.09262"},"observation_digest":"sha256:c1c03b62e0d4a748ec9a5468a9e365ffeb26da276e7166f0ab5c8f59a8399e9f","observation_id":"d9179099-d64b-4beb-9db5-5f92b6033424","resolution":{"observed_at":"2026-05-12T06:06:25.161203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:9be17f3dc0e7a6057cd009523d498a111643babfa7eda2a8b4bd0ef0ad1931d1","observation_id":"cca0ac9b-fc25-41ba-a2b9-ef19002ac348","resolution":{"observed_at":"2026-05-12T06:01:24.337093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.07980","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-07-02T02:56:30.028956Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning.arXiv preprint arXiv:2509.07980, 2025a","venue":null,"work_id":"75a4a861-4da2-4147-926b-d361952ab5e5","year":2025},"citing_paper":{"arxiv_id":"2606.03102","last_updated":"2026-06-02T03:42:04Z","snapshot_observed_at":"2026-08-03T04:21:57.609394Z","submitted_at":"2026-06-02T03:42:04Z","title":"Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-28T10:25:10.559953Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2606.03102"},"observation_digest":"sha256:f852bb9fd65fa6f1528c3737a7e3c674d1fc0fe15d15ed3c60f9353d48afdaee","observation_id":"0aeec0c5-f4f8-4218-be30-738bdc2b06b9","resolution":{"observed_at":"2026-07-02T02:56:30.030900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07980","snapshot_observed_at":"2026-08-02T06:37:39.525266Z","title":"Parallel-r1: Towards parallel thinking via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-02T06:37:29.284904Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:39.525266Z"},"links":{"cited_paper":"/paper/2509.07980","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:7ed07616b729fa64a0ab9cfffa0b68c76e08f1723aea2f10151a331ad3b6c68d","observation_id":"a49cfe8a-2894-4485-ab0b-ea0df3835026","resolution":{"observed_at":"2026-08-02T06:37:39.525266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.07980/citation-record","integrity":"/paper/2509.07980/integrity","json":"/paper/2509.07980/citation-record.json","paper":"/paper/2509.07980"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-04T21:28:48.417972Z","title":"Large language monkeys: Scaling inference compute with repeated sampling.arXiv preprint arXiv:2407.21787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:48.417972Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:5c0d97352020d025bec4e88c904605c636d1df3107a5ce6e27c4dd0c69f23382","observation_id":"1cbdb3f4-4df4-4b74-b593-063bbb42ed12","resolution":{"observed_at":"2026-08-04T21:28:48.417972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T21:28:48.842982Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:48.842982Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:24c839a018a3885db7096ae7786e19261ef197f43d7ae2088784642559cdfa07","observation_id":"ed11c2c4-520a-4729-99d2-62093fe0dd0c","resolution":{"observed_at":"2026-08-04T21:28:48.842982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10074","last_updated":"2024-10-14T01:34:16Z","snapshot_observed_at":"2026-08-07T14:29:43.157706Z","submitted_at":"2024-10-14T01:34:16Z","title":"Divide, Reweight, and Conquer: A Logit Arithmetic Approach for In-Context Learning","version":1},"cited_work":{"arxiv_id":"2410.10074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10074","snapshot_observed_at":"2026-08-04T21:28:53.308744Z","title":"Divide, Reweight, and Conquer: A Logit Arithmetic Approach for In-Context Learning","venue":"cs.LG","work_id":"c6dc5603-9f72-403d-9a33-ab3f217376a6","year":2024},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.059722Z"},"links":{"cited_paper":"/paper/2410.10074","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:dfd1aa4504565b55bf59cb2d65621d57d12e7d1c3440399933391b53617be97e","observation_id":"b198ef7d-3422-4d4b-8989-f7f26f6cbc2a","resolution":{"observed_at":"2026-08-04T21:28:53.391615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00031","last_updated":"2025-02-25T00:21:14Z","snapshot_observed_at":"2026-07-06T20:44:35.837721Z","submitted_at":"2025-02-25T00:21:14Z","title":"Efficient Test-Time Scaling via Self-Calibration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00031","snapshot_observed_at":"2026-08-04T21:28:49.143122Z","title":"Efficient test-time scaling via self-calibration.arXiv preprint arXiv:2503.00031, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.143122Z"},"links":{"cited_paper":"/paper/2503.00031","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:691c0a600629310623087101445c22bfdd2a0f71dd35f63ff3caaf54779a758f","observation_id":"d60036a1-5e84-4f5c-a3d6-b9a9c62b5162","resolution":{"observed_at":"2026-08-04T21:28:49.143122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-04T21:28:49.329292Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.329292Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:d5d0004d8c6adb79b1887705563b217bbf4a1a7ae0d2814cb5d62f0dba645788","observation_id":"af4ec024-5037-42b1-81e7-713b7e716b3d","resolution":{"observed_at":"2026-08-04T21:28:49.329292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:28:49.390681Z","title":"Spiral: Self-play on zero-sum games incentivizes reasoning via multi-agent multi-turn reinforcement learning.arXiv preprint arXiv:2506.24119,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.390681Z"},"links":{"citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:d8b2e5c834f742c6206954a965c041ec48a872c9b9523d6dffa2f2a372d63547","observation_id":"9547c6ec-a53a-4d31-bff0-449c73ccfa24","resolution":{"observed_at":"2026-08-04T21:28:49.390681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:28:53.639468Z","title":"Matthew Macfarlane, Minseon Kim, Nebojsa Jojic, Weijia Xu, Lucas Caccia, Xingdi Yuan, Wanru Zhao, Zhengyan Shi, and Alessandro Sordoni","venue":null,"work_id":"d52ceb7d-1a9a-4ccb-bdbb-90ec27b6f31b","year":2025},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.445211Z"},"links":{"citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:142dcbc5ff3a8dd8ba05c2e66bca1ef43d4db315e5ca0465ccb607751326c2ce","observation_id":"80287147-8dee-4a21-9caa-501098559db8","resolution":{"observed_at":"2026-08-04T21:28:53.693150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15466","last_updated":"2025-08-17T18:23:42Z","snapshot_observed_at":"2026-08-07T16:00:25.971897Z","submitted_at":"2025-04-21T22:29:02Z","title":"Learning Adaptive Parallel Reasoning with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15466","snapshot_observed_at":"2026-08-04T21:28:49.523071Z","title":"Jiayi Pan, Xiuyu Li, Long Lian, Charlie Snell, Yifei Zhou, Adam Yala, Trevor Darrell, Kurt Keutzer, and Alane Suhr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.523071Z"},"links":{"cited_paper":"/paper/2504.15466","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:6565b368d7b1452d4d4c7fe2c0ab9f366ab9cdefe9cd6122fadad68324be5848","observation_id":"6fc2d1c6-c9bc-49c0-ace7-5ab8591c63f1","resolution":{"observed_at":"2026-08-04T21:28:49.523071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:28:49.606573Z","title":"Hogwild! inference: Parallel llm generation via concurrent attention.arXiv preprint arXiv:2504.06261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.606573Z"},"links":{"citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:0fea3b2becc53ef93a2ba216f7d9d67688fdbf9855b5bffd577080333cdfedaa","observation_id":"713939a4-7a0f-458e-ad97-07f78449db3c","resolution":{"observed_at":"2026-08-04T21:28:49.606573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01633","last_updated":"2025-06-25T15:31:17Z","snapshot_observed_at":"2026-08-06T13:49:51.185947Z","submitted_at":"2025-02-03T18:59:01Z","title":"Adversarial Reasoning at Jailbreaking Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01633","snapshot_observed_at":"2026-08-04T21:28:49.697568Z","title":"Adversarial reasoning at jailbreaking time.arXiv preprint arXiv:2502.01633,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.697568Z"},"links":{"cited_paper":"/paper/2502.01633","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:f0b66300f0442d1a9132d7dec929512357d98d3616161543a03f648847a097cd","observation_id":"405ed9da-be08-441c-a7c5-f99b938dd518","resolution":{"observed_at":"2026-08-04T21:28:49.697568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T21:28:49.771954Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.771954Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:73722e0f45d629f69e992cfa0f215c37216e0593ec64118d3088228191bacc44","observation_id":"e08612b1-25fd-4410-b5dd-12cf2946f872","resolution":{"observed_at":"2026-08-04T21:28:49.771954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-04T21:28:49.856838Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.856838Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:dd05fe2c41645cb62fe712665b97590d82c57262c05c2ae92e3569ec8f2ef652","observation_id":"92990e46-971a-4b49-802d-bc35ea597896","resolution":{"observed_at":"2026-08-04T21:28:49.856838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05720","last_updated":"2025-07-08T07:07:53Z","snapshot_observed_at":"2026-08-06T19:17:21.170038Z","submitted_at":"2025-07-08T07:07:53Z","title":"MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05720","snapshot_observed_at":"2026-08-04T21:28:49.949465Z","title":"Mobilegui-rl: Advancing mobile gui agent through reinforcement learning in online environment.arXiv preprint arXiv:2507.05720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.949465Z"},"links":{"cited_paper":"/paper/2507.05720","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:b2b47c4b0dd996b6fb6e6346603d6b500f2efde8409a4616068667eb82e431e1","observation_id":"3a8e54aa-775a-42e5-89c2-6ac17b513180","resolution":{"observed_at":"2026-08-04T21:28:49.949465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10625","last_updated":"2024-07-01T13:36:29Z","snapshot_observed_at":"2026-07-06T18:31:32.118399Z","submitted_at":"2024-06-15T13:16:44Z","title":"On the Hardness of Faithful Chain-of-Thought Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10625","snapshot_observed_at":"2026-08-04T21:28:50.022641Z","title":"On the hardness of faithful chain-of-thought reasoning in large language models.arXiv preprint arXiv:2406.10625,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:50.022641Z"},"links":{"cited_paper":"/paper/2406.10625","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:3cb80828cafcb3ae253dc5b53a3646022e6b064ce5529c58308e74df0ec97925","observation_id":"bf208120-e27a-4f5a-a3f3-df5416e19825","resolution":{"observed_at":"2026-08-04T21:28:50.022641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00691","last_updated":"2025-07-18T07:40:22Z","snapshot_observed_at":"2026-07-06T20:29:45.369233Z","submitted_at":"2025-02-02T06:32:23Z","title":"To Code or not to Code? Adaptive Tool Integration for Math Language Models via Expectation-Maximization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00691","snapshot_observed_at":"2026-08-04T21:28:50.169747Z","title":"To code or not to code? adaptive tool integration for math language models via expectation-maximization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:50.169747Z"},"links":{"cited_paper":"/paper/2502.00691","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:a0a718b3b31c55624a1a185a6904532ab19c6956e5c9cd70eddfc3022511416b","observation_id":"bf8f7d3c-d7c9-40f7-b544-a1fa7f6a0420","resolution":{"observed_at":"2026-08-04T21:28:50.169747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-04T21:28:50.583503Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:50.583503Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:1eae1a49ced95b4c19e286bb1fee8e062721c0865e5def488df2cc2ddd9b7b46","observation_id":"9691f506-e6da-4df4-b0aa-c82e74f335aa","resolution":{"observed_at":"2026-08-04T21:28:50.583503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-04T21:28:51.031284Z","title":"Accessing gpt-4 level mathematical olympiad solutions via monte carlo tree self-refine with llama-3 8b.arXiv preprint arXiv:2406.07394,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:51.031284Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:1ea1798f9abd2e237b40d0c3ba06def6f1643614d0dd056c2e8db794f5f0e608","observation_id":"7449f66d-9235-43f2-b462-499ca818af64","resolution":{"observed_at":"2026-08-04T21:28:51.031284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15817","last_updated":"2025-06-09T21:22:15Z","snapshot_observed_at":"2026-08-07T15:08:50.488727Z","submitted_at":"2025-05-21T17:59:54Z","title":"Learning to Reason via Mixture-of-Thought for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15817","snapshot_observed_at":"2026-08-04T21:28:52.055915Z","title":"Learning to reason via mixture-of-thought for logical reasoning.arXiv preprint arXiv:2505.15817,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:52.055915Z"},"links":{"cited_paper":"/paper/2505.15817","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:e633b6fa791852545003b0bd11ec7a70f3726976dd68276e080fe1b33eb02168","observation_id":"2128fd9f-9219-4868-92bb-21e14ce554b4","resolution":{"observed_at":"2026-08-04T21:28:52.055915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T21:28:52.354156Z","title":"Dissecting logical reasoning in llms: A fine-grained evaluation and supervision study.arXiv preprint arXiv:2506.04810,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:52.354156Z"},"links":{"citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:8f64c220b799b515cef3fc8e2b4f86990e3260fc060ae4d5ca23e57bb459dd7a","observation_id":"42cfe4e3-fc94-478f-9ca9-40b95fdf9932","resolution":{"observed_at":"2026-08-04T21:28:52.354156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-04T21:28:52.581372Z","title":"Ttrl: Test-time reinforcement learning.arXiv preprint arXiv:2504.16084,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:52.581372Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:d48254f78dc58ee97738b32f4411a5f0a5c2f13837ea13d02e55118a409b0a4c","observation_id":"2220d7ac-1e80-4b0f-bb7a-a0aa533bc019","resolution":{"observed_at":"2026-08-04T21:28:52.581372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03714","last_updated":"2025-07-07T04:11:47Z","snapshot_observed_at":"2026-08-07T16:29:49.116124Z","submitted_at":"2025-03-28T16:23:59Z","title":"Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03714","snapshot_observed_at":"2026-08-04T21:28:48.635933Z","title":"Breach in the shield: Unveiling the vulnera- bilities of large language models.arXiv preprint arXiv:2504.03714, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":1989,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:48.635933Z"},"links":{"cited_paper":"/paper/2504.03714","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:251b326009fd5d7011f4132f35a22606f3dd18916b5554b6351db9d7d0735384","observation_id":"fdcdd31d-64c2-4f09-9a52-63b8c5b54c8a","resolution":{"observed_at":"2026-08-04T21:28:48.635933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11517","last_updated":"2025-02-21T06:14:19Z","snapshot_observed_at":"2026-07-06T20:37:37.864423Z","submitted_at":"2025-02-17T07:39:16Z","title":"Learning to Keep a Promise: Scaling Language Model Decoding Parallelism with Learned Asynchronous Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11517","snapshot_observed_at":"2026-08-04T21:28:49.250131Z","title":"Learning to keep a promise: Scal- ing language model decoding parallelism with learned asynchronous decoding.arXiv preprint arXiv:2502.11517,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:49.250131Z"},"links":{"cited_paper":"/paper/2502.11517","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:0ad03d0f595b0b5e69ecbbf848324869ffc447aa24c791e687d247b82e4cbad2","observation_id":"c59ba061-c2cb-49e9-8181-ebcf4f50a036","resolution":{"observed_at":"2026-08-04T21:28:49.250131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11107","last_updated":"2025-05-16T10:40:35Z","snapshot_observed_at":"2026-08-07T15:44:44.133748Z","submitted_at":"2025-05-16T10:40:35Z","title":"Group Think: Multiple Concurrent Reasoning Agents Collaborating at Token Level Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11107","snapshot_observed_at":"2026-08-04T21:28:48.990999Z","title":"Group think: Multiple concurrent reasoning agents collaborating at token level granularity.arXiv preprint arXiv:2505.11107,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:48.990999Z"},"links":{"cited_paper":"/paper/2505.11107","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:3fafda00b34995310c36ec00dfeff9e024c990ae18f30032fe32445ef604d0fb","observation_id":"d32bd04e-8be1-4b51-beb1-40f512cf0fcb","resolution":{"observed_at":"2026-08-04T21:28:48.990999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T21:28:50.298882Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:50.298882Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:4e106f77492d564c95584f71996403660d7b55a246cc69b7f9a520b8719bd8aa","observation_id":"545b25e9-4311-4970-99e9-24fbce537175","resolution":{"observed_at":"2026-08-04T21:28:50.298882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T21:28:50.365945Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:50.365945Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:0c08e2823161c4873334555b0aa50ca2750067f631226f3d401f7d975e880eda","observation_id":"40ebbcef-d119-4401-8470-c8073730f54a","resolution":{"observed_at":"2026-08-04T21:28:50.365945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08895","last_updated":"2025-08-14T09:04:56Z","snapshot_observed_at":"2026-08-07T09:35:30.150849Z","submitted_at":"2025-08-12T12:35:55Z","title":"ASPD: Unlocking Adaptive Serial-Parallel Decoding by Exploring Intrinsic Parallelism in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08895","snapshot_observed_at":"2026-08-04T21:28:48.497263Z","title":"Aspd: Unlocking adaptive serial-parallel decoding by exploring intrinsic parallelism in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:48.497263Z"},"links":{"cited_paper":"/paper/2508.08895","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:f8b9d5758f2acc16f957ca6e646e010197f8156b581edf952d9cfc9886b7d997","observation_id":"bf4b7a5f-abee-4dad-b9af-69f47d76e78e","resolution":{"observed_at":"2026-08-04T21:28:48.497263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T21:28:48.745667Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:48.745667Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:6a547a03b2d9bbd24e2b070576446ccbc48690bbe40b48d326fb47be3c3b9ee8","observation_id":"fe6b19d7-fe42-4231-b346-f3a6e7612a58","resolution":{"observed_at":"2026-08-04T21:28:48.745667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 17 inbound Pith citation observations for arXiv:2509.07980."}