{"as_of":"2026-08-10T19:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d24313c52035121028de795619735fc74ab2e7bc70074766d68588b314e6ab9a","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:57:49.117837Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:40:36.038438Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:57:41.429120Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-08T14:40:36.038438Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-08T18:40:06.157350Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:40:36.038438Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2502.06703"},"observation_digest":"sha256:085b1ab8b1a47e170ee6855076985645a49d9363c09196638372af9a21e3799d","observation_id":"3dce8e4f-0f9d-4d11-a579-5c0aabe028d2","resolution":{"observed_at":"2026-08-08T14:40:36.038438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":247,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:96b5cbf464153af8926686e3bc85e2928e6727ebaf15dff246ccdaf7825c167b","observation_id":"f9a615c3-b6df-4fb9-b809-2dc43c1778f4","resolution":{"observed_at":"2026-05-13T01:36:24.423192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-07T15:07:04.324930Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16401","last_updated":"2025-06-12T15:02:59Z","snapshot_observed_at":"2026-08-07T14:59:29.508178Z","submitted_at":"2025-05-22T08:52:21Z","title":"Divide-Fuse-Conquer: Eliciting \"Aha Moments\" in Multi-Scenario Games","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:04.324930Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2505.16401"},"observation_digest":"sha256:51872a73b9006ce88e6c0d6d2cd714ec9887889170445fec79123edaaea90930","observation_id":"44ac4dce-7654-4d1a-88b3-5134cc8e77f0","resolution":{"observed_at":"2026-08-07T15:07:04.324930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-07T12:47:22.078456Z","title":"Satori: Reinforcement learning with Chain-of-Action-Thought enhances llm reasoning via autoregressive search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23604","last_updated":"2025-05-29T16:15:36Z","snapshot_observed_at":"2026-08-09T05:03:49.842579Z","submitted_at":"2025-05-29T16:15:36Z","title":"Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:47:22.078456Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2505.23604"},"observation_digest":"sha256:9318a315de120090e1bdf2d685e6a381f3c7ac79489d977c49ad53439a7aff2d","observation_id":"e4ecac6f-8fb3-4663-a6a9-f731e82367d8","resolution":{"observed_at":"2026-08-07T12:47:22.078456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-07T05:14:47.425928Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-07T09:15:20.058485Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:47.425928Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2506.08446"},"observation_digest":"sha256:7a7e9487ece942cbc6023a1dbd41192e2e897ea98a7ffd535ca7a41ba348a623","observation_id":"9fce8929-7c3b-4dd7-9c7f-21a23129442c","resolution":{"observed_at":"2026-08-07T05:14:47.425928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-06T23:28:39.674751Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18237","last_updated":"2025-06-23T02:06:04Z","snapshot_observed_at":"2026-08-08T19:39:45.470566Z","submitted_at":"2025-06-23T02:06:04Z","title":"AdapThink: Adaptive Thinking Preferences for Reasoning Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:39.674751Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2506.18237"},"observation_digest":"sha256:9d75cd3e61046ee4d1a3156621ddb0f05332164eef9c0538ff7cc6ff7440377b","observation_id":"f604a5e2-42d6-4142-893b-39539c96e298","resolution":{"observed_at":"2026-08-06T23:28:39.674751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-05T04:42:06.395257Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-10T17:33:07.161592Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.395257Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:bfc47100690c05db019ab9080c13d461da10e8739e75b3b7d884fab450477c97","observation_id":"d3877bd5-b1fc-4b05-8349-1711b53a8446","resolution":{"observed_at":"2026-08-05T04:42:06.395257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-03T00:13:28.211988Z","title":"Satori: Reinforcement learning with chain-of-action-thought en- hances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11351","last_updated":"2026-06-28T23:49:44Z","snapshot_observed_at":"2026-08-08T10:00:22.672311Z","submitted_at":"2026-02-11T20:40:43Z","title":"Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T00:13:28.211988Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2602.11351"},"observation_digest":"sha256:5b0297993bd357c2de788929952d5528b3e0dae2b0e700da931657ffdc83a082","observation_id":"2465e9b8-0ca7-4897-9838-026eacf3cd3d","resolution":{"observed_at":"2026-08-03T00:13:28.211988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2605.07353","last_updated":"2026-05-08T07:08:25Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:08:25Z","title":"Confidence-Aware Alignment Makes Reasoning LLMs More Reliable","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:40.020460Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2605.07353"},"observation_digest":"sha256:46e37f0c7b9d73f0105c28084d64189ecbb3d0c55b9ef75f03e3793cf2f833b4","observation_id":"6c5bfa9d-980d-4cbb-980e-0309ac158e4e","resolution":{"observed_at":"2026-05-11T03:55:53.932850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2605.18851","last_updated":"2026-05-13T11:04:31Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-13T11:04:31Z","title":"STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T20:47:16.236629Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2605.18851"},"observation_digest":"sha256:1931936a3c96a3611a52838b40ba561a422e305f458f2bec70c33f031bb7d0c9","observation_id":"95abce7f-b9cf-4393-a279-22f842fa3615","resolution":{"observed_at":"2026-05-20T20:49:00.696829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2605.20654","last_updated":"2026-06-03T08:00:52Z","snapshot_observed_at":"2026-08-02T18:56:31.274465Z","submitted_at":"2026-05-20T03:16:15Z","title":"REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-21T06:16:01.040236Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2605.20654"},"observation_digest":"sha256:ed4344600edc3d215944592f1250b066a5b91f3b2d5e87714ae8a0fae93d2c71","observation_id":"fb1c88c3-4325-4065-858e-d40580c05100","resolution":{"observed_at":"2026-05-21T06:19:41.990511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2605.22138","last_updated":"2026-05-21T08:11:54Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:11:54Z","title":"Efficient Agentic Reasoning Through Self-Regulated Simulative Planning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-22T06:33:36.846345Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2605.22138"},"observation_digest":"sha256:25a133bcef2338066ac16ade6f1c78e6e70261a8c533a7525e56aa7537072a54","observation_id":"4dae21f0-5cb3-4497-ac38-039c04402437","resolution":{"observed_at":"2026-05-22T06:34:41.015581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-08-08T11:14:54.052517Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:a315beec838bbe8eafc3c9d44991467969399bfcc505491e5274c0d991b779e9","observation_id":"d65c1290-9258-4ad1-accd-ea2af3017a66","resolution":{"observed_at":"2026-06-28T17:22:24.890131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":"2502.02508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-07-03T05:57:41.429120Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances LLM reasoning via autoregressive search","venue":null,"work_id":"66c78192-e23f-4d45-b4d4-e395c45ad50d","year":2025},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-06-09T21:59:37Z","snapshot_observed_at":"2026-07-06T23:50:35.052764Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:fc85c0397e9cc59cbe6fa34cf9c9f0e2e4e3ca610a610b3d508f975fd46809d0","observation_id":"545b8966-bd2a-4b23-b2e0-185011057ac0","resolution":{"observed_at":"2026-07-03T05:57:41.430647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02508/citation-record","integrity":"/paper/2502.02508/integrity","json":"/paper/2502.02508/citation-record.json","paper":"/paper/2502.02508"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.205152Z","title":"( s + 2) ( 2.4− t 60 ) = 9 Let’s solve these equations step by step","venue":null,"work_id":"ece24b98-c273-4275-aecf-c068639b2a06","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.824996Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:b00f1fda36dc8c7995952bd4a07df094df0bd8df119b5b1abc52b2875d88abde","observation_id":"1229900a-f24d-4041-8375-33a12896dd33","resolution":{"observed_at":"2026-08-09T11:57:50.209342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:48.754123Z","title":"Self- consistency improves chain of thought reasoning in lan- guage models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.754123Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:406f4f45886c16398107150932122d490e208f6f91d4a5c5d06833933a382773","observation_id":"ad843070-ac30-4804-a4dd-5e40acc01e59","resolution":{"observed_at":"2026-08-09T11:57:48.754123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-09T11:57:48.758762Z","title":"Math-Shepherd: Verify and reinforce LLMs step-by-step without human annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.758762Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:72083e9778a1cd97da119f77cdfd814ecce739cafddf4bb8e838a29a88d2db4a","observation_id":"22b49c8f-5b87-473f-b689-220da3b35a17","resolution":{"observed_at":"2026-08-09T11:57:48.758762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-09T11:57:48.763506Z","title":"DeepSeek-R1: In- centivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.763506Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:7b17d89f2ed713c7ae92c6c058f5f285574fa1a4624ec7b0c086e4dfecefa7c9","observation_id":"e4c20d2e-04df-4ed4-ad19-030622c80607","resolution":{"observed_at":"2026-08-09T11:57:48.763506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06195","last_updated":"2024-08-12T14:42:13Z","snapshot_observed_at":"2026-08-09T16:44:49.698332Z","submitted_at":"2024-08-12T14:42:13Z","title":"Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06195","snapshot_observed_at":"2026-08-09T11:57:48.773155Z","title":"Reflexion: Language agents with verbal rein- forcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.773155Z"},"links":{"cited_paper":"/paper/2408.06195","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:fd52edbc5faab365e95dfee6e36c8272017e6e7c63ae41529d9ba2039c148fba","observation_id":"f07620ed-7ca1-4ac4-9df6-786b49367384","resolution":{"observed_at":"2026-08-09T11:57:48.773155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16579","last_updated":"2024-11-25T17:11:54Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T17:11:54Z","title":"Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16579","snapshot_observed_at":"2026-08-09T11:57:48.778636Z","title":"Recursive in- trospection: Teaching language model agents how to self-improve,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.778636Z"},"links":{"cited_paper":"/paper/2411.16579","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:715d6be936a287bc9042ec1356eb1dbccb1bcb86b4fdbdda83be249321fc8d92","observation_id":"d2ac63d0-277d-4136-855b-3533293a6cef","resolution":{"observed_at":"2026-08-09T11:57:48.778636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.062418Z","title":null,"venue":null,"work_id":"6157ed18-39a2-43d6-84d8-fa92d83d0c32","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.873047Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:a752568a91472f68f3598b2efd75ec9e5984160d5ac62c479175dfef07378795","observation_id":"c692f436-95e2-4d79-8f9f-7afaea91f86f","resolution":{"observed_at":"2026-08-09T11:57:50.066840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.049180Z","title":null,"venue":null,"work_id":"5544bce4-7cfd-435a-8b51-6290e9d7b790","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.877128Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:afaf607a5dcedbd749ffc4003483ef5999d6e059ae18ba52d17c921cf6d6acc5","observation_id":"c1d70402-b030-47bc-b71a-db2d3020a1d0","resolution":{"observed_at":"2026-08-09T11:57:50.053463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.035897Z","title":null,"venue":null,"work_id":"afd85e93-ea1d-446e-9c6c-4b1d448d6421","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.881086Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:5cba1ba58fd2ddb1ec1c494fb28a3f00decb6ec180e134d34a3c2f88fd7c82e5","observation_id":"a4e8493c-1a30-45a9-b0bd-7bf9cab9f7c4","resolution":{"observed_at":"2026-08-09T11:57:50.040040Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-09T11:57:48.797404Z","title":"Qwen2.5-math techni- cal report: Toward mathematical expert model via self- improvement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.797404Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:b50ecc495ce7d3160f095fc5e9f5ef95bf82b23725a0779dee110ec926af8332","observation_id":"7f7acff6-6204-4b09-a876-a4dc6805cb13","resolution":{"observed_at":"2026-08-09T11:57:48.797404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04295","last_updated":"2023-12-05T08:38:01Z","snapshot_observed_at":"2026-08-07T23:35:18.737859Z","submitted_at":"2023-09-08T12:34:28Z","title":"FIMO: A Challenge Formal Dataset for Automated Theorem Proving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04295","snapshot_observed_at":"2026-08-09T11:57:48.802192Z","title":"SWE-bench: Can language mod- els resolve real-world github issues?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.802192Z"},"links":{"cited_paper":"/paper/2309.04295","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:9d9299c5ab7e6d6666ef04e11dadef7fa3b61138c77cf80840c88ce89f5ec4b6","observation_id":"9d6d1d30-2b9b-442a-8479-e85dc2cdf8fd","resolution":{"observed_at":"2026-08-09T11:57:48.802192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02884","last_updated":"2024-11-21T07:07:59Z","snapshot_observed_at":"2026-08-07T12:03:21.367108Z","submitted_at":"2024-10-03T18:12:29Z","title":"LLaMA-Berry: Pairwise Optimization for O1-like Olympiad-Level Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02884","snapshot_observed_at":"2026-08-09T11:57:48.815737Z","title":"Generating sequences by learning to self-correct,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.815737Z"},"links":{"cited_paper":"/paper/2410.02884","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:1c0aaffd7b22fc2f6ba9c2d82188090943bf90dfe297aca6161224fc7b2eae06","observation_id":"cf00df94-b20b-4b68-8a09-efa45ca0b981","resolution":{"observed_at":"2026-08-09T11:57:48.815737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:48.820421Z","title":"The final answer is: 7 Figure 6: Math Domain Example","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.820421Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:154734c71bbf99744e30b61dec71fff0aa6ff23dbcb1594c02dc71428cd8a524","observation_id":"17b21789-6b6d-49df-8266-65ab88b727f1","resolution":{"observed_at":"2026-08-09T11:57:48.820421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.166563Z","title":"- For p = 2: The exponent in 17! is 15","venue":null,"work_id":"0ee863af-c3a5-4522-8c66-7ad82c9a6699","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.838795Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:c35a39b96e14275788cf0ec109655c74abc13ad9a117fb132bf0a5ba0b7ccf64","observation_id":"4951b2ab-7486-4d87-abd6-a331eddc6b91","resolution":{"observed_at":"2026-08-09T11:57:50.170634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.192108Z","title":null,"venue":null,"work_id":"c0e8b965-ad4e-4e3b-be5d-4bf104beb5a6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.829328Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:3227305baa8fee3549dbee94b1df996d78937c27c3a479e3eb426eeea284d762","observation_id":"90b6fbf8-c42e-458b-be63-406341098dd8","resolution":{"observed_at":"2026-08-09T11:57:50.196434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.153569Z","title":null,"venue":null,"work_id":"a837f11c-30d7-4e1f-bc8f-4dd52b89708d","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.843189Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:ff81ca3bf9bb767ba82abb50b729e4d2565256983800bfb8014512891c4db082","observation_id":"e10216c5-ea86-4ad2-832d-5319d6692a62","resolution":{"observed_at":"2026-08-09T11:57:50.157546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.140643Z","title":null,"venue":null,"work_id":"9b1b9426-0ff1-42d4-a339-77f367d01f92","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.847508Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:2206a2881d8743c7b11c92ead7d2069acaa3afcd57cf367d42ced2d8dd5d463c","observation_id":"f2b2bf08-6002-4209-9eba-b358a6efedc4","resolution":{"observed_at":"2026-08-09T11:57:50.144768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.128045Z","title":null,"venue":null,"work_id":"2d5f0869-e17e-4d96-b8e4-032503abee05","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.851794Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:5b5544dbd1e782100a264e356c0462cb3e7cb7b83cb4cae4ff5456da5f46e6e1","observation_id":"e92b71bf-6983-4a18-854a-7f2ad207b046","resolution":{"observed_at":"2026-08-09T11:57:50.131974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.115110Z","title":null,"venue":null,"work_id":"4e5bb4a9-dc6d-4b40-8c6c-004a74e5f7a6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.856150Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:435b837d178d71cac1c3aec70648b7b999b564e6a8ce592f38b3f5c93651071a","observation_id":"abb21582-f2a0-4546-bc1c-a6fcfe9e8b39","resolution":{"observed_at":"2026-08-09T11:57:50.119153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.102302Z","title":null,"venue":null,"work_id":"765173a1-aa71-428d-b6cb-61c389d99520","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.860446Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:941e5ac48269d1354a72940369c1059a92730205b3f670cc56fb721ebdf98d0a","observation_id":"777bdcce-ada4-49fc-97fb-1b9de9789362","resolution":{"observed_at":"2026-08-09T11:57:50.106481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.089090Z","title":null,"venue":null,"work_id":"f9ea5925-d39a-4336-9654-5371e19556cc","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.864677Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:e29b3c00aa5edd4ecd882f7e6ccae92f76eeed09e6de85bbd930d891190afb37","observation_id":"a8672318-e70f-4ff6-8aea-480f3952d479","resolution":{"observed_at":"2026-08-09T11:57:50.093349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.075774Z","title":null,"venue":null,"work_id":"e348bb3e-d7fd-49ad-9363-612a93553ebd","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.868939Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:a7a35351de1d97d8142879cccc83ef1b895d916579c64397cdb0bde0e55f24e3","observation_id":"87438d9e-6158-4009-9c43-d64daa440b31","resolution":{"observed_at":"2026-08-09T11:57:50.080011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.023065Z","title":"- The liger is a physiotherapist","venue":null,"work_id":"d21ec63c-a1c2-42f8-8566-f0d6808d7383","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.885162Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:c994ace48db0ab0ee5bde524a3d101b06391cb0ca809a8a94e4780c388e8dd9b","observation_id":"ce5e6b8e-8bcf-492d-850e-299148b484f4","resolution":{"observed_at":"2026-08-09T11:57:50.027233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.009596Z","title":"- The dimensions of the box are 52.3 x 43.6 x 36.1 inches","venue":null,"work_id":"f2a888a7-48fe-46cd-ac40-b52dea59eee5","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.889206Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:428b5818a6f1444699017b96c283d502dcc26a1f15aedc54000cf13e9f0be751","observation_id":"02121093-8594-4fab-969a-83c14b37d159","resolution":{"observed_at":"2026-08-09T11:57:50.013742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.996280Z","title":"- The seal hides the cards that she has from the bee but does not build a power plant near the green fields of the husky","venue":null,"work_id":"c27e14f0-dfbe-462c-9645-29d2c180987a","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.893289Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:8e87256bdd8ce455f3f24c491228c7e92ab9b78b21f8f73da5b6d62b06d365ea","observation_id":"9523bf24-98d7-47d6-bb58-8f9ecaa43a15","resolution":{"observed_at":"2026-08-09T11:57:50.000605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.982996Z","title":"Therefore, the final answer is: True","venue":null,"work_id":"4e9e1453-51f4-48a4-b5ac-ddb3508fcc7e","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.897435Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:c6d025f2568997432fddf1ef5ab0aad919fa069f0173daa5272adcae250cd399","observation_id":"bf68543f-2169-4be7-8dd4-c5c382ab41d0","resolution":{"observed_at":"2026-08-09T11:57:49.987513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.970287Z","title":null,"venue":null,"work_id":"7a7bcba5-83a6-4e7e-b7b7-13c1227e74b1","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.901882Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:ea26f50a1393c6c01d2550f5add959d5a82947bae262f398e915fb59a954e9d0","observation_id":"44c8e436-d893-49ea-870e-02b0eb7a74ef","resolution":{"observed_at":"2026-08-09T11:57:49.974480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.957654Z","title":null,"venue":null,"work_id":"1f9491fc-61a4-42b4-93b6-be6f49619770","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.906295Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:888dbb9a2d187227bca1a2c76990fdf30e6b99de89e0a8871bf9a54aac8ef289","observation_id":"3571d180-50a5-4a2b-9753-e55d5e86d7e4","resolution":{"observed_at":"2026-08-09T11:57:49.961712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.944393Z","title":"Based on the facts above, answer the following question","venue":null,"work_id":"875874d4-905a-41fe-a857-7074608622e4","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.910561Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:3653b9d02f65793e02dc569dc773e80075d2c91599e609ec5bf9897bbcaeb845","observation_id":"ea7231ba-b934-4bd9-aba9-6f1de521ebc8","resolution":{"observed_at":"2026-08-09T11:57:49.948650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.931222Z","title":null,"venue":null,"work_id":"7ce0913c-e7e9-4406-b567-b428652bbb28","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.914960Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0d3bb40c04f8984178acd251be2396888af7b1763162b77b7378b3d795326a2a","observation_id":"99591b1a-de19-4422-93e4-dbfbe821be49","resolution":{"observed_at":"2026-08-09T11:57:49.935352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.918473Z","title":null,"venue":null,"work_id":"edf00ac8-f8e7-4a48-b6bc-e1866c2a37a9","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.919175Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:f4124de80badef479141cdf60ac0c254b4d7ae196a19477f9da3e6c6efcccb4e","observation_id":"d4f71e77-8491-4029-ad36-21663d827ae3","resolution":{"observed_at":"2026-08-09T11:57:49.922571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.904786Z","title":"Christopher Reeve’s spinal cord injury was severe, and he required specialized medical equipment and ongoing treatment","venue":null,"work_id":"23c7a644-3704-477f-abd8-60eb67bebe9f","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.923486Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:71ad6cd20bd24b6f4108648c0de7d108978a99feef67a1e3959ed50cd55b0ecd","observation_id":"9c233a02-91d4-4681-a439-8cff21c8f94a","resolution":{"observed_at":"2026-08-09T11:57:49.909191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.891677Z","title":"The molar mass of Mg is 24.31 g/mol","venue":null,"work_id":"8a10fd67-b377-4b5c-b33d-eefa3b774395","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.927807Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:582808fb9dc760c116e858eafba0ecc9e157e926ea626f83b84ade8e03d589b8","observation_id":"fd1a1377-5d53-4f12-9b72-8680a4a240c4","resolution":{"observed_at":"2026-08-09T11:57:49.895865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.878539Z","title":null,"venue":null,"work_id":"7b1893c1-ec27-4dd3-9ff4-60afd7322ebc","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.931959Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:fac0ef763530f04a4def2fdde1dcbf87127efe39cb371988de72637e3d234aef","observation_id":"0dcf4edd-ccde-4e4f-907c-e2be8e9c3cae","resolution":{"observed_at":"2026-08-09T11:57:49.882898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.865533Z","title":"Since the reaction occurs in a beaker and the volume change is significant, we need to consider the external pressure and the change in volume","venue":null,"work_id":"ff489748-7cd7-4104-8e94-94a2906ffed3","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.936376Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:27e10343340a5cb19fa0134d3a71f9b9751353b087c67577baad5c065b372f97","observation_id":"69830b52-fb84-451f-88ba-3d86a1614d41","resolution":{"observed_at":"2026-08-09T11:57:49.869824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.852171Z","title":"Here, text = ’ertubwi’ , sep = ’p’ , and maxsplit = 5","venue":null,"work_id":"6951bc3b-16da-4051-90dd-b9f14593eaa0","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.940664Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:806e57863ca04c82593cc746b80775aeabaaddbea022e1bc86c03e290b4c420a","observation_id":"2c19af94-8fab-42ae-8de9-effd2345dfb4","resolution":{"observed_at":"2026-08-09T11:57:49.856599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.839314Z","title":null,"venue":null,"work_id":"f2edd071-818a-499b-8087-7a2f9d4894d9","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.945072Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:c3973a686032dc31c88cfa9983c4df938bf19037b2e3e209c17c007e56adb43d","observation_id":"ba60185a-c98c-40c9-a26a-1ba0eee35b54","resolution":{"observed_at":"2026-08-09T11:57:49.843271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.826394Z","title":null,"venue":null,"work_id":"4e2937bd-1e07-4ef8-b9d7-5397b4ec7174","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.949270Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:126af278b2588384d03aa74fdde162af13c77736a0d28c88a1047c4884ad2c21","observation_id":"ec314509-d6d9-4609-9331-5d69742a99f6","resolution":{"observed_at":"2026-08-09T11:57:49.830571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.813833Z","title":null,"venue":null,"work_id":"281544d5-b28d-4d50-a894-07e8cc1237a7","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.953461Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:1b5dc87fd6cfbd028290ee8886407a6b023acdd2fb8f41f20d82f310ce1ca856","observation_id":"b6ca5d4f-7b25-4fdd-856f-60c266f740d1","resolution":{"observed_at":"2026-08-09T11:57:49.817832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.801266Z","title":"Let’s consider the correct approach:","venue":null,"work_id":"a18420bc-875f-4107-a590-6e23c514a9e6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.957469Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:1c0313b57e412c077aea855b2c6144e8525b51ae3975d2996f370a417fb988b4","observation_id":"349d8217-d6a6-45f3-870e-cd1e5e910ed8","resolution":{"observed_at":"2026-08-09T11:57:49.805212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.788234Z","title":"Given the function’s behavior and the input, the correct approach is to split the string into two equal parts and reverse the first part","venue":null,"work_id":"f3999227-34a4-442b-9cbe-f70b246c3bf3","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.961799Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0ff36cadf4b4e1a9db0fb5b7e7756fa044e198ca3d2f443917098b5686b10fd1","observation_id":"f816ac15-1d9a-4c7d-a835-3929024227bd","resolution":{"observed_at":"2026-08-09T11:57:49.792615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.775501Z","title":null,"venue":null,"work_id":"8a16f90d-3efc-4636-9fb8-1cad27852beb","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.966290Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:b0a10b1564596aff937ee4cf70ee915a22b5df930fd9c31956c1c79c3db71bdd","observation_id":"86edcf3a-a8eb-42be-8f1e-bd830876c99a","resolution":{"observed_at":"2026-08-09T11:57:49.779702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.762957Z","title":null,"venue":null,"work_id":"8819ee72-727a-40b4-a902-eee137283e8b","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.970794Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:cfdc834a513eb72c5677640130a78e697ab194340e61b1a28b5d1200f327ec27","observation_id":"8ecbffa9-686f-4070-b627-d7e3800d4444","resolution":{"observed_at":"2026-08-09T11:57:49.766859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.750311Z","title":"Therefore, the final answer is: uertpbwi","venue":null,"work_id":"5517f234-fd94-4fb1-9c0c-71c256b807b5","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.974976Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:985fae1e4d4752fcfb4123dfc642e64b98832992c689566d7f9cf698a92c2e83","observation_id":"05b90b56-5fab-4fb8-aca9-12731434e318","resolution":{"observed_at":"2026-08-09T11:57:49.754569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.737654Z","title":null,"venue":null,"work_id":"7b8fc317-fa2f-497f-8cf8-e6035884c7e4","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.979367Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:6626526cbc1f5054010a89f452cc55a12bc58f4fc35b0f261d40e0c1c97a6ec2","observation_id":"1ca2df08-b4d2-4b80-aee0-0bf7aad63402","resolution":{"observed_at":"2026-08-09T11:57:49.741549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.725213Z","title":null,"venue":null,"work_id":"694a3026-33b3-4d09-88e9-808d3637fba6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.983809Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:42a538a78fe2601057d67145fd5a87a185954b175215107e0e2e30cfee98c131","observation_id":"c5f63040-891e-405e-b8bd-d9d959bff08f","resolution":{"observed_at":"2026-08-09T11:57:49.729279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.712567Z","title":null,"venue":null,"work_id":"d7729486-a905-44da-b106-f4e38c557c6c","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.988466Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:963d636a43ff3deb5b54d2f56bc1b045c60d1b1cc4d8af30441d2e244499e9c5","observation_id":"abb1883f-114f-4317-9126-d9c4c5187dea","resolution":{"observed_at":"2026-08-09T11:57:49.716694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.699649Z","title":null,"venue":null,"work_id":"09bdafc0-295d-4552-84b0-eb9cefeb8f88","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.992777Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:264dad5be870d5232b96489cbe27b09c39b28bf7483a82a21ce3ea8e72b6cef4","observation_id":"3e88025a-aafd-41ca-a416-84d63f7d2690","resolution":{"observed_at":"2026-08-09T11:57:49.703827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.686014Z","title":"superhuman","venue":null,"work_id":"028d0a0d-ddef-4a5b-8cc5-4f8bec907e5d","year":2021},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.996928Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:beddc4094fcc36d4686bed3d07367aa6e4ba7b26060202e8e036c9b2d1b37490","observation_id":"ceeaa65e-5ae9-4037-8c03-29b00904140d","resolution":{"observed_at":"2026-08-09T11:57:49.690490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.672590Z","title":null,"venue":null,"work_id":"215da23e-0365-4d51-8ba1-9cbbf57cf449","year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.001527Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:234adcd4ee6702504f1abce59959c35c27b2ea4fa7784c1bcfcaad345a141fb8","observation_id":"825bd4f2-9bbf-4372-8d44-9d73c49354da","resolution":{"observed_at":"2026-08-09T11:57:49.677070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.659738Z","title":null,"venue":null,"work_id":"7c1cb7ab-29a8-44e1-a462-6909b06f315b","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.006055Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:614a603c89e5e50d19a2eab41696638ef411654ce23477234d4f6a5bee25af24","observation_id":"f374d70c-f487-4960-b004-b9010dd17816","resolution":{"observed_at":"2026-08-09T11:57:49.663891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:50.179452Z","title":"$x$\\\", (high, 0), E); label(\\","venue":null,"work_id":"f1256a58-2daa-4972-bb3a-90892aefde7a","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.833684Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:e2461237065c8d56bff86bebdf00dfc6d12c1409677babdb2838283f2e53a632","observation_id":"440fd80b-05ef-4887-94d2-c5c0950a5070","resolution":{"observed_at":"2026-08-09T11:57:50.183460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.646518Z","title":null,"venue":null,"work_id":"f5940daa-623a-4de4-a00c-382d8e1ec2bc","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.010468Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:d10dd3576b9a7bb3eb727050ef25f33aee4106d9a2f65c6c6ff9ec5a17f169c2","observation_id":"a98f65f2-ce8b-4bd4-9cd3-4a3eb0c65d48","resolution":{"observed_at":"2026-08-09T11:57:49.650716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.633360Z","title":null,"venue":null,"work_id":"f9e0165a-d7d3-49f5-8890-8de335037dcc","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.014684Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:63dffa8d5125b934e819151101f92064bf6ef4fe377bc7c64503dd9fc56b31e2","observation_id":"6acb6765-8bdd-49c4-8d36-86741e19e657","resolution":{"observed_at":"2026-08-09T11:57:49.637406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.620662Z","title":null,"venue":null,"work_id":"f8cb710d-e802-49bd-be8c-148285178f1d","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.019125Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:07e69c0b035f1d8d88f7caddf8e7f9cadadba84eebce66c2d6d2eeb681f27cb8","observation_id":"8cc3729f-f38e-4e13-af50-12adacdcab2c","resolution":{"observed_at":"2026-08-09T11:57:49.624675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.608045Z","title":null,"venue":null,"work_id":"157e16c7-d1ba-4560-adf1-9679eaa3c1f6","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.023421Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:f760875d16386e5c5a588cfeffe5c84ed68a318b37ae39e02d096e04a16004fd","observation_id":"fdf46ab8-92e1-40e4-87dd-0dd07027af26","resolution":{"observed_at":"2026-08-09T11:57:49.612216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.595008Z","title":"The prompt templates for these situations are detailed in Appendix D.1.1","venue":null,"work_id":"61934083-e7bc-45ea-b351-f6bdda52da3e","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.027700Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:6e0795ae9e027b96745ca503bfefd9462a6542443a1523409f565e5cdcb83e96","observation_id":"3bb8c525-c608-422b-bad7-b8df7e631eb8","resolution":{"observed_at":"2026-08-09T11:57:49.599320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.582224Z","title":null,"venue":null,"work_id":"43e47a6c-a4fe-423c-99c4-5ef2ae5134d8","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.031908Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:083e9ee2cda4e90c609448818564c00566b8145442547ef09db19142eadd6fda","observation_id":"73504001-38ec-4431-a69c-b15472a3f8fd","resolution":{"observed_at":"2026-08-09T11:57:49.586401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.569154Z","title":null,"venue":null,"work_id":"4e0ac90f-cdfe-4b83-ab39-203345f3d50a","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.036034Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:943535d7a88e785604bda91d9fc60b60a8e4a1bc5ca157fae107a92e13dee8fa","observation_id":"f9036570-0158-46fc-a653-4793b71f957f","resolution":{"observed_at":"2026-08-09T11:57:49.573534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.556220Z","title":null,"venue":null,"work_id":"0b8696c1-7ed9-47b4-b54d-c6cfd384d1ad","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.040666Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:78ad2ce35e9e1a5ecf104d778953be295a1cef30ef363ee06aa3b3366803214c","observation_id":"2be8cf18-cc91-498b-8c66-97132679f4f4","resolution":{"observed_at":"2026-08-09T11:57:49.560445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.542918Z","title":null,"venue":null,"work_id":"36f9b1b0-a513-46c2-88ff-3f97fa589c11","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.044888Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:c0dc90f6f0332fa1615a502f1031481e6ed166bef6db16a849d6d673ab40081d","observation_id":"a31b254e-eaf5-4416-b473-50d75e761889","resolution":{"observed_at":"2026-08-09T11:57:49.547163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.529517Z","title":"Therefore, the final answer is: \\(\\boxed{answer}\\)","venue":null,"work_id":"3e716699-d752-4638-9235-c580dfe69251","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.048976Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:33947b5587bccb5335544253fd64fbc3a738be72b57c808e3a834ff558ed830e","observation_id":"21746f7e-f1ff-437a-9a0f-a5188a9b3e90","resolution":{"observed_at":"2026-08-09T11:57:49.533673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.515866Z","title":"Verify: [brief explanation of why you are correct with one sentence]","venue":null,"work_id":"4c848f43-4b86-4793-9d6f-b9d378c360bd","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.053555Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:8aa0a744439d126c7ddb590cdd397006eacf9561f59cbcc9c97117de808f8059","observation_id":"74f75386-9f21-4dbb-a897-5a9759c8299b","resolution":{"observed_at":"2026-08-09T11:57:49.520413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.502836Z","title":null,"venue":null,"work_id":"d3c919ce-fbba-4790-8224-02b81f3123b4","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.057793Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:5a4010786bf8dc3e154975c83001fc3407a0c063c54918edfc614fa57b1100e3","observation_id":"b8140fec-c184-44ac-ba4f-ba4d59b635a4","resolution":{"observed_at":"2026-08-09T11:57:49.506941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.488590Z","title":"ground truth solution","venue":null,"work_id":"8ce638ad-3855-4473-8d3b-4dfbcf6a1fef","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.061965Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0983fb2b95de5b217a7a8760ffd68553b663e13291d9564b2a6d4248e8ff9a64","observation_id":"8e954bae-307e-4996-a927-807d6d650c62","resolution":{"observed_at":"2026-08-09T11:57:49.492947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.475289Z","title":"Your task is to carefully review your own solution to a math problem, and adhere to the following guidelines:","venue":null,"work_id":"8182ed56-166e-4a73-bda4-2b0f7703afeb","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.066144Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:ebc7aa803ec98fb0f79745178ba6cbe6f7b969a92a7d28eb3d18aa1e1faefac0","observation_id":"5145fcb8-f4d6-446b-b393-24040ba1a788","resolution":{"observed_at":"2026-08-09T11:57:49.479751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.461663Z","title":"In Step <id>: [brief explanation of the mistake with one sentence]","venue":null,"work_id":"8c873df9-86cb-4fd4-8630-bdc97c68879a","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.070386Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:62dd1236712455945869063daa8f25c70b2bf622ae278a823769d51f4537de3c","observation_id":"001184a8-ab1d-465f-bf9a-98620a7691d4","resolution":{"observed_at":"2026-08-09T11:57:49.466269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.447778Z","title":"Alternatively: [your suggested step with one sentence]","venue":null,"work_id":"f78de392-65d4-45db-a802-759116f6aec7","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.074909Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:aeeb7db202164680e4e1d54e8b15903b37e79a7af28164be0ad80b521892dcaf","observation_id":"175599de-f265-4d54-94bb-a9a071bf276b","resolution":{"observed_at":"2026-08-09T11:57:49.452554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.434140Z","title":null,"venue":null,"work_id":"74cd06a1-b278-42b0-8892-223f38fd931b","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.078980Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:5820467cb22c95234bea079abf69a1328adfeda304a0b8e3a7596fd83db2381c","observation_id":"5ec0956c-14ff-4e15-9f1b-8914bc491e99","resolution":{"observed_at":"2026-08-09T11:57:49.438562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.420847Z","title":"ground truth solution","venue":null,"work_id":"f00d4a32-5c51-44cf-9ad3-600d92c7ea37","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.083128Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0b8f6b929a9acddfe12ff0b088980d2951f712a834d07d58536ce983f733e6fc","observation_id":"12b31eee-316f-4c46-a17b-ac1890d98f6e","resolution":{"observed_at":"2026-08-09T11:57:49.425042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.407269Z","title":"You are collaborating with a partner to solve math problems","venue":null,"work_id":"d14444f0-7768-4c8e-9219-815075b36ef9","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.087244Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:0b5cf8641a0605d28c8b4f7549d37358c3528bfcf8ec7b652867d3f8997a8078","observation_id":"87e3eeb2-83dd-4dff-89fa-3a4ca5684bce","resolution":{"observed_at":"2026-08-09T11:57:49.411650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.393804Z","title":"Your partner’s partial solution","venue":null,"work_id":"c7635d79-e52c-4eac-b085-a4654becb9dd","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.092476Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:099a02d884a2e335f4169ce5724a62d71e4c67448c240295ad486ece62cea1db","observation_id":"d0f29297-4655-444c-9f67-15c26dcb8c94","resolution":{"observed_at":"2026-08-09T11:57:49.398107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.378902Z","title":"Your partner’s partial solution","venue":null,"work_id":"2110d6a0-0da5-4557-863a-7cc7fb1281c2","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.096709Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:923def895f6015892f93edfd868d230dba88f872f10f871dc735d86100498968","observation_id":"68dcfcd3-ac7a-4ee1-bcfc-b54d0dd5352a","resolution":{"observed_at":"2026-08-09T11:57:49.383765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.364475Z","title":"Alternatively: [your suggested step with one sentence]","venue":null,"work_id":"12f9d4b8-0824-4d8f-84dd-6fc90c78d039","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.100902Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:8fb4d96dedf1d3f9e7cfeb38898cb45259ebe405ebf4adebf6968a2d71f221e6","observation_id":"49e2bf81-44b6-4ce0-853b-db0cf2e0b213","resolution":{"observed_at":"2026-08-09T11:57:49.368878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.350285Z","title":null,"venue":null,"work_id":"af691c1e-5869-466d-9804-fb4c24e9fee2","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.105098Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:665676791b9bc8f6d68d440e86713befa092400a7c6190f3b9eab2e57a093dca","observation_id":"1eb586c8-faf3-4076-939e-fca111bc0d06","resolution":{"observed_at":"2026-08-09T11:57:49.354962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.336379Z","title":"ground truth solution","venue":null,"work_id":"7736f983-a04b-4474-88ca-690a75193942","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.109751Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:6b7aa2e692d185f957ec40207b73eecd2772b2f837c93cc63b3e541bf6a2cc58","observation_id":"b8929a89-83dd-49ab-9288-3c0f08af1672","resolution":{"observed_at":"2026-08-09T11:57:49.340855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.321844Z","title":"DO NOT refer to any mistake in your partner’s partial solution","venue":null,"work_id":"7e794e9a-ba4f-4e5c-a68e-378bbebab8de","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.113775Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:a68d8594f44b9609a74200fabc3697eb9fd2b2e2f7cc953c36b53ab661c356af","observation_id":"343bcb62-c7e8-47c8-acc6-b67a5f3a413d","resolution":{"observed_at":"2026-08-09T11:57:49.327010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:49.306249Z","title":"three two five","venue":null,"work_id":"ad7f5da8-f859-41c1-93ae-a992e0544077","year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:49.117837Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:4eb669c33dcb657d1c5d7cb4a7cd9e4fe91ff88637c53ea71f099a27a58980c2","observation_id":"f3f5fad2-c131-4f0f-be50-f619e458dcd5","resolution":{"observed_at":"2026-08-09T11:57:49.311495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T11:57:48.792502Z","title":"A reduction of im- itation learning and structured prediction to no-regret online learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":668,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.792502Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:a0695a4895dfd15b1241a04ef5d06d2701ebe2041c823d97c39a69ff12bef2dc","observation_id":"2bd64f1d-4468-408b-a609-8a5c9002de74","resolution":{"observed_at":"2026-08-09T11:57:48.792502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:48.788137Z","title":"Efficient reductions for imitation learning,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.788137Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:06dbc94e490edbd1ba139d56fc986910db633753bc818af67dac7e893ac1e86c","observation_id":"48295069-fb9a-405b-bdbc-fd320cc7f24f","resolution":{"observed_at":"2026-08-09T11:57:48.788137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04229","last_updated":"2024-06-06T16:29:25Z","snapshot_observed_at":"2026-08-10T06:23:47.214592Z","submitted_at":"2024-06-06T16:29:25Z","title":"The CLRS-Text Algorithmic Reasoning Language Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04229","snapshot_observed_at":"2026-08-09T11:57:48.811186Z","title":"The CLRS algorithmic reasoning benchmark,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.811186Z"},"links":{"cited_paper":"/paper/2406.04229","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:bbaccd9cf13ce0ceba4bebc1598579e859770806a8f0c32c73aabe05e6641300","observation_id":"25f66ac8-423b-486c-9a92-82531b4a572c","resolution":{"observed_at":"2026-08-09T11:57:48.811186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:57:48.783650Z","title":"Im- itation learning: A survey of learning methods,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.783650Z"},"links":{"citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:b640f7b37e7bdc03b7a7a583d6556abd1bf8ce105ea4e2c79f3cc30171b11a55","observation_id":"9b043971-f640-4552-aee1-adc2149f58f7","resolution":{"observed_at":"2026-08-09T11:57:48.783650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01560","last_updated":"2024-10-05T03:54:22Z","snapshot_observed_at":"2026-08-10T11:04:25.169116Z","submitted_at":"2024-10-02T14:00:09Z","title":"OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01560","snapshot_observed_at":"2026-08-09T11:57:48.748398Z","title":"Openmathinstruct-2: Ac- celerating AI for math with massive open-source instruc- tion data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.748398Z"},"links":{"cited_paper":"/paper/2410.01560","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:26522725a9ae23a774f5fb2bb4c5e88f1116743cdf872c107a6c4a1879c6e07c","observation_id":"74fa24fa-07e2-48f0-99c3-4e3cb1325270","resolution":{"observed_at":"2026-08-09T11:57:48.748398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-10T07:37:55.457401Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-09T11:57:48.806698Z","title":"Common- senseqa: A question answering challenge targeting com- monsense knowledge,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"reference_index":3634,"source":"pdf_text","source_observed_at":"2026-08-09T11:57:48.806698Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2502.02508"},"observation_digest":"sha256:25b8d16780357bf5b139b1b711456d160ff76b56eeccb8ade1648dc8ba7592da","observation_id":"18646795-6beb-43db-b12b-d781a9d6c42c","resolution":{"observed_at":"2026-08-09T11:57:48.806698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T18:27:22.109369Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 14 inbound Pith citation observations for arXiv:2502.02508."}