{"as_of":"2026-08-20T14:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea42121c331ae21a6217e43b6f315e18378e0096aab82ff371a0f415266a81e7","coverage":[{"denominator":164,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:43:44.408738Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:56:46.353798Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T10:27:02.431242Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-15T23:56:46.353798Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.03469","last_updated":"2025-05-21T06:17:56Z","snapshot_observed_at":"2026-08-20T14:00:28.683849Z","submitted_at":"2025-05-06T12:18:11Z","title":"Long-Short Chain-of-Thought Mixture Supervised Fine-Tuning Eliciting Efficient Reasoning in Large Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T23:56:46.353798Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2505.03469"},"observation_digest":"sha256:58e5caa630399788d6a93b0cbad83a7ccc4f566f9a96e610d6e2cbaee7f2fee1","observation_id":"e17fa188-ac60-485a-8b92-9650eba75225","resolution":{"observed_at":"2026-08-15T23:56:46.353798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-15T20:40:19.843039Z","title":"100 days after deepseek-r1: A survey on replication studies and more directions for reasoning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12370","last_updated":"2025-05-24T03:01:02Z","snapshot_observed_at":"2026-08-17T13:59:43.463445Z","submitted_at":"2025-05-18T11:22:04Z","title":"Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:19.843039Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2505.12370"},"observation_digest":"sha256:4ad6ce789e5799a4d523fd4c4e5ebf9ba5557382ee9cca10699d79eb80a12e75","observation_id":"fbd93588-3794-49d2-b589-10b7e5da2a54","resolution":{"observed_at":"2026-08-15T20:40:19.843039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-07T14:31:11.242194Z","title":"100 days after deepseek-r1: A survey on replication studies and more directions for reasoning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-16T23:13:31.947741Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:11.242194Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:e7d401644e0682089006054292f5daf4e5cf0938a9deb28692469e33db64f86e","observation_id":"41b48aa1-d17b-4230-8db2-f10c5ecc337c","resolution":{"observed_at":"2026-08-07T14:31:11.242194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-07T13:08:59.831868Z","title":"100 days after deepseek-r1: A survey on replication studies and more directions for reasoning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22648","last_updated":"2025-08-10T06:05:46Z","snapshot_observed_at":"2026-08-19T22:44:55.403708Z","submitted_at":"2025-05-28T17:57:07Z","title":"WebDancer: Towards Autonomous Information Seeking Agency","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:59.831868Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2505.22648"},"observation_digest":"sha256:33372b196e5b8048dfbf3fff57a49791d57f8f15fd73b93b53732e67addcb1a1","observation_id":"426d76a5-1199-4889-a3fb-0e9c2a936848","resolution":{"observed_at":"2026-08-07T13:08:59.831868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-06T21:02:38.860058Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-17T18:30:09.396290Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.860058Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:748092cd35f5bb79a696741d70bd719c1ac868207325d2826d8620333ddf0a14","observation_id":"71613651-96da-44e0-bf60-01d6a1a7ebf9","resolution":{"observed_at":"2026-08-06T21:02:38.860058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-06T17:54:18.056863Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-20T12:31:43.651320Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":238,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:18.056863Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:7341b3aed453b0ed0e85137ef243949bbf1d7ddbb5f90b67ad0bd7f441c59587","observation_id":"0404d396-0421-4503-b026-64648534fb39","resolution":{"observed_at":"2026-08-06T17:54:18.056863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-08-06T15:55:42.618381Z","title":"100 days after deepseek-r1: A survey on replication studies and more directions for reasoning language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-19T12:08:46.453087Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.618381Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:bafcbafc26e1e3cb22bfad037000d49972e00cb773f25f659e7c4666820b8989","observation_id":"959f1a18-0010-458e-a947-05e298a39acd","resolution":{"observed_at":"2026-08-06T15:55:42.618381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":"2505.00551","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-07-10T10:27:02.431242Z","title":"arXiv preprint arXiv:2505.00551 , year=","venue":"cs.CL","work_id":"3e13be07-2f5f-4b04-be03-54b8eddcbee9","year":2025},"citing_paper":{"arxiv_id":"2605.08905","last_updated":"2026-05-09T11:57:25Z","snapshot_observed_at":"2026-08-11T11:04:38.944000Z","submitted_at":"2026-05-09T11:57:25Z","title":"Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T02:44:33.143247Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2605.08905"},"observation_digest":"sha256:dbcc7c7961c4a7be2d7d8610d84f74a5631bdc9b68be9abda0d072521993de8f","observation_id":"b3712cee-75c6-4c3d-ab03-29e56857fac0","resolution":{"observed_at":"2026-05-12T02:46:18.945828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":"2505.00551","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-07-10T10:27:02.431242Z","title":"arXiv preprint arXiv:2505.00551 , year=","venue":"cs.CL","work_id":"3e13be07-2f5f-4b04-be03-54b8eddcbee9","year":2025},"citing_paper":{"arxiv_id":"2605.31446","last_updated":"2026-05-29T15:40:58Z","snapshot_observed_at":"2026-08-19T07:19:56.761401Z","submitted_at":"2026-05-29T15:40:58Z","title":"Fine-grained Verification via Diagnostic Reasoning Supervision for Aspect Sentiment Triplet Extraction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T22:10:53.620510Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2605.31446"},"observation_digest":"sha256:dddb1277a0b11790b540194ee87923302261c5dc5bd9a99a1c0e61455a61ef7d","observation_id":"a4c8a8ab-0d59-4890-a6fe-6f8b65bba7fe","resolution":{"observed_at":"2026-07-01T19:36:09.438194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":"2505.00551","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-07-10T10:27:02.431242Z","title":"arXiv preprint arXiv:2505.00551 , year=","venue":"cs.CL","work_id":"3e13be07-2f5f-4b04-be03-54b8eddcbee9","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:ee9a3e965b72cb288013e0e3060689377c5ab5f3f8260a5de58646e7e1a204ef","observation_id":"7cfe54ec-dac8-4315-9e43-a6338af90cf7","resolution":{"observed_at":"2026-07-01T20:56:13.444066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"cited_work":{"arxiv_id":"2505.00551","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.00551","snapshot_observed_at":"2026-07-10T10:27:02.431242Z","title":"arXiv preprint arXiv:2505.00551 , year=","venue":"cs.CL","work_id":"3e13be07-2f5f-4b04-be03-54b8eddcbee9","year":2025},"citing_paper":{"arxiv_id":"2607.08268","last_updated":"2026-07-09T09:10:49Z","snapshot_observed_at":"2026-08-20T10:40:52.263302Z","submitted_at":"2026-07-09T09:10:49Z","title":"Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T10:20:46.103409Z"},"links":{"cited_paper":"/paper/2505.00551","citing_paper":"/paper/2607.08268"},"observation_digest":"sha256:5fd189db2f20ec10c4b49d41c12fc9d0c101a543fbcf90c76142d9cd3533f0af","observation_id":"dc303744-dedc-4b76-b87f-a00cd8383882","resolution":{"observed_at":"2026-07-10T10:27:02.432515Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00551/citation-record","integrity":"/paper/2505.00551/integrity","json":"/paper/2505.00551/citation-record.json","paper":"/paper/2505.00551"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.653066Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.653066Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:31c1f1c80eefc0758c5bc1a9fdbf3826b8318b05410a14d29f3c40f7f8af1336","observation_id":"539d1072-9f97-459b-94c5-7a17770fecb0","resolution":{"observed_at":"2026-08-16T04:43:43.653066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-17T16:48:59.674177Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-16T04:43:43.660637Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.660637Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:341810136ec212e1a4c75194da7024d1f5d02d766f696ba951d329e6781e2fcb","observation_id":"7b45ede3-5bee-4a45-8609-33f85f139e16","resolution":{"observed_at":"2026-08-16T04:43:43.660637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.665427Z","title":"Back to basics: Revisiting REINFORCE -style optimization for learning from human feedback in LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.665427Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:41c1854909fb06f52bba8acaaa5c03ce2961d409e3a5a408e47a9f6b1ac2f178","observation_id":"737fb8a7-6034-40b5-ba2f-2d8f6dc4fb6c","resolution":{"observed_at":"2026-08-16T04:43:43.665427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-18T07:57:35.968161Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-08-16T04:43:43.670016Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.670016Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:69a229c6e10dbb743b397f63b3651ef552f1159eba554cf21a1da4bb540baeab","observation_id":"33a3da34-7ee6-46b7-a0f3-3e436693dc6f","resolution":{"observed_at":"2026-08-16T04:43:43.670016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-16T04:43:43.675591Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.675591Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:2a18438b3cdd232c1632df0b86aab801f963bece9bf422394e2c844b86f43ca1","observation_id":"e654e9a2-1a7a-4f1e-b88a-6aedfa1803be","resolution":{"observed_at":"2026-08-16T04:43:43.675591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.681164Z","title":"Aops wiki:competition ratings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.681164Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:174b9217b3efe89e03cb16f8a25679b9c826aa4a4e9d3f4e1fd246777575406f","observation_id":"fcc8145a-006b-49c0-9d7f-b6a959fe05b1","resolution":{"observed_at":"2026-08-16T04:43:43.681164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.685923Z","title":"Training language models to reason efficiently, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.685923Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:128c7fd31d5a03ea8f64c39f57f16a746944214dee8df980c48d8616f62dc174","observation_id":"94de2831-4712-4f84-b463-4ee6d5318713","resolution":{"observed_at":"2026-08-16T04:43:43.685923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18438","last_updated":"2025-01-31T15:39:00Z","snapshot_observed_at":"2026-08-18T02:12:13.894958Z","submitted_at":"2025-01-30T15:45:56Z","title":"o3-mini vs DeepSeek-R1: Which One is Safer?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18438","snapshot_observed_at":"2026-08-16T04:43:43.692600Z","title":"o3-mini vs deepseek-r1: Which one is safer? arXiv preprint arXiv:2501.18438, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.692600Z"},"links":{"cited_paper":"/paper/2501.18438","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:87ef50faea949cc2a6d432ae7fe14a71597107e2afc92d5a8c35f859c8c03cf3","observation_id":"70909e96-10be-484f-b6c4-ec5351f37f12","resolution":{"observed_at":"2026-08-16T04:43:43.692600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.698742Z","title":"Bespoke-stratos: The unreasonable effectiveness of reasoning distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.698742Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:7b802ae27be32f5490be4fa67436c3f15571d4fe5ba0e64f392e18358e5f17d9","observation_id":"af693a3e-e438-4504-8094-8afd781e87a6","resolution":{"observed_at":"2026-08-16T04:43:43.698742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.705095Z","title":"Seed-thinking-v1.5: Advancing superb reasoning models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.705095Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:705a67e33461c0a873e0f8644b20bff0a316ca990843c15ac41da3b9b7d25210","observation_id":"aa9cdd5d-fd91-406a-aa1d-a25151abec72","resolution":{"observed_at":"2026-08-16T04:43:43.705095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07037","last_updated":"2024-01-13T10:53:53Z","snapshot_observed_at":"2026-08-16T14:27:46.540003Z","submitted_at":"2024-01-13T10:53:53Z","title":"xCoT: Cross-lingual Instruction Tuning for Cross-lingual Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07037","snapshot_observed_at":"2026-08-16T04:43:43.709923Z","title":"xcot: Cross-lingual instruction tuning for cross-lingual chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.709923Z"},"links":{"cited_paper":"/paper/2401.07037","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:64326c17f22a00b3362a01a47779c8578f03b05d3b51e1f23c6175105eaa6ef2","observation_id":"a341fbb0-cda3-4f41-842b-17b079732d41","resolution":{"observed_at":"2026-08-16T04:43:43.709923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20238","last_updated":"2025-06-01T15:57:10Z","snapshot_observed_at":"2026-08-19T20:40:25.757043Z","submitted_at":"2025-02-27T16:23:25Z","title":"FINEREASON: Evaluating and Improving LLMs' Deliberate Reasoning through Reflective Puzzle Solving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20238","snapshot_observed_at":"2026-08-16T04:43:43.716688Z","title":"Finereason: Evaluating and improving llms' deliberate reasoning through reflective puzzle solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.716688Z"},"links":{"cited_paper":"/paper/2502.20238","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:78f38b40badcd21e0c91f62c4a68dd62e1fb4b3be13f3eaf55e0bb7691375d07","observation_id":"e8fb42a0-2d4d-4977-a683-767cd202b69b","resolution":{"observed_at":"2026-08-16T04:43:43.716688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-08-16T11:24:28.964729Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-16T04:43:43.726938Z","title":"Extending context window of large language models via positional interpolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.726938Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:356ad0a15b3e5e972b41dcb7c1d638f3d29720cbd9c5c8963f233849f0602e41","observation_id":"5977f55c-6888-45e0-971d-2879b09060ea","resolution":{"observed_at":"2026-08-16T04:43:43.726938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-20T11:42:35.796814Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-16T04:43:43.734066Z","title":"Do not think that much for 2+ 3=? on the overthinking of o1-like llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.734066Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:33eefb90e1f79c6d1a917e13d1b176c3f181a9995296a4e0d4dbd76dfdbe4338","observation_id":"235a3bdc-f2ac-490e-b2bd-e46f64d65e1f","resolution":{"observed_at":"2026-08-16T04:43:43.734066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.740471Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.740471Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:a7a111bec7e198dde2f340d062baa0385653e79a8ddb338de5b35eba60784f48","observation_id":"9bda6d7d-b413-499a-aa0a-b04a3300dce2","resolution":{"observed_at":"2026-08-16T04:43:43.740471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-16T04:43:43.745341Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.745341Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:f9810a905c41bb7c5a0502cb0aa673524dfd91cccd75e3bd324b75cae0b4b1a0","observation_id":"9950968d-2503-4b3d-951f-3c365170bf79","resolution":{"observed_at":"2026-08-16T04:43:43.745341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.753574Z","title":"Gpg: A simple and strong reinforcement learning baseline for model reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.753574Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:85e02e50dac237f1e611bb30d901c3e517958eb9a61ec653b198a90c288cfb67","observation_id":"f9445de0-8023-4fc4-9509-4ad79f9fb677","resolution":{"observed_at":"2026-08-16T04:43:43.753574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-16T04:43:43.758427Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.758427Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:3b04d860571364c87decbaca9f32d81c0b6060ceff2b4a8283377b39c60e5dc9","observation_id":"f68977e9-67bf-4d12-aec5-ae17b98c33c2","resolution":{"observed_at":"2026-08-16T04:43:43.758427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08235","last_updated":"2025-02-12T09:23:26Z","snapshot_observed_at":"2026-08-17T02:05:44.540631Z","submitted_at":"2025-02-12T09:23:26Z","title":"The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08235","snapshot_observed_at":"2026-08-16T04:43:43.765953Z","title":"The danger of overthinking: Examining the reasoning-action dilemma in agentic tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.765953Z"},"links":{"cited_paper":"/paper/2502.08235","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:5d7f520703f3238e3c6ad5c36407b61ce6b5d10a2cb557eca8886a6a07135836","observation_id":"4846c4d0-69cd-442b-88f6-4765013aaede","resolution":{"observed_at":"2026-08-16T04:43:43.765953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-20T04:08:34.710482Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-16T04:43:43.770838Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.770838Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:e25dabb10cc2506d6af9d21ff4228f7fc69d14d700222d4e448b9ddb1e4042ce","observation_id":"d9fa991f-8f09-4fb8-87b8-1f122e2e85fe","resolution":{"observed_at":"2026-08-16T04:43:43.770838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04303","last_updated":"2025-04-07T15:45:13Z","snapshot_observed_at":"2026-08-15T22:15:03.537612Z","submitted_at":"2025-01-08T06:27:07Z","title":"Graph-Based Multimodal Contrastive Learning for Chart Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04303","snapshot_observed_at":"2026-08-16T04:43:43.953062Z","title":"Multimodal graph constrastive learning and prompt for chartqa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.953062Z"},"links":{"cited_paper":"/paper/2501.04303","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:a04ec061782df134a1d5b6f063de669750fbf11c1d3009b2b3359fa84008213d","observation_id":"c0d52865-b231-429b-b59c-60801388833e","resolution":{"observed_at":"2026-08-16T04:43:43.953062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.958215Z","title":"Ai as algorithm designer: Teaching llms to improve sorting through trial and error in grpo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.958215Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:9dca16387cc514e64be7b9a219dc08b169941c4f551a0d41b003a48018486913","observation_id":"9bd0dc57-facd-48dd-8928-45bc8c6ef586","resolution":{"observed_at":"2026-08-16T04:43:43.958215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.963622Z","title":"Teaching language models to invent or optimize efficient sudoku algorithms through reinforcement learning, 3 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.963622Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:833396f57d63f77db7b45019259fbd7ec7eb8883433f6c994311abad0a5b1027","observation_id":"fc382601-9c73-468a-91ee-18e603a66191","resolution":{"observed_at":"2026-08-16T04:43:43.963622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.967613Z","title":"Teaching language models to solve sudoku through reinforcement learning, 3 2025 c","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.967613Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:c61083da662feb231f6556d0ba5a1b83d8e0d8925d6a4fd2ddd12368a1605f73","observation_id":"fa3f1e1f-ee3d-482b-b7de-ae5f61ab6369","resolution":{"observed_at":"2026-08-16T04:43:43.967613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.970955Z","title":"Security and privacy challenges of large language models: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.970955Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:67b3f2015bb776c2fbb98fb2cb592292ccb0f2bc6eb76699dc9af98beba4d4a0","observation_id":"68a90ae2-7eda-4475-bbf7-f4748bd22c03","resolution":{"observed_at":"2026-08-16T04:43:43.970955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-16T04:43:43.976613Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.976613Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:9b15465ce3641c6f05e3c651c60d058350a5b71b5bc6440c56f4544414fbbf20","observation_id":"842c4169-4948-4a16-b1ef-fcfba4180718","resolution":{"observed_at":"2026-08-16T04:43:43.976613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-08-18T14:49:13.384384Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-16T04:43:43.981170Z","title":"Sycophancy to subterfuge: Investigating reward-tampering in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.981170Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:8232ba5679ef77588489c3f8e07343a128101454c433c0068028cba5e96fd827","observation_id":"91a398ea-39f4-471e-9915-14d4d3093035","resolution":{"observed_at":"2026-08-16T04:43:43.981170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-16T04:43:43.986239Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.986239Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:028752b2adc8863d0c31a7263492175f0d780cae24ad51bb38d691735c66a890","observation_id":"15ed7328-d0ea-4d23-b07b-6259ad79cc68","resolution":{"observed_at":"2026-08-16T04:43:43.986239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:43.993212Z","title":"Rl, reasoning & writing - grpo on base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:43.993212Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:f3ebd2474fac529f16a46bc874aaac46e3b7e96480cd86c1cd72c643da2fae66","observation_id":"7d6325cf-c9c2-4a59-bb4a-59bedf5c1323","resolution":{"observed_at":"2026-08-16T04:43:43.993212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19510","last_updated":"2025-06-16T09:05:04Z","snapshot_observed_at":"2026-08-16T18:03:54.707366Z","submitted_at":"2024-09-29T01:48:09Z","title":"Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19510","snapshot_observed_at":"2026-08-16T04:43:44.001435Z","title":"Cot-st: Enhancing llm-based speech translation with multimodal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.001435Z"},"links":{"cited_paper":"/paper/2409.19510","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:9464b8c701dbcb85a8c9b67a807d55d1f45603c39f432c386e6244eb3cabfa00","observation_id":"10c16ef4-b66c-4c1c-92f3-71d812140c20","resolution":{"observed_at":"2026-08-16T04:43:44.001435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01904","last_updated":"2025-02-05T09:17:01Z","snapshot_observed_at":"2026-08-16T12:59:45.562292Z","submitted_at":"2025-01-03T17:14:16Z","title":"Virgo: A Preliminary Exploration on Reproducing o1-like MLLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01904","snapshot_observed_at":"2026-08-16T04:43:44.006174Z","title":"Virgo: A preliminary exploration on reproducing o1-like mllm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.006174Z"},"links":{"cited_paper":"/paper/2501.01904","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:f4aca700e3e04df24bf0bcbd03f66fbb072db2c9b494076c47f14b334b04bc94","observation_id":"e165a717-3b67-4b88-b811-db7d64cf7964","resolution":{"observed_at":"2026-08-16T04:43:44.006174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08417","last_updated":"2017-08-19T05:01:16Z","snapshot_observed_at":"2026-08-14T20:58:41.859898Z","submitted_at":"2017-05-23T17:06:56Z","title":"Reinforcement Learning with a Corrupted Reward Channel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08417","snapshot_observed_at":"2026-08-16T04:43:44.019777Z","title":"Reinforcement learning with a corrupted reward channel","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.019777Z"},"links":{"cited_paper":"/paper/1705.08417","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:d833927af912b9605643c87346e3c351277cf8928e455c8c694cbc4662d5812e","observation_id":"a2ad7230-6a31-4da7-be4c-ae366e42e6d4","resolution":{"observed_at":"2026-08-16T04:43:44.019777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.025443Z","title":"Reward tampering problems and solutions in reinforcement learning: A causal influence diagram perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.025443Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:874231ca9a3809313f6d402ba9899801081fdbade0cfff19fa4dc2cf3087bbf8","observation_id":"9291da73-4fc6-4dca-b42d-1a1de474dd68","resolution":{"observed_at":"2026-08-16T04:43:44.025443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16940","last_updated":"2025-07-22T02:01:16Z","snapshot_observed_at":"2026-08-16T12:55:48.911604Z","submitted_at":"2025-02-24T08:08:41Z","title":"Reasoning Does Not Necessarily Improve Role-Playing Ability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16940","snapshot_observed_at":"2026-08-16T04:43:44.032419Z","title":"Reasoning does not necessarily improve role-playing ability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.032419Z"},"links":{"cited_paper":"/paper/2502.16940","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:951bbb598f7a6e36468f5ab7f352ce9962125d1257e27b4e90363a9d87d9508d","observation_id":"06504b25-192d-4195-bbf4-a58ab1f83f72","resolution":{"observed_at":"2026-08-16T04:43:44.032419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10160","last_updated":"2025-04-14T12:14:18Z","snapshot_observed_at":"2026-08-16T12:41:22.322867Z","submitted_at":"2025-04-14T12:14:18Z","title":"MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10160","snapshot_observed_at":"2026-08-16T04:43:44.037426Z","title":"Mt-r1-zero: Advancing llm-based machine translation via r1-zero-like reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.037426Z"},"links":{"cited_paper":"/paper/2504.10160","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:61a2e573dd7d4798876428e9c590d36510fa990c9e52e4de964648601a984232","observation_id":"3680ba6f-d40b-4cd3-a2c6-0a43099e1473","resolution":{"observed_at":"2026-08-16T04:43:44.037426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-14T13:46:28.086398Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-16T04:43:44.045196Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.045196Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:81c35ee2b29bd943485742392e7431ca510bec2a402dee598c88bfe29529c27a","observation_id":"8d52c3e7-5fb4-44d5-9ecc-e8f3e5dd051e","resolution":{"observed_at":"2026-08-16T04:43:44.045196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-16T04:43:44.050673Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.050673Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:062351f17c57c3e1ef24316aa758ee71b5cfcc1ad73288a074cdb5e43a532906","observation_id":"c8791a3b-9453-4a93-81df-3f1645c89627","resolution":{"observed_at":"2026-08-16T04:43:44.050673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T04:43:44.056956Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.056956Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:eae5c75f9aa9469526f514ac52e3f107d3daf23a475357e2aff9ce1045c3a132","observation_id":"b75ba7e0-d583-433a-b684-a9e26f4c86c6","resolution":{"observed_at":"2026-08-16T04:43:44.056956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-17T07:21:20.458339Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-16T04:43:44.061399Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.061399Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:bc57fff452a2fe8d49a6113ef71933fb2e01a5c94e53181377ed8681849c8519","observation_id":"b8e9d880-62e1-42dd-9f0c-435166cbec4c","resolution":{"observed_at":"2026-08-16T04:43:44.061399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-14T00:11:28.443916Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-16T04:43:44.071707Z","title":"rstar-math: Small llms can master math reasoning with self-evolved deep thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.071707Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:374fe8a491406c2ecc805a356cd1d672f091dd33c8f4331cb49a6c20b3246621","observation_id":"a5ca0d26-8934-405b-a674-102b5789d6e1","resolution":{"observed_at":"2026-08-16T04:43:44.071707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T04:43:44.082711Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.082711Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:9f630f34ec94113e2a9960962d9b17a026529683c058b8aeb456d24a32f91596","observation_id":"1d6279c5-b26a-45cd-873b-c5e51377c159","resolution":{"observed_at":"2026-08-16T04:43:44.082711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.087659Z","title":"Skywork open reaonser series","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.087659Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:488c5620341508c67f13e13db2f451a50c69bd5df7eacdfe86c0b7394cdc10fc","observation_id":"dab3e8d5-0853-44ff-8370-0c71dc4c0d84","resolution":{"observed_at":"2026-08-16T04:43:44.087659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-13T20:36:12.184426Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-16T04:43:44.092433Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.092433Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:52753884773ae49d5e9891a2fac32ce02e2918a817f29241ad33d780bc716eb6","observation_id":"36b44c6e-d536-4be2-a50f-6b218cab3c47","resolution":{"observed_at":"2026-08-16T04:43:44.092433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-16T04:43:44.099187Z","title":"Measuring mathematical problem solving with the math dataset, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.099187Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:18e0d36cd20d9142e4c37beb628b94070a1816a7786b1f758f2578ad36f3f814","observation_id":"9d0e7856-73f4-4ed7-8bd3-d410e6b5035b","resolution":{"observed_at":"2026-08-16T04:43:44.099187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.105789Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to reproducibility","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.105789Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:c3b86369dbb8dcacf329fdc52679ab905b6fa496df8c0a82c86235c4440aaa90","observation_id":"3d6368f4-43fa-4ac0-900c-1c5cef74b7dd","resolution":{"observed_at":"2026-08-16T04:43:44.105789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.110512Z","title":"Curatedthoughts: Data curation for rl training datasets, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.110512Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:4111bd7086258db30474dccf20dae4f1cfa58b5ebf4db97dad163b9732e9b1e9","observation_id":"264223ce-1e6f-4a4f-a21c-bc173a677681","resolution":{"observed_at":"2026-08-16T04:43:44.110512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-16T04:43:44.115501Z","title":"Reinforce++: A simple and efficient approach for aligning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.115501Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:9a8af98e3928ddf1007f66b4f051505a8c0b5982975875f2f686d735a2244430","observation_id":"e704c7ad-f7a5-4fa3-aa49-08195c4722c9","resolution":{"observed_at":"2026-08-16T04:43:44.115501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.120856Z","title":"Open-reasoner-zero: An open source approach to scaling reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.120856Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:d3c03e6f7f4fcf6da12a61dd31ebc13806ef793552b4c0cf6a81d2653ad417e2","observation_id":"7919bc4a-540c-4556-8b10-0fa91a12a07f","resolution":{"observed_at":"2026-08-16T04:43:44.120856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12759","last_updated":"2025-05-23T21:59:14Z","snapshot_observed_at":"2026-08-15T07:58:01.172171Z","submitted_at":"2025-03-17T02:53:42Z","title":"RAG-RL: Advancing Retrieval-Augmented Generation via RL and Curriculum Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12759","snapshot_observed_at":"2026-08-16T04:43:44.124530Z","title":"Rag-rl: Advancing retrieval-augmented generation via rl and curriculum learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.124530Z"},"links":{"cited_paper":"/paper/2503.12759","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:6f03f77a5bd78f40960be2f8b91e7c78a5553cb5cfd1e71b3bb65e4ce7bb9067","observation_id":"dc8a8724-a5cc-4de1-932a-8be56b37bd1d","resolution":{"observed_at":"2026-08-16T04:43:44.124530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00555","last_updated":"2025-06-05T03:20:54Z","snapshot_observed_at":"2026-08-20T10:46:25.339162Z","submitted_at":"2025-03-01T16:42:01Z","title":"Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00555","snapshot_observed_at":"2026-08-16T04:43:44.129405Z","title":"Safety tax: Safety alignment makes your large reasoning models less reasonable","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.129405Z"},"links":{"cited_paper":"/paper/2503.00555","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:253602e76050f00af76ab125600ddb309d30f298ee1b0032da073a6d3a8a7ab1","observation_id":"2742fabe-428d-4cfc-9ca8-4c6dfdeafd59","resolution":{"observed_at":"2026-08-16T04:43:44.129405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.133728Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.133728Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:9bb2a8daa3e678b74bb6d63d9f5109c081360a89ef366ccbbe56bfb6245f0b05","observation_id":"9b758c15-4145-4132-b9c1-afb7fa7159b5","resolution":{"observed_at":"2026-08-16T04:43:44.133728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.138731Z","title":"Ii-thought : A large-scale, high-quality reasoning dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.138731Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:e431bb1dbf2cad4ba755dd5c3c786120a8724dc9840fd6ddfa72690caa63afe1","observation_id":"81325677-905f-4287-9ffb-5f781852b2b4","resolution":{"observed_at":"2026-08-16T04:43:44.138731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-16T04:43:44.144299Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.144299Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:495edf80d66bf0600f151ecc32c9f549583e7ff06dae0ef289e937e7e3e821b6","observation_id":"94593af2-4786-4bbf-966a-26c4180612fa","resolution":{"observed_at":"2026-08-16T04:43:44.144299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.149253Z","title":"Rlsf: Reinforcement learning via symbolic feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.149253Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:a6e0db242bde66bc210292dace7199db72cf971d256a16238f8cad81d5523537","observation_id":"2b8911b6-556d-4591-be50-69962d61e3cc","resolution":{"observed_at":"2026-08-16T04:43:44.149253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-16T12:57:38.105423Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-08-16T04:43:44.154696Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.154696Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:2ed4407c1eed923a66790548a99457bfa57785a9f6c72bae09f40ec98be79768","observation_id":"e4e1ff9e-115f-4005-a912-78a432dafbfd","resolution":{"observed_at":"2026-08-16T04:43:44.154696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10169","last_updated":"2023-07-19T17:55:13Z","snapshot_observed_at":"2026-08-19T07:44:13.006259Z","submitted_at":"2023-07-19T17:55:13Z","title":"Challenges and Applications of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10169","snapshot_observed_at":"2026-08-16T04:43:44.159814Z","title":"Challenges and applications of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.159814Z"},"links":{"cited_paper":"/paper/2307.10169","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:018c23a0a620e83873917db4ec5aa19bfbd4176826156ce5e1d6d30b871e1118","observation_id":"c15495c8-f115-4aa3-bb20-e30f3f6da3e2","resolution":{"observed_at":"2026-08-16T04:43:44.159814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-16T04:43:44.165181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.165181Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:34df085bfe475ae46febc6ed9c15bd170c616ea5874f73c2ae1d5dd1b81b998c","observation_id":"b55d0dec-73e3-4d7c-918b-40de3708833d","resolution":{"observed_at":"2026-08-16T04:43:44.165181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.170960Z","title":"Overthink: Slowdown attacks on reasoning llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.170960Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:e3d95724409b270a56568c7d26c43cdd3d448230139e32e456d7bf322bd064cd","observation_id":"8fd814f1-5d9f-420c-8655-7239f1518449","resolution":{"observed_at":"2026-08-16T04:43:44.170960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-18T20:55:55.424089Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-16T04:43:44.183385Z","title":"H-cot: Hijacking the chain-of-thought safety reasoning mechanism to jailbreak large reasoning models, including openai o1/o3, deepseek-r1, and gemini 2.0 flash thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.183385Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:dbfa386a08c870531dbeda085ee32946e424825539d50cfc75c0efc59a8d7c96","observation_id":"d7479e89-db88-42e0-be82-2cc3d1119f42","resolution":{"observed_at":"2026-08-16T04:43:44.183385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.190597Z","title":"Math-verify: Math verification library, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.190597Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:2cd0419927777dee44dfacb60a101744549801c2bfdded8135dee8b21888cfff","observation_id":"5991164e-8c26-405b-b9c5-f9f3c0aa6e6b","resolution":{"observed_at":"2026-08-16T04:43:44.190597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02301","last_updated":"2024-07-10T12:45:13Z","snapshot_observed_at":"2026-08-16T18:03:55.825388Z","submitted_at":"2024-06-04T13:30:45Z","title":"mCoT: Multilingual Instruction Tuning for Reasoning Consistency in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02301","snapshot_observed_at":"2026-08-16T04:43:44.195659Z","title":"mcot: Multilingual instruction tuning for reasoning consistency in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.195659Z"},"links":{"cited_paper":"/paper/2406.02301","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:b98b711018df07d15bce4f627163332e53c0f05ac3fb958c1f3a19b088c6fde0","observation_id":"332fcf98-a569-44f1-a0ea-be3d802202b5","resolution":{"observed_at":"2026-08-16T04:43:44.195659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.202387Z","title":"Introducing superalignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.202387Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:03f33a6c2795139579cd73113f18bff3101fc68163e95c51211bf0e8f91f0d3a","observation_id":"e60b414b-4b68-4c0c-8972-bab8c3b42498","resolution":{"observed_at":"2026-08-16T04:43:44.202387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.206947Z","title":"Exaone deep: Reasoning enhanced language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.206947Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:4f959fac7050cf5664f39deb2c1a62d03c6f678293c918c3e5992e3eea194d0c","observation_id":"5e73aa25-0587-4aac-a69a-6e59d6163a0a","resolution":{"observed_at":"2026-08-16T04:43:44.206947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11197","last_updated":"2025-05-14T02:12:43Z","snapshot_observed_at":"2026-08-16T12:50:05.916488Z","submitted_at":"2025-03-14T08:43:53Z","title":"Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11197","snapshot_observed_at":"2026-08-16T04:43:44.212452Z","title":"Reinforcement learning outperforms supervised fine-tuning: A case study on audio question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.212452Z"},"links":{"cited_paper":"/paper/2503.11197","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:c097b67845a2a984fd1ac1e698be720e716b148aa4199203c167c3b5fdefd729","observation_id":"60de9cde-9c75-4160-9e52-0c8fde14d64b","resolution":{"observed_at":"2026-08-16T04:43:44.212452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.217133Z","title":"Numinamath","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.217133Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:9edb166b328c50f2e812355bf0f08abbd98f144df8b02e8c0a8a202c6061cc47","observation_id":"4d2baa89-6623-4f8f-82aa-17b6953abd41","resolution":{"observed_at":"2026-08-16T04:43:44.217133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-08-18T07:56:10.424560Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-16T04:43:44.223637Z","title":"Taco: Topics in algorithmic code generation dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.223637Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:b2a870a4868dce782ea462c100b1c9733fdb1df0fec8ead6abed2c34ae3b281c","observation_id":"ccb18a27-11ac-4e4d-9b38-88f173ee4f50","resolution":{"observed_at":"2026-08-16T04:43:44.223637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08147","last_updated":"2024-11-12T19:53:00Z","snapshot_observed_at":"2026-08-14T22:04:50.847373Z","submitted_at":"2024-11-12T19:53:00Z","title":"Large Language Models Can Self-Improve in Long-context Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08147","snapshot_observed_at":"2026-08-16T04:43:44.229927Z","title":"Large language models can self-improve in long-context reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.229927Z"},"links":{"cited_paper":"/paper/2411.08147","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:ba9044f91e4cb228e5ae41a7b3913c1eb2f1752651351da69b9b0ff32226416d","observation_id":"14a587b3-fe87-4db8-9ebb-748a1039dd17","resolution":{"observed_at":"2026-08-16T04:43:44.229927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01428","last_updated":"2024-10-02T11:26:02Z","snapshot_observed_at":"2026-08-16T13:13:25.122030Z","submitted_at":"2024-10-02T11:26:02Z","title":"Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01428","snapshot_observed_at":"2026-08-16T04:43:44.234950Z","title":"Can we further elicit reasoning in llms? critic-guided planning with retrieval-augmentation for solving challenging tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.234950Z"},"links":{"cited_paper":"/paper/2410.01428","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:9f0f6a11f50c4b0e497d76f9e70a358fd42460f0905e847b2c8848c452d4d91c","observation_id":"3f16efdf-be7c-48aa-bbfc-13374a57dd7c","resolution":{"observed_at":"2026-08-16T04:43:44.234950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-17T13:27:14.855105Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-16T04:43:44.239798Z","title":"Limr: Less is more for rl scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.239798Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:e683b2e309b71cf9a5b708c8d482bb3e0bdf2c9a47b5b586267d0354a4cca589","observation_id":"bb5e8f2f-9fcf-4fb2-a0e4-46bbdeb4f310","resolution":{"observed_at":"2026-08-16T04:43:44.239798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01923","last_updated":"2025-03-02T06:29:22Z","snapshot_observed_at":"2026-08-18T06:58:13.416087Z","submitted_at":"2025-03-02T06:29:22Z","title":"Output Length Effect on DeepSeek-R1's Safety in Forced Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01923","snapshot_observed_at":"2026-08-16T04:43:44.243755Z","title":"Output length effect on deepseek-r1's safety in forced thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.243755Z"},"links":{"cited_paper":"/paper/2503.01923","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:03d529a5b0e413987c542809de203ddc61a661fa84cdf94c77ee100ae4057dc0","observation_id":"8c52a279-373d-4c57-aa91-d593b5b4e3b8","resolution":{"observed_at":"2026-08-16T04:43:44.243755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.247422Z","title":"Small models struggle to learn from strong reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.247422Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:b68aa02a582dbd0e398fd4cae804dfde86e3724a2497387de640cb9f98444015","observation_id":"59986456-26a4-49de-8c40-e5c2807722e3","resolution":{"observed_at":"2026-08-16T04:43:44.247422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.251211Z","title":"A survey of multimodel large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.251211Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:4693f7f18b06c674d4150359c7811f2ef79cbd6d6593d57160f28ee5be07c0a4","observation_id":"9424f790-a9de-4953-8fb5-eb7d4cdf526a","resolution":{"observed_at":"2026-08-16T04:43:44.251211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-08-18T19:02:23.250634Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-08-16T04:43:44.255840Z","title":"Zebralogic: On the scaling limits of llms for logical reasoning, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.255840Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:f5efc5fd97e8b845a51d55f05bedee8e165a119df57531384c41ab0b539e16af","observation_id":"1bf94511-93a2-499a-9dc3-7b262485f806","resolution":{"observed_at":"2026-08-16T04:43:44.255840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.260455Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.260455Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:06fa76960ad40f634a77b8085b89d813abe78d5398b9f6f695f0d641b1f24a3f","observation_id":"cb84d433-49da-4ddb-8d63-5f4ec874af0b","resolution":{"observed_at":"2026-08-16T04:43:44.260455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.265382Z","title":"Code-r1: Reproducing r1 for code with reliable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.265382Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:0612a84d2350e5695286086273a8057c96cb4d6cea904532674a0545045dfdd6","observation_id":"bc0d6079-6d76-4cfb-9aae-20c604b4ff1e","resolution":{"observed_at":"2026-08-16T04:43:44.265382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17451","last_updated":"2025-06-06T10:36:59Z","snapshot_observed_at":"2026-08-17T00:50:40.901836Z","submitted_at":"2024-12-23T10:18:41Z","title":"Diving into Self-Evolving Training for Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17451","snapshot_observed_at":"2026-08-16T04:43:44.269509Z","title":"Diving into self-evolving training for multimodal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.269509Z"},"links":{"cited_paper":"/paper/2412.17451","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:999a5dcd10e81db2ad26a16fa59d696da3af00b0ceb93744ad703e7b109e3e64","observation_id":"3496bbc7-00de-4828-a669-bd813145e4e5","resolution":{"observed_at":"2026-08-16T04:43:44.269509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.274565Z","title":"Guardreasoner: Towards reasoning-based llm safeguards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.274565Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:b3c4defc4dacdb27baafeff37c369bc167ae561fe8ab9209818f097420291a42","observation_id":"9ca07818-0809-4e4c-bdfc-d31e0c5db510","resolution":{"observed_at":"2026-08-16T04:43:44.274565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.279831Z","title":"There may not be aha moment in r1-zero-like training — a pilot study","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.279831Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:e090950b5fa959965454745aec9551e34d0ce8cc65f6c26e012114481145e8b8","observation_id":"94eeefe6-ae10-40f3-abdc-2618ca81a267","resolution":{"observed_at":"2026-08-16T04:43:44.279831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-16T04:43:44.286554Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.286554Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:cac90f3c1b93a81e3cf7341d01f86077c505445fd48822bcac2532988a311cf8","observation_id":"4b2a3a0b-18ad-4406-8525-a2b1c50b5294","resolution":{"observed_at":"2026-08-16T04:43:44.286554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.293430Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.293430Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:2a6d38faeaf70681286189a6331df106c3b98ecca326255a52048d647caf188e","observation_id":"4cb61198-0b13-4456-b6e9-17cd2c61a76c","resolution":{"observed_at":"2026-08-16T04:43:44.293430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.297852Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.297852Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:a40702b3acae50d04cf765b89a13fb89e6298ac484000eac117f7fb41f2c6319","observation_id":"498f85de-3130-4e88-8950-cb711b149688","resolution":{"observed_at":"2026-08-16T04:43:44.297852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-16T03:56:33.383172Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-16T04:43:44.302502Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.302502Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:7273ecf745b26a0036a83716792f8cfac8bc2d71d0201d80424ff3dcbc627e37","observation_id":"ba918591-2bd3-4234-b5e5-24366a42275f","resolution":{"observed_at":"2026-08-16T04:43:44.302502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-08-16T12:57:19.745389Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-16T04:43:44.306712Z","title":"S ^ 2 r: Teaching llms to self-verify and self-correct via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.306712Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:69ead4018358e69f482d4fe946179863639e781a0879ba870cc47f375be0cd46","observation_id":"21f50789-98d9-4c5f-ba51-f3255275429c","resolution":{"observed_at":"2026-08-16T04:43:44.306712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07246","last_updated":"2025-01-13T11:54:40Z","snapshot_observed_at":"2026-08-16T18:04:08.829886Z","submitted_at":"2025-01-13T11:54:40Z","title":"Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07246","snapshot_observed_at":"2026-08-16T04:43:44.310863Z","title":"Audio-cot: Exploring chain-of-thought reasoning in large audio language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.310863Z"},"links":{"cited_paper":"/paper/2501.07246","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:3f6a3acb8d19731314f0d56e4eb0696bc63862a32fc6972b5f47f8ecc2b3930c","observation_id":"52293daa-1209-4ad3-ad7a-f8bc2b0277cf","resolution":{"observed_at":"2026-08-16T04:43:44.310863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.316099Z","title":"Synthetic-1: Two million collaboratively generated reasoning traces from deepseek-r1, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.316099Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:810c82379cf93ed9ccaf6043921e68dcd31a0b8f731ad75450572065f25a121c","observation_id":"203b37a9-0ece-4088-8dba-772aae9fc564","resolution":{"observed_at":"2026-08-16T04:43:44.316099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-16T04:43:44.320176Z","title":"s1: Simple test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.320176Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:f1fb2ce143dbe85d5dcfeb7b66841c743cba74db390f0fdb26e3568b9696c1bf","observation_id":"52bd7f95-618f-4bea-8cde-bd8ea93d63b9","resolution":{"observed_at":"2026-08-16T04:43:44.320176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09400","last_updated":"2023-09-17T23:49:10Z","snapshot_observed_at":"2026-08-19T23:22:07.740848Z","submitted_at":"2023-09-17T23:49:10Z","title":"CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09400","snapshot_observed_at":"2026-08-16T04:43:44.325608Z","title":"Culturax: A cleaned, enormous, and multilingual dataset for large language models in 167 languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.325608Z"},"links":{"cited_paper":"/paper/2309.09400","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:2df378abc20bbef18da2e8799a9467188fa1c0e78ed8e0229ffece01795f7d61","observation_id":"f8786328-0db2-4dc0-8151-e9e2c3f9fbb5","resolution":{"observed_at":"2026-08-16T04:43:44.325608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.329887Z","title":"Spirit-lm: Interleaved spoken and written language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.329887Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:3507f23a827d04f731769bac6cad5f1f9ca7f3e72f6fc8665b58509a46bd29ab","observation_id":"90a9eb36-f8c6-4273-ab7d-16aa9933bfde","resolution":{"observed_at":"2026-08-16T04:43:44.329887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.333747Z","title":"Gpt-4o system card, August 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.333747Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:3b91e6f672e01da9b153261f4b01b638e470b7f25654111db1c2ab42cfcf292e","observation_id":"5e08302b-f578-4164-bca1-4c07b65cc56a","resolution":{"observed_at":"2026-08-16T04:43:44.333747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.338042Z","title":"Introducing openai o3 and o4-mini, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.338042Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:68139eeadf76e0c15067c72ea3064f5c02cda1b8b33111efe24272ec8f8433a8","observation_id":"94a7770e-8221-46bd-97e8-37b142f98e7b","resolution":{"observed_at":"2026-08-16T04:43:44.338042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.344468Z","title":"Open Thoughts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.344468Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:ff1f1f9fa6211e95d52ee80a9caa197c3860f89df59494535e182a1d92bd5b75","observation_id":"8bb88ca0-4883-4445-a83e-6e7374252f7f","resolution":{"observed_at":"2026-08-16T04:43:44.344468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-16T04:43:44.351074Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.351074Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:abf88f3e7c49e867ed8262e02c4d648051137dd325080e690ef2f6de22e07ac4","observation_id":"0c7bc8b6-6ca1-4e87-b5bf-d7b80afbf320","resolution":{"observed_at":"2026-08-16T04:43:44.351074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-08-16T03:45:29.671274Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03544","snapshot_observed_at":"2026-08-16T04:43:44.362469Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.362469Z"},"links":{"cited_paper":"/paper/2201.03544","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:97b2c5abb26c073bf0b3b619864d4f58bd161297b3856e3f725412bac90563f2","observation_id":"2ef7f58a-5a65-41e8-a0cd-20f4f5801c74","resolution":{"observed_at":"2026-08-16T04:43:44.362469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.370194Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.370194Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:e57a8e3def0ff85a04e21cac87ea34fe233dd3d6653ee2b40c482cd26f8bdafa","observation_id":"0bc5f446-4463-48de-a024-fa8be02cf558","resolution":{"observed_at":"2026-08-16T04:43:44.370194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.379471Z","title":"Codeforces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.379471Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:bd63fb2301a59c8a5d59d683827d80a3be37d7ed98b90c534b805bb492d27130","observation_id":"5372249b-0709-40fe-880c-5eec9d852c48","resolution":{"observed_at":"2026-08-16T04:43:44.379471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04925","last_updated":"2024-04-07T11:52:44Z","snapshot_observed_at":"2026-08-18T14:00:15.726543Z","submitted_at":"2024-04-07T11:52:44Z","title":"Multilingual Large Language Model: A Survey of Resources, Taxonomy and Frontiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04925","snapshot_observed_at":"2026-08-16T04:43:44.385068Z","title":"Multilingual large language model: A survey of resources, taxonomy and frontiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.385068Z"},"links":{"cited_paper":"/paper/2404.04925","citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:a84dea800e504fc48bfd627d05a78bbc40c6c4d6dcecee16de8299cd9d29d1b7","observation_id":"06719fe8-cfc3-4917-b2c2-8699f22cad61","resolution":{"observed_at":"2026-08-16T04:43:44.385068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.393377Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.393377Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:43e732d8e25ab6914a2e6d22a84bffded1e246fc7a50c1782904ff33d2956160","observation_id":"c8c7723f-ef14-454f-afd2-358cdb54fec0","resolution":{"observed_at":"2026-08-16T04:43:44.393377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.397390Z","title":"Qwen3: Think deeper, act faster, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.397390Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:62a0626724a0da6330409e692125350455881852d82629e9e93d4718644b2313","observation_id":"f967b2d8-ea1a-4767-84a9-440d24fe44b7","resolution":{"observed_at":"2026-08-16T04:43:44.397390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.402354Z","title":"Qwq-32b: Embracing the power of reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.402354Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:5abb6d975f341cf3d8d15cb16c0762a451b70f7891035863aa068395cfea38df","observation_id":"0e9f0f9f-edce-4c41-9927-3e9ab03d65a9","resolution":{"observed_at":"2026-08-16T04:43:44.402354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:43:44.408738Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:44.408738Z"},"links":{"citing_paper":"/paper/2505.00551"},"observation_digest":"sha256:538be4db9f382e1cae13ef6a777904011e6be2970f3014575a8c9d72cb56962e","observation_id":"c4bff36c-2ddb-4015-990d-ffda5b89905e","resolution":{"observed_at":"2026-08-16T04:43:44.408738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.00551","last_updated":"2025-05-15T14:16:03Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T18:29:23.516617Z","submitted_at":"2025-05-01T14:28:35Z","title":"100 Days After DeepSeek-R1: A Survey on Replication Studies and More Directions for Reasoning Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":164},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 164 outbound references and 11 inbound Pith citation observations for arXiv:2505.00551."}