{"as_of":"2026-08-05T09:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45e0c2e560bf9071a0b6e2b4c155177b33a7d3578b62030c04e14cab028e1bc4","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:53:13.195296Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03972/citation-record","integrity":"/paper/2608.03972/integrity","json":"/paper/2608.03972/citation-record.json","paper":"/paper/2608.03972"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.518258Z","title":null,"venue":null,"work_id":"7a3aaedf-0de0-4d27-aa75-47bb0aa7a8ee","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.932970Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:be43f146ed513fc70ad493945c8f2fec456da47ba8f191e3202b5d3258827cee","observation_id":"71316cb8-5dfe-4eca-aeb6-84068d6591a4","resolution":{"observed_at":"2026-08-05T04:53:14.524151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.496011Z","title":"DAPO: An open-source LLM reinforcement learning system at scale","venue":null,"work_id":"c64f0ac1-70ae-4119-a497-106ff59b8e32","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.938125Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:0758b67623bd9fefe80608f11ac0fd2d526c55fbeb6256321650064ef66cbdb9","observation_id":"a6cd4b45-4225-435a-9331-cba37575e76f","resolution":{"observed_at":"2026-08-05T04:53:14.503525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13408","last_updated":"2025-05-19T17:44:26Z","snapshot_observed_at":"2026-07-06T21:26:30.087184Z","submitted_at":"2025-05-19T17:44:26Z","title":"CoT-Kinetics: A Theoretical Modeling Assessing LRM Reasoning Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13408","snapshot_observed_at":"2026-08-05T04:53:12.942968Z","title":"Cot-kinetics: A theoretical modeling assessing lrm reasoning process.ArXiv, abs/2505.13408, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.942968Z"},"links":{"cited_paper":"/paper/2505.13408","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:6243ffc5ef61ef8bc65e0953f4b55a906094e99dcf4c9a4a572f6708a9e0587f","observation_id":"8dd9ea9a-6b98-4d28-9433-78731f14513b","resolution":{"observed_at":"2026-08-05T04:53:12.942968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.479192Z","title":"Loong: Synthesize long chain-of-thoughts at scale through verifiers, 2025","venue":null,"work_id":"a87ed8b4-1004-4ef3-b6bf-dd0bda9f0c51","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.947974Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:a17bfec62ea66166a2c6a096baa618896061c80864d5090079559afbf9ad40da","observation_id":"b9f173e5-5435-4412-8d60-8680b15edc49","resolution":{"observed_at":"2026-08-05T04:53:14.484558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24375","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.924062Z","title":"Reinforcement mid-training, 2025","venue":null,"work_id":"2eaff9cd-58fa-4d0a-a33b-97ba844a6a71","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.952698Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:c2022d410764c7ddc1f2805050fc07dbe4fd35e2aaf0076a38d3834f99d854d3","observation_id":"676f668a-52ec-46bb-8205-8d92a83901b9","resolution":{"observed_at":"2026-08-05T04:53:13.931848Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.findings-acl","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.264154Z","title":"Self-evolving multi-agent systems via textual backpropagation","venue":null,"work_id":"25ca6f9e-b785-42fa-90a7-9e69b1e518c1","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.957456Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:d1603bdd22dd20fc21c2833b4462c7888f252a1319420cb44597056b439dec80","observation_id":"44f0d7fa-e63b-4d3f-95ab-b22290f112a8","resolution":{"observed_at":"2026-08-05T04:53:13.269181Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:12.967025Z","title":"On-policy distillation.Thinking Machines Lab: Connectionism,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.967025Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:c3d8d97fba2a771bb9dfeae7c7f9fa8757b547f17e2c094442f1bc443ae3e79f","observation_id":"67a31706-7647-441c-8dc1-7555dd841db5","resolution":{"observed_at":"2026-08-05T04:53:12.967025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.426092Z","title":"EchoRL: Reinforcement learning via rollout echoing","venue":null,"work_id":"13251cd3-3fcb-48e2-8d19-6a167fd47baa","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.977027Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:7613a65c1b53097b3a651dfb93afc66a5d11b512bb7b923a858dee71c818866e","observation_id":"08623710-4d5f-4471-9ed1-b85223d145b3","resolution":{"observed_at":"2026-08-05T04:53:14.431786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.397414Z","title":"Learning to reason under off-policy guidance","venue":null,"work_id":"49d5e19b-c846-41f0-bc9e-bc4f5b7843e6","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.981914Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:8504c9cd03c16d7dbb7055f2e3ffe5cea991d13f9022a999aba4589f3a1bf0a9","observation_id":"52a20fe1-d4db-4942-bd10-d5997539c958","resolution":{"observed_at":"2026-08-05T04:53:14.403651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.380452Z","title":"Ozdaglar","venue":null,"work_id":"0bbc9de7-88c4-4043-a11a-690715e482ec","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.986788Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:e666905911865a6aa12ed7e0d6f6ed9d3960352921d8ddac069c57c54eef1a05","observation_id":"b0ef0794-26c1-4934-9d36-ef04fc58c1de","resolution":{"observed_at":"2026-08-05T04:53:14.384926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-05T07:13:28.092224Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-05T04:53:12.991139Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.991139Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:2cb27ea7ab8ba7091947f3928578d2e739ab5acd4925f8ee4af19051aa99c1f4","observation_id":"b85e76e7-0456-4d29-bc9a-c56812d5dcb0","resolution":{"observed_at":"2026-08-05T04:53:12.991139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-05T04:53:12.995759Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.995759Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:806690979c0fc1c0d04c8a18a89b6342d3898e3fb18efd8a8a7c5cd7eb087066","observation_id":"3e10b2e6-8c8f-44a6-aa55-41da810147f7","resolution":{"observed_at":"2026-08-05T04:53:12.995759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.000441Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.000441Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:bce13445a1780c2d107d83cc5206ba1f255591a063787be84c7d835839ef19d2","observation_id":"ed2e493a-78a5-41cf-b3d3-c6115491da56","resolution":{"observed_at":"2026-08-05T04:53:13.000441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.351960Z","title":"Solving quantitative reasoning problems with lan- guagemodels","venue":null,"work_id":"a251f37d-90fa-446c-848a-11d8a37b2111","year":2022},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.004741Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:c9c640460a56129bceac106b1c540cf560c5fffa519268c85231a862dbea3f4e","observation_id":"f3f5af37-516a-4256-a71d-ad4ed9033892","resolution":{"observed_at":"2026-08-05T04:53:14.356660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.009142Z","title":"OlympiadBench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.009142Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:ef4b0c355b9e99621c0984e1d55871ae98c157be82712ea8bf399d4187d6dbe2","observation_id":"9a4ab40e-1c4d-42b2-abc4-82df9bd4935a","resolution":{"observed_at":"2026-08-05T04:53:13.009142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-05T04:53:13.014357Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.014357Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:0b277102911cc9cb7a2f0ea383528d86743729b362213f293d7986ee4a0eae6a","observation_id":"459ab9fd-1d12-4713-a675-b2c08aa7424b","resolution":{"observed_at":"2026-08-05T04:53:13.014357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.019460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.019460Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:e9f44ba53764deb7713d1a54e54ca60db049dfbc8408088c1cad1184263c0871","observation_id":"1112e77e-80b2-45ad-b511-b36b7e5fab67","resolution":{"observed_at":"2026-08-05T04:53:13.019460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.314470Z","title":"MMLU-pro: A more robust and challenging multi-task language understanding 12 benchmark","venue":null,"work_id":"c3b569d9-4fad-4b54-a2e9-011b13639eea","year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.024162Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:8d41e0be09d9d8afec0f4cd48c94d9d6a1a17168cde815a1aaa13217e8aa21c7","observation_id":"efe2d354-b221-4331-b963-3c3aa75c560c","resolution":{"observed_at":"2026-08-05T04:53:14.319942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.298256Z","title":"SimpleRL-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":"8ffb81ca-55c6-42b1-8c28-c05927ceae8e","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.028821Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:10018e34baca107b709a437ae5a798ce0ba78174c2b03ff4316a1030e7bf6909","observation_id":"8f65f649-835a-4863-9ab0-ad4026eaee28","resolution":{"observed_at":"2026-08-05T04:53:14.303448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.281679Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":"c5a8bddf-3ece-4e04-9615-3fd307e7ca98","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.033764Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:c0234866ede73e89c7b16be60a67e5ce237dcbb213ae28c797cbb0433f95bc47","observation_id":"6ebc4b3a-56c6-45b5-84ad-3dcc8aa093ca","resolution":{"observed_at":"2026-08-05T04:53:14.286659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.264144Z","title":"Process reinforcement through implicit rewards.Transactions on Machine Learning Research,","venue":null,"work_id":"08acc090-d99d-4f85-b136-29bf204a0c99","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.038050Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:aa3a176b382efc496569227a7995333a41b106b1f4569530a73654dfd727c2ac","observation_id":"b6cf11d9-1ffb-4e6d-b7ca-4fd5826cd031","resolution":{"observed_at":"2026-08-05T04:53:14.268959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T04:53:13.046874Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.046874Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:fe4e8b8b8db698172b07e1c4962ec999c1a7f9b92fb11ea8ce498356478992dc","observation_id":"db9f4ef3-9ecd-428d-9fed-a5df98748910","resolution":{"observed_at":"2026-08-05T04:53:13.046874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T04:53:13.051552Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.051552Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:17d8997e6605183eba84180035e4c4f6f7d789ac7d6b6e674c28869fefca6c04","observation_id":"8e59e571-48aa-4a9a-8545-fbb844e7488b","resolution":{"observed_at":"2026-08-05T04:53:13.051552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.232407Z","title":"Think outside the policy: In-context steered policy optimization","venue":null,"work_id":"6add68af-f4d1-4e9a-ada4-a73adf9eabd5","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.057291Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:d8a3e8464e8e6747f3070a7f1db5b2f9ffdfe81b74feb3dc4684de1f6056b092","observation_id":"c97db0fe-842d-4390-928a-c1a0eee4a97a","resolution":{"observed_at":"2026-08-05T04:53:14.237674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23747","last_updated":"2026-04-26T14:53:48Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T14:53:48Z","title":"SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23747","snapshot_observed_at":"2026-08-05T04:53:13.062069Z","title":"SFT-then-RL outperforms mixed-policy methods for LLM reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.062069Z"},"links":{"cited_paper":"/paper/2604.23747","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:d0a7ebf0458e2c94257613c6021e4c69cb849405ea8cffa037dc869b19fb18d3","observation_id":"f4754bd8-ebb5-4826-81cc-08f8df5b9e12","resolution":{"observed_at":"2026-08-05T04:53:13.062069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-01T18:45:31.835391Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07266","snapshot_observed_at":"2026-08-05T04:53:13.066820Z","title":"When more is less: Understanding chain-of-thought length in llms.ArXiv, abs/2502.07266, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.066820Z"},"links":{"cited_paper":"/paper/2502.07266","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:415bc2aebe837a0dbe69a798b47ec75bf6843a9d8465eab177937d9ba8e45122","observation_id":"c6f71012-67b5-4f5f-8950-493008b635b8","resolution":{"observed_at":"2026-08-05T04:53:13.066820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.215530Z","title":"Don’t overthink it","venue":null,"work_id":"9dfddb7f-872d-4d97-aae9-c481259199fa","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.072079Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:96a7945f0e7bd0983b56bac912edd539b0b794678f97a7908030ef8694885bfc","observation_id":"4113cf82-1aa0-4f83-a1e1-30163a41d3b3","resolution":{"observed_at":"2026-08-05T04:53:14.220813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.193461Z","title":"LLaVA steering: Visual instruction tuning with 500x fewer parameters through modality linear representation- steering","venue":null,"work_id":"8087caae-cfa6-44a5-8737-9ed0415caf85","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.077044Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:46e42eed1111ae48a3059c60d6efe3c358d03748b6a1988b17d129b339285c96","observation_id":"aa62ebab-5ecd-4e67-913b-e590d9786438","resolution":{"observed_at":"2026-08-05T04:53:14.199622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12119","last_updated":"2026-05-29T11:31:58Z","snapshot_observed_at":"2026-07-06T20:38:00.177933Z","submitted_at":"2025-02-17T18:43:41Z","title":"PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12119","snapshot_observed_at":"2026-08-05T04:53:13.081608Z","title":"Prism: Self- pruning intrinsic selection method for training-free multimodal data selection.ArXiv, abs/2502.12119,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.081608Z"},"links":{"cited_paper":"/paper/2502.12119","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:ddc285940487a11c88e46257fd298e1b908a0cb48003c4101257197cf9016244","observation_id":"00d862b3-3b99-465b-8966-3f520b032d86","resolution":{"observed_at":"2026-08-05T04:53:13.081608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.164627Z","title":"Beyond nl2code: A structured survey of multimodal code intelligence,","venue":null,"work_id":"4e05c022-178b-4226-a121-9faeea1e2154","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.091539Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:5937ac1478011c8ce4cf8a4343dae2d82138f2b0473f90073b27ae42fa984fd4","observation_id":"11290c47-93f1-4ba8-a121-b8c902397195","resolution":{"observed_at":"2026-08-05T04:53:14.169785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12919","last_updated":"2023-12-01T17:33:55Z","snapshot_observed_at":"2026-07-06T16:50:46.608196Z","submitted_at":"2023-11-21T18:43:07Z","title":"SPOT! Revisiting Video-Language Models for Event Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12919","snapshot_observed_at":"2026-08-05T04:53:13.101410Z","title":"Spot! revisiting video-language models for event understanding.arXiv preprint arXiv:2311.12919, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.101410Z"},"links":{"cited_paper":"/paper/2311.12919","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:2b2566577757ea45f12ab7845597af3cf5004b23385658ebaaef1ff908c9a1f6","observation_id":"3cf0b7a4-e5fd-4080-a050-efd75a89652f","resolution":{"observed_at":"2026-08-05T04:53:13.101410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01393","last_updated":"2026-05-31T18:35:30Z","snapshot_observed_at":"2026-07-06T23:41:58.121923Z","submitted_at":"2026-05-31T18:35:30Z","title":"Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing","version":1},"cited_work":{"arxiv_id":"2606.01393","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.01393","snapshot_observed_at":"2026-08-05T04:53:13.641330Z","title":"Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing","venue":"cs.CL","work_id":"b70a9e14-97ce-4af5-a173-53ab55245c09","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.106954Z"},"links":{"cited_paper":"/paper/2606.01393","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:db3c3522a2ab7422a83a2e381dff7c33fdcf5fd23af22f6c40a305c7f7c15dd1","observation_id":"d02da753-95da-47eb-86c2-22a74beb1c38","resolution":{"observed_at":"2026-08-05T04:53:13.646604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.086535Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.086535Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:1dd2ad964f1b9817ef44694808f779aca0627e2551f5ba077f16498813d827de","observation_id":"614957f0-49a5-4284-9ca1-8e36fb0678d9","resolution":{"observed_at":"2026-08-05T04:53:13.086535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19316","last_updated":"2026-05-07T10:32:29Z","snapshot_observed_at":"2026-08-04T19:02:12.420139Z","submitted_at":"2025-10-22T07:26:55Z","title":"KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.19316","snapshot_observed_at":"2026-08-05T04:53:13.116166Z","title":"Kore: Enhancing knowledge injection for large multimodal models via knowledge-oriented augmentations and constraints, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.116166Z"},"links":{"cited_paper":"/paper/2510.19316","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:5a47a11d5f70936c5f4cdb459c35e50e9a551b81918b37e95d92566020b8a591","observation_id":"caefa43e-66b5-448b-9654-1b652cf39833","resolution":{"observed_at":"2026-08-05T04:53:13.116166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.15932","last_updated":"2026-06-16T15:28:03Z","snapshot_observed_at":"2026-07-06T23:52:37.922109Z","submitted_at":"2026-06-14T17:21:43Z","title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","version":2},"cited_work":{"arxiv_id":"2606.15932","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.15932","snapshot_observed_at":"2026-08-05T04:53:13.685184Z","title":"Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence","venue":"cs.CL","work_id":"b5ed27b9-07e6-4247-9f7e-e597a35f8ea0","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.095917Z"},"links":{"cited_paper":"/paper/2606.15932","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:ef4b51a3a50343cfc84621795d91a5c66bbff938d8b0efbd1936087db0e8a6bb","observation_id":"641dc76e-2364-4908-a5ea-84cbcf94c2f3","resolution":{"observed_at":"2026-08-05T04:53:13.690777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.125098Z","title":"Aditya Prakash, Yizhou Sun, and Wei Wang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.125098Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:386602c09274f6d2b7a4d58f89b322085879e7b65188f2f8adafbde22de53a6f","observation_id":"f9a3aeed-c64c-4e64-a40c-744ce16e7669","resolution":{"observed_at":"2026-08-05T04:53:13.125098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.149893Z","title":"HYPERION: Fine-grained hypersphere alignment for robust federated graph learning","venue":null,"work_id":"15dd68b7-0fd1-4fff-b367-274344291761","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.129286Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:88c10ccca7c46129fc2997e153220e285464d7fc81f3d3b5bddff8c9938483d9","observation_id":"cd29fcac-7c1b-45c6-bf24-4b2c68e8208f","resolution":{"observed_at":"2026-08-05T04:53:14.154663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02004","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.601035Z","title":"Alignsae: Concept-aligned sparse autoencoders, 2026","venue":null,"work_id":"8dae3236-23c3-4652-bf24-3e84060ed355","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.111636Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:e052a80ce3ff5c512e32d08bf4156d902edbecb5a39e92d602f1cde215010de0","observation_id":"86e77089-5ef2-4b20-ad58-6bfb328ad5cc","resolution":{"observed_at":"2026-08-05T04:53:13.621870Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.138245Z","title":"Can visual input be compressed? a visual token compression benchmark for large multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.138245Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:a9c9cc6bf735b76f16155ed1f9000c4e58f4dc02f64c62ea79a6641228cdf900","observation_id":"bf1166f2-560f-4ee7-86c6-b287bfd71e1e","resolution":{"observed_at":"2026-08-05T04:53:13.138245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i12.38000","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.231672Z","title":"Ascd: Attention-steerable contrastive decoding for reducing hallucination in mllm.Proceedings of the AAAI Conference on Artificial Intelligence, 40(12): 10306–10314, Mar","venue":null,"work_id":"79bff8b2-32d2-46bf-b4f8-2eeb48125739","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.120867Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:73540d9b8a141e704a5f63eb8c7d57df32d1d8929e397fe3379644c20aecc50a","observation_id":"33ee0171-b0d2-45d6-a8c8-35bc4f89def1","resolution":{"observed_at":"2026-08-05T04:53:13.238886Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.117078Z","title":"Let’s verify step by step","venue":null,"work_id":"4d1bd1fd-a4e5-44fe-8832-05115f4897a4","year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.148046Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:82e133921da8a8b52ecfafe01b280b270dfacfe0de6587989f9cd055a98478da","observation_id":"9f59fc7c-c5ff-4cb9-9a09-f4498dc40694","resolution":{"observed_at":"2026-08-05T04:53:14.121834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.152614Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.152614Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:c92b7e653c89d76546668f5c44a836e61974055d79e368b20980faaed2073c68","observation_id":"7480c158-ceb8-4a12-b726-2534a5dde6e2","resolution":{"observed_at":"2026-08-05T04:53:13.152614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.133520Z","title":"Backdoor cleaning without external guidance in MLLM fine-tuning","venue":null,"work_id":"040e94f2-2c30-4f8c-99fe-4871e8b873d7","year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.133448Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:04f556963aaa747483aa54e9fb1c0c8e0d91ed48b52698b51eb52a1e671b1720","observation_id":"f23d5009-9e53-4424-922c-c96b54579004","resolution":{"observed_at":"2026-08-05T04:53:14.138677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.068957Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":"5e956024-f44b-42b6-8695-c8f1f39a97b4","year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.161276Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:3663101aacba77ebf47d2a67d95f203f236a18f712c79e4743ddac1b8c9df433","observation_id":"d32c9b7a-0a3b-45a1-8917-2b78a3643fa0","resolution":{"observed_at":"2026-08-05T04:53:14.074366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.19457","last_updated":"2026-04-07T03:23:13Z","snapshot_observed_at":"2026-07-06T22:33:48.680749Z","submitted_at":"2025-10-22T10:41:57Z","title":"MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.19457","snapshot_observed_at":"2026-08-05T04:53:13.142470Z","title":"Mined: Probing and updating with multimodal time-sensitive knowledge for large multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.142470Z"},"links":{"cited_paper":"/paper/2510.19457","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:845f20de331c11847c383e295e1c7fb87cdd797fcd8ff2d3b82254891b20e818","observation_id":"a51bb7c4-78cd-4b2f-99bc-40b975e53ee3","resolution":{"observed_at":"2026-08-05T04:53:13.142470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.087361Z","title":"Mathcoder: Seamless code integration in llms for enhanced mathematical reasoning","venue":null,"work_id":"567f243c-dd72-4412-a565-27fe33c97377","year":2024},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.156977Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:f8677ebb918aba6fcd0d5f9472a74b70965b1cf7bdd73dd17c64bb254b3688d3","observation_id":"74b080b8-944d-4d8a-a72b-534a39c68219","resolution":{"observed_at":"2026-08-05T04:53:14.092400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00053","last_updated":"2022-10-31T18:09:51Z","snapshot_observed_at":"2026-07-06T14:12:45.730577Z","submitted_at":"2022-10-31T18:09:51Z","title":"Generating Sequences by Learning to Self-Correct","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00053","snapshot_observed_at":"2026-08-05T04:53:13.165423Z","title":"Generating sequences by learning to self-correct, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.165423Z"},"links":{"cited_paper":"/paper/2211.00053","citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:cfd65c6d3d6bbe31d7615570ecef1b710c5e544a28f4e4e7673fb6ca6fc110b4","observation_id":"76c6f394-d6e1-4557-8a99-8089f7dcf0cb","resolution":{"observed_at":"2026-08-05T04:53:13.165423Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.051860Z","title":null,"venue":null,"work_id":"03da5b6f-4154-4db7-8444-5ac473d9f5fb","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.170212Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:b11594d8a4419efcf52beca7a30bbc00487ee318de79ff691202c29ad81df2f3","observation_id":"4a368c62-a29d-4e6e-9f93-ecdb5d9c6a58","resolution":{"observed_at":"2026-08-05T04:53:14.057496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.034352Z","title":null,"venue":null,"work_id":"f6297529-50cc-441d-8b9d-c0d6ac0b5ecc","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.175101Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:f5a0d6d0e199d18968e12aa2c2a4b87b7a30a2e365eca55af50772b01b198ead","observation_id":"cc02cac2-914a-4afa-830f-3f0e1a453564","resolution":{"observed_at":"2026-08-05T04:53:14.039323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.015435Z","title":null,"venue":null,"work_id":"e340877d-049e-492a-9316-78830a1ac9be","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.179774Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:6ecfd9ca08aaea5f74cccbf2748978787d78fbdc88a41a3fab293eebb10a86e7","observation_id":"e82dd163-107b-494f-8a7d-0843a8f6677a","resolution":{"observed_at":"2026-08-05T04:53:14.021601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.997402Z","title":"17 Figure 10Case Study: Reflective Reasoning (Success)","venue":null,"work_id":"3cc9a0b0-4dc0-4d48-815e-d318e00a53da","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.184559Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:3de76a800dc536cb99826f57ea9d7ca827e8c10b8836979c55a1feca5ac669d3","observation_id":"615e3fea-8876-41e4-b695-975684456f7a","resolution":{"observed_at":"2026-08-05T04:53:14.002582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.980536Z","title":null,"venue":null,"work_id":"acf5457c-d3cf-4275-8636-3d82dac01b1c","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.190617Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:d5316e8d8f3576a8b2dd0579ce48479ac9d0d19b03aaeccd36b1d6d7a0c2c504","observation_id":"165e5c50-9541-4901-b645-34bffda28b24","resolution":{"observed_at":"2026-08-05T04:53:13.985398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:13.963754Z","title":"The reference solution suggests there were some errors in the previous attempts. Recomputing:","venue":null,"work_id":"705efd24-3382-4ec8-8add-a3c9a1726c5b","year":2048},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.195296Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:8dd6afe4bc8962e7f5e414849f268bbff950702d496ef1ac189a975ddaa72479","observation_id":"185dcd77-df9f-48aa-b89b-249267a1f57f","resolution":{"observed_at":"2026-08-05T04:53:13.968802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.456909Z","title":null,"venue":null,"work_id":"d7850cd8-4169-4d9b-a470-7a0d72102e80","year":2026},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":483,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.962737Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:d07f7f2f31f24a6915d6493af4a4ebc8b9817d14e920199e057ee0fd4f0fb6c9","observation_id":"c1872307-fff5-456f-8650-4dfb8e02e1e9","resolution":{"observed_at":"2026-08-05T04:53:14.461761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:12.971795Z","title":"https://thinkingmachines.ai/blog/on-policy-distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:12.971795Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:41931b6993ed16fe329791db73ed31f113bbdb5570a6716d367764cef3378c5f","observation_id":"edd914fa-d6f8-45f0-8048-8e58b2befa49","resolution":{"observed_at":"2026-08-05T04:53:12.971795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:14.248768Z","title":"URLhttps://openreview.net/forum?id=9SkkifLopZ","venue":null,"work_id":"28dce8ab-c5b4-488a-bf87-d8810cf57929","year":null},"citing_paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:13.042559Z"},"links":{"citing_paper":"/paper/2608.03972"},"observation_digest":"sha256:31c3cf3f42e1988d0f2cde3f12657a4fea22fc28a7b06f6d0b09493876d35a23","observation_id":"3fa1c871-1e68-4fbe-a32c-6e00ee3212e2","resolution":{"observed_at":"2026-08-05T04:53:14.253295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03972","last_updated":"2026-08-04T17:40:08Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T08:40:14.137222Z","submitted_at":"2026-08-04T17:40:08Z","title":"ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":6,"verified_fuzzy":22},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.03972."}