{"as_of":"2026-08-08T04:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee3aa51cf51dd4e749922ac0c3bc6677f0754e14eaa6aed0e996be4f2017aa0e","coverage":[{"denominator":133,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:13:10.322843Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:31:25.047058Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T15:31:26.249343Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"cited_work":{"arxiv_id":"2505.19815","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19815","snapshot_observed_at":"2026-08-06T15:31:26.249343Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","venue":"cs.CL","work_id":"8bf2ae0c-0c88-4892-88b4-dd16428d2701","year":2025},"citing_paper":{"arxiv_id":"2507.16003","last_updated":"2026-06-02T08:52:07Z","snapshot_observed_at":"2026-08-06T15:18:11.945149Z","submitted_at":"2025-07-21T18:44:35Z","title":"Learning without training: The implicit dynamics of in-context learning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:25.047058Z"},"links":{"cited_paper":"/paper/2505.19815","citing_paper":"/paper/2507.16003"},"observation_digest":"sha256:8e146e7f0c87122d2ff99668a1925f66fb24ab2c83f351527492e97d7886504f","observation_id":"36db4986-8f7d-4b3a-bcd8-080ad3e7dd9e","resolution":{"observed_at":"2026-08-06T15:31:26.311146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19815/citation-record","integrity":"/paper/2505.19815/integrity","json":"/paper/2505.19815/citation-record.json","paper":"/paper/2505.19815"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:03.846154Z","title":"On sensitivity of meta-learning to support data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:03.846154Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:ef7334d0adc84287c019ec20104cdd66a463c4fa9fa597ca0e8fa29ee65bcf70","observation_id":"cd7960cf-27bb-447b-9b92-a329d3c9a498","resolution":{"observed_at":"2026-08-07T14:13:03.846154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:03.889689Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:03.889689Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:f6e88f3472135866b04c3535a31abea2cf3cf0d4e388efb491985451c5ca9397","observation_id":"9062d4bc-6448-4df5-88c6-5edc78f9f64c","resolution":{"observed_at":"2026-08-07T14:13:03.889689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:03.954359Z","title":"What learning algorithm is in-context learning? investigations with linear models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:03.954359Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:4a8771608855acae2af802a0fd3628b8d250225de12c2d2565309c316b890800","observation_id":"41bcb0e9-8fef-4824-a591-e2b94b7ae97d","resolution":{"observed_at":"2026-08-07T14:13:03.954359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.007965Z","title":"Hoffman, David Pfau, Tom Schaul, and Nando de Freitas","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.007965Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e25efbe64529e750c9e59dd95f9b7ee52a39aba7196c9e34d13b1c5239dc5b5f","observation_id":"37cd0d8e-c446-4c34-9e67-58bc0e03c546","resolution":{"observed_at":"2026-08-07T14:13:04.007965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.021073Z","title":"Transformers as statisticians: Provable in-context learning with in-context algorithm selection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.021073Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:2c024da473aee92335a659ae82eb5420dbb1df6e9ddae41dedca3dcb7cd0c94c","observation_id":"4d3070e3-e1cf-401e-9067-fef6d050f215","resolution":{"observed_at":"2026-08-07T14:13:04.021073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.089527Z","title":"Numinamath 72b cot.https://huggingface.co/ AI-MO/NuminaMath-72B-CoT, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.089527Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e11d99edbafe5f2d654ad8687cb8e722eabf7cead1cd0add3bb16b2fb3ce873c","observation_id":"640cc635-1292-4979-a2e8-f575c7d052ef","resolution":{"observed_at":"2026-08-07T14:13:04.089527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.153587Z","title":"On the optimization of a synaptic learning rule","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.153587Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:47a22b1944cfa95df7833672e9a635feaf7c9492d20deb04c1538e2feb525258","observation_id":"6cbcf43e-f241-4849-8d4d-3a83eb7b4a52","resolution":{"observed_at":"2026-08-07T14:13:04.153587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.185963Z","title":"Llama-Nemotron: Efficient reasoning models.CoRR, abs/2505.00949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.185963Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:4328bd8a69a3d9d3b7c5192aa22b04cdba8b21f879e0a1e58f9fef3c9d719eda","observation_id":"95fbf38b-d253-4a4d-9a88-36061aad59d2","resolution":{"observed_at":"2026-08-07T14:13:04.185963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00200","last_updated":"2025-03-03T19:53:28Z","snapshot_observed_at":"2026-08-04T16:59:22.807968Z","submitted_at":"2024-04-30T21:06:52Z","title":"In-Context Learning with Long-Context Models: An In-Depth Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00200","snapshot_observed_at":"2026-08-07T14:13:04.222611Z","title":"Gormley, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.222611Z"},"links":{"cited_paper":"/paper/2405.00200","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:b3993b2c530a00a352a9bef0b7b627357ea4115b5a63dc34e2704b374b49e504","observation_id":"63ffba2c-47ae-4b84-b451-cb57d72f734b","resolution":{"observed_at":"2026-08-07T14:13:04.222611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.276040Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.276040Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e94fc5d142f2637fcbea3491d3550c8d5741cfa4d71dd22b35097886bf0f9438","observation_id":"492d5d87-8e50-42d7-801b-64ae44e07137","resolution":{"observed_at":"2026-08-07T14:13:04.276040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.332975Z","title":"On the ability and limitations of transformers to recognize formal languages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.332975Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e51f2fc2cccae779b576041fb4ef5242969d3f14fa56d8ba42afd667a6415da7","observation_id":"22663e17-7e8c-4082-b7e7-5f4b984cf4e6","resolution":{"observed_at":"2026-08-07T14:13:04.332975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.393726Z","title":"Application of calculus of matrices to method of least squares: with special reference to geodetic calculations.Trans","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.393726Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:f008213c841d5bb453c6cb0c6775cbde06e22704ee887fbeacc952564a979924","observation_id":"cbcbcbea-674a-4073-9ce1-ae6ee9130e25","resolution":{"observed_at":"2026-08-07T14:13:04.393726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.463619Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.463619Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:13681f0d32116ce88a06475f88e4dfd5fc9877a68ff1945a519280f12a97bc06","observation_id":"0c356d39-3593-4cb4-96da-5e231a942a6d","resolution":{"observed_at":"2026-08-07T14:13:04.463619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-07T14:13:04.572965Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.CoRR, abs/2504.11468, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.572965Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:1a826d8677a7323d6cc0971e464ee64580cef08c3816dd5525c7bbfca60815c3","observation_id":"111a5e79-786e-45ab-b28e-e508b1c541de","resolution":{"observed_at":"2026-08-07T14:13:04.572965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.650151Z","title":"A closer look at the training strategy for modern meta-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.650151Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:c3a6224eef5a0c807ca7322cf31cbd62f19222a4e4d846e4df67dd4de4ab52a1","observation_id":"1d5550d9-631f-4a81-8b12-9f17cb116a5c","resolution":{"observed_at":"2026-08-07T14:13:04.650151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:04.777215Z","title":"Variational metric scaling for metric-based meta-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.777215Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:92a8f4faab74246c356334bf09019126fd630d1c4a727745d59a779627d06962","observation_id":"ee5eaa55-4e10-49fc-b2d9-a4a2f9773045","resolution":{"observed_at":"2026-08-07T14:13:04.777215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T04:13:14.044604Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:13:04.861032Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.861032Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:372e845715734c3ee313c360cff19fe52da48090940ac69463ab3c0fa749b298","observation_id":"bd803e36-d4ad-4d2e-908b-1d81c32c6da5","resolution":{"observed_at":"2026-08-07T14:13:04.861032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T14:13:04.956661Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models.CoRR, abs/2503.09567, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:04.956661Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:55671bd400d971f14bc17daa1aac2855361a734991568eee378e426d781f2d6a","observation_id":"518ca357-322d-446b-80b2-59141bdd4cc3","resolution":{"observed_at":"2026-08-07T14:13:04.956661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.037177Z","title":"Tighter bounds on the expressivity of transformer encoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.037177Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:cdea9cfcb8988bf02c480977b167f70ea1c1b84324bb45305135acf350383e15","observation_id":"e55d93cd-53dc-4e59-90ce-8d4dac890a6f","resolution":{"observed_at":"2026-08-07T14:13:05.037177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T14:13:05.097364Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.097364Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:080948a716134cd4ee46bde1bde359485b301f3759f39f792e188aad34edc4a6","observation_id":"13f9710f-010f-4439-b2c3-3413663f1975","resolution":{"observed_at":"2026-08-07T14:13:05.097364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.185556Z","title":"Gpg: A simple and strong reinforcement learning baseline for model reasoning.CoRR, abs/2504.02546, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.185556Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:590280c5ddc1f9214fbf98e86e8e7ae9b9c21928e42ce413b54e33b1247e50e1","observation_id":"f2bb6e67-9f19-457a-a385-9c22bdff631d","resolution":{"observed_at":"2026-08-07T14:13:05.185556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.251388Z","title":"Task-robust model-agnostic meta-learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.251388Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:2038207a1b7730e23c5921ad5ec5766795043b103a304a6e3e4dd998c33a19c4","observation_id":"873e7d08-0884-446a-af88-6381fd5c39d4","resolution":{"observed_at":"2026-08-07T14:13:05.251388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.313549Z","title":"How does the task landscape affect MAML performance? InCoLLAs, volume 199 ofProceedings of Machine Learning Research, pages 23–59","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.313549Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:a7bca334aea4b573ead998ab588516028a8344c638cad2d331d30f7369ce2623","observation_id":"546d6461-e0ef-43e0-a34f-77188d01d39f","resolution":{"observed_at":"2026-08-07T14:13:05.313549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.373031Z","title":"Approximations by superpositions of a sigmoidal function.MCSS, 2:183–192, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.373031Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:234aa32ed8175532ac33d5d79410100d61b38a5c8661dde2ac82613f11e45fcc","observation_id":"5d538284-4aa0-4d77-b52a-a7c81927e3b0","resolution":{"observed_at":"2026-08-07T14:13:05.373031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.423564Z","title":"Why can gpt learn in-context? language models secretly perform gradient descent as meta-optimizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.423564Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:388456a5db8527f4e9f82314ec12b80ce5be25715d6fd3b87d18387a1073f1e4","observation_id":"b3cd39d0-bcdb-480f-9e5d-544dbf71c5a5","resolution":{"observed_at":"2026-08-07T14:13:05.423564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.535773Z","title":"Gemini 2.5: Our most intelligent ai model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.535773Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:9e1fdefbabe312e1633af23a931a66b64a8a7b0295754aca7450b3377a7e9c48","observation_id":"4061d508-f39e-446a-a831-e4e9dd5c0317","resolution":{"observed_at":"2026-08-07T14:13:05.535773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:13:05.581094Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.581094Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:28085b261aa9c5bdabd2ac0e7adeef29651526a6ecad9a08f8670a3343ae74d0","observation_id":"d825fd48-c173-4c7c-ba2c-9bc5abf04bed","resolution":{"observed_at":"2026-08-07T14:13:05.581094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T14:13:05.623446Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.623446Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:9cec7f660c21b4cd8e9730308bb122f51fa71ffacb3f7a6f0d9ac154fe94770c","observation_id":"68cacb91-93c5-4dff-b88e-87ab20cc52c2","resolution":{"observed_at":"2026-08-07T14:13:05.623446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.680234Z","title":"Universal transformers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.680234Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:85c656454f9aa6e74e46867e50a1fec58dfb7d97b5fd92436fd6b5f4d3caa91c","observation_id":"8a67dbd7-0b59-4cbd-841b-f33895d00586","resolution":{"observed_at":"2026-08-07T14:13:05.680234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.778916Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.778916Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:ff723b80540141fd1c21d3c10d05a516e127c0312fb39d30c4b8daaab71a0ed8","observation_id":"5b31e925-f738-47dd-817e-06d3ab34c297","resolution":{"observed_at":"2026-08-07T14:13:05.778916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.847209Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.847209Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e0867c9642977f1b8cf333702c24241d0f27ccb24bf9d568eca2baa1948b786e","observation_id":"0785688b-7ca1-42f5-b648-87b70ce5f28c","resolution":{"observed_at":"2026-08-07T14:13:05.847209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:13:05.932438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.932438Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:13c971516a5052ba34c7c9cbb10e2b3ab2b4e02cf3500de7ff82c8216bb2b9e7","observation_id":"221e7f49-d486-4dde-8594-c117654f1f23","resolution":{"observed_at":"2026-08-07T14:13:05.932438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:05.991035Z","title":"Towards revealing the mystery behind chain of thought: A theoretical perspective","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:05.991035Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:a561e427c20b2faa97d219311085c6ce72f279a1dfea303c5bdfd0975b4b9ba4","observation_id":"a0b5cb80-3051-48de-847f-972378cc0d86","resolution":{"observed_at":"2026-08-07T14:13:05.991035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.102481Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.102481Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:87fb37c75ba3127cafdb68452f85842ee3a7f835e6183b49f5bb465de4bb9433","observation_id":"08087437-dede-417f-ac4c-65901acb7763","resolution":{"observed_at":"2026-08-07T14:13:06.102481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.154765Z","title":"Transformers learn to achieve second-order convergence rates for in-context linear regression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.154765Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:5eab1593fbf093b29699567f997837e9b4ceb3330d4531acc1207a174281dbcf","observation_id":"f3180c5d-5d3c-4818-b70f-c94029497cde","resolution":{"observed_at":"2026-08-07T14:13:06.154765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.196331Z","title":"Reddi, Stefanie Jegelka, and Sanjiv Kumar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.196331Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:739b4e99c9ab20ddb4bb6b777b07dcded6aad611f76a41c7737681efcc9accb9","observation_id":"9eff5f2d-8af6-41d4-bebd-65c8686419a8","resolution":{"observed_at":"2026-08-07T14:13:06.196331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.230812Z","title":"Lee, and Dimitris Papail- iopoulos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.230812Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:7f54d1854b74690e6fcc5eb16700949ec81e696789d003b2d046499c952091ff","observation_id":"624d798b-e489-4310-b1d5-dc2edf934cd9","resolution":{"observed_at":"2026-08-07T14:13:06.230812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T14:13:06.287596Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.287596Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:6d88cabafee7f2a8e2b0f3fb9a1f9376cf103e2eec6fbbc1582b613a7f36d9e4","observation_id":"4448d8e4-a2ab-484b-89d3-7a10ae08bff6","resolution":{"observed_at":"2026-08-07T14:13:06.287596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.392230Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.392230Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:bd05a4c92bb9903b01c1a22e6c9176db0167d6936f44fdbe4f1f1ca2ea786047","observation_id":"ffc3e076-c28e-4cfc-9980-2f1346756a49","resolution":{"observed_at":"2026-08-07T14:13:06.392230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.430607Z","title":null,"venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.430607Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:154b15d0044bcc73669dd909e8885b528a36d458f7e5b4907f8e3baa2228703e","observation_id":"bd24f75d-82fa-4466-b347-72ef1b765fe2","resolution":{"observed_at":"2026-08-07T14:13:06.430607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.473455Z","title":"Approximation capabilities of multilayer feedforward networks.Neural Networks, 4(2):251– 257, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.473455Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:b5b1c2ffd35c35c534ec05f34904f30a07e6ae06b62db5c0a10b92fdff2e19ae","observation_id":"f21210e3-b3ed-4504-8e04-fc6881df648b","resolution":{"observed_at":"2026-08-07T14:13:06.473455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.538821Z","title":"Hospedales, Antreas Antoniou, Paul Micaelli, and Amos J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.538821Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:232090df250dd5f51bfa389aab14eae832a620fd425bda01938ddfe2e8f579b5","observation_id":"15de22bd-2ef9-4a81-90c9-01be65b74530","resolution":{"observed_at":"2026-08-07T14:13:06.538821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.609290Z","title":"Universal language model fine-tuning for text classification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.609290Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e72703c3c86504a6a36623b17246405db6afbfed1776f5f04600095ea0b006c1","observation_id":"68ed48f3-f99e-45db-a421-0b288074d9c9","resolution":{"observed_at":"2026-08-07T14:13:06.609290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T14:13:06.674033Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.CoRR, abs/2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.674033Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e1427dacff1ffe24174944a2c1a235eb6a10f748ae2a670beee262bb79f49276","observation_id":"49759538-da87-46cd-b2f8-683f3257d031","resolution":{"observed_at":"2026-08-07T14:13:06.674033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21212","last_updated":"2025-02-28T16:40:38Z","snapshot_observed_at":"2026-08-07T17:39:12.775789Z","submitted_at":"2025-02-28T16:40:38Z","title":"Transformers Learn to Implement Multi-step Gradient Descent with Chain of Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21212","snapshot_observed_at":"2026-08-07T14:13:06.748375Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.748375Z"},"links":{"cited_paper":"/paper/2502.21212","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e4627a8d3a71406d00f852c088cbea279bb6d00959363cafef124be0d1eb86ca","observation_id":"04a28cdf-1d77-4bec-8a79-869984e94306","resolution":{"observed_at":"2026-08-07T14:13:06.748375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T14:13:06.798749Z","title":"Qwen2.5-coder technical report.CoRR, abs/2409.12186, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.798749Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:37bfe3f10b63b2fccae7e70977aa0f10ea3fd32348aa9cd2a33b14133e5a91a9","observation_id":"2517825d-c34d-423a-abe8-5ff36dab6d15","resolution":{"observed_at":"2026-08-07T14:13:06.798749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T14:13:06.850119Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.CoRR, abs/2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.850119Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:48fb17b362ace00775e2caafc5573693e09c44dd1286eaa0e76495d387bb9202","observation_id":"02f2b3f1-399c-4b62-ad26-f141f0219f78","resolution":{"observed_at":"2026-08-07T14:13:06.850119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.927332Z","title":"Xu, Jun Araki, and Graham Neubig","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.927332Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:2635dd39a31bd015db4151ecc7fda9bd14d5d7f52d6b58103401a2de0edd89fc","observation_id":"90e9767b-ae4a-4976-bae1-1253314a8f9e","resolution":{"observed_at":"2026-08-07T14:13:06.927332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:06.987382Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:06.987382Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:6e70849e987d2371a6433ece5eda731ad652819294c001828eda088aba6e51e2","observation_id":"9a023e01-3435-474c-ba5a-78295caafe5d","resolution":{"observed_at":"2026-08-07T14:13:06.987382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.041699Z","title":"Bespoke-stratos: The unreasonable effectiveness of reasoning distillation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.041699Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:2554552d05f575fc6da424e84f177cae9ec9ef594b2675889f97c276da77ef59","observation_id":"1e7ae17b-a6b3-48a8-a2fd-d54b5352348e","resolution":{"observed_at":"2026-08-07T14:13:07.041699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.097294Z","title":"Rupam Mahmood, Shuicheng Yan, and Zhongwen Xu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.097294Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:a6188f3c9e00e132c5dcd2f9865a74b4f3149f1e5d9f9fd791a3fc158cf3db44","observation_id":"89db988a-f9ec-4f09-871f-95a0574a4636","resolution":{"observed_at":"2026-08-07T14:13:07.097294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.176651Z","title":"Meta-learning with differentiable convex optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.176651Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:065ad948b53d0b39244d59aff9506d1c85b827eac7def724a6f5b0d0137eb388","observation_id":"b726312e-9fc3-4c7f-beda-8d93305874fe","resolution":{"observed_at":"2026-08-07T14:13:07.176651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.242294Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.242294Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:4e01adeaa2f852b5f79e581cc8c60b0845e46335a8eba759bd723fb230dcf081","observation_id":"06ecbfd4-822e-4de7-869c-928c16e769ea","resolution":{"observed_at":"2026-08-07T14:13:07.242294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.318755Z","title":"Learning to optimize","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.318755Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e9445ab14631abf56a49c44027fb6c6a4e7c7ba36ecf0b81e79af7b96fc86a34","observation_id":"76f61f26-2816-44e5-bd00-473c7774b1a9","resolution":{"observed_at":"2026-08-07T14:13:07.318755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00441","last_updated":"2017-11-30T18:59:01Z","snapshot_observed_at":"2026-07-06T05:31:57.481191Z","submitted_at":"2017-03-01T18:52:23Z","title":"Learning to Optimize Neural Nets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00441","snapshot_observed_at":"2026-08-07T14:13:07.379623Z","title":"Learning to optimize neural nets.CoRR, abs/1703.00441, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.379623Z"},"links":{"cited_paper":"/paper/1703.00441","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:534dcd72cde975d6de0d0af9a061700b46dc77c71a983f73b5b9d0c5a7d0f479","observation_id":"f998e8fe-af3c-4a9c-9893-69e6a9366d7d","resolution":{"observed_at":"2026-08-07T14:13:07.379623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10069","last_updated":"2025-04-27T08:55:07Z","snapshot_observed_at":"2026-08-03T02:39:23.642980Z","submitted_at":"2025-01-17T09:42:48Z","title":"A Survey on LLM Test-Time Compute via Search: Tasks, LLM Profiling, Search Algorithms, and Relevant Frameworks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10069","snapshot_observed_at":"2026-08-07T14:13:07.442289Z","title":"A survey on LLM test-time compute via search: Tasks, LLM profiling, search algorithms, and relevant frameworks.CoRR, abs/2501.10069, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.442289Z"},"links":{"cited_paper":"/paper/2501.10069","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:89eeeea5937b0cbaa2207b6f17dde2d578876769a8a5ad5f3d1feef418708acb","observation_id":"27e8b020-eb5b-4619-9341-d453c3383f62","resolution":{"observed_at":"2026-08-07T14:13:07.442289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.493931Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.493931Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:601119b5f9dbd8c9dd28a92c2a5a178445e051353dfec86e8c19e6006e988af6","observation_id":"6931b8cd-e0db-4d64-a1c0-2f141e2dfed9","resolution":{"observed_at":"2026-08-07T14:13:07.493931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.561262Z","title":"Ash, Surbhi Goel, Akshay Krishnamurthy, and Cyril Zhang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.561262Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:fa2096c25dc45ec8d6f06c74d29e10d601f78db9bec7692cecdc501ed8294d84","observation_id":"d629610e-a7cc-49a7-a1b6-d5468648bd1f","resolution":{"observed_at":"2026-08-07T14:13:07.561262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.624447Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.624447Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:5cce8cca1300878750d53ff93f0ea9be21b3270b9d4aa937090eca276ca62958","observation_id":"78b9157b-413b-488f-b7d7-5aea2ac871d9","resolution":{"observed_at":"2026-08-07T14:13:07.624447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13147","last_updated":"2025-08-08T15:28:01Z","snapshot_observed_at":"2026-08-04T08:26:16.909949Z","submitted_at":"2024-12-17T18:12:47Z","title":"Are Your LLMs Capable of Stable Reasoning?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13147","snapshot_observed_at":"2026-08-07T14:13:07.676651Z","title":"Are your llms capable of stable reasoning?CoRR, abs/2412.13147, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.676651Z"},"links":{"cited_paper":"/paper/2412.13147","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:36a2a7447b86d20cce7f98f26d1cb38587e6a736488bb8fa85b588b468956982","observation_id":"011da701-fbe3-44ef-af4e-b2ac622f280f","resolution":{"observed_at":"2026-08-07T14:13:07.676651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-08T01:06:59.135762Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-07T14:13:07.755282Z","title":"Reasoning models can be effective without thinking.CoRR, abs/2504.09858, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.755282Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:7aadca7e807c90c0eef83843ca3c57f3d7c94a895a61a44cbb0fb6bbaee757a4","observation_id":"fd37c512-1417-436e-851c-aa6767c0faa7","resolution":{"observed_at":"2026-08-07T14:13:07.755282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.821020Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.821020Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:c70aa416b7e20bc14d7e33112f7ec2f04a8adf47d3ce35f2b29d2f1b0c0486ac","observation_id":"ee90d448-51da-4cb6-9e8a-5adcc25a3fb0","resolution":{"observed_at":"2026-08-07T14:13:07.821020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.888575Z","title":"Academy, 1877","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.888575Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:936ef201d6dec8d7dafdd563c7e68fd9681728a08947d7816d129d1ab20a6665","observation_id":"e53b52d6-0857-47c1-9c75-47ac5611c292","resolution":{"observed_at":"2026-08-07T14:13:07.888575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:07.949373Z","title":"Metaicl: Learning to learn in context","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:07.949373Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:751e3077f05e2bf6427214316c0ce5e76f754a722813c1958d0d7e3ee093ac08","observation_id":"7fb5527f-58c4-4ac9-b746-3f9b15ecad3a","resolution":{"observed_at":"2026-08-07T14:13:07.949373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.015925Z","title":"Rethinking the role of demonstrations: What makes in-context learning work? InEMNLP, pages 11048–11064","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.015925Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:4b50c77db754f6cb254e91c6730e90278ceee4d2414f1f5e93254e8eeb49deb8","observation_id":"fa2536c2-34e6-46df-8164-eb0c6387edc8","resolution":{"observed_at":"2026-08-07T14:13:08.015925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T14:13:08.100248Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems.CoRR, abs/2412.09413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.100248Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:0d08f21b08cab169fead1aa3e998306d456f074db20363e99a6d075683d067b0","observation_id":"550dffcd-cfeb-4f98-970f-5d2d4c3956f4","resolution":{"observed_at":"2026-08-07T14:13:08.100248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-07T14:13:08.198094Z","title":"Riedmiller","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.198094Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:89f6acf59cb571482eecf35376d1870cf53c9c3b11f3b454215adbcc7dae42b8","observation_id":"22b59dbf-ee13-4759-ad72-fd323d8caa7f","resolution":{"observed_at":"2026-08-07T14:13:08.198094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.267336Z","title":"On the reciprocal of the general algebraic matrix.Bull","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.267336Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:4391bbebe64e1de608dc3db241c99ce4f0b47f7cf2b5b6548277f903c08de5a5","observation_id":"bf72671a-9350-459f-bc18-2878a716ae4a","resolution":{"observed_at":"2026-08-07T14:13:08.267336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T14:13:08.379653Z","title":"Candès, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.379653Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:ed5af075f799aec1735279e866807c21873dbd594eb321095e7829beb222fcd0","observation_id":"64fec554-2a0e-4197-b806-4203055af3a3","resolution":{"observed_at":"2026-08-07T14:13:08.379653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-07T14:13:08.434201Z","title":"In-context learning and induction heads.CoRR, abs/2209.11895, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.434201Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:3a1ff0a1ddb8f606f8aafd74b0fa53715643906f799b5058b137a6d0677c7c4d","observation_id":"0f35de02-d51b-41f4-88f5-a971b38fd0e8","resolution":{"observed_at":"2026-08-07T14:13:08.434201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:13:08.513001Z","title":"GPT-4 technical report.CoRR, abs/2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.513001Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:99b2fc85ba1cae6cfed651e3cebe6aa99f1a52b67ea6c2617cc9cfe798528b99","observation_id":"9ee7c885-1c6d-4409-845d-bea84e13b2ae","resolution":{"observed_at":"2026-08-07T14:13:08.513001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.575853Z","title":"Learning to reason with llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.575853Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:ae4c1f3a3d7eceda47b0a41797145f201fd147f2308747b0cc34e1f149994222","observation_id":"683dd9a5-4a8a-40ff-af3c-4ffd1827649e","resolution":{"observed_at":"2026-08-07T14:13:08.575853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.641941Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.641941Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:c6e0a1cb225ffcdc47b1b3044aed12b36207900327160c6fa8a06b362cebe4fb","observation_id":"9d3b5eb4-c868-4973-9009-be573e8d2175","resolution":{"observed_at":"2026-08-07T14:13:08.641941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.705867Z","title":"Yang, Zachary DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.705867Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:b49a0b762769c8139b0e82dd2abf941b99cb2c2b09e5e2b54a1007951262b6c6","observation_id":"f219487c-ed62-43de-98a5-51cc592c890f","resolution":{"observed_at":"2026-08-07T14:13:08.705867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.774117Z","title":"A generalized inverse for matrices","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.774117Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:a34508446db95818e78680c198d622b60c52299e936800147125abce9183005c","observation_id":"7e03045f-d25d-4ae7-bc7e-351a68c5b162","resolution":{"observed_at":"2026-08-07T14:13:08.774117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:21.621085Z","title":"A simple guard for learned optimizers","venue":null,"work_id":"90ffe3f5-5c34-43c0-a7ed-dc7c33e809e7","year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.870312Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:328f4966a8f89d4758c7b6a93fbff412ee4d26406f243ca2293f808546b192fb","observation_id":"b5119c13-0e97-4ebe-83c0-3850e6a154b5","resolution":{"observed_at":"2026-08-07T14:13:21.684679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-07T14:13:08.930615Z","title":"O1 replication journey: A strategic progress report - part 1.CoRR, abs/2410.18982, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.930615Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:bd99b96b872e01de47bb5b28a7180fa9bb4af5a48ab0ffc6badcdd4ea7f94873","observation_id":"c47a79b1-30cf-4b43-a5c0-f515f443b4e2","resolution":{"observed_at":"2026-08-07T14:13:08.930615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:08.992883Z","title":"A survey of efficient reasoning for large reasoning models: Language, multimodality, and beyond.CoRR, abs/2503.21614, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:08.992883Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:63cfadc234fb9925e93d30b28cd0d0f43ff7160da0dd96805c6c86fd222bca96","observation_id":"c1011af8-99ce-4177-8156-c40f5efe5df3","resolution":{"observed_at":"2026-08-07T14:13:08.992883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:21.430326Z","title":"Improving language understand- ing by generative pre-training.OpenAI, 2018","venue":null,"work_id":"1d4fc761-195a-4fbf-9600-d1bb16d73eef","year":2018},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.058562Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:9c2491285ee6d5fc3b048e7d0b72c7460822d0798c277dd5b370f9549350638c","observation_id":"2c8d8de0-ee38-49d5-8af1-33a0e84922af","resolution":{"observed_at":"2026-08-07T14:13:21.531829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:21.205656Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":"4ebf8c35-4342-49f2-be80-6f9d2782a71b","year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.133936Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:74c80ac1774f5a3e6804da64edb311dbceff4f2c5953501ad3b5d1c8780a933f","observation_id":"e51bd8b2-4182-498d-96cc-3b7833cdff6d","resolution":{"observed_at":"2026-08-07T14:13:21.300794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:21.030010Z","title":"Kakade, and Sergey Levine","venue":null,"work_id":"c1d5c09b-ea34-4a98-af55-42839dcfcd96","year":2019},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.195493Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:71b4fe51761de809d961f21e6a80628a155dcebd99b96971b830f1a82581b9cf","observation_id":"a034b155-5f00-40d9-9edd-e50bca4beed3","resolution":{"observed_at":"2026-08-07T14:13:21.122628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.861725Z","title":"Optimization as a model for few-shot learning","venue":null,"work_id":"118d08de-75ec-4694-b5e5-229085d7f0b7","year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.270372Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:0abb293785a7e962d5f797b4d37be7f9b0619359269844c5c28eb63c2ff4d599","observation_id":"a8b5061b-8020-4e77-8b7f-93b94df87b7f","resolution":{"observed_at":"2026-08-07T14:13:20.922435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T14:13:09.318060Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.318060Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:e4107b12653dda862ed4c617aeee3b033c0b59a26c8bc5c25bc326afaf8d357a","observation_id":"a65b5a9c-ba39-4bdf-aa26-e2de63b7b95d","resolution":{"observed_at":"2026-08-07T14:13:09.318060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.645910Z","title":"Learning to retrieve prompts for in-context learning","venue":null,"work_id":"b7519dc9-aed7-419b-a5b6-253679e8d146","year":2022},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.365657Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:8c7fd824b2611e29292cc5a5a547b3ceaebc881eaec8f67bb59ce20d212d4c43","observation_id":"5330e67a-6131-43f2-85f1-333ad8ba8a99","resolution":{"observed_at":"2026-08-07T14:13:20.774803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.06065","last_updated":"2016-05-19T17:44:51Z","snapshot_observed_at":"2026-08-03T18:45:26.284373Z","submitted_at":"2016-05-19T17:44:51Z","title":"One-shot Learning with Memory-Augmented Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.06065","snapshot_observed_at":"2026-08-07T14:13:09.429316Z","title":"Botvinick, Daan Wierstra, and Timothy P","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.429316Z"},"links":{"cited_paper":"/paper/1605.06065","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:3db8220622177a48dc410434916793c5fe84e598fe1aa89093fb033d3dccc08c","observation_id":"93d8f48c-b70b-4b15-8978-319febdeeaaa","resolution":{"observed_at":"2026-08-07T14:13:09.429316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.459632Z","title":"Evolutionary principles in self-referential learning, or on learning how to learn: The meta-meta-","venue":null,"work_id":"c449e28e-2f76-4b27-85c6-c21a13bbcf50","year":1987},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.524137Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:bde9e87267d509000ca3dc76a4465ccfe6625bfce8f465983c0dc2addf2c35f2","observation_id":"4fe45818-2782-473c-abbb-d63ea510437a","resolution":{"observed_at":"2026-08-07T14:13:20.546970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:13:09.625547Z","title":"Proximal policy optimization algorithms.CoRR, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.625547Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:3df160ed64d4989c5a282ad37f2a6fc1d1db3e457eeaef63e380429c9eb9e2c5","observation_id":"93df2217-f2c0-45f0-ab75-75ad274dafc7","resolution":{"observed_at":"2026-08-07T14:13:09.625547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04022","last_updated":"2025-04-05T02:24:07Z","snapshot_observed_at":"2026-08-07T21:53:41.208900Z","submitted_at":"2025-04-05T02:24:07Z","title":"Rethinking Reflection in Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04022","snapshot_observed_at":"2026-08-07T14:13:09.701448Z","title":"Rethinking reflection in pre-training.CoRR, abs/2504.04022, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.701448Z"},"links":{"cited_paper":"/paper/2504.04022","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:5b17c3125f30b70c0f824646025043b9d8bb2370828b30cebfea238bb353483b","observation_id":"add5ac14-23fd-414a-84bc-edfcea2c2eae","resolution":{"observed_at":"2026-08-07T14:13:09.701448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:13:09.795838Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.795838Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:147a4a8dad95b4a363a414b277496f7e355d980e9dfd90cf67bb6af35e18fa74","observation_id":"c3388108-bb18-4d55-a6ac-eb23367b7892","resolution":{"observed_at":"2026-08-07T14:13:09.795838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.242649Z","title":"Hybridflow: A flexible and efficient RLHF framework","venue":null,"work_id":"ad170c9a-d53e-44c9-bb75-3693772f69ab","year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.853973Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:46ec5c71235c502f2a3e872218c691ab946e9dd8bece83e5f9b5f55670ede9c1","observation_id":"52505d35-b8b5-4057-8449-f549907560a3","resolution":{"observed_at":"2026-08-07T14:13:20.357532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08200","last_updated":"2025-05-23T03:46:43Z","snapshot_observed_at":"2026-08-07T17:13:49.613889Z","submitted_at":"2025-03-11T09:08:07Z","title":"Route Sparse Autoencoder to Interpret Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08200","snapshot_observed_at":"2026-08-07T14:13:09.892396Z","title":"Route sparse autoencoder to interpret large language models.CoRR, abs/2503.08200, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.892396Z"},"links":{"cited_paper":"/paper/2503.08200","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:a6283f26814515d06544d322ee95e8afef1c5a8af5a3190d014e56ff9f807b50","observation_id":"9ade0988-831f-482c-85dc-b309ea41f64b","resolution":{"observed_at":"2026-08-07T14:13:09.892396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:20.050728Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":"c285f893-2a2e-409f-867a-43592f713514","year":2024},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:09.944823Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:5a73e59274e113d04f7a163bd60c7cc6f8babd1c633bf37c2ae5ee7218c0b695","observation_id":"6c376dd7-ff2d-409c-8abe-555878c0ed4d","resolution":{"observed_at":"2026-08-07T14:13:20.145364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.850753Z","title":null,"venue":null,"work_id":"ce5d8101-0989-48e7-b8dc-4305eda08807","year":2017},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.004740Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:675768b387485a9f49eec40b4acebe319ad857312280a0018a13f0f934b6e352","observation_id":"e8ad6c2e-f46e-4cf0-8cef-7ad7ff522a18","resolution":{"observed_at":"2026-08-07T14:13:19.926428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.672832Z","title":"End-to-end memory networks","venue":null,"work_id":"2edf8337-d2fd-4e84-b60f-c3a19b5c92bd","year":2015},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.050171Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:23b3deb2284aed759a65ea33e4632639d257887078aaf00519e944844d5c8853","observation_id":"798131f2-a93a-48e7-9826-3de2136420aa","resolution":{"observed_at":"2026-08-07T14:13:19.761948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:10.096820Z","title":"Andrew Bagnell","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.096820Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:eda4450ce4b39ec64e9e2a586f9dbda531319cc80b1a2eee57d79d52134149ad","observation_id":"a9dd52e9-1da2-455e-b46e-8e90b913ea8c","resolution":{"observed_at":"2026-08-07T14:13:10.096820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.512440Z","title":"Blockmix: Meta regularization and self-calibrated inference for metric-based meta-learning","venue":null,"work_id":"66e22f00-ff20-4860-aff6-e0f0ea24329b","year":2020},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.141251Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:9221f7292e7f2216ffd069d3b679a274066e51dcea0cdcab6636144f71989f6d","observation_id":"1a7e9674-6b59-4031-8e4e-44638681b15f","resolution":{"observed_at":"2026-08-07T14:13:19.584497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:13:10.188547Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.188547Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:20b9d0e1af6fb4eb1cb2ca38d5f2633b88bc9cc8724ffd33b37a129d1217e9a7","observation_id":"0dc475fb-517a-4ba8-9778-89e2b58fd9fe","resolution":{"observed_at":"2026-08-07T14:13:10.188547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.304974Z","title":"Sky-t1: Train your own o1 preview model within $450.https://novasky-ai","venue":null,"work_id":"18edb71e-2e4d-4c25-b489-9acf4359517c","year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.233784Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:04d245e0a2b37e143dc29fdd57c5291bd079116bfae54ba774f02449830d0f15","observation_id":"0b24141c-efa8-4b5f-a8bf-a283380141c8","resolution":{"observed_at":"2026-08-07T14:13:19.414611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:19.047074Z","title":"Open Thoughts.https://open-thoughts.ai, 2025","venue":null,"work_id":"9e65f7fc-8af3-40f7-bcb2-641f79d51688","year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.278438Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:124aeedc6e3e5595df10df3320ba1f65de8105b036db6c5ef6515256f9353717","observation_id":"8d544828-9521-49e4-87a2-9fd7f3cb77b3","resolution":{"observed_at":"2026-08-07T14:13:19.181089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:13:18.810573Z","title":"Qwen3: Think deeper, act faster.https://qwenlm.github.io/blog/qwen3/, April","venue":null,"work_id":"b0bf3b97-52e8-49d1-bf68-2b0091a4219b","year":null},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:10.322843Z"},"links":{"citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:28ee1ad85c0655dd877f5c6c9e0d8ee62e7a52e6fd387354c3e4e2dceda54b9b","observation_id":"1a42a299-166e-4879-9e37-ed8dfed4d730","resolution":{"observed_at":"2026-08-07T14:13:18.893561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":86,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":133},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 133 outbound references and 1 inbound Pith citation observation for arXiv:2505.19815."}