{"as_of":"2026-08-20T19:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb19e7cdd658c04469e2d7a0c1a5dc3f96db768331f6403c5eaa24f7695ac8d9","coverage":[{"denominator":110,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T10:50:54.419477Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04963/citation-record","integrity":"/paper/2607.04963/integrity","json":"/paper/2607.04963/citation-record.json","paper":"/paper/2607.04963"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:eb338dcc4515e755d02db75dcdef85767546027d0c0675e92e7676bca2ba72f4","observation_id":"957f32bc-7e79-45ae-a7e2-d092602e8e1b","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:67f960c21ed2b79a00e9a95749847fd6f4b3abd97847c4aee9d7a76d4648d0fe","observation_id":"320b38b2-5c3d-4b08-8c12-b627df5136dc","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:271ed44a0f83f0d49474205c78342715249b56c63314dc12d4792e4dfbfaa4c2","observation_id":"05aee880-0362-4168-810e-49dea053f2fc","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"NeurIPS 2024 Workshop on Open-World Agents , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:9321aa820268921c2e5be2cf5dd3bad4417ff3f72b9058004ff18c612c1d1916","observation_id":"4e1d901c-42d4-4b8b-ab74-aea5bebebc89","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:7ef93144cc7ddf974824172f024560e328b0799f58bdeb74eeac716a9fe91e40","observation_id":"8064da12-92e1-404e-899d-c45d858f70e7","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:a30dd74f62ed407c905700d1c155473e6b45ffa00a2f348504f2ea95bcc80fa5","observation_id":"2f465362-e5d1-41b0-a1cf-338ac3980999","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:7bce2624bba2ae2ec37cf826a5f4fdf5fd52963bea6eb3a39a43f7d85195d009","observation_id":"1b247f7c-3cfb-4205-9c25-e1ad118b43f2","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"The Dawn of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:ed6bbb635b28988e3b347abc8a3363b185e63c90eb764fd3e36276d66aa801f4","observation_id":"fccddd7b-c971-4912-81e3-57b1c10d13f0","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2402.12289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:166627806ed750e4a419fe99ed3c25c500572aaabf565694ea6fd500a5a681b7","observation_id":"59256957-4dc9-436f-8070-ee1b3757428e","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2312.11805 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:a74f2a07280f1b2681ae86d87c2779206e218deb7849a72e4b3da4a641225719","observation_id":"9b263e96-8033-49f1-9f23-a1360f573ed5","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:cbec4f98c5cf8d54bbec8441d1f40410e3fec41a788427183d15a4e6adbe571c","observation_id":"047b9b9b-1387-4236-bdaf-474bf9d19fb9","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Transactions on Machine Learning Research , issn=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:cc852a3cbc2c5742751e6291bdaeb185666326505948afda968643eab09180b3","observation_id":"fbee810a-7503-4044-b679-ae74aa84f9ac","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:caf011f6942d51c8175d3b678c40f7a6c45568b48e19a2cc07e1ea3d7647df67","observation_id":"e019641e-235c-48d6-a6a1-98693a199282","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15033","last_updated":"2023-11-25T14:14:01Z","snapshot_observed_at":"2026-08-19T16:22:28.601818Z","submitted_at":"2023-11-25T14:14:01Z","title":"Agent as Cerebrum, Controller as Cerebellum: Implementing an Embodied LMM-based Agent on Drones","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15033","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2311.15033 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2311.15033","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:0a09512ff737d94e8a1132b412c7749fc75768984d9e58ff253b95fd19d2fc87","observation_id":"1f6818e8-cfa8-499d-b859-5054d651c4db","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"2023 , organization=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:6fed7dca5d4cb8675d10a3464ce30afc6af125556c82d2a0e9ad81a44ad820ba","observation_id":"a0fab0fd-ee0a-41e1-b57f-23b2304be306","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-20T18:18:30.378150Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2312.13771 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:b65e46f72cdfd34eb1d40ead2c9759192e11eb47cdaa9cefb2c8aa25c0c87012","observation_id":"6ea9c60d-52b9-4e98-80a8-d78fdecb332e","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:d84b7e3388af3f84954132853756dabd00a5c0381298876332b8439cd4465341","observation_id":"0f6790ad-0d11-4eb6-a205-0455cfbf5a0b","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:b92f6c597aaa48f1a8576970477f0f025f760ee65d5a053d754bc81f7585ab0e","observation_id":"f3962adc-f4b6-4072-a5c7-0d08872bd172","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:f73727b618eee4ce6a2fab04df664e431016cca35cdb4b4bb4bf2ee56ee6d846","observation_id":"04fb3aca-3512-4525-8aee-e4fd3ed65f68","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:e134c5ba9e5f50edfb27d77d16358381ef983d60aab8b02e3c5bcccac96aea55","observation_id":"14075823-08c4-46c8-be05-55673d61ee34","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:ca67057623c6fbb0c793895da0a93cb8e3dd31b78f5a7d1c1a18b1abf2580694","observation_id":"4ea01bc3-da9c-4af1-bf71-9121e51c6aa0","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-20T03:06:00.034814Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:1910.00177 , year=","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:e13bfb8f1f818f303bf3414907fa66c69db053254f17add826cff3daa06fc37e","observation_id":"5c8ec340-b559-499c-98ba-7f17b61249c2","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:50f350f03d9ef38681254e9065eee46cbcad7ef00092cbf685ca854d7566eb12","observation_id":"32f2f142-126c-4729-8d54-73ccda10b892","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:417c0dfbeffda996e285c44ba5678e909e4c4ced35e179ef858d6c67b84bc74b","observation_id":"66100cb3-994e-4bb5-a046-59ec672fded9","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:ad66f1e785b6bd9429091255664553a6246010449c69de0fc02f292c681c2ab1","observation_id":"2f413e00-dcd8-4e95-a9dc-e4ef6bac9f52","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:8a9b56cb44533477c97515a1ae8b47a9fa809da1889bf254b8923496bd15a629","observation_id":"9e2c3f41-3444-41c2-bcf5-724d9f21d4b6","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:d533e20e6fcc561d20a4a078db42e7106635b413da2bcd56fbc79687f60f8b0f","observation_id":"8976df23-1688-4147-bd56-ae470e7824a3","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07945","last_updated":"2024-02-09T02:33:45Z","snapshot_observed_at":"2026-08-16T14:20:01.793685Z","submitted_at":"2024-02-09T02:33:45Z","title":"ScreenAgent: A Vision Language Model-driven Computer Control Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07945","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2402.07945 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2402.07945","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:9efe1f940f926526e2d62dde100095d2ccf9832cd00e8f3004b6b39428f5c368","observation_id":"9d5528c1-323a-48f8-917f-0b08a64b44a4","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Findings of the Association for Computational Linguistics ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:df1de0c0fe4edbaaecff17a808e3a0b969e5ff788aaa143df4c225afea0861e7","observation_id":"1045e8a1-e62a-4f88-b725-de8b7f2680ac","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Reinforcing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:ad9ed9ef0e4578e0542052ebf1d9b1bc76a11f5949581cf10235eb3b0cbedcbc","observation_id":"fd47b29e-9b45-40de-b877-0b02d1cd61da","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:4aa4f81672680e87c11cba41a9d8b08f5421f3b20e086cb873eeb50ba4f99170","observation_id":"e310de8e-4725-4e8c-b7d1-5d3f49cf1eb5","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-16T14:53:43.494263Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2310.05915 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:1a9ab887c7c015c73a670300cabbfc56297c38567608a90f07a7e51ec34e1711","observation_id":"56cecc91-1805-4e49-912f-9797b1ea6101","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:51efaa719da56e3284c7ddd31cb538875d4092ee9f14d02806bcd6d2981678eb","observation_id":"acad7ed2-fc0c-4ac0-92b7-0d51960b3ed8","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:587e4a4952d340f607d35d1f3e62d6ae06dabbea5a3d013f98249d714a22c621","observation_id":"79bce8b4-78a5-4194-9de2-63698f423084","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:7e914a309b80896ba23e9355c9d44d9ec442e963b221caeda4d1a873b3e7ecd6","observation_id":"c16bd459-e178-41e8-8696-63e1d0919bbe","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:5ac4b1bead976a49c802615d9b2b359224981aa7d1e3f2ae4db567f8720d230c","observation_id":"4e8d8593-4603-4bd9-9b02-0ff3aa328784","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:a9b262c1578c6c75f3b43d04e9d175d9be01c542b4d6795395f107560543eb79","observation_id":"d16b72f0-e5b8-4d73-a4ee-57fbeee56165","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Huang and Mustafa Safdari and Yutaka Matsuo and Douglas Eck and Aleksandra Faust , title=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:0b2900ddab6b60558f24ebe6d14a36c96bb51f11c530ef7b7c0b6f5536fec6cb","observation_id":"50ba1777-7e6d-4cd1-9f46-426e23a72028","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:c3fc7615f7555aee5e3657b19610ae31a7fca6398cb6edb0fe12a0447e7fc2b2","observation_id":"77e558e9-5543-47fc-854b-a25724db6c26","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:090773f942e82da353cb44d11ae7d1af7e187ff756747ffc46fef36ca812d17e","observation_id":"ffd33716-b5a4-48b4-bfbd-2a31c4b6ed40","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:c8ed1d120a4459df3c47896a943b57e463457978fed692ccc1239ac40b3dc780","observation_id":"123aa6e2-783e-4364-a3d5-597766887343","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:2618dcf845bbf9c2caf3fe2a1db644b898d86a75b0ae0b5c21d88d47052c8dac","observation_id":"79bf2cb6-2040-41c0-b4e6-2463bd6c254f","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-14T18:41:41.282322Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:1808.04355 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:2467564101dac059cbca6e77ee1e226a98cdbb7d66e2c4b76568f41d0d1fac61","observation_id":"a9caaed7-851b-432f-a850-226988c2c7fd","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"2010 , publisher=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:a7463e28c2dcfc63051e4bd22249f7831c6d541eb85901c7509669a818391c2f","observation_id":"2eb33799-c497-4663-980e-72d7e58c9d08","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:4f5c828ad13ecbcb613ab2fcbf1c74b7b910634d1928ed6f8882fde1cf72ea6a","observation_id":"c20e9de4-e927-41ab-9133-37dbc93b178a","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:a2d412289136cbae83474133740bac645b522cc514ce8fb530c29a3a492f37e9","observation_id":"c8af4c45-6483-4640-b418-f3b2c316ef6a","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:ec58d1f9e65cb1671476ce063398757462fbc4b05cc2ea414d9032583efe8cf4","observation_id":"56d354d5-aa7b-41b6-83d0-cb24c42e6039","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":", title =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:d70249173eaf21229b4fd5599c67ef63a38eeda1f3eca12df8edf8db485375a5","observation_id":"c35d7284-3b5c-4797-b1bc-9b2144c703da","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-17T16:48:59.674177Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2503.04697 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:d54f318de59786f5c1e330f9aee8ea47d47f5357fc708a899d777bb56bfc122e","observation_id":"fc8a6eaa-0aec-49cf-8452-22b4f1c2fea2","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:28b5f3596a71ca82912d53ff88ee3640c4cc48cac6e536a0ee5899688e26247e","observation_id":"3e36be9a-30ee-4886-a157-05b101a813c7","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:54724f9c3c21705cd6b61a945ed2a58c21972393015eb150c3f4d17aa76f035c","observation_id":"c382f814-2583-4ff0-af54-06778051013f","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"5 technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:5330a740d95fb9980a40b18f29528773dee367a95bc5e10b26428e018895570e","observation_id":"bb605e8d-26e0-4f5c-acda-177e31c5f407","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Embodied Agent Interface: Benchmarking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:5864772868b4c626d3e99f482cc89d14c3d6c3f74400c8a0896ddc29b970b3e0","observation_id":"072b26d5-edc6-49f7-9e1b-ec34d12395aa","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:4e4884835542e13b57930e1d14da7605edd644f4f019c3eeb0f173b7899ca5af","observation_id":"45bc7e29-f461-4d42-827f-26f8ad5f4261","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:c1606dff2c2b745b9dd68c3335f393a245a2549b9893a8181d71cbea2a6d4e41","observation_id":"64faf99c-c04b-4c46-b25a-5e2cf8b57b42","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"ICLR 2019 Workshop , year=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:f05022afdc76865d9deca77080f0f5402c0603c17f0a82729f647c523dc56029","observation_id":"c042b441-17ec-4e08-8a90-594347e3badf","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2503.20783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:0552852e8c7d783aa665971562eec79ed88d646460884338857aeaaafb8e338f","observation_id":"22545a3c-3b43-44ad-b52c-6d49c5e845ee","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:5f3f7a444097a7e2c6f1304fd7a73263531ab99c058bfa69b1fbd5539d61d49c","observation_id":"d6bc13d3-873c-42c5-985b-7c5b745d673e","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:71c3fc07e8198ab9dfbef8b8e5ab73ac6f6f56cf244e053cb415c86bb98c7bfa","observation_id":"745f386e-72a4-45ce-b849-a3bb3b9f73ea","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-18T03:07:34.996948Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2502.01600 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:25dbbc850dfc7a0324e5779707e1f0bb98ac8651326470cf5fb10b21b0489096","observation_id":"b644b619-26d8-48ea-91df-0d76deedb835","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:a9c706798726ca8ae3801c713bf5b5ebeeb8f5bcd488df18d7a70357e208f5d0","observation_id":"6b369be3-e4ab-4a7a-a8c3-8c31c7118a7a","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:1909.08593 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:be4f3d75762820bf3393b366ebf696175478178b0faa7e0f0073828ace9dc6f1","observation_id":"4728e245-64c2-4507-9861-c9d9a79d2649","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:b9b362cb701607a23080ee1caeadb3bd2942a5530494075088d79497aa5b0ef6","observation_id":"78a91dff-a3f5-4096-8ef0-f7cea535354a","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:2e3022675cc5b9071a71312b6863f10c6c121a42a7882a41829be383c08d096c","observation_id":"0a4eb951-4ac6-4d41-b74f-82d96b3dc9bb","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"2024 , organization=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:31602465fdfd3906bf20df10fb9081a92143b36275156284c4932f17cdd709d5","observation_id":"c22a6063-fe30-45f5-bc49-c388e89bce20","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:3e2872209b959982efee125efcc85d19dc3ea1f06402969d4ff0e12719b1c3b9","observation_id":"0e344cb6-0fa2-48e5-9fac-b1695c121d57","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2504.13958 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:f44b5191960f579201a134bf30d0ff940c6998d38a9dc9c134c2d24842fc8bc2","observation_id":"f0600542-6d49-4567-809e-94e6b476ee83","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Kimi k1.5: Scaling Reinforcement Learning with","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:85bbde81b7ccff11b8f0c1a21b94b36508d56025af515a7f4548f3ce13326308","observation_id":"5f375978-c8a9-4d8a-9d97-90c889677d7b","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:1405caca2244a954253c7eaa075ee58184e714187da19f84a48b1e71775e9284","observation_id":"3a386376-582d-4a48-a9a9-1ae52656a5ee","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:15c56096700fbec7c6d4bddf515c49c18e9a4513276728ce16762a5db4f5e447","observation_id":"ebe314ac-1e82-4bc2-bda0-7bc89470683d","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02903","last_updated":"2020-10-06T17:36:29Z","snapshot_observed_at":"2026-08-16T19:15:26.431243Z","submitted_at":"2020-10-06T17:36:29Z","title":"Keep CALM and Explore: Language Models for Action Generation in Text-based Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02903","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2010.02903 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2010.02903","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:bf03ac0d918ccff28944049e1dfb912db944dadff66e32dd454131b0aba04eb8","observation_id":"e562ecc5-f39a-4722-8bc8-e1cbaa3c576a","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:246afc70fb26271e76de526ba8555afd2c7a38844833ce92ff2688b1efda9374","observation_id":"e80472bc-65df-429a-ad86-947049c3a6df","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:4df987459fe67a89b78d15a80e413c8dbde23289a7dd856008d2f0138a7fac51","observation_id":"f6bcefbf-1140-40fa-8182-2ebb5e28b9a4","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:40d5774ed67a0946d1dc405025d926b00def2205565186d7e9e19d14c0c0cc84","observation_id":"fc881cec-8333-41b4-b89e-e740b974845d","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:289306eeb755e84891429c9567f8a6048d2db1c4ba51c70d5fb67f93f47a483d","observation_id":"b84942a6-1d88-4bdc-bd49-345545803f89","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Qwen2.5-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:891e758c197ff01ca9d92ba9cb8818c6feef456b0b4a18b15902e9f40ed5d22e","observation_id":"95936b3f-a369-47d9-9bfa-caf7c672acf8","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:adf501696229d01f221c531d0a5247b9ed69a84083a7891341f211dc6091a857","observation_id":"4228559b-a206-4066-8ed7-e518374af6a9","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:f5028d378013236031cff9d25075d4ab7206f9ee59b3c1fd9917e440b8b732a5","observation_id":"be50895e-a126-4cad-b461-592417e6d5d6","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:783ca178ca2e2285962cde8b24b7d1df9e5661db6e9c462c2545c38be9802efa","observation_id":"cd621eac-c30c-4d50-9625-bd7ec5475a53","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:5668b9db2bc943f9cd00dd0dc567707af6ef7856af816f5fce16c9fb5ab1d25d","observation_id":"657707dd-ad74-4f1c-8f47-f612d05f8ca1","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:3f69aa358a180290763bb9869dab61b6554f004dff7eea7ee83df7fec3e92c3d","observation_id":"016f0631-24b2-4e2f-b739-2550c3faa646","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:3b76bdc3aba5fa2217ee33dcdde296bc2bd8467db90fcee273d0bebe2d90ea88","observation_id":"738a5063-4efc-43b1-b186-08c188afc0df","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:33798a82719c3e904769828d7a5e842cf998aa5e2bbb1f08011765c51ca34449","observation_id":"8a00c42f-93ed-45b6-b4d7-d44b3414654d","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:a8c07ac4c5e8f42f4d7ea3cb0b9173f4e31fc38d3ca5aeb6e7bd08b064020168","observation_id":"9d853f87-8e48-45c0-8b45-32ab1b217429","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:7da80902c4dba42d97964aa5712ddc399312b50c2907d275e42536420f2bde35","observation_id":"e6c15aee-048a-4732-9285-1d60034f3533","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"2022 , publisher=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:933462c829363564c36920a6eb2cb54a711c1a54364caab9ec2d0f73032cc77d","observation_id":"24d989d7-942b-49b6-92db-389cc43b5e57","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-08-15T17:25:43.175408Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2210.03350 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:c869d878e47c95a2653e2250fde1c61250b7bfe94dc3cdf44cc6a31cc8a3b87b","observation_id":"08536e4e-425d-4d7a-b1b7-7dbcb0784b68","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2212.10511 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:25b98f15b2b6c304acbf83c421106821a3cc51182e3db881003fa091952e81dd","observation_id":"a4603ac8-d8d4-42c3-a630-992b2619fb6e","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-08-14T05:50:17.249446Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2011.01060 , year=","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:073ee478d45133d52f0c27c26644c82ce048c00deb84fb60c84a8f2729122992","observation_id":"ede3a1b8-1754-4d9b-aea1-d9301445b575","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:ccb647c40439b105c6d2163b818786441e4b089506bc1716eac2d336cc3b3744","observation_id":"5d5f57ff-b147-4ba9-a093-d6f2e22f6878","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:1e17d084c88a0707bda463f7a0350eb64527cbc651e513fea37245aba2d531f6","observation_id":"f2500176-f6f2-4021-ad3c-4b837c51ddf4","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2212.03533 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:4686f4db46beaef3c556099c4638e20eed8e0fff2fcf651bdc33e30d4b7dcfc3","observation_id":"adb9a0e8-37d0-435d-adb1-9727a6ce19ae","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"Towards Efficient Online Tuning of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:a2a097b0c98835e537f40b50738f08d6576ccad92864786fa83f92e6867691a2","observation_id":"dc178778-6115-419e-bc51-0a4c66471888","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:614a9569d7d3b84074474e555a48264481088aebc18dba0f68c3176103a68ba4","observation_id":"32017a5b-3aed-4b52-83b2-f9939883db03","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:53a1331ce13efb9e306cd5c7e219f3f9d5237214ef5ddae26f1814ddae34d20a","observation_id":"b0e79b2e-d358-4394-ac5b-34614017d85e","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-12T18:24:04.714959Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:e3de080a699890edbe359ee3ff22e6cbc552df6334ccb53c24e6abc892309f4d","observation_id":"1b4ac855-29fe-4c3f-bd0b-6a6e657fdfe0","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-19T03:54:53.855141Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2507.22844 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:66217cab31eeced8404d428ea12764fbc4fa38383bbe9bff1e3eafc0ab663d6f","observation_id":"f39e0090-b9af-40e9-bb51-fdc755be7ea1","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2509.22576 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:577bdbb1a54c36a6aa267ff0c03d472490e80755c271fa6ab3771014735da7f3","observation_id":"14758683-266e-4648-9a30-c9efbd253752","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-17T17:47:20.877990Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2505.15134 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:be307f94c5deb96507d649317091c3d89fb0361cbe2366ef3d4a10cded64c025","observation_id":"b155a972-255b-4d7d-9ff8-8174c9ea0e72","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-07-11T10:50:54.419477Z","title":"arXiv preprint arXiv:2505.22617 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-07-11T10:50:54.419477Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2607.04963"},"observation_digest":"sha256:12528745709a49e377107f10b65b9afc75be265a8799b4ef2f8b8ffb145f6a45","observation_id":"f12623df-14a8-4c8c-baf3-cfd014d9d665","resolution":{"observed_at":"2026-07-11T10:50:54.419477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04963","last_updated":"2026-07-06T11:50:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T03:54:12.305106Z","submitted_at":"2026-07-06T11:50:06Z","title":"STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":99,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":110},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 110 outbound references and 0 inbound Pith citation observations for arXiv:2607.04963."}