{"as_of":"2026-08-04T11:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eda54e08e2319d1247fa4ce07f93b58567d019d17dde466fd0d854c79e9f73d5","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T21:44:39.699017Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27973/citation-record","integrity":"/paper/2607.27973/integrity","json":"/paper/2607.27973/citation-record.json","paper":"/paper/2607.27973"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-31T21:44:39.585532Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.585532Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:ace1159b4fd6d49d3469cdb749d5d234fb39451c70c0093ebaffe694ae896ddf","observation_id":"4b4aa3bc-6628-42d1-a393-165418b0f174","resolution":{"observed_at":"2026-07-31T21:44:39.585532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-31T21:44:39.588812Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.588812Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:49339193b0ba4e9b75f2b6cf1805015a28843ad8c899290c6e297d169b760b1d","observation_id":"5831a163-a6c7-44db-8028-17f4af99b395","resolution":{"observed_at":"2026-07-31T21:44:39.588812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-31T21:44:39.592129Z","title":"Qwen2.5 technical report.ArXiv, abs/2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.592129Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:0ae2b7ae3c7220b3d6a312159ff2fb93dc7f631fe8320ea9fe490de4a6f99929","observation_id":"b8e22867-69a9-4e42-88da-edfa1627f947","resolution":{"observed_at":"2026-07-31T21:44:39.592129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-31T21:44:39.595092Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.595092Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:2b0c944b57bfd79f5f96394bf61e383bd3b12ea901b783db7634c8be93d1f500","observation_id":"a9fa85a6-9ae5-46c7-a736-b8f3626439dc","resolution":{"observed_at":"2026-07-31T21:44:39.595092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11854","last_updated":"2024-02-25T16:21:00Z","snapshot_observed_at":"2026-07-06T15:29:50.743434Z","submitted_at":"2023-05-19T17:44:34Z","title":"Multimodal Web Navigation with Instruction-Finetuned Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11854","snapshot_observed_at":"2026-07-31T21:44:39.598107Z","title":"Multimodal web navigation with instruction-finetuned foundation models.arXiv preprint arXiv:2305.11854, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.598107Z"},"links":{"cited_paper":"/paper/2305.11854","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:dc8c9232e7be66bf34b9368da48645fabebabfc07f7e3613a83fd847ee38e8cc","observation_id":"1f02e486-dab4-461f-8114-afd539c2ae60","resolution":{"observed_at":"2026-07-31T21:44:39.598107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-07-31T21:44:39.601537Z","title":"Gpt-4v (ision) is a generalist web agent, if grounded.arXiv preprint arXiv:2401.01614, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.601537Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:724e21d081f3f47a538907c7e4004339e34e011f42b3e8442cca09bd7e771945","observation_id":"634df6b6-7e15-4fa5-8211-c2c498cd8216","resolution":{"observed_at":"2026-07-31T21:44:39.601537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.604589Z","title":"Embodied agent interface: Benchmarking llms for embodied decision making.Advances in Neural Information Processing Systems, 37:100428–100534, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.604589Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:6ffa1c619b6ce7f0f257dc6c6951fd6764c6661509d09865e585794c22b0791b","observation_id":"903a6313-e57f-489c-88f1-55f281659901","resolution":{"observed_at":"2026-07-31T21:44:39.604589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.606756Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.606756Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:e39a0151a7d3aa5a9931a3118f8b864f21758329e0bc7e01038a551a9b7d2e12","observation_id":"6556022e-ee80-4c45-81db-d214d24cd033","resolution":{"observed_at":"2026-07-31T21:44:39.606756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.609034Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.609034Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:30a1c6d6c81fe052a924e1f552135b1ea491ae96ec007ae80008f00b4df1471c","observation_id":"385bcef2-03b7-4696-b0e5-0e3a6d3d3b84","resolution":{"observed_at":"2026-07-31T21:44:39.609034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-31T21:44:39.611311Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.611311Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:4bd5c6c73747474e9aa73eb7eaf087dda128e10e0b6fd2fa8b247d7f20614ef9","observation_id":"71c2bca8-b13a-487f-9e18-37234ffc5b1b","resolution":{"observed_at":"2026-07-31T21:44:39.611311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T21:44:39.614561Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.614561Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:dc9856d1461dcfc4dbf878dda165923a6139d14ca049c934c9995bf529b4a4bc","observation_id":"411df13f-8af4-443c-8036-881b431581ac","resolution":{"observed_at":"2026-07-31T21:44:39.614561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-07-31T21:44:39.617527Z","title":"Lam, Yiping Lu, Kyunghyun Cho, Jiajun Wu, Fei-Fei Li, Lijuan Wang, Yejin Choi, and Manling Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.617527Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:967393ec0d8965e6bde0169be9eeb638bc37e3432cc33cc10e225c119f3162e7","observation_id":"888a4484-cdc8-4d06-85cc-3db0d89068bb","resolution":{"observed_at":"2026-07-31T21:44:39.617527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-07-31T21:44:39.620076Z","title":"Group-in-group policy optimization for llm agent training.arXiv preprint arXiv:2505.10978, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.620076Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:9dd8d0ee7ae67d086bcea63fc4b1f5d5371971ba04748aebc853ad16f76b5c03","observation_id":"c8735516-36a0-43e9-89f9-5203bb40c61a","resolution":{"observed_at":"2026-07-31T21:44:39.620076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.622957Z","title":"General agents need world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.622957Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:33319d3a02eeb6f76fd53bf9cdc6b382be14ae21ba233eb4c1318ccdbb1abfaa","observation_id":"1c8ae0c1-cf39-4b32-98a2-c000c4af9b68","resolution":{"observed_at":"2026-07-31T21:44:39.622957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05397","last_updated":"2016-11-16T18:21:29Z","snapshot_observed_at":"2026-07-30T18:54:41.998123Z","submitted_at":"2016-11-16T18:21:29Z","title":"Reinforcement Learning with Unsupervised Auxiliary Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05397","snapshot_observed_at":"2026-07-31T21:44:39.625477Z","title":"Reinforcement learning with unsupervised auxiliary tasks.arXiv preprint arXiv:1611.05397, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.625477Z"},"links":{"cited_paper":"/paper/1611.05397","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:3b661faada64a6a205ec070bee605348ff19a7dbcd8ba5fb765c0adcf68e45e6","observation_id":"c7e4a8bd-41a0-4f7a-87c1-794798b2141c","resolution":{"observed_at":"2026-07-31T21:44:39.625477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.628079Z","title":"Deep- mdp: Learning continuous latent space models for representation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.628079Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:75c6c1ddc5ce1ccd7756dd859787372fd932205dbadb87c0859814a520066db1","observation_id":"e6db1d2c-16ab-4d3a-9085-5c7787abe26a","resolution":{"observed_at":"2026-07-31T21:44:39.628079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.630204Z","title":"Vlms- guided representation distillation for efficient vision-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.630204Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:0a928d0cebe1acd675ac03933d31266814a90225a7a9d2fde1d105c21de0b943","observation_id":"4d86f2f0-9407-47eb-9b2e-6975c1723600","resolution":{"observed_at":"2026-07-31T21:44:39.630204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05929","last_updated":"2021-05-20T09:15:57Z","snapshot_observed_at":"2026-07-06T09:37:29.573073Z","submitted_at":"2020-07-12T07:38:15Z","title":"Data-Efficient Reinforcement Learning with Self-Predictive Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05929","snapshot_observed_at":"2026-07-31T21:44:39.632400Z","title":"Data-efficient reinforcement learning with self-predictive representations.arXiv preprint arXiv:2007.05929, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.632400Z"},"links":{"cited_paper":"/paper/2007.05929","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:adaec2a1a5e0cb40de47f09a52f427509e98b19ab4c9d2bf9845367f0d6d3ce7","observation_id":"5328c020-c40e-4471-a32f-1bef29fd3f08","resolution":{"observed_at":"2026-07-31T21:44:39.632400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-31T21:44:39.634912Z","title":"Agent learning via early experience.ArXiv, abs/2510.08558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.634912Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:8cf1430b5e0b96fa60df7137d8fdc0f041aaf303e902b6b8e916e6dd6628cd16","observation_id":"5d95d0b2-43f3-403f-98bf-6a6ec15cb62e","resolution":{"observed_at":"2026-07-31T21:44:39.634912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.637487Z","title":"Reinforcement world model learning for llm-based agents.arXiv preprint arXiv:2602.05842, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.637487Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:9c040f5947e68e467b666ee7244f02b89ac871c1c6e8d29fe22090f396bca48c","observation_id":"fb474bf4-dcbe-46be-bb53-1dfdf73bab9c","resolution":{"observed_at":"2026-07-31T21:44:39.637487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.639844Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents.Advances in Neural Information Processing Systems, 35:20744–20757, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.639844Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:9361147fcf100248d8a9c6495bdcd2c8340b3a71ec226ad48e1f5bf464d6ccf4","observation_id":"bdac9022-35f5-449c-8d0b-a75e148c70f1","resolution":{"observed_at":"2026-07-31T21:44:39.639844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-07-31T21:44:39.642114Z","title":"Alfworld: Aligning text and embodied environments for interactive learning.arXiv preprint arXiv:2010.03768, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.642114Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:96233995a7d2eb8d06024ec8e25479ba83bc28c5862e187c458ca8f4e3a854f7","observation_id":"4c015d4a-6083-4f83-9e76-5284edfb809e","resolution":{"observed_at":"2026-07-31T21:44:39.642114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07339","last_updated":"2024-08-09T06:16:55Z","snapshot_observed_at":"2026-07-06T17:15:22.551637Z","submitted_at":"2024-01-14T18:12:03Z","title":"CodeAgent: Enhancing Code Generation with Tool-Integrated Agent Systems for Real-World Repo-level Coding Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07339","snapshot_observed_at":"2026-07-31T21:44:39.644614Z","title":"Codeagent: Enhancing code generation with tool-integrated agent systems for real-world repo-level coding challenges.arXiv preprint arXiv:2401.07339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.644614Z"},"links":{"cited_paper":"/paper/2401.07339","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:99ceae4f580e02f54526693a2c9345b3d53bf8316fb292688a3329625dd7c859","observation_id":"aac405ef-6282-48e6-be71-c8d28ba29d35","resolution":{"observed_at":"2026-07-31T21:44:39.644614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-07-31T21:44:39.647018Z","title":"τ-bench: A benchmark for tool-agent-user interaction in real-world domains.arXiv preprint arXiv:2406.12045, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.647018Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:c1a6d4dd33bf32647b050e77803e34ba56eaad4cb0e54b66dc948087a862ac53","observation_id":"65cc9ddf-b3c2-4104-9aed-8f694fcc11c9","resolution":{"observed_at":"2026-07-31T21:44:39.647018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-07-31T21:44:39.649499Z","title":"V oyager: An open-ended embodied agent with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.649499Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:c9f313f73ec3cd505ec9768d9539aa596bf5a396d1ca5719c1839b37b3277078","observation_id":"2d413b60-1d57-46da-87c7-279b4f935e39","resolution":{"observed_at":"2026-07-31T21:44:39.649499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22648","last_updated":"2025-08-10T06:05:46Z","snapshot_observed_at":"2026-08-03T10:37:02.820839Z","submitted_at":"2025-05-28T17:57:07Z","title":"WebDancer: Towards Autonomous Information Seeking Agency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22648","snapshot_observed_at":"2026-07-31T21:44:39.651881Z","title":"Webdancer: Towards autonomous information seeking agency.arXiv preprint arXiv:2505.22648, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.651881Z"},"links":{"cited_paper":"/paper/2505.22648","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:5eabe1431226eb734671f37d0c9965f284fb952075be7bf48c8244e5c958a7ff","observation_id":"6c0496fa-01bb-4c21-8b8d-35eb7d750d84","resolution":{"observed_at":"2026-07-31T21:44:39.651881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02592","last_updated":"2025-07-03T12:59:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-03T12:59:07Z","title":"WebSailor: Navigating Super-human Reasoning for Web Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02592","snapshot_observed_at":"2026-07-31T21:44:39.654314Z","title":"Websailor: Navigating super-human reasoning for web agent.arXiv preprint arXiv:2507.02592, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.654314Z"},"links":{"cited_paper":"/paper/2507.02592","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:9f5ca64c2d35e83fa9126d3742fad380d1bd2dcd36433b785fd757d0f07ee297","observation_id":"d3d1f9e4-8cea-4cb8-a25d-12a5c6f16966","resolution":{"observed_at":"2026-07-31T21:44:39.654314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.656683Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.656683Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:668ed1fe2eff932e0647e9d6fd2ea11b96a710763677406e37d30e1cb5a97651","observation_id":"32e21fec-cc70-4b66-83e2-2944416c30cd","resolution":{"observed_at":"2026-07-31T21:44:39.656683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.658791Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.658791Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:06cea3820f5c2a270bfaacc531c3ef4ad4e72d5289827bdb91b667c3d568a34d","observation_id":"e1bbfc75-3b80-4683-8353-be3af30bad12","resolution":{"observed_at":"2026-07-31T21:44:39.658791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.661240Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36:8634–8652, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.661240Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:2415632eb10f02bdce38b28c413444277355b9eebe31a7248f56b3fcc3ac66c2","observation_id":"774269c8-0ef8-4ddf-8c5e-e370ef54b1d2","resolution":{"observed_at":"2026-07-31T21:44:39.661240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-07-31T21:44:39.663478Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.663478Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:5f70d71f447eb5855d787cd6394a8ec90ff95f6e7f1d42e14ffd70d6981c3474","observation_id":"05423b04-eb26-4c2c-a480-7126191203d3","resolution":{"observed_at":"2026-07-31T21:44:39.663478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-31T21:44:39.666212Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.666212Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:f693b056c1ec269da11b0f0e9b35acc09ff5776b4bbbce89faa2534f785295d9","observation_id":"189ff840-67d9-4843-8c0e-de4eae2f4613","resolution":{"observed_at":"2026-07-31T21:44:39.666212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-31T21:44:39.668576Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.668576Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:481c4a7573c1986e26555097e8d16624a306aa8715cf93a3b9cf90203a0db1de","observation_id":"b915ecb9-cb16-42a9-beb5-851cc140193c","resolution":{"observed_at":"2026-07-31T21:44:39.668576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-31T21:44:39.670928Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.670928Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:ce6bc1d767ca152eaa19aa4bc782d937f7224bb7e4177fdf08314c856cc9696b","observation_id":"858ec9ad-6c65-497f-9cb6-c0e3ea8e723b","resolution":{"observed_at":"2026-07-31T21:44:39.670928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-31T21:44:39.673802Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.673802Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:3d811ba38a6c95068f0b7d01cdf76cf36bc87f86e4ade8adee3648fbf20c20f8","observation_id":"f06992f8-47c7-4e56-8a08-c7341f06a8c4","resolution":{"observed_at":"2026-07-31T21:44:39.673802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-07-06T22:03:15.296567Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-07-31T21:44:39.676348Z","title":"Agentic reinforced policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.676348Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:658f2605e8c075987e5eb5732c6b735c771b43909ee7a86e9687f446d55780ba","observation_id":"0ca8784e-c1de-493f-8d81-83c2274d1d71","resolution":{"observed_at":"2026-07-31T21:44:39.676348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-03T15:20:23.515607Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-07-31T21:44:39.678831Z","title":"Dream to control: Learning behaviors by latent imagination.arXiv preprint arXiv:1912.01603, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.678831Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:22bfd6f4a950f85e8e48c3af03f2bf24d927b4f7dd812a9438555b14f9726d7c","observation_id":"d929e877-9682-493b-9c17-ef7bfa0dd1f8","resolution":{"observed_at":"2026-07-31T21:44:39.678831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-07-31T21:44:39.681305Z","title":"Mastering atari with discrete world models.arXiv preprint arXiv:2010.02193, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.681305Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:3e6c31f206b5ef65551838f794a9e26fd979d4c3ad8175eab89d00b2a5b1d256","observation_id":"93875012-557a-42a8-90df-798d46b23199","resolution":{"observed_at":"2026-07-31T21:44:39.681305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-07-31T21:44:39.683897Z","title":"Mastering diverse domains through world models.arXiv preprint arXiv:2301.04104, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.683897Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:ba023e6a4f459369481b8cb87d907d271c43d1e26b56c1cab057b97dc2d7e33c","observation_id":"6c8da77b-8f99-4c4b-8fb3-d0898bc32cc7","resolution":{"observed_at":"2026-07-31T21:44:39.683897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T21:44:39.686699Z","title":"Reason- ing with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.686699Z"},"links":{"citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:d8ece91884a670750a7138d419ed02ee7bf02192cced9a50f1ce3adbdc74fecf","observation_id":"9d205fcf-7e3c-482f-8f60-5dbe3578bfcc","resolution":{"observed_at":"2026-07-31T21:44:39.686699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13232","last_updated":"2025-03-29T08:59:09Z","snapshot_observed_at":"2026-07-06T19:35:04.087584Z","submitted_at":"2024-10-17T05:37:00Z","title":"Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13232","snapshot_observed_at":"2026-07-31T21:44:39.688810Z","title":"Web agents with world models: Learning and leveraging environment dynamics in web navigation.arXiv preprint arXiv:2410.13232, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.688810Z"},"links":{"cited_paper":"/paper/2410.13232","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:17ca8f64199fe3ffc382efc5c6ec54a722bc2fe92f456ab453065ef60d537965","observation_id":"5aa4ef01-dc0d-47cc-a9e7-253c083f8ffb","resolution":{"observed_at":"2026-07-31T21:44:39.688810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06559","last_updated":"2025-04-01T05:04:47Z","snapshot_observed_at":"2026-07-06T19:48:10.800324Z","submitted_at":"2024-11-10T18:50:51Z","title":"Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06559","snapshot_observed_at":"2026-07-31T21:44:39.691367Z","title":"Is your llm secretly a world model of the internet? model-based planning for web agents.arXiv preprint arXiv:2411.06559, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.691367Z"},"links":{"cited_paper":"/paper/2411.06559","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:7c8a82d17cbe3b0c07b088da8e8af6fdbe80d7a20ecb98d05ddaee09986454a2","observation_id":"f202d84d-b982-4228-9ab8-288546579a13","resolution":{"observed_at":"2026-07-31T21:44:39.691367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21024","last_updated":"2025-08-21T05:55:43Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-23T02:54:31Z","title":"WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21024","snapshot_observed_at":"2026-07-31T21:44:39.693932Z","title":"Webevolver: Enhancing web agent self-improvement with coevolving world model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.693932Z"},"links":{"cited_paper":"/paper/2504.21024","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:963a937599bb565adf31f27d5bf7dd10e248efa1e52e998760e6a60cb56ea8c9","observation_id":"53c918da-4385-4142-8181-dcf78676b305","resolution":{"observed_at":"2026-07-31T21:44:39.693932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-07-06T22:05:17.795002Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22844","snapshot_observed_at":"2026-07-31T21:44:39.696164Z","title":"Rlvmr: Reinforce- ment learning with verifiable meta-reasoning rewards for robust long-horizon agents.arXiv preprint arXiv:2507.22844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.696164Z"},"links":{"cited_paper":"/paper/2507.22844","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:cd9aa8b7366bea7f8f670a703fe746766e8ccae16118df9a6694e784b284a85d","observation_id":"6198f19b-ce98-49eb-b616-8555e4fa7ad7","resolution":{"observed_at":"2026-07-31T21:44:39.696164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-31T21:44:39.699017Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.699017Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:21e34601ffe4c2cd92f3e924927cdde69557eb92cd91284ca9b6f8bd3ea73f84","observation_id":"ff20e295-7b85-4f67-b39b-369ce0b7a07f","resolution":{"observed_at":"2026-07-31T21:44:39.699017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T09:37:33.292562Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.27973."}