{"as_of":"2026-08-19T14:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:90ecff7422bb83c8b537f6e17619b10ae3289d8e4596850d3f433b3571e4bb35","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:40:35.531232Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:01:22.822171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02388","snapshot_observed_at":"2026-08-01T08:01:22.822171Z","title":"Policy and world modeling co-training for language agents.arXiv preprint arXiv:2606.02388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21273","last_updated":"2026-08-04T10:37:25Z","snapshot_observed_at":"2026-08-07T23:11:42.684740Z","submitted_at":"2026-07-23T12:50:18Z","title":"The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T08:01:22.822171Z"},"links":{"cited_paper":"/paper/2606.02388","citing_paper":"/paper/2607.21273"},"observation_digest":"sha256:0249feb2a9cc5dcd8a34f5ed8b6e702576cdb2a5ffdf02db5d2ec7071ab0875f","observation_id":"0dea1744-5a2a-4637-b593-55ac58a1ff86","resolution":{"observed_at":"2026-08-01T08:01:22.822171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.02388/citation-record","integrity":"/paper/2606.02388/integrity","json":"/paper/2606.02388/citation-record.json","paper":"/paper/2606.02388"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:b2ce504abbf042cf2f9754fcda87687ce716699bdd29088fe2e4691e8f9e96ca","observation_id":"4c003cf6-adb8-4b38-ba26-3a8224824ca0","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:d8135fe3c846534ad4a5922a584b1d18fea0602c062125dd5b478fbc8b32f642","observation_id":"4f5c93b8-4ad8-4503-b6c6-beaa50166fbc","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:38d9ecf29188057cecd97630f6320a58638305ab943506e9ca80e10b0fbf7492","observation_id":"c89cccce-5462-4ddb-8e85-4d4804ab293e","resolution":{"observed_at":"2026-07-01T22:16:15.586269Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Cognitive science , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:572b1721f4fc8671030cfcf6b9fa8db52fe148f2c069f2058c3e478090d416d5","observation_id":"89940cc9-f397-4a9d-81ea-7c2c52462fef","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"2012 , publisher=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:53638ad1141ab33469c6f66344a54b2522e04aa2c45a636508660ab621cf694e","observation_id":"d441ce0e-af88-43fb-aaf0-aaf6412da3f7","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"2, 2022-06-27 , author=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:e04c8a72aba5c4badad276f6724891cf9cd7ee993a78aaf42d04f05e56544353","observation_id":"dd6b5893-9a51-4806-b638-c88b55fc2c49","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Conference on Empirical Methods in Natural Language Processing , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:bc99da18676ddcca6e698dfb2ac3d7c35e71bd0740f111e96927365b15db913d","observation_id":"0425e934-e6d5-44e7-b977-c6af884f3944","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Transactions on Machine Learning Research , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:8d868cd51d6156f81b518d7f1be7bb1db03dfb7bf15dd1dab05079cf3bb15c27","observation_id":"4855de63-bc66-4712-903e-23a49bd051fe","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18832","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:06.168340Z","title":"hallucinations","venue":null,"work_id":"32cca2ca-9dd4-4221-ac95-330f5d5d9fe1","year":2025},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:65af858f5ac3260b575ca9241f65b477713108a4631b9bf79046340274d05928","observation_id":"d27cf3ab-50c9-4aa6-bb55-8ff311132110","resolution":{"observed_at":"2026-07-01T22:06:17.193574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"W eb E volver: Enhancing Web Agent Self-Improvement with Co-evolving World Model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:6e76232931d0d55aa6dcb694d965a1b1bc6e12ab5a81cc37dced580c1245e707","observation_id":"87351c43-2e0c-41b7-ae60-bf5c5f7e523d","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:cf6e5602f5e9e9f6eb75be797c93359873630a7e3858174e259bc6f00b96df36","observation_id":"c650f2a6-b961-4706-874f-94e875aa6aa6","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T23:16:24.876887Z","title":"arXiv preprint arXiv:2601.08955 , year =","venue":null,"work_id":"2daa1b74-174d-47f5-951a-5294ddb98322","year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:fdb35192b801831b607fbb3b0bd97a63cd196bf0eb3e9e7bd774325a0f61e80f","observation_id":"a7ddbd63-8ec1-46e7-882f-922a08f20b46","resolution":{"observed_at":"2026-07-01T22:06:17.196067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:110266f6021633e131aa8a6d6e4ce0f61dfa936a59a8c940aae817c967d13112","observation_id":"474e12d5-de9a-47fb-bd4e-d4f7c5c05a09","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:fbb2f00b2228cc97cd20a75871d9c90e051eb8a5080fc6c58c7fc481775dc877","observation_id":"d71d9c1e-022a-422a-acf7-d4186bda41f8","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Group-in-group policy optimization for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:2e84fdea2b34caa8108dfa700f1a7d8bcdead175c9abd3f4f5a59c7100793783","observation_id":"a691ca32-ab8c-4359-ae73-98a1b69cc2d8","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11432","last_updated":"2025-03-02T04:04:03Z","snapshot_observed_at":"2026-08-17T02:16:24.215789Z","submitted_at":"2023-08-22T13:30:37Z","title":"A Survey on Large Language Model based Autonomous Agents","version":7},"cited_work":{"arxiv_id":"2308.11432","doi":"10.48550/arxiv.2308.11432","metadata_source":"pith","pith_arxiv_id":"2308.11432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Large Language Model based Autonomous Agents","venue":"cs.AI","work_id":"47f7e8a3-3732-4530-b412-d9c984ce99ed","year":2023},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2308.11432","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:608e271a1359309c7f6a1c31686ae53faa8d49240975c2e928834e98968f253c","observation_id":"d8751f45-a5eb-46ab-951b-3112952d3fad","resolution":{"observed_at":"2026-07-01T22:06:17.195380Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:dfaa42038ee872e90538d26ef6bbffafd88e7045303d90daca32e7db15157419","observation_id":"728bcd6e-4b91-4b9e-9143-d34c94006e89","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:2075f3b9674d6697e73638de67af0bcf8eec346885475b3c6160466d8a8d6834","observation_id":"8b291edb-830e-4198-83d3-12535fe8d6e6","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:cbabc6ec24ea2f96a66be07046819eca54a7f0074e2049c3c74d15d1bfcbffb9","observation_id":"dc5baac2-bf39-49ad-9644-be504850ebcf","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Transactions on Machine Learning Research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:841879e50cb16ae87e5df6ae95a6f6b2a14303fbadd9cd61fd7adf407f7e0403","observation_id":"033f2b31-7ea4-4be3-a974-3720845addff","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"and Yang, John and Wettig, Alexander and Yao, Shunyu and Pei, Kexin and Press, Ofir and Narasimhan, Karthik , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:28115e7f019a41a51e7708daeee461ea85633d0ebe043565e3305a84f020df9e","observation_id":"9e51ab5c-f81e-4d96-94df-432f927311ad","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:dec32f1bbd6778be6b3acd87cd1bd431f3e22c1abea404a608408d378260d39f","observation_id":"70fc4987-e09f-49b1-8f72-0946c5109e8c","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:5d8891466473b9341dfbcae71b807ca63634cbf0cdc544de206aa77efad1cf93","observation_id":"d1660de3-a0f1-43eb-9540-d9dfc63469e8","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:0196efbfd4f5abfbba12fd071efd7956ac0afa41781e81a48fd6266d35784afd","observation_id":"965e79f8-df4d-4980-b290-97641c43af6d","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Xu and Hao Zhu and Xuhui Zhou and Robert Lo and Abishek Sridhar and Xianyi Cheng and Tianyue Ou and Yonatan Bisk and Daniel Fried and Uri Alon and Graham Neubig , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:8efe4670508866e71c92ad721646f519b5a7159a058ded8c87705ed3d80ca39f","observation_id":"0fe09c9b-91cc-40f8-b792-067547d83c43","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:c9b7fc442c369c4120c870b477bd56a5d6efcc936b8c8c396f2619c20d40f01e","observation_id":"896afd57-317a-455c-b714-78cd23ffa84c","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:eb2c3dbb0f51db2d01ec0c5bcd283c4f39d01612bec2df0e1ce161bc8a9a4b7b","observation_id":"3532b426-ba72-4799-9e69-f742c2ab954e","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"A gent T uning: Enabling Generalized Agent Abilities for LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:0c03ebbeb294c4437a95ee359813b670a1fd0d7e0207d0cff59114914cca1c76","observation_id":"9d10e3b4-a2a7-429a-a3a2-59ebf09a3977","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:e46e84fc89476335f43f00e0e840fcb784593ce299e0fde3daf51ea8a8fe4159","observation_id":"ec32a406-f240-4e74-acd8-f78b8d66e362","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Annual Meeting of the Association for Computational Linguistics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:7f22a213205568c6770ac2135eccd9a48e60ea290874ac42f6250c2861323bae","observation_id":"2872c5c7-4f5a-4edb-9fb9-5aa4de03a251","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"ACM SIGART Bulletin , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:7ff8420e42275ac5257ee9770997314a2aa02fd7014509bd72139fcae06575de","observation_id":"acd0e178-306e-4dd5-b02a-bb5a1752c637","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-18T07:04:58.690133Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:3103c20ef408c7e190a0e49e659d75f55b0445b181dd494c1f2417ab373f66d0","observation_id":"94fa64c9-6511-4dc5-b102-bd5def26d61b","resolution":{"observed_at":"2026-07-01T22:06:17.181088Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:1f5a4a106d6f2cba8783ceb752a67796e18f04b3c342299d06b0eb0092b1aaf7","observation_id":"8d9d382a-dce9-4233-bc6a-b7e2867dd1df","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:13683b2f9b62f5ffadf75d729223199579b0d374e1dfa25f542c51be9465c491","observation_id":"975f5b88-659b-44f6-bd8d-e4a8ceea2f60","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Conference on Empirical Methods in Natural Language Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:527ffb06e9bf9844db06d59d37b954e080ebc4b7021f90fede1cf8ae9d9967f3","observation_id":"16fb4234-b4d2-41e8-b1f7-82ba0fc4ed0a","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:13554721758783ce8a6d5ac92f40d04ce178cb203aed17113ee590a0615635f8","observation_id":"b73e95c3-15a1-44e0-bdaa-cf130e55ce43","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.02918","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:06.165452Z","title":"arXiv preprint arXiv:2506.02918 , year=","venue":null,"work_id":"a4c2fbbc-bf4b-4367-9306-9f95cd884197","year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:d24424ccfaf4261f472edb78f4cf9e3f073648f7ebbd386d00c48feca4e1dcbd","observation_id":"4d859721-0fe3-4752-988f-f9e0e10b16ac","resolution":{"observed_at":"2026-07-01T22:06:17.178005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Reinforcement World Model Learning for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:5d43afd37afbe6272ab6f49216edc356a27b6614f081f7b50a66c9bbeacf4379","observation_id":"d659ea87-4c34-434d-a461-bc401b3d2f68","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:4afcd80f8e68ccb516b14e409f8f0797c4c530e34fa7a64394867d102e21a23b","observation_id":"37ae8883-1b61-4a10-98a6-e66583219a62","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:d23a507540c58fd8faf07c9d3698a25c3b78457941adb932d29e14b6a2bd49de","observation_id":"a5f4e345-84fc-4344-bae5-782cb41c4fe6","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:117349ff957984f55c0e56d09677e5f895872f330015e0de2ff0ce20340cc1e3","observation_id":"2ff247b2-3b70-46ba-81cb-beaaef4fe6b2","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15155","last_updated":"2026-05-14T17:51:26Z","snapshot_observed_at":"2026-08-16T20:35:48.643273Z","submitted_at":"2026-05-14T17:51:26Z","title":"Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2605.15155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15155","snapshot_observed_at":"2026-07-04T13:29:51.609911Z","title":"Self-Distilled Agentic Reinforcement Learning","venue":"cs.LG","work_id":"fe0b31a4-355b-4ff9-8239-86a1316550c5","year":2026},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2605.15155","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:8c83df6691ffb274d3243f7ef020076e001bce31c85fcdfa61129ab3881897b1","observation_id":"361c6456-82b4-45d4-892f-5786f5edf56b","resolution":{"observed_at":"2026-07-01T22:06:17.172028Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"ZeroSearch: Incentivize the Search Capability of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:69bc19e1f8bae213e31a64a14069c128c1d864ad86ae4891841764caca1ff755","observation_id":"3a47e44d-156f-4587-a053-98cca8a5c4d0","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:8993a184ccda67b71fe0d6c9aa8b89be802574ad9ff8c20413bc597fa8258edd","observation_id":"2b94da71-ec1b-4c20-a2f3-7e81eab16ea4","resolution":{"observed_at":"2026-07-01T22:06:17.190939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:a068d263cef02c851377656b110f3f546028871c243d6f00d3d8c88bff23cd8a","observation_id":"2e653546-5ae8-4bbc-bd4f-b2e188c2e758","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:886f41cb3ca4131569c21f449720bb4da3c88e8a079a4277ed079f887e9c74cc","observation_id":"02b82752-face-4b15-8ae1-a006a5f6d124","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:13780f3c051fc3a5f7c872141f1edf98f5d2b35f6a5fec73516dffee0d78e701","observation_id":"420a738f-ac83-4087-bdf1-c03e8ea0e40a","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:de555fb66f6b58222b22f6b37814f2fecc1eff49a6f05ecbefc4c57f4b88fb7a","observation_id":"60bc52f3-3526-4f25-8994-3ae4c21cbf0e","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:1811c3b388e2086eef557984053dda0db11e85ef18ecd41f69b86f3410e7b017","observation_id":"9f9d8eb4-1b04-4133-b3b2-ceb772e83a8c","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-08-15T17:25:43.175408Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03350","doi":"10.1007/s11229-022-03791-y","metadata_source":"pith","pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","venue":"cs.CL","work_id":"79aa4add-ff4a-4871-9c74-6f473b0579c1","year":2022},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:82fa0d916da9de0e84e92450cda1c9194ff61f0a20a9a32a37694361fa93ed74","observation_id":"682192ed-7109-4637-b993-d22b4a4e6523","resolution":{"observed_at":"2026-07-01T22:06:17.174310Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":"2212.10511","doi":"10.48550/arxiv.2212.10511","metadata_source":"pith","pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","venue":"cs.CL","work_id":"5021c16e-c088-4765-8c10-3d0dd6e18bb0","year":2022},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:d5729eb4452d44cf2cd0ef3a5260a6159917e13c3542a93b863c96670c9a7061","observation_id":"a368db46-73c8-417b-b96c-a5a1276e8ad6","resolution":{"observed_at":"2026-07-01T22:06:17.162569Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-08-14T05:50:17.249446Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:aa0dd4643d0252eb25aa1b8ed61b99de34fc9a253705aaf616241d88d464537f","observation_id":"76007fe2-3744-45f9-827d-38802c53fbe5","resolution":{"observed_at":"2026-07-01T22:06:17.178935Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:d4c31dac25863cc3d79bdfb8a48809cad36cfea20b9c2dd6af4bb5bffe21ea16","observation_id":"96afb0d7-c851-4695-a542-5b1c8f0aac97","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:448b6f789f2f586ecd545a6bb11d292ed41f2b64f9e29292c81b12751b287bf1","observation_id":"2a6afe87-ec14-4e78-9a3c-b832c7dcca7f","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:440a80c810d74f87d7371b7c83351e8fd48daf4445a9e53d5003c9d461e3b6b6","observation_id":"d9d2fb63-efc0-45fd-bb31-2c80e30e8696","resolution":{"observed_at":"2026-07-01T22:06:17.185933Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:29249f9250372ba7197424d35852f980964ad6a13cdae850ce5c910e78d9ed29","observation_id":"af0e8fd5-3399-43ea-8eef-4b15fa347073","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:73aed2f1876b6ad8208218cf2d189e5b1a86895fb9771d971a6f94795e422cc5","observation_id":"7d06a568-9ca5-41f5-a769-218fcac12400","resolution":{"observed_at":"2026-07-01T22:06:17.190324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":"2212.03533","doi":"10.48550/arxiv.2212.03533","metadata_source":"pith","pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","venue":"cs.CL","work_id":"789cc674-467e-4f23-bb50-05c79fe8c4c2","year":2022},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:fc2cb4836bd2f87e03e297748bc9a54e67304893e7456b82f4ac34ed8c3a7456","observation_id":"6246ff5c-f5a8-4f92-b901-04b53b199b15","resolution":{"observed_at":"2026-07-01T22:06:17.187638Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:23dc8145216d1e3fc744aad3b3320a06ffcc7918e1511c59e86ac510a922e7d5","observation_id":"7e15f381-9a6c-4697-afb0-f813ccd80eba","resolution":{"observed_at":"2026-07-01T22:06:17.197721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:6b08394d9495ba5aac6b3d99ca3dd9f8fa8d593beb50affa3f3d617a3f689d3b","observation_id":"f0626b20-a272-44fc-a737-f0694e830d88","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":"International Conference on Learning Representations Workshop , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:71468b4c4dc34cddf36ed2c101a7b3c07cd87d2f56be2f09eb36e263d13a6ef3","observation_id":"9d3fbba6-5608-421a-bb21-f88860d599be","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:ce6f9f0831abc512e848a68833c58ffb11a64f51ecf86e39166cbee854cb7e07","observation_id":"961efa38-d9e8-4ac1-ab1d-9d326baadd77","resolution":{"observed_at":"2026-07-01T22:06:17.185221Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:3e04a3661a0bb2aeab80d6286e162d2bf736d3a7f442cb957dcbe6107f2b2555","observation_id":"128ea551-0aa4-4bde-bc01-e2e3f75ec0f9","resolution":{"observed_at":"2026-07-01T22:06:17.183596Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:40:35.531232Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:cb46847fe4af472dc2162682710c7ca63047f22be57e98077e8e4ce5913b8fa1","observation_id":"febdc317-90a9-4044-bed1-ae7b44bf4e6b","resolution":{"observed_at":"2026-06-28T15:40:35.531232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T01:42:50.730893Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":47,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2606.02388."}