{"as_of":"2026-08-06T08:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f91bfa14cae124072ed5fbc22bed44d3031d97b0482408c3bcb251e712e883b","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:48:06.310505Z","state":"measured"},{"denominator":124,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":124,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:51:46.531155Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T20:00:07.735443Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2511.21678","last_updated":"2026-05-02T09:08:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-26T18:55:08Z","title":"Agentic Learner with Grow-and-Refine Multimodal Semantic Memory","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T04:27:40.232015Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2511.21678"},"observation_digest":"sha256:3df69453e976e3ce47010ef482a55cf431c0a7ec0523fc40a268e8e2ab4296aa","observation_id":"005f710f-f0b7-4ba8-93d4-6d9b46aacbdb","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-08-02T20:51:46.531155Z","title":"Agent learning via early experience","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22190","last_updated":"2026-05-25T21:32:44Z","snapshot_observed_at":"2026-08-02T20:51:33.578240Z","submitted_at":"2026-02-25T18:34:57Z","title":"GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-02T20:51:46.531155Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2602.22190"},"observation_digest":"sha256:3b77ad3c3c8fb06867be8cbf5b20da58f10fca9f4fd1a16c2faf242431c49b17","observation_id":"cd77b6ba-29ef-4761-a3df-410a882af35c","resolution":{"observed_at":"2026-08-02T20:51:46.531155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2604.02345","last_updated":"2026-02-11T17:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-11T17:02:38Z","title":"UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-16T02:59:27.807789Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2604.02345"},"observation_digest":"sha256:b867b1e79ef8dccf1866bf5460b1351eb916d5054bae5a4168fc3fc94ee3d814","observation_id":"1f2e425a-fe2c-442f-885e-df90f2f18237","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2604.08224","last_updated":"2026-04-09T13:19:41Z","snapshot_observed_at":"2026-08-02T22:56:00.067549Z","submitted_at":"2026-04-09T13:19:41Z","title":"Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering","version":1},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-05-10T17:40:14.733882Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2604.08224"},"observation_digest":"sha256:de7d130d72c74424c4c5ea219a133dcec89071bbf2479b511a3cb056aec849c4","observation_id":"444a7421-5b68-40d7-9059-f279b1d7d0b0","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2604.11544","last_updated":"2026-04-13T14:35:47Z","snapshot_observed_at":"2026-08-01T03:30:45.957360Z","submitted_at":"2026-04-13T14:35:47Z","title":"Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:15:13.188244Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2604.11544"},"observation_digest":"sha256:0b6e76731f6e763d6a2168ea9ea68f69794c27cb069bac37809da0755f5f8638","observation_id":"fe2d8dea-1f92-4ae4-85f9-a56a5df9830a","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:225a5f3d4e5d81d54295afd0cd906323e918831406ae0ed6177982ebf6411e47","observation_id":"3f1b556f-f2c0-43a1-a866-0f3241e284fe","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2604.18131","last_updated":"2026-04-20T11:54:20Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T11:54:20Z","title":"Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T04:36:27.381942Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2604.18131"},"observation_digest":"sha256:09f1d972ab6f95c213df0065d0c7391d7a1f864f9bfd9525143eef47d8df9216","observation_id":"0dd1f92d-876a-4411-bec9-2be34833247e","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2604.20148","last_updated":"2026-04-22T03:25:17Z","snapshot_observed_at":"2026-07-06T23:06:40.154278Z","submitted_at":"2026-04-22T03:25:17Z","title":"Meta-Tool: Efficient Few-Shot Tool Adaptation for Small Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-10T00:50:27.257888Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2604.20148"},"observation_digest":"sha256:fef19fb49f7408c8502190bd4d18d97725d233ca5cd2e86c52148bb6278aa9dc","observation_id":"153fe713-d22d-4d3e-ac86-39b708db7566","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2605.02469","last_updated":"2026-05-04T11:10:32Z","snapshot_observed_at":"2026-07-06T23:15:32.349713Z","submitted_at":"2026-05-04T11:10:32Z","title":"Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T19:34:22.546508Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2605.02469"},"observation_digest":"sha256:6c090e925e69ea7418417a94bcc688b6022e4e6165ce95c754cb572efc2e7e78","observation_id":"3d057f68-acd6-47f9-8821-ce5edd187112","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2605.03308","last_updated":"2026-05-05T02:56:25Z","snapshot_observed_at":"2026-07-29T20:35:21.357849Z","submitted_at":"2026-05-05T02:56:25Z","title":"Revisiting the Travel Planning Capabilities of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T16:52:54.690422Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2605.03308"},"observation_digest":"sha256:dcba51af407bcb3019d9937c3b34afe87e1da563d346b0f69a0d37f86d1f7350","observation_id":"8a99a819-e3fb-4fea-b322-17548c5d8b1e","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2605.05413","last_updated":"2026-05-06T20:13:42Z","snapshot_observed_at":"2026-07-06T23:18:02.987518Z","submitted_at":"2026-05-06T20:13:42Z","title":"From History to State: Constant-Context Skill Learning for LLM Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T16:50:43.547830Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2605.05413"},"observation_digest":"sha256:f428bc3177e05c7531c1c096b0629dbee931b62b9732a035951ec3d7465e0fc8","observation_id":"a2ffa417-7f58-4024-b852-e1740b3d2a91","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2605.06702","last_updated":"2026-05-05T12:16:59Z","snapshot_observed_at":"2026-08-02T07:43:25.285396Z","submitted_at":"2026-05-05T12:16:59Z","title":"CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-11T01:16:30.734428Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2605.06702"},"observation_digest":"sha256:390648e4e71dfe4552cae28a3f9fcaf38a2b1be3a417160a3ec476dfbe6475d6","observation_id":"259159bf-eb49-4132-ae5e-a86900fc5214","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2605.07180","last_updated":"2026-05-08T03:18:40Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T03:18:40Z","title":"Learning Agent Routing From Early Experience","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T01:15:07.381414Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2605.07180"},"observation_digest":"sha256:d269e8791066ef002730a6b9f51c8fdd4aaa41870703df232f5bb421a64496bf","observation_id":"506667a1-1d5b-42e5-b27c-4c823f3c70ae","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2605.13037","last_updated":"2026-05-13T05:46:29Z","snapshot_observed_at":"2026-08-05T09:07:24.966960Z","submitted_at":"2026-05-13T05:46:29Z","title":"MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:53.213389Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2605.13037"},"observation_digest":"sha256:709d33b34239bbdcf1f686736b5a06919b5e6841e3c805d51fdf6384921a8a36","observation_id":"b1e37e50-7213-4dcf-bc7e-a48be15f5573","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2605.15706","last_updated":"2026-05-29T15:25:05Z","snapshot_observed_at":"2026-07-06T23:26:56.013191Z","submitted_at":"2026-05-15T07:54:46Z","title":"Differentiable Mixture-of-Agents Incentivizes Swarm Intelligence of Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-20T19:53:04.689519Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2605.15706"},"observation_digest":"sha256:8c9f24746f26c21cf21bf1b38b1a00e17e3e92435a25396d9fa6f36d2c272d07","observation_id":"5824f0ba-200a-4502-b3a7-fb0853273a85","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2605.17721","last_updated":"2026-05-18T00:50:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-18T00:50:23Z","title":"EXG: Self-Evolving Agents with Experience Graphs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T22:17:10.728289Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2605.17721"},"observation_digest":"sha256:24901013c07bc89cf04d9c0bcb9ddf670ef4f657265092b8bc617be94e5fd19e","observation_id":"75a8d3bf-63a4-43c3-94b3-4b219e00150e","resolution":{"observed_at":"2026-05-26T03:04:06.268577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2605.24517","last_updated":"2026-05-23T11:08:46Z","snapshot_observed_at":"2026-08-01T19:56:38.196339Z","submitted_at":"2026-05-23T11:08:46Z","title":"ECHO: Terminal Agents Learn World Models for Free","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T14:57:03.095107Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2605.24517"},"observation_digest":"sha256:75e73966e4de30b0101c32e3dd4ec93789fe5320cf79f7e9d7229e050d3dbf25","observation_id":"75cae065-4852-417b-95a3-afbc0306ca12","resolution":{"observed_at":"2026-06-30T15:04:46.503768Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.00869","last_updated":"2026-05-30T19:53:19Z","snapshot_observed_at":"2026-08-01T18:48:30.860504Z","submitted_at":"2026-05-30T19:53:19Z","title":"Enhancing LLM Metacognition via Cognitive Pairwise Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T19:01:18.153145Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.00869"},"observation_digest":"sha256:d3b6d28f8a55d49755e4ef0a0f219686e483c36df79417f3a0c7c12fcadd5aa0","observation_id":"6bdf2e05-4eb1-4d78-b2cd-0c719b5ca6bc","resolution":{"observed_at":"2026-06-28T19:02:33.901234Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.02372","last_updated":"2026-06-01T15:21:17Z","snapshot_observed_at":"2026-08-06T05:25:08.076791Z","submitted_at":"2026-06-01T15:21:17Z","title":"COMAP: Co-Evolving World Models and Agent Policies for LLM Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T14:27:50.260308Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.02372"},"observation_digest":"sha256:cbdbbb9cf00c36f1613e23d51cdca7bc5e0fc6a0de5da09d868d9215ecee6140","observation_id":"37c3835c-7587-45f3-b4da-08b33bfee284","resolution":{"observed_at":"2026-07-01T23:16:24.862123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.02388","last_updated":"2026-06-01T15:35:40Z","snapshot_observed_at":"2026-08-01T19:32:54.241045Z","submitted_at":"2026-06-01T15:35:40Z","title":"Policy and World Modeling Co-Training for Language Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T15:40:35.531232Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.02388"},"observation_digest":"sha256:41ba2f89e77906adeb1cfc34ed83d5e5b242d3d8c562f94b075314da96aa6486","observation_id":"2b94da71-ec1b-4c20-a2f3-7e81eab16ea4","resolution":{"observed_at":"2026-07-01T22:06:17.190939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.03951","last_updated":"2026-06-02T17:39:07Z","snapshot_observed_at":"2026-08-03T02:09:58.081901Z","submitted_at":"2026-06-02T17:39:07Z","title":"Demo2Tutorial: From Human Experience to Multimodal Software Tutorials","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T10:33:26.954959Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.03951"},"observation_digest":"sha256:e7a19cb0d6a1ee86d0a61de0088b41f2bda6cf73fd4ee0cee645f806733a1fba","observation_id":"a50be362-d665-487c-97ff-bf9f22e4c9cb","resolution":{"observed_at":"2026-07-02T02:56:28.748387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.08755","last_updated":"2026-06-07T17:55:55Z","snapshot_observed_at":"2026-08-01T04:11:26.349236Z","submitted_at":"2026-06-07T17:55:55Z","title":"Co-Evolving Skill Generation and Policy Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T18:37:00.015083Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.08755"},"observation_digest":"sha256:f155d7bb64a9cea9a890a940645b3722512807e3b95e1730a13e4272cc8d5bcb","observation_id":"3a71f265-0b05-4144-be95-d1611ff72898","resolution":{"observed_at":"2026-07-02T22:57:25.878799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.24428","last_updated":"2026-06-23T11:05:05Z","snapshot_observed_at":"2026-08-05T04:36:12.703717Z","submitted_at":"2026-06-23T11:05:05Z","title":"Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-25T23:49:38.932474Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.24428"},"observation_digest":"sha256:9d2b67e103cef46e25a29039a9d389c83118ae9b925216baa530b2f87595f63f","observation_id":"9768ab59-e63f-4f93-960e-6e66d8a2b11a","resolution":{"observed_at":"2026-07-04T17:19:59.997876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.24597","last_updated":"2026-06-23T13:53:55Z","snapshot_observed_at":"2026-07-06T23:59:08.580746Z","submitted_at":"2026-06-23T13:53:55Z","title":"Qwen-AgentWorld: Language World Models for General Agents","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:31.403419Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.24597"},"observation_digest":"sha256:5969b5da8acf7ef71f16f3f7bbe75ea1247792470220a6f474b60b22a2b078e4","observation_id":"b2d13abf-35c5-4890-858b-8701e787e150","resolution":{"observed_at":"2026-07-04T17:09:59.206662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.25421","last_updated":"2026-06-24T05:31:00Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T05:31:00Z","title":"Beyond Next-Observation Prediction: Agent-Authored World Modeling for Sequential Decision Making","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-25T21:11:50.874696Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.25421"},"observation_digest":"sha256:809648cce82a02cad3618b44f35bb0abc8d7ff233506ec44ad97f68777e4665c","observation_id":"d66174e5-e55e-441c-b5d9-068dc173bb2d","resolution":{"observed_at":"2026-07-04T19:40:06.177688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.25447","last_updated":"2026-06-24T06:23:02Z","snapshot_observed_at":"2026-08-02T17:31:06.713424Z","submitted_at":"2026-06-24T06:23:02Z","title":"The Interplay of Harness Design and Post-Training in LLM Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-25T20:57:20.179394Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.25447"},"observation_digest":"sha256:58868bb35aa603a94c3d80ce12340e263bf122b195aba5e4d189f1ff3b459bc4","observation_id":"3290972a-195c-4a15-99e8-51fff462aead","resolution":{"observed_at":"2026-07-04T20:00:07.736814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.26935","last_updated":"2026-06-25T12:09:16Z","snapshot_observed_at":"2026-08-05T08:46:41.476055Z","submitted_at":"2026-06-25T12:09:16Z","title":"Where Do CoT Training Gains Land in LLM based Agents?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T04:55:14.293452Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.26935"},"observation_digest":"sha256:7912c36f57d1033e3ba8d7b85bf2cbe3def7f9f9c547a001116bc331527080bd","observation_id":"ae2fb3c1-9a00-4b39-8be2-a1a8dcfbdcba","resolution":{"observed_at":"2026-07-04T13:49:51.529478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.27483","last_updated":"2026-06-25T19:05:44Z","snapshot_observed_at":"2026-08-01T16:32:32.633211Z","submitted_at":"2026-06-25T19:05:44Z","title":"Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T01:53:56.067792Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.27483"},"observation_digest":"sha256:14bcd496b6922d4ddc8696f089d32db21ba493a0521eeb0ef7d0273138dcea80","observation_id":"197dc697-0f81-465f-92a4-03757ec2c530","resolution":{"observed_at":"2026-07-01T18:35:58.497615Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":"2510.08558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-04T20:00:07.735443Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":"cs.AI","work_id":"f0d69349-a2c2-4250-8431-82719c22096f","year":2025},"citing_paper":{"arxiv_id":"2606.30639","last_updated":"2026-06-29T17:58:43Z","snapshot_observed_at":"2026-08-02T07:48:43.235067Z","submitted_at":"2026-06-29T17:58:43Z","title":"Self-Evolving World Models for LLM Agent Planning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-30T05:48:11.441644Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2606.30639"},"observation_digest":"sha256:0555b3894db660b25ca0c7b32066527f28314ede63330876084d12d43eb2cab0","observation_id":"89fe5cae-e6f8-4568-bc91-c097dc38e617","resolution":{"observed_at":"2026-06-30T13:44:41.504930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-11T14:43:39.668059Z","title":"Agent learning via early experience.arXiv preprint arXiv:2510.08558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04713","last_updated":"2026-07-06T06:32:39Z","snapshot_observed_at":"2026-08-05T03:26:47.178615Z","submitted_at":"2026-07-06T06:32:39Z","title":"RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:39.668059Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2607.04713"},"observation_digest":"sha256:2d9bec50ec3b56b88b89b58c2bda378bea3194aa8ec6b97acc8601034bdbda11","observation_id":"183b1700-f357-449a-a6ee-def7c82df27d","resolution":{"observed_at":"2026-07-11T14:43:39.668059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-08-01T16:07:59.640364Z","title":"arXiv preprint arXiv:2510.08558 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18110","last_updated":"2026-07-20T16:08:49Z","snapshot_observed_at":"2026-08-05T10:41:27.894489Z","submitted_at":"2026-07-20T16:08:49Z","title":"LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:59.640364Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2607.18110"},"observation_digest":"sha256:8d13fce73fce4bd372b97b95f6f70e63aff3b51e12cbe5ae1a3fcfb9c87ec348","observation_id":"f65c47cb-620b-48dc-b740-9488350328e6","resolution":{"observed_at":"2026-08-01T16:07:59.640364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-31T23:04:34.096442Z","title":"Agent learning via early experience.arXiv preprint arXiv:2510.08558, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24112","last_updated":"2026-07-27T07:54:08Z","snapshot_observed_at":"2026-08-06T08:03:01.329757Z","submitted_at":"2026-07-27T07:54:08Z","title":"Scaling GUI Agents with Visual State Transitions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T23:04:34.096442Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2607.24112"},"observation_digest":"sha256:8af1e79925cd25c39039f181ed91c5425fb6c12b9544658ec81d50f0c3364890","observation_id":"6154c06e-df20-472c-a8ed-76a6620735ef","resolution":{"observed_at":"2026-07-31T23:04:34.096442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-08-01T03:02:07.103981Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-05T06:20:48.441250Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:07.103981Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:06027961a7a0540139c19bc9bc3832913b87f90b775b81ab39fcea2acbd016fa","observation_id":"ae9ad3dd-80de-4d02-a865-45dbeccee357","resolution":{"observed_at":"2026-08-01T03:02:07.103981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08558","snapshot_observed_at":"2026-07-31T21:44:39.634912Z","title":"Agent learning via early experience.ArXiv, abs/2510.08558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27973","last_updated":"2026-07-30T10:17:55Z","snapshot_observed_at":"2026-08-06T03:40:42.643302Z","submitted_at":"2026-07-30T10:17:55Z","title":"TAPO: Transition-Aware Policy Optimization for LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T21:44:39.634912Z"},"links":{"cited_paper":"/paper/2510.08558","citing_paper":"/paper/2607.27973"},"observation_digest":"sha256:70fa4b89f3cb322ab18d74c74dac93464ef3cd2ea4b2e90d98bb43623280f553","observation_id":"5d95d0b2-43f3-403f-98bf-6a6ec15cb62e","resolution":{"observed_at":"2026-07-31T21:44:39.634912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.08558/citation-record","integrity":"/paper/2510.08558/integrity","json":"/paper/2510.08558/citation-record.json","paper":"/paper/2510.08558"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:56.506509Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:56.506509Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:cc09e1800d0b7d4b53ac6a664faf3ef49259ce79185ea984f6d32355e47cd6b0","observation_id":"98353674-d12e-4a05-9b5b-93480057539a","resolution":{"observed_at":"2026-08-04T10:47:56.506509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:56.584040Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:56.584040Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:111949b1222c013c589af71b771e299af6b2891d72eb11cedea9d9cdc41f3494","observation_id":"f2957aec-e8bb-450f-b12c-e803e3d3c071","resolution":{"observed_at":"2026-08-04T10:47:56.584040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:56.723578Z","title":"Bellemare, Yavar Naddaf, Joel Veness, and Michael Bowling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:56.723578Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:a6d5aa56611c53d792af84126018b44b01fd9cca7389687faa7af587ab0672c7","observation_id":"6b25a9a5-87af-4259-8d5e-f356859708ed","resolution":{"observed_at":"2026-08-04T10:47:56.723578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:56.900269Z","title":"A markovian decision process","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:56.900269Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:9dafa9c97bca3843f506bffc8653b05bd0b8aeb61f38ec6a934e0872ed854dbc","observation_id":"4c5c6e16-f8aa-480a-8b1f-0177606aa294","resolution":{"observed_at":"2026-08-04T10:47:56.900269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-04T10:47:57.125475Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:57.125475Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:e31cd54977d08fbff927f1639e44804f280ccbc9ccdeb1e8e6c903bd1e73fa30","observation_id":"4175b265-f9d7-46db-8d4c-520439f915c2","resolution":{"observed_at":"2026-08-04T10:47:57.125475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:57.297587Z","title":"Web agents with world models: Learning and leveraging environment dynamics in web navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:57.297587Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:5bbefd43615430b1fe76eb2e3fd21c3162520bdd1423f6ee8c53b0a8ee8a0b4a","observation_id":"d74d271c-b12c-48de-8669-261eca641cb8","resolution":{"observed_at":"2026-08-04T10:47:57.297587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:57.473817Z","title":"Baker, Benjamin Burns, Daniel Adu-Ampratwum, Xuhui Huang, Xia Ning, Song Gao, Yu Su, and Huan Sun","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:57.473817Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:b6b4426e17beb88845b8447c69e0cf7e626ae8c40dba0d5fbcc7b9ee6db81222","observation_id":"cfdb7304-bb93-4667-b3a7-0c6d70eae062","resolution":{"observed_at":"2026-08-04T10:47:57.473817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:57.646059Z","title":"SFT memorizes, RL generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:57.646059Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:99bd7ddff9929cca6b2d73db53d38352ee68183edb9b692f204e5b1b4221a29d","observation_id":"12a48378-77dd-455d-a24a-6354db69e839","resolution":{"observed_at":"2026-08-04T10:47:57.646059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.11532","last_updated":"2019-11-08T14:57:21Z","snapshot_observed_at":"2026-07-06T06:47:35.336460Z","submitted_at":"2018-06-29T16:56:07Z","title":"TextWorld: A Learning Environment for Text-based Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.11532","snapshot_observed_at":"2026-08-04T10:47:57.846696Z","title":"Textworld: A learning environment for text-based games","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:57.846696Z"},"links":{"cited_paper":"/paper/1806.11532","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:9cfe6bc423da695888637b838fd04abda15f774e53677804c28e7859d64e8d2b","observation_id":"ad1297fe-b9f7-4f4f-ba0b-5501da60cfaa","resolution":{"observed_at":"2026-08-04T10:47:57.846696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:58.076593Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.076593Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:c280b7dbbde1b29a2ebba3dabdae79b71b249f271f3ebc31bb1fbf78bd2bdac7","observation_id":"f2653aaf-fc4b-43a2-b890-73a02237e909","resolution":{"observed_at":"2026-08-04T10:47:58.076593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-04T10:47:58.288029Z","title":"Group-in-group policy optimization for llm agent training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.288029Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:9efc1133662a1646a004b5da256e0131b0e6019c5c4135517553214d19a48745","observation_id":"0cf5a722-79ac-4f9f-8ef8-669cb43f5b89","resolution":{"observed_at":"2026-08-04T10:47:58.288029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:58.389893Z","title":"o rg P. M \\","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.389893Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:41b077e623330ee06e732b5f9c4eb23ea1f07bfbeffe9e137811250666446627","observation_id":"eff87050-7876-4b69-8fe2-c579e4538ae1","resolution":{"observed_at":"2026-08-04T10:47:58.389893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:58.507889Z","title":"Multimodal web navigation with instruction-finetuned foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.507889Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:e33d77c40d5590789edf38e14f97b29775a857cdfffd1788b1cac829012ae687","observation_id":"8eee5330-96f6-42e4-ae48-9245f0c587ee","resolution":{"observed_at":"2026-08-04T10:47:58.507889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-02T04:59:06.901290Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-04T10:47:58.616326Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.616326Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:f80db8731ca0736795f8536a7060162b7b63533147311ce2115fc11b4bfb8540","observation_id":"9989590c-175f-49ea-992e-207d1eca1144","resolution":{"observed_at":"2026-08-04T10:47:58.616326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:58.722164Z","title":"Middleware for LLM s: Tools are instrumental for language agents in complex environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.722164Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:87cad56da1befb15ad8f7d950f304d2db3ca2870166671e3115d465473be8909","observation_id":"ba0c974f-6795-42e0-9cf5-2c226c5b8d20","resolution":{"observed_at":"2026-08-04T10:47:58.722164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06559","last_updated":"2025-04-01T05:04:47Z","snapshot_observed_at":"2026-07-06T19:48:10.800324Z","submitted_at":"2024-11-10T18:50:51Z","title":"Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06559","snapshot_observed_at":"2026-08-04T10:47:58.803710Z","title":"Is your llm secretly a world model of the internet? model-based planning for web agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.803710Z"},"links":{"cited_paper":"/paper/2411.06559","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:0531abeb9be8ecd7e3f92324d493d0461533af3de3af62c60c3c3adb79f7fe08","observation_id":"cc9ee8f5-43f0-4df3-b64b-4bbfb3ffbc5c","resolution":{"observed_at":"2026-08-04T10:47:58.803710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:58.908791Z","title":"World modelling improves language model agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.908791Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:1b0112511f329158c9f583ce345a262a959de9c156fbbd64622e891a13af99d8","observation_id":"b71b2ef9-9321-4376-b30e-ba1d1a25f069","resolution":{"observed_at":"2026-08-04T10:47:58.908791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:58.984749Z","title":"Recurrent world models facilitate policy evolution","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.984749Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:d7629bf9ff0e30f2bd5959add334f11ca5090904f60d03c0ccd2e0599ea66fa3","observation_id":"3a0b34ad-cecb-4482-bde0-5e88ceebf935","resolution":{"observed_at":"2026-08-04T10:47:58.984749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:59.064163Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.064163Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:b1367fa0c2ae595b40a7ec0769ac609f496102a152ccf3fad5b5e592f6438097","observation_id":"af8199f1-020f-49a0-ad5c-a33eefcbce67","resolution":{"observed_at":"2026-08-04T10:47:59.064163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:59.153672Z","title":"Mastering atari with discrete world models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.153672Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:b9fa29742e8daf71b7b908f2b889d9c573143fd8ab780601c81c72f51e25362b","observation_id":"f7771a86-7a17-41d6-b73d-c51000c17f49","resolution":{"observed_at":"2026-08-04T10:47:59.153672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:59.271600Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.271600Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:be9192ecbd4c0f85bf43e7bb8e563c2f5a70eb59f112a4f14b11dd243623719c","observation_id":"697bf0e5-d2e2-4a84-9146-783fa9004246","resolution":{"observed_at":"2026-08-04T10:47:59.271600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:59.356603Z","title":"Constructing a multi-hop QA dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.356603Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:b7445016b6ec79cf88062579335e62f34388e5b1a6facecf066237b79bb4a917","observation_id":"c8ccb03b-ca18-49d7-bd77-0c5a77f7c3b7","resolution":{"observed_at":"2026-08-04T10:47:59.356603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:59.442881Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.442881Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:1b45b8435ad66c77ec93c93d69f33cf4426a204f16ec18e0ece847374e8da33a","observation_id":"d738211a-229d-4dfd-89f8-ebc7e9b917bf","resolution":{"observed_at":"2026-08-04T10:47:59.442881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:59.563349Z","title":"Lo RA : Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.563349Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:10229324474ba54b8c15c9711cc1ccd3b5b32bcb8b6efb1bada56df110053c34","observation_id":"6e532730-8555-4857-adb8-7336787ffabb","resolution":{"observed_at":"2026-08-04T10:47:59.563349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:59.628208Z","title":"Large language models can self-improve","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.628208Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:f38de21c88feb043b90cbdadc1c89dd8e4006d47dd4f75a4ac637c0726eb02a7","observation_id":"a12b6eaf-3eaa-4498-85a3-211e024ce892","resolution":{"observed_at":"2026-08-04T10:47:59.628208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:59.739590Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.739590Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:42ca8b81dbc69f533d5f7077a23ceb7943d57f4429c193d53b88cb61557756e3","observation_id":"f9fb40ad-a4c7-4db0-abcc-c85d8e6f6176","resolution":{"observed_at":"2026-08-04T10:47:59.739590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:47:59.850231Z","title":"Imitation learning: A survey of learning methods","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.850231Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:8a16aec2497f76ed417937c62eb714e06e6e5380ee755dfc96c202199ba872c5","observation_id":"6f9831e9-31c0-498d-9d39-748193f910c1","resolution":{"observed_at":"2026-08-04T10:47:59.850231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T10:47:59.970459Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:59.970459Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:50f67022ae25b1367b9a5e2275bc27a84fe2cf044e5d0a6e1a51f7b08cbf2262","observation_id":"2230664e-8cdf-4292-b0e9-c4a75ac757bd","resolution":{"observed_at":"2026-08-04T10:47:59.970459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:00.093999Z","title":"Tree search for language model agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.093999Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:0aa34459fc3b5f3f50dbf3deb552a0c7edf7ac8f9d8fb6a6bc49308221d86503","observation_id":"6f383fb3-7639-41c5-a13b-9219a6a0639c","resolution":{"observed_at":"2026-08-04T10:48:00.093999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06327","last_updated":"2024-08-12T17:44:17Z","snapshot_observed_at":"2026-07-06T18:59:47.901397Z","submitted_at":"2024-08-12T17:44:17Z","title":"VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06327","snapshot_observed_at":"2026-08-04T10:48:00.216972Z","title":"Visualagentbench: Towards large multimodal models as visual foundation agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.216972Z"},"links":{"cited_paper":"/paper/2408.06327","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:0ad741a9a03cb2f4ce6755d66f0b1a49f740addd5ee15f287ed6008d4614ad93","observation_id":"e75f23f8-27ca-4f8e-ada5-ee995680f6ac","resolution":{"observed_at":"2026-08-04T10:48:00.216972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:00.302101Z","title":"Visualagentbench: Towards large multimodal models as visual foundation agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.302101Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:80912934f8bb7adfdb8c4d73939fe1033ccee5a97c5ca4d075db6099fc79d2e1","observation_id":"89bcbb31-2d78-4396-96d9-c9a9784ab24e","resolution":{"observed_at":"2026-08-04T10:48:00.302101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:00.416385Z","title":"AAAR-1.0 : Assessing ai's potential to assist research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.416385Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:ed621c1833633daa2bdb846e0c2422c10febaf0b4d189b6018293499cfd1ca4d","observation_id":"8ccca055-feba-4e1c-b71a-0bcc5d883f46","resolution":{"observed_at":"2026-08-04T10:48:00.416385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:00.516077Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.516077Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:83d1f08917c63fa72e57321b93a61f4544914920a53fc830fa7a4e35a303edfd","observation_id":"d809de26-f766-442d-8de4-5857bee8b53f","resolution":{"observed_at":"2026-08-04T10:48:00.516077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01861","last_updated":"2025-07-09T13:52:32Z","snapshot_observed_at":"2026-07-06T20:45:55.263034Z","submitted_at":"2025-02-24T09:31:56Z","title":"Towards Enterprise-Ready Computer Using Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01861","snapshot_observed_at":"2026-08-04T10:48:00.611698Z","title":"Towards enterprise-ready computer using generalist agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.611698Z"},"links":{"cited_paper":"/paper/2503.01861","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:208c9b8f6db192067abac85f492c0a10a22ae2ccb03004e0f6125f03f58ee09e","observation_id":"bc199b04-a244-4f96-aef2-b47fa26b334d","resolution":{"observed_at":"2026-08-04T10:48:00.611698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-04T10:48:00.750900Z","title":"Riedmiller","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.750900Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:c75bfc242de39c939da6672e19981d9c5ed97d31b536b45c7095d218dc5c3af0","observation_id":"1ec18984-96b6-4bdd-8252-bc3c999efc12","resolution":{"observed_at":"2026-08-04T10:48:00.750900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:00.830638Z","title":"Manning, Peter Shaw, Mandar Joshi, and Kenton Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.830638Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:6c99c5a1c3e81f32e2ccbec8d93fef8b55ff77f4ae5203fb664e28fa5de19c10","observation_id":"e9962b77-3bb7-4c3d-9324-d2f28e76cdfd","resolution":{"observed_at":"2026-08-04T10:48:00.830638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:00.863967Z","title":"Hello GPT-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.863967Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:5554fbbf596a118bb627c9f711dec87b398e6cdd8f3b7a99e12e0ed64f5ae05c","observation_id":"b0c7cdd5-2e0c-4548-a7bd-bfd721a933a8","resolution":{"observed_at":"2026-08-04T10:48:00.863967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:00.989334Z","title":"Explorer: Scaling exploration-driven web trajectory synthesis for multimodal web agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:00.989334Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:0e54a8a2e4ada1b126a961689d4d8ae72e22a3e5c6302e6718d216da6d0ff7bb","observation_id":"530fde74-325c-4b96-aa89-1e6bf4132b76","resolution":{"observed_at":"2026-08-04T10:48:00.989334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:01.121050Z","title":"Gonzalez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.121050Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:428fc0b6effa5dcface501f19c16a35b9500b2f8c90e1f69365b42f236757983","observation_id":"5d7bfe75-1935-495c-8311-1e34cdf4b344","resolution":{"observed_at":"2026-08-04T10:48:01.121050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:01.145663Z","title":"Efficient training of artificial neural networks for autonomous navigation","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.145663Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:d2d8139f08031334b38b455646f5ba7117b1b0206c6e2cfbb4838115b48b10de","observation_id":"97e52afc-0f4c-4ddc-8fa1-f1cc9882ef00","resolution":{"observed_at":"2026-08-04T10:48:01.145663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03601","last_updated":"2025-07-19T17:39:17Z","snapshot_observed_at":"2026-08-05T07:23:13.534267Z","submitted_at":"2025-04-04T17:13:57Z","title":"APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03601","snapshot_observed_at":"2026-08-04T10:48:01.215310Z","title":"Apigen-mt: Agentic pipeline for multi-turn data generation via simulated agent-human interplay","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.215310Z"},"links":{"cited_paper":"/paper/2504.03601","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:67acd35b1bd28eb2a92ac8b6c87ee5272e4a0578687cd9724d2977b13c829af6","observation_id":"c077b242-53db-460c-8a05-1ae325f6f53d","resolution":{"observed_at":"2026-08-04T10:48:01.215310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:01.373304Z","title":"Measuring and narrowing the compositionality gap in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.373304Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:50f453611a42ef700fee96e4558d1fb284c6d537c7a1914c9d10c2b09b25306c","observation_id":"8ad3072c-a31c-4410-a97a-a3b66aca7efe","resolution":{"observed_at":"2026-08-04T10:48:01.373304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-04T10:48:01.456515Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.456515Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:bf0fb8e81b2afdd33f11d102b50019eb5f0eec11c9ac11b16512393392552f5f","observation_id":"456f2f7e-ae95-44e5-9e90-486f0853b895","resolution":{"observed_at":"2026-08-04T10:48:01.456515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:01.572095Z","title":"Web RL : Training LLM web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.572095Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:6722a8dd8b3a2c5ca630771c645be6688e1986d7c55dd132ed3ca75e370bf783","observation_id":"ccdb5895-460e-49b8-86f4-161f28e4bca2","resolution":{"observed_at":"2026-08-04T10:48:01.572095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-04T10:48:01.703082Z","title":"Toolrl: Reward is all tool learning needs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.703082Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:8da61a4ad5289edbb5a2e8e86c5661911020380d212581307f052dee31a2bcfb","observation_id":"4c148590-0c74-4097-b064-dd4f7bd01825","resolution":{"observed_at":"2026-08-04T10:48:01.703082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:01.808110Z","title":"Efficient reductions for imitation learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.808110Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:997009fd9b2eaaa3574f5f890a91fb1447b47a6c4c2f72c28f6eb9f7a0c8938e","observation_id":"0ed98744-c594-4e95-a3ef-e39120147ab7","resolution":{"observed_at":"2026-08-04T10:48:01.808110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:01.923890Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:01.923890Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:3cb4571bf0cc07f466e259992db024338a6b2a840ac872975134eef11b5e73ba","observation_id":"757c5d10-939a-4b0f-a774-c3ba3b52b523","resolution":{"observed_at":"2026-08-04T10:48:01.923890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:02.019600Z","title":"Russell and Peter Norvig","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:02.019600Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:fcd99f2e85654565b99ad0c3c63e91998e1955dc258730e57f8c085ad6f8e2d0","observation_id":"6213fdc4-694b-4f78-a163-f97a66536212","resolution":{"observed_at":"2026-08-04T10:48:02.019600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:02.138239Z","title":"Learning from demonstration","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:02.138239Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:bd7d4bd1e5d645365a18ed8bca9b3dece26510fa8f240b9fc7dffc1f58788d43","observation_id":"f1508f2a-73e9-4c01-a470-a63425e73673","resolution":{"observed_at":"2026-08-04T10:48:02.138239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:02.267088Z","title":"Mastering atari, go, chess and shogi by planning with a learned model","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:02.267088Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:c3540baca591a70af62bd88c45ce82cb217a710b5f52a8dec24ce88d7db2a18d","observation_id":"3e94de37-0c24-4429-b499-ea7b959930a3","resolution":{"observed_at":"2026-08-04T10:48:02.267088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T10:48:02.362478Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:02.362478Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:74052bae353376d405bef33cb7b7f2eebe3f23322adae48198a306e616aeda87","observation_id":"5fbde27e-d5d1-45cc-9636-d31c2353c480","resolution":{"observed_at":"2026-08-04T10:48:02.362478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15004","last_updated":"2024-12-05T02:00:07Z","snapshot_observed_at":"2026-08-05T16:22:08.749834Z","submitted_at":"2024-11-22T15:26:23Z","title":"ScribeAgent: Towards Specialized Web Agents Using Production-Scale Workflow Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15004","snapshot_observed_at":"2026-08-04T10:48:02.524137Z","title":"Scribeagent: Towards specialized web agents using production-scale workflow data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:02.524137Z"},"links":{"cited_paper":"/paper/2411.15004","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:b345e9c022e555b27edd141892ba618d77c7e7ba7d4b04d143820b5643a0dac7","observation_id":"bdca6f21-046e-45d8-8633-062648eea9ac","resolution":{"observed_at":"2026-08-04T10:48:02.524137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:02.675594Z","title":"Hybridflow: A flexible and efficient RLHF framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:02.675594Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:552a1ad0b232a9c4293ef65f9cfd7020e4a8b6989ca3499edc4dcdd4960e976b","observation_id":"f42aa539-7284-44f0-a554-901f7a2cda1b","resolution":{"observed_at":"2026-08-04T10:48:02.675594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:02.837901Z","title":"Reflexion: language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:02.837901Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:c02fd8787194f8153b45c0dd417f362a330250daf9805d24b63b823e86cfd2cd","observation_id":"1812c5e6-9304-4766-bd46-1c4853408aa5","resolution":{"observed_at":"2026-08-04T10:48:02.837901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:03.004397Z","title":"\\ ALFW \\ orld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.004397Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:e9c68cbe3f68fe13a665b9d0354b0d7d21e7b7af017b3afe088882d5211e4bc3","observation_id":"6fd6c576-536d-4126-bd9e-f9283fa589e1","resolution":{"observed_at":"2026-08-04T10:48:03.004397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:03.172498Z","title":"Welcome to the era of experience","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.172498Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:5feeab19598b72490c14a837e3235dc70b96575564f22a2595ee5769c495ba7b","observation_id":"e1feac97-edcc-46e2-a979-39fd7f69520f","resolution":{"observed_at":"2026-08-04T10:48:03.172498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:03.334789Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.334789Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:02ab3548462e8e44c8d57aba3161f560003341033c04720bc5d1ef3de987ba65","observation_id":"5b8fd965-3dc7-4c6b-ba68-64252683cef4","resolution":{"observed_at":"2026-08-04T10:48:03.334789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-04T10:48:03.340432Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.340432Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:9aba2c5b00f7459fe67f887625e21067e9b193e24c35758885dda4646c627316","observation_id":"1ba1141b-7b50-48ad-9600-db220049afaf","resolution":{"observed_at":"2026-08-04T10:48:03.340432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10893","last_updated":"2025-01-18T22:34:41Z","snapshot_observed_at":"2026-07-06T20:22:59.218985Z","submitted_at":"2025-01-18T22:34:41Z","title":"Learn-by-interact: A Data-Centric Framework for Self-Adaptive Agents in Realistic Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10893","snapshot_observed_at":"2026-08-04T10:48:03.400830Z","title":"Learn-by-interact: A data-centric framework for self-adaptive agents in realistic environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.400830Z"},"links":{"cited_paper":"/paper/2501.10893","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:6cc8e4b13896a96fb7c482081ac1a533b18006d61508484f1275938c6b9e34d3","observation_id":"3b04eb56-2391-4aa3-92c1-7eb63fc7a2cd","resolution":{"observed_at":"2026-08-04T10:48:03.400830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:03.503938Z","title":"Language agents: Foundations, prospects, and risks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.503938Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:578b1edad4e44f696d10f29e85beb31b430ba22ecaa083d19acc206e32fe487c","observation_id":"151b51f2-7274-44eb-913e-345770543c78","resolution":{"observed_at":"2026-08-04T10:48:03.503938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:03.585571Z","title":"Cognitive architectures for language agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.585571Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:322a97c3ebdccc8cb5e7231d1ea9f8461adc131e7c70f378085c8a69d0ed3cff","observation_id":"2e7712b4-add6-48df-bfec-d7f4a1c4338f","resolution":{"observed_at":"2026-08-04T10:48:03.585571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:03.678603Z","title":"Dyna, an integrated architecture for learning, planning, and reacting","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.678603Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:d4d10c8f88546afc28dd8b7b7daeec821e964aedc973a34c985ecc10a26a9da1","observation_id":"24bfd7eb-7037-4ff1-beed-2e826f039d07","resolution":{"observed_at":"2026-08-04T10:48:03.678603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:03.815177Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.815177Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:f5aba37d51f6b4af9e1074a5f865690f48248cc8f501bc51c205c278ac3e4c13","observation_id":"ef3492e9-62a0-465f-bfc6-a83d847becb6","resolution":{"observed_at":"2026-08-04T10:48:03.815177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:03.913957Z","title":"Efficient exploration in reinforcement learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.913957Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:0408ddf7595db05e835fd070cd9c6fbe4cad398091b7072f75eeb683a3a373fb","observation_id":"569dcd57-83c3-4d2f-9560-8be2130be822","resolution":{"observed_at":"2026-08-04T10:48:03.913957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:03.994776Z","title":"Musique: Multihop questions via single-hop question composition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:03.994776Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:64fb8c6037e0b55bb22c4bc9d5d2ef4b96ec95055047f1caa62fbf214e99b5f3","observation_id":"85ecd5f2-fb70-4812-b4f8-a81b1a283db2","resolution":{"observed_at":"2026-08-04T10:48:03.994776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:04.039176Z","title":"A pp W orld: A controllable world of apps and people for benchmarking interactive coding agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:04.039176Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:4ea3a603f9363070bc20e2303befe5083886bd4660f2622ba49b9efaf054a7ca","observation_id":"e850cbe3-f015-4836-9abd-168ba02a1440","resolution":{"observed_at":"2026-08-04T10:48:04.039176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:04.124786Z","title":"Investigating the effectiveness of self-critiquing in LLM s solving planning tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:04.124786Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:0a3f7a089ea46bd1284e6357bb8a568dcc58c5d452dea566432789a8589ec2d7","observation_id":"43b25c1d-9ebd-4f3c-92f7-3917f6a07cb9","resolution":{"observed_at":"2026-08-04T10:48:04.124786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:04.197435Z","title":"S cience W orld: Is your agent smarter than a 5th grader? In EMNLP, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:04.197435Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:81e765aed04cf7a623f677918981ce07194e35610f8f74ca89a62c94bea17c77","observation_id":"a676dd61-4aa2-448b-a334-fd7efb8acd68","resolution":{"observed_at":"2026-08-04T10:48:04.197435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-04T10:48:04.269782Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:04.269782Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:4fe5323d768a1eab01010571ddcb62e2455127d0666040b22a39ba7252e5280c","observation_id":"2f2a474c-08e4-4498-84cb-d20a478138f9","resolution":{"observed_at":"2026-08-04T10:48:04.269782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:04.282352Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:04.282352Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:77bb980246386d710552e714f33325c4d4bbf2b73928e558f5077648bd7b04cc","observation_id":"98925eb0-8367-487a-b990-c9f09c17d489","resolution":{"observed_at":"2026-08-04T10:48:04.282352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:04.593498Z","title":"Webagent-r1: Training web agents via end-to-end multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:04.593498Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:28bff7d6a096c4ad0ad5662945710c89a58370c1db7dd4c07aa22710bd5b52de","observation_id":"38eac46c-db24-4a9b-94de-e82e5d182901","resolution":{"observed_at":"2026-08-04T10:48:04.593498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:04.792221Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:04.792221Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:998f06a44491cdc89740e3b7cef944eeb61eafb21413416bcd5e386e04d0e8d4","observation_id":"6023e19f-39bf-4353-abe6-2e6596f65974","resolution":{"observed_at":"2026-08-04T10:48:04.792221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11924","last_updated":"2024-10-15T05:47:19Z","snapshot_observed_at":"2026-08-04T02:10:00.440481Z","submitted_at":"2024-02-19T08:12:30Z","title":"Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11924","snapshot_observed_at":"2026-08-04T10:48:04.961013Z","title":"Cofca: A step-wise counterfactual multi-hop qa benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:04.961013Z"},"links":{"cited_paper":"/paper/2402.11924","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:8252d93c129ae607e99a33c225a7f4ca556303cd21d31e5472127ed9563d6281","observation_id":"1411b88a-6749-4946-88a9-3403e3ec155d","resolution":{"observed_at":"2026-08-04T10:48:04.961013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.133243Z","title":"Agentgym: Evolving large language model-based agents across diverse environments, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.133243Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:b158a0ce87b13991d2a46d467a0ac5db66d9799209a8670686efff46246f1ae0","observation_id":"4db8f092-61da-40b1-9c5f-7c418823dd20","resolution":{"observed_at":"2026-08-04T10:48:05.133243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.227412Z","title":"Travelplanner: A benchmark for real-world planning with language agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.227412Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:8990e0caf92ae83979929e9b61c6245f3a85e8893ac855212353361ccfe1abe5","observation_id":"65b0b769-6f38-4193-ac6c-0f190fa8606b","resolution":{"observed_at":"2026-08-04T10:48:05.227412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.371114Z","title":"Revealing the barriers of language agents in planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.371114Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:6da1672db5620b8a1a7ab78dfb90982d8439bf6039cf225fed8fae4b178d8335","observation_id":"48915cd1-c204-4e3b-bbfe-a79248f6fab4","resolution":{"observed_at":"2026-08-04T10:48:05.371114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.486278Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.486278Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:6c249ee44da0d9080cf3d38b90f6d03a59ef946a73c6941967768fcdd41769a8","observation_id":"a79b1651-c840-418d-b89d-cf525982f3da","resolution":{"observed_at":"2026-08-04T10:48:05.486278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.562175Z","title":"An illusion of progress? assessing the current state of web agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.562175Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:97bc696772652f093bc18097a1daf3410bd5f6d0b22615474f578684a3d9f2dc","observation_id":"6f3e55cf-1a28-4600-a8f1-b968b8a367fb","resolution":{"observed_at":"2026-08-04T10:48:05.562175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13825","last_updated":"2025-05-24T03:55:22Z","snapshot_observed_at":"2026-08-04T16:18:16.404587Z","submitted_at":"2024-10-17T17:50:38Z","title":"AgentOccam: A Simple Yet Strong Baseline for LLM-Based Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13825","snapshot_observed_at":"2026-08-04T10:48:05.644648Z","title":"Agentoccam: A simple yet strong baseline for llm-based web agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.644648Z"},"links":{"cited_paper":"/paper/2410.13825","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:4e10c9ec8e14e784aeb3e99808d2c469f783381d87da8fa9ea0bd130822e9523","observation_id":"5c2919eb-8c15-4b23-84f5-4da8e101284e","resolution":{"observed_at":"2026-08-04T10:48:05.644648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.700685Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.700685Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:eb0c6b192f6bde070eae9576d150a7042fb4faa1d227bd277a189ed098b07ada","observation_id":"e34bb7ec-7172-48f6-adf3-1207db33ba34","resolution":{"observed_at":"2026-08-04T10:48:05.700685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.785257Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.785257Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:db7cc8d0bda113ff35077af1447a2f6356c566fd9a3f9ae4c039f645bbe1f79b","observation_id":"4409272e-f614-4508-b19e-fa60dc60919a","resolution":{"observed_at":"2026-08-04T10:48:05.785257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.865689Z","title":"-bench: A benchmark for tool-agent-user interaction in real-world domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.865689Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:d175ae26853fb90c474ebd8dab29e606a090102a5b65719ecc908dfa29588795","observation_id":"73b3c26e-60a2-46f3-9889-5aaa862fcbe9","resolution":{"observed_at":"2026-08-04T10:48:05.865689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.921855Z","title":"Dyna-think: Synergizing reasoning, acting, and world model simulation in ai agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.921855Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:644f69fc5e3981a66c074d45992a715981886a7b359cb7333bee6e2cddc16e13","observation_id":"f266dc3d-a1f2-4fef-b678-82b3a8e7af4b","resolution":{"observed_at":"2026-08-04T10:48:05.921855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:05.984194Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:05.984194Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:67cd0acdee9d3e256fea7f2e4f3d104cac0b8c93965c1b1d460ceddd497fb058","observation_id":"d83ac179-c6d7-4aed-87f2-4fab3e267c79","resolution":{"observed_at":"2026-08-04T10:48:05.984194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10127","last_updated":"2025-04-15T17:13:46Z","snapshot_observed_at":"2026-07-06T21:09:03.012115Z","submitted_at":"2025-04-14T11:35:02Z","title":"Breaking the Data Barrier -- Building GUI Agents Through Task Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10127","snapshot_observed_at":"2026-08-04T10:48:06.046348Z","title":"Breaking the data barrier -- building gui agents through task generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:06.046348Z"},"links":{"cited_paper":"/paper/2504.10127","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:cb6e27c55ecf9a0285a490703f833f4ab652829ee8b7d1156094273185bd1d17","observation_id":"3104a2ea-9b8c-4d5b-8d7b-ff0b2b0dfbba","resolution":{"observed_at":"2026-08-04T10:48:06.046348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:06.102772Z","title":"Gpt-4v(ision) is a generalist web agent, if grounded","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:06.102772Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:51c345a4bd4a346825d56575ec96f909ab91059d5fa24b8d0b8e14136a285850","observation_id":"d831caac-22ec-405f-923d-a32db62dc671","resolution":{"observed_at":"2026-08-04T10:48:06.102772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:06.154764Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:06.154764Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:43d35408d5001e620a6d58aec23c79753acac5ccfb8b6e60565316505242ca42","observation_id":"8a7caab8-8afd-4fbe-a471-f65565a268cb","resolution":{"observed_at":"2026-08-04T10:48:06.154764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:06.206487Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:06.206487Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:22b16da866c2ae11f6a1b07bdf1c9edde19e5d0f7103b81357b7f375215489dc","observation_id":"351629a1-78ce-472e-8892-59e6e30e08f8","resolution":{"observed_at":"2026-08-04T10:48:06.206487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01716","last_updated":"2025-06-02T14:23:33Z","snapshot_observed_at":"2026-08-06T03:18:09.808455Z","submitted_at":"2025-06-02T14:23:33Z","title":"Self-Challenging Language Model Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01716","snapshot_observed_at":"2026-08-04T10:48:06.257869Z","title":"Self-challenging language model agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:06.257869Z"},"links":{"cited_paper":"/paper/2506.01716","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:92b872b7864f4fcad371bd81f9db719159bfb9d5ece1bb470e99eff4409f661e","observation_id":"76755336-f839-4dc1-9ff6-32b58057e22b","resolution":{"observed_at":"2026-08-04T10:48:06.257869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:48:06.310505Z","title":"Proposer-agent-evaluator ( PAE ): Autonomous skill discovery for foundation model internet agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-04T10:48:06.310505Z"},"links":{"citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:58f304daadb9c75673349385adad0e3f6a07485cece10bc2e79b70f6af813918","observation_id":"3d1bf8f6-3fff-470c-890c-9c7287944595","resolution":{"observed_at":"2026-08-04T10:48:06.310505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":90,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 34 inbound Pith citation observations for arXiv:2510.08558."}