{"as_of":"2026-08-22T06:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:efbab54533a681bea84d78347ba414d6887d8b94e7fff82c2d64236d2d117965","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:49:40.262037Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.14897/citation-record","integrity":"/paper/2507.14897/integrity","json":"/paper/2507.14897/citation-record.json","paper":"/paper/2507.14897"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:42.469008Z","title":"Ahmadian, C","venue":null,"work_id":"59222a40-90f4-4ab5-b0c9-7943259a7245","year":2024},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:37.344151Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:f28896054ced7c733dcf79d9e81634b0a6b14b7e6477a1e1b262065af677640f","observation_id":"545a452f-77c9-49c0-90c0-06a9dce691eb","resolution":{"observed_at":"2026-08-06T15:49:42.542688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:42.337876Z","title":null,"venue":null,"work_id":"192f38c8-6bd0-4722-ba65-b08fe1f875ed","year":2023},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:37.443399Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:ad1d53ad335e8dfec7d9507f5e5886039d1bc4655d63ab14d91f41342368bfa8","observation_id":"57a527e9-81cb-420d-8db1-5bef6d9e62c5","resolution":{"observed_at":"2026-08-06T15:49:42.408889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-06T15:49:37.552030Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:37.552030Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:6ac74337e8a97e10b75419fbca8a8ac4f43e093f51c1fdb49bf859500fba0e20","observation_id":"b09e553c-2459-4e37-8782-65cd2a56899e","resolution":{"observed_at":"2026-08-06T15:49:37.552030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:42.235477Z","title":null,"venue":null,"work_id":"8b27aa5f-6046-45d0-9cb8-363578574bb1","year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:37.693263Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:81e243486fb14858e4634d93f44bc866b4b26b088bca90b230918399fdb02324","observation_id":"814e8c07-510b-4f08-8a4e-724c1a893d1a","resolution":{"observed_at":"2026-08-06T15:49:42.291835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:49:37.805080Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:37.805080Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:7adabdc139b51b231a71ac023e6e6995ed50bf6525deed169fba6a8784d563ea","observation_id":"9a5b15d0-9306-4dfa-9baa-9793114ebc4f","resolution":{"observed_at":"2026-08-06T15:49:37.805080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:42.110724Z","title":null,"venue":null,"work_id":"72792ad1-f7a1-4060-a823-e7256a52f2be","year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:37.945699Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:1ac0170927affa1d1b3cd8e80715ecb236b3b4166881568284942fe8beca8d98","observation_id":"0a1c42fc-8829-41df-bf51-1cf17397ab75","resolution":{"observed_at":"2026-08-06T15:49:42.170209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-06T15:49:38.134448Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:38.134448Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:79488c75ad643955b8f037385a56b6886a5dccef018dbe2da26fdd0bee4fa676","observation_id":"cb1bdac4-c8d3-4608-a7b1-6613022f3e80","resolution":{"observed_at":"2026-08-06T15:49:38.134448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:41.978719Z","title":"Ouyang, J","venue":null,"work_id":"f91361b9-db4f-41e3-93f0-e9f1239a6452","year":2022},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:38.242729Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:e734fccb5c10c3e7b9793781ce94b42d8acf0a9e998737a8808a5523b28655cd","observation_id":"812e6747-e5ca-4c02-9d20-4c9cf3192ae8","resolution":{"observed_at":"2026-08-06T15:49:42.044253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:41.792474Z","title":null,"venue":null,"work_id":"e2240168-2271-4453-b7f3-e902660d02ae","year":2024},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:38.326110Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:1bcd2505f1c78d14375535eba876d9d31c8da2031b1b0d454fa8a30575b146e9","observation_id":"40a437bd-051b-423d-9aeb-c2b5191c5802","resolution":{"observed_at":"2026-08-06T15:49:41.944332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:38.468957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:38.468957Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:5771e58813c698e0d1d5d7af38d00fbfc82250af3dcf35ba49e63b536970381c","observation_id":"a7e06540-0385-432d-8f66-c60d1a8d84be","resolution":{"observed_at":"2026-08-06T15:49:38.468957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T15:49:38.583346Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:38.583346Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:1a8e0f59b90ae22bbd2af5765f8de35f3692db7a66ac597be30d8f835d2acedb","observation_id":"eff85625-5804-4d7f-b0f3-7f8dbcbdedeb","resolution":{"observed_at":"2026-08-06T15:49:38.583346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:49:38.725073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:38.725073Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:6313c5ed42253b22bf69cdfbc4051bf80f555e665924800a8a41de6cb35d500f","observation_id":"bf64fbaf-93c4-4dd1-b106-27eb9cf74d15","resolution":{"observed_at":"2026-08-06T15:49:38.725073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T15:49:38.832390Z","title":"Sheng, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:38.832390Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:5b437bc0b6fc6a1356091a1ce76123949fc8ae700e8bc943d92eabc0b54e89ba","observation_id":"363b84b1-c703-4a4d-b97f-8712702a66d8","resolution":{"observed_at":"2026-08-06T15:49:38.832390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-19T18:51:42.906395Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-06T15:49:38.967794Z","title":"Shridhar, X","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:38.967794Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:746044a81ff9f960f8a822e8afade3310a3d64dae3594480b3c66369ec88612a","observation_id":"0fe9480a-1ad1-4035-9382-8f48545101ce","resolution":{"observed_at":"2026-08-06T15:49:38.967794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:41.650809Z","title":"Rl-factory","venue":null,"work_id":"36ff3b8a-3b8d-4810-b5f6-e7e5d886ecfb","year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:39.069127Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:84c65fc746df7a4d393dcd57334bcd72dda2ad833afb55070c2e458f2f5fedb8","observation_id":"43ae38bb-e1e5-42a3-b986-1d616c41d714","resolution":{"observed_at":"2026-08-06T15:49:41.722444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:41.516608Z","title":"Sumers, S","venue":null,"work_id":"0679d0a0-a5eb-4a5f-bea5-43dfe036e470","year":null},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:39.181757Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:2351a8597dd1d60455e09aa2bf380801f639c56d9253fbcbd02a97b90b9a7799","observation_id":"07ada5ad-2663-45b8-bb3b-9e9a93878ac9","resolution":{"observed_at":"2026-08-06T15:49:41.591462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:41.392541Z","title":null,"venue":null,"work_id":"78babc84-79f9-461e-9b3e-d2d2f73e1754","year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:39.322374Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:eb1afb3ed6e1e6644903859f656ac7e7c2b85b2147df342f31a9db15d0e0a6e5","observation_id":"2c791712-6f51-48c1-8d3f-971d617ffd7a","resolution":{"observed_at":"2026-08-06T15:49:41.449138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07540","last_updated":"2022-11-14T17:52:27Z","snapshot_observed_at":"2026-08-22T04:51:34.197483Z","submitted_at":"2022-03-14T22:52:34Z","title":"ScienceWorld: Is your Agent Smarter than a 5th Grader?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07540","snapshot_observed_at":"2026-08-06T15:49:39.486542Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:39.486542Z"},"links":{"cited_paper":"/paper/2203.07540","citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:6c168a3c3d6348847badfcf990b77a0528b78cae58a51ad88001815dd6397fb8","observation_id":"bcb806f7-9237-444c-8551-380929bed4e9","resolution":{"observed_at":"2026-08-06T15:49:39.486542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:41.255502Z","title":null,"venue":null,"work_id":"6471ee91-6e55-4691-a5ba-4cc39d6270ca","year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:39.635367Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:b470ece36a3a9d4e625f9606dded24b44dbf85214d4a5cbc57b1377d65219ce5","observation_id":"b51cc60f-e16b-4cc8-a9f6-07c1fae16fc4","resolution":{"observed_at":"2026-08-06T15:49:41.323935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:41.041596Z","title":null,"venue":null,"work_id":"9f9e7787-9278-430d-8b01-b7becda70364","year":2024},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:39.762963Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:f881e08573498d3def2b8591d3e392b2f7078fdf5cc9ab83f32c6eeb13d8427c","observation_id":"bf73ace5-97c3-44ff-bcec-7e739bb4cb97","resolution":{"observed_at":"2026-08-06T15:49:41.137535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:40.897111Z","title":null,"venue":null,"work_id":"2fd23e87-af9f-43d7-a235-dba921a0e7d1","year":2018},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:39.924443Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:9f32033c1e30b25036f011d84433bdd5a45c219734cd2ed4439cccd39ab7e89f","observation_id":"2ec57a07-5b94-4bf9-b66c-fcf93d52a08f","resolution":{"observed_at":"2026-08-06T15:49:40.952067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01206","last_updated":"2023-02-08T01:39:30Z","snapshot_observed_at":"2026-08-20T13:31:10.504015Z","submitted_at":"2022-07-04T05:30:22Z","title":"WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01206","snapshot_observed_at":"2026-08-06T15:49:40.070569Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:40.070569Z"},"links":{"cited_paper":"/paper/2207.01206","citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:6188c5d8410994ebcdac577b94e07cd2c5e67b039252e56218f2963881d172a4","observation_id":"ccacb417-bc29-4a6f-aea0-f5c336bc2c3d","resolution":{"observed_at":"2026-08-06T15:49:40.070569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:40.763221Z","title":null,"venue":null,"work_id":"d5576230-dead-4301-be66-11d33ae7ddda","year":2023},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:40.129587Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:5607098cbea9a04e1444c20a25d2d5cecd8075b911029d9d85249d0c9e2a001f","observation_id":"73a24159-f12e-439c-b31a-f3b636ab88f6","resolution":{"observed_at":"2026-08-06T15:49:40.824110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:40.578277Z","title":null,"venue":null,"work_id":"d32787d8-d3d9-48bb-b364-ed8263ba9350","year":2024},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:40.191632Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:65bb0d618224b6db86e57c5bbdcd28d825eaa27d92765a990d53e2940ca4e4ae","observation_id":"f9a5efa7-819c-47cd-8a32-c85e981442a2","resolution":{"observed_at":"2026-08-06T15:49:40.675842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:40.421589Z","title":"qa_f1_reward","venue":null,"work_id":"4971123e-768e-4b33-8c95-5caf26c34e1d","year":2025},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:40.262037Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:bf3d9609dac9874ad44e2c21884106aecc0cfe6da4ae8fbecfdce6182da26ada","observation_id":"b5938653-f283-4f96-9fe5-667ca10fd4d9","resolution":{"observed_at":"2026-08-06T15:49:40.459525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:49:40.015259Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T15:49:40.015259Z"},"links":{"citing_paper":"/paper/2507.14897"},"observation_digest":"sha256:c318e66fdec3c821042fae9149fd1f4f173bfe2e5b9d930105c0f3b4de72d2f6","observation_id":"6da7cb92-1644-4bd1-bfca-f184dc506489","resolution":{"observed_at":"2026-08-06T15:49:40.015259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.14897","last_updated":"2025-07-20T10:22:36Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T10:43:56.272822Z","submitted_at":"2025-07-20T10:22:36Z","title":"AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2507.14897."}