{"as_of":"2026-08-24T03:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8580d1ef448a3a67697c0115ec2332acd6decab785a2cdc9e0ea354f0149eed4","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T09:06:03.221498Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.20246/citation-record","integrity":"/paper/2605.20246/integrity","json":"/paper/2605.20246/citation-record.json","paper":"/paper/2605.20246"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19679","last_updated":"2026-04-25T13:29:08Z","snapshot_observed_at":"2026-08-15T10:11:56.950871Z","submitted_at":"2025-08-27T08:40:05Z","title":"InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2508.19679","doi":"10.48550/arxiv.2508.19679","metadata_source":"pith","pith_arxiv_id":"2508.19679","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning","venue":"cs.AI","work_id":"5f35d44d-a3a1-49a1-8ad7-80351def0c0f","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2508.19679","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:084281e130a0174aa4e09036673974ed30eb8ded5a2bd9fc22082c28a58fa3b3","observation_id":"066c5b2e-2e54-4b0f-a100-fbf187bc44b3","resolution":{"observed_at":"2026-05-22T09:06:18.886667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-23T06:52:45.242916+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T06:52:45.242916+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:13:49.537511Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"8cce8101-1a0a-4da5-a8d4-8b72b9d0c60f","year":null},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:aee68117ad9f6ffb169bbd1b03115117b378f998910091d18491b632c5919ccc","observation_id":"0f291730-6b29-4c24-8038-779259a856a5","resolution":{"observed_at":"2026-05-22T09:06:20.314370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:d04ce4f2f05dc2359a023d4134c09c69f483440aca9291d6d028583d69dbcefd","observation_id":"67000697-7a1d-43ad-853d-60a644c93873","resolution":{"observed_at":"2026-05-22T09:06:20.235878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos.Advances in Neural Information Processing Systems, 35:24639–24654","venue":null,"work_id":"bf094d80-b997-40de-ad5d-6097af817e8f","year":2022},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:e11d2a4104ce00fc4fe45cdf9eecf54635c8834ca75a8b5076105d4a63ef7a58","observation_id":"a8bffc09-6934-4936-b0d6-e73e97eb518a","resolution":{"observed_at":"2026-05-22T09:06:20.318146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23698","last_updated":"2025-07-31T16:20:02Z","snapshot_observed_at":"2026-08-15T05:19:55.869635Z","submitted_at":"2025-07-31T16:20:02Z","title":"Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents","version":1},"cited_work":{"arxiv_id":"2507.23698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.23698","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable multi-task reinforcement learning for generalizable spatial intelligence in visuomotor agents","venue":null,"work_id":"2bd7952d-4874-4134-a987-45e903be2cff","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2507.23698","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:ac6de641c5cbba5ad63ca9fd1dd20626edcf4681b19ded651739cf3e399b7801","observation_id":"23336069-bd0d-4da8-bd94-12e81418c2be","resolution":{"observed_at":"2026-05-22T09:06:20.226388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2734.2025","doi":"10.1109/cvpr52734.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Freeman, Frédo Durand, Eli Shechtman, and Xun Huang","venue":null,"work_id":"d0e5199d-8907-47b1-905a-07ab8b623a4c","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:8eb90f65382c0f05529d4858bad5f39d516b158e62938054af7078a63c802854","observation_id":"27697d87-0687-49be-80d8-6a6f8f6acc9a","resolution":{"observed_at":"2026-05-22T09:06:18.909678Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:50:06.316117+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:50:06.316117+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rocket-1: Mastering open-world interaction with visual-temporal context prompting","venue":null,"work_id":"95fec925-d5d1-4238-bcfc-69c77afeead4","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:6c611a12bc45dc5bccf789cc3ccc4059f3e8df704bd8e139fd14dc5f3bb39df3","observation_id":"23a36722-1d0e-4764-8ccb-ffa826d894d3","resolution":{"observed_at":"2026-05-22T09:06:20.307643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12351","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:23:54.266530Z","title":"Liu, Ram Vasudevan, and Maani Ghaffari","venue":null,"work_id":"bbe13a8c-4321-4c65-8487-c0b8152a0415","year":2026},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:4f56e172cd1bd109da35dc03c730e3be6ba8f807097eba08c016d5d804335c84","observation_id":"fe28cfab-1196-4ff2-906d-d4bad9509c0c","resolution":{"observed_at":"2026-05-22T09:06:20.217335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compassnav: Steering from path imitation to decision understanding in navigation","venue":null,"work_id":"2986c515-0481-4210-896f-5a8fc9571f85","year":2026},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:b7d1f116a60796518b8dfa0071896b958eb97a181e8bde3d9ad8e812d7ec076d","observation_id":"bb003685-2125-4a27-9b3e-36cd4c61ca87","resolution":{"observed_at":"2026-05-22T09:06:20.310942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.920","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"JARVIS-VLA: Post- training large-scale vision language models to play visual games with keyboards and mouse","venue":null,"work_id":"4ed6485e-83e1-45df-af8d-fc5d8e327783","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:2fe73a57462d1ff37c333e08adb1c99c60eb10e30e228952246abe667629a899","observation_id":"70b77976-9598-43f0-b8db-aa3ea75dff5b","resolution":{"observed_at":"2026-05-22T09:06:18.900244Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-23T06:52:45.981133+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T06:52:45.981133+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19386","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coloragent: Building a robust, personalized, and interactive os agent","venue":null,"work_id":"0aaa9486-f416-4ab5-bb8f-52f563498ad4","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:55e31d2e7a470020350228314f06031712d34eaeb0f9472c04b927cf11929f96","observation_id":"8221cfde-8f7e-4bef-ba75-c718e1322d5a","resolution":{"observed_at":"2026-05-22T09:06:20.207848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Steve-1: A generative model for text-to-behavior in minecraft.Advances in Neural Information Processing Systems, 36:69900–69929","venue":null,"work_id":"643f811d-84e5-42fe-9a3f-81707d074e8b","year":2023},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:4d49af5fe3b5210b83ef3424415e76888bff934edd5139fdd89a3a1795a44a49","observation_id":"fa8e4814-d2a9-4f46-87d5-b9de4ac112fc","resolution":{"observed_at":"2026-05-22T09:06:20.300899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08367","last_updated":"2025-06-03T02:30:05Z","snapshot_observed_at":"2026-08-21T10:50:32.715497Z","submitted_at":"2023-10-12T14:38:25Z","title":"MCU: An Evaluation Framework for Open-Ended Game Agents","version":4},"cited_work":{"arxiv_id":"2310.08367","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08367","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mcu: A task-centric framework for open-ended agent evaluation in minecraft","venue":null,"work_id":"4d4e297c-a581-4a23-b262-85e1a0aa655c","year":2023},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2310.08367","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:87a3394175f6660c3d8aab5c5eb92c54015db64ef93485c3b035b0324b4554dc","observation_id":"76f3ea3e-39cc-41b3-84cc-b3999cb62a63","resolution":{"observed_at":"2026-05-22T09:06:20.148998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02046","last_updated":"2026-05-02T12:32:44Z","snapshot_observed_at":"2026-07-06T22:07:16.776694Z","submitted_at":"2025-08-04T04:28:18Z","title":"NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks","version":4},"cited_work":{"arxiv_id":"2508.02046","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.02046","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks","venue":"cs.RO","work_id":"ab285914-bfbe-4a83-8231-8c27dae29969","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2508.02046","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:5c86a3966519e20721b1b2c2614844ca164a5bf65447be85ed68068ded01df92","observation_id":"cc0cdb18-3e2a-4c25-bbde-e8b331d4a0a6","resolution":{"observed_at":"2026-05-22T09:06:20.198974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06407","last_updated":"2022-10-12T17:03:41Z","snapshot_observed_at":"2026-08-16T16:24:45.577876Z","submitted_at":"2022-10-12T17:03:41Z","title":"Interactive Language: Talking to Robots in Real Time","version":1},"cited_work":{"arxiv_id":"2210.06407","doi":"10.48550/arxiv.2210.06407","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interactive language: Talking to robots in real time","venue":"arXiv (Cornell University)","work_id":"14f18d78-e030-41b7-bfce-adfa4c043c74","year":2022},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2210.06407","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:783202e4277ab3f46b4fa1f07c10a2fb6742e89bb9c9df13f112642b035aad9f","observation_id":"ea22657c-6db6-4cc3-b7b7-9da40c8ed92a","resolution":{"observed_at":"2026-05-22T09:06:20.194865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nitrogen: An open foundation model for generalist gaming agents","venue":null,"work_id":"eb451ce0-3566-4ca1-9626-b40962e64c11","year":null},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:17ce8c109b83e9537729b99609541a9c3466bce0e0dc6b9c571b9993515fb3e9","observation_id":"b5aef6f7-a30b-430b-a5ab-7c7f7ad48ee8","resolution":{"observed_at":"2026-05-22T09:06:20.297001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.02427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:29:59.593488Z","title":"Nitrogen: An open foundation model for generalist gaming agents","venue":null,"work_id":"fa54f2ce-cc29-4cdd-b8dc-c33c37fa4f0c","year":2026},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:d8091cda2c94ec262d179f2c9a0c7abbfb55fa9809ac47cc2e02ea80ca5c042f","observation_id":"e5cdfbfa-7241-425a-bd87-39e978b04782","resolution":{"observed_at":"2026-05-22T09:06:20.190443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gameworld: Towards standardized and verifiable evaluation of multimodal game agents","venue":null,"work_id":"f1827530-5349-4397-a67b-43584cc4dfec","year":2026},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:aa40051e689d95828e054639f34b6fed02c2830cbb8f37f8c6f862471ca30f7a","observation_id":"fe16d6f4-0897-4cbd-9059-6e05603b89e4","resolution":{"observed_at":"2026-05-22T09:06:20.304168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:b2c31ca6f738eda14ba7ae45bdb310a795ca672c37057aaccdf167c1f0cdfe06","observation_id":"48e98a13-db5c-4b6d-92a5-97c9c12688b2","resolution":{"observed_at":"2026-05-22T09:06:20.212533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:df3aa23f3f5ee7f57fa07960ac91f048a488a608ed936efad537fa88c5fa60a2","observation_id":"63a64880-a6fa-41d1-a4d1-6c8ea82ca854","resolution":{"observed_at":"2026-05-22T09:06:20.231172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05720","last_updated":"2025-07-08T07:07:53Z","snapshot_observed_at":"2026-08-14T16:53:04.784753Z","submitted_at":"2025-07-08T07:07:53Z","title":"MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment","version":1},"cited_work":{"arxiv_id":"2507.05720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05720","snapshot_observed_at":"2026-07-04T10:59:46.413359Z","title":"Mobilegui-rl: Advancing mobile gui agent through reinforcement learning in online environment","venue":null,"work_id":"4b1aecd7-add8-45d1-b46c-5c1a9c30fe03","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2507.05720","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:e059cecd255c917b352990838b58e85bd3b81097806af75e952704fb7fe2916d","observation_id":"d7c09be8-2028-4ab9-b67d-f3049fe923ed","resolution":{"observed_at":"2026-05-22T09:06:20.173865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.08892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:07:29.913889Z","title":"Lumine: An open recipe for building generalist agents in 3d open worlds","venue":null,"work_id":"f4477ab3-f154-446f-8af6-05f5afc2b936","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:1ad2467fff3a46a6c127a0f77e6b2abf085fb5ffd391c597a7a8e00b3baf6447","observation_id":"f59a9f64-b71f-477a-a4e1-eef8872c6b4a","resolution":{"observed_at":"2026-05-22T09:06:20.178376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:9e9cd7d4f95a82f1aea59e8b5fc0ba5c7d538fdd4d5147af9acb91c72b96d37d","observation_id":"3a6782f4-b59d-491e-ae6d-c3869e43404a","resolution":{"observed_at":"2026-05-22T09:06:20.182452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T14:08:11.914281+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.13347","doi":"10.48550/arxiv.2509.13347","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Openha: A series of open-source hierarchical agentic models in minecraft","venue":"ArXiv.org","work_id":"873bad2b-47ff-4738-9223-6143e85be237","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:c33d798c541a707e70db70e8de0d6f36cd16fdec60c56c46b9fc153e2438702b","observation_id":"318df860-02fc-46be-b865-2464a94a6c03","resolution":{"observed_at":"2026-05-22T09:06:20.159090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:07:29.952542Z","title":"Game-tars: Pretrained foundation models for scalable generalist multimodal game agents","venue":null,"work_id":"4863cdd8-14ec-4536-bde0-801f99c4dbd1","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:fa7df42c9be309a3fc583990fbd14eb8b146cb46c824756cb17093f47a93bf7c","observation_id":"3394bc5e-ef40-461d-b7c9-7483ed52d96e","resolution":{"observed_at":"2026-05-22T09:06:20.164107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentgym: Evaluating and training large language model-based agents across diverse environments","venue":null,"work_id":"20ec357c-05c9-45ff-b489-ab46ce6b6206","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:2396a7c9f70f1e8f2b9002c32266322c27233f106b5572948ac711d65583b72b","observation_id":"bdf00b0d-c6d3-4b39-9db2-1931e3f76182","resolution":{"observed_at":"2026-05-22T09:06:20.293099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Etp-r1: Evolving topological planning with reinforcement fine-tuning for vision-language navigation in continuous environments","venue":null,"work_id":"d2072e3a-9eb1-4ba1-b4b4-ea02fdbdfebe","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:fe1b97adf26043c7ad7f161a05304200ff0e03675dbbd20c967418fe9c078915","observation_id":"d3699671-cc8d-426f-b115-87275d78e961","resolution":{"observed_at":"2026-05-22T09:06:20.154173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04206","doi":"10.48550/arxiv.2510.04206","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentrl: Scaling agentic reinforcement learning with a multi-turn, multi-task framework","venue":"ArXiv.org","work_id":"5d14b2f1-ee1c-407d-8b3f-4e653c4781ad","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:f23a1b54fcaba5ce02b44791322c980698ba65cc7e6761022ce5509ef90e5a69","observation_id":"61751152-934b-419a-a5b7-aea962ca45f6","resolution":{"observed_at":"2026-05-22T09:06:20.168920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:08:21.402943Z","title":"Activevln: Towards active exploration via multi-turn rl in vision-and-language navigation","venue":null,"work_id":"f4d968af-dc91-4241-b4eb-44080f8b1ac6","year":2025},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:ef167c29ff79924ec3763ab44553aa66732d5667a78a5c0854db12167df30df7","observation_id":"f75eb785-be6c-4683-9ee6-de09f904d8bb","resolution":{"observed_at":"2026-05-22T09:06:20.186483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-08-17T02:51:06.474773Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":"2403.13372","doi":"10.48550/arxiv.2403.13372","metadata_source":"pith","pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","venue":"cs.CL","work_id":"462b3287-e058-48e3-b5e3-82a5f2a8dc06","year":2024},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:8716d92454e0ec1f73dfd00ddcf3f7fde87c6b332e36d5ddd3b3efe6043dfa94","observation_id":"9c48a5f6-d393-45f8-b7cf-1057e3bbb9da","resolution":{"observed_at":"2026-05-22T09:06:20.203515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:35:46.734396Z","title":"mine iron ore","venue":null,"work_id":"560ad74a-e095-4ae3-9e7a-b9b75a3b994c","year":2026},"citing_paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T09:06:03.221498Z"},"links":{"citing_paper":"/paper/2605.20246"},"observation_digest":"sha256:15dc1f1b8be585e2827343eb71c850ac85d93694ad0642cc71eeb51d79c139d7","observation_id":"0f510b5a-f0e7-4489-be3b-178361324bbf","resolution":{"observed_at":"2026-05-22T09:06:20.221332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20246","last_updated":"2026-05-21T05:35:18Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T09:06:10.899292Z","submitted_at":"2026-05-18T04:56:59Z","title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":22,"verified_fuzzy":8},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2605.20246."}