{"as_of":"2026-08-04T18:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6bd6a5700cff9c33d7ed5c17b221890ccd75bdae1440841a40a5859e4d51d2d3","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T12:58:30.777235Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:57:40.853069Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T14:09:53.718432Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2605.06175","last_updated":"2026-05-08T06:32:29Z","snapshot_observed_at":"2026-07-31T03:14:45.876383Z","submitted_at":"2026-05-07T12:56:58Z","title":"VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T09:11:21.715023Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2605.06175"},"observation_digest":"sha256:1232ff2d7ce775752018d37818cf2792de56a3feeb8677313d7fe74c9a859ac5","observation_id":"c136c42d-0514-483d-8f53-d9fc1928c427","resolution":{"observed_at":"2026-05-21T02:04:11.439936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2605.06175","last_updated":"2026-05-08T06:32:29Z","snapshot_observed_at":"2026-07-31T03:14:45.876383Z","submitted_at":"2026-05-07T12:56:58Z","title":"VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:05:07.509291Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2605.06175"},"observation_digest":"sha256:367a9561b336fc8ed96df0c140d5109d4a21635e54714bbdaddef8cfe491fb53","observation_id":"54fbf5b6-c48d-4a25-815b-fedfe200d0ce","resolution":{"observed_at":"2026-05-21T02:04:11.439936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2605.19282","last_updated":"2026-05-19T03:00:26Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T03:00:26Z","title":"Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T07:14:31.613251Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2605.19282"},"observation_digest":"sha256:a873765a16ddd3499015ebcfc5870119c98152855da4ac9869d510c8471ffdc4","observation_id":"102eb8f3-cd5d-49f3-a700-c087586b9b1f","resolution":{"observed_at":"2026-05-21T02:04:11.439936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2605.30834","last_updated":"2026-05-29T04:40:12Z","snapshot_observed_at":"2026-08-02T14:58:44.039726Z","submitted_at":"2026-05-29T04:40:12Z","title":"Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T22:39:15.211339Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2605.30834"},"observation_digest":"sha256:3fcb41ed358766ff509a9d425dc7ed81321859e371da336dbd80601b66f3bf6f","observation_id":"20be91d9-bff0-49eb-a1b7-848a0b41da9a","resolution":{"observed_at":"2026-06-28T22:42:46.568474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2606.17924","last_updated":"2026-06-16T13:38:03Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T13:38:03Z","title":"PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T00:57:58.312567Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2606.17924"},"observation_digest":"sha256:b43390f22671ee7dd72fa89c93b2206a843d05e620041e6bfe22f4e57b04ead4","observation_id":"94d4f7ab-fae3-4fa6-b308-181e2d207902","resolution":{"observed_at":"2026-07-03T20:58:58.543012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":"2602.18532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-07-04T14:09:53.718432Z","title":"Vlanext: Recipes for building strong vla models.arXiv preprint arXiv:2602.18532","venue":"cs.CV","work_id":"e7a9aa71-5bef-41b3-92de-ba90ad375056","year":2026},"citing_paper":{"arxiv_id":"2606.27355","last_updated":"2026-06-25T17:56:33Z","snapshot_observed_at":"2026-08-02T02:42:43.577220Z","submitted_at":"2026-06-25T17:56:33Z","title":"RouterVLA: Turning Smoke Tests into Supervision for Heterogeneous VLA Selection","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T04:25:18.870217Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2606.27355"},"observation_digest":"sha256:6ed3daeb5d30e473477b8213a22adef6bf27874485d437e1f08e35f977ac0921","observation_id":"5e853214-c132-47ed-87d7-1375423f15f7","resolution":{"observed_at":"2026-07-04T14:09:53.719676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-08-04T11:57:40.853069Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-04T18:35:30.662519Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.853069Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:b0a718d9562818a0b32ded26e99c7bcb1264b4e7b9c5e9c5f3a8795d97df0dc7","observation_id":"f0f812ab-e057-4896-a429-b6a98d1b7a4c","resolution":{"observed_at":"2026-08-04T11:57:40.853069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.18532/citation-record","integrity":"/paper/2602.18532/integrity","json":"/paper/2602.18532/citation-record.json","paper":"/paper/2602.18532"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:ef3e1f1fc36e9861408ec524527e0ab0eef0155c64f74b647068f62485b5e589","observation_id":"b2529d4c-c5b3-4386-af60-45f20360ac71","resolution":{"observed_at":"2026-05-21T13:00:09.843841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.05800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.820608Z","title":"3d cavla: Leveraging depth and 3d context to generalize vision language action models for unseen tasks","venue":null,"work_id":"10a5d041-6d20-404d-a379-a0782b16f45e","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:9e5fb7397598a91f30e62816b5fdfacec528ede1c9450f7ea7b40deaddc29650","observation_id":"7a76bb13-8fbc-4c1f-a856-83b19701ba6b","resolution":{"observed_at":"2026-05-21T13:00:09.938258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":"2512.13030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-07-10T04:16:48.690751Z","title":"Motus: A Unified Latent Action World Model","venue":"cs.CV","work_id":"d0b2d257-524d-4d67-9daf-5fb43e5e977a","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:077225064a47f583d9a351037dfa8a971cc3ae9b0a4103b1752e52574d16d799","observation_id":"ea65ca17-e5fe-4943-9cd2-aad2b1be43dc","resolution":{"observed_at":"2026-05-21T13:00:09.853621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-10T23:07:47.672265Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:396e1f216b71e6ed5ed8f4c98dc2e6c68ef6bf3f2528b5bd087d0b069e4488fd","observation_id":"91a89579-96fe-4a66-bd99-578a2e942d9b","resolution":{"observed_at":"2026-05-21T13:00:09.829471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T00:07:42.817654Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:3e74a7a426700788516780185cb016b4019f47c14f5218fb0ca9b1620ada23b4","observation_id":"6a830836-c062-455f-9806-e218bc442433","resolution":{"observed_at":"2026-05-21T13:00:09.800641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"cited_work":{"arxiv_id":"2511.17502","doi":"10.48550/arxiv.2511.17502","metadata_source":"pith","pith_arxiv_id":"2511.17502","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rynnvla-002: A unified vision-language-action and world model","venue":"cs.RO","work_id":"f28355c2-726f-4492-899f-be74df2c09cd","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2511.17502","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:08969fe7b5e8328220824fd5e931d26a8545a3416b5daf4e9f739907afcce975","observation_id":"3403115c-1040-4070-a9d6-984910f7010d","resolution":{"observed_at":"2026-06-02T02:03:36.254972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.09527","doi":"10.48550/arxiv.2503.09527","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Combatvla: An efficient vision-language-action model for combat tasks in 3d action role-playing games.arXiv preprint arXiv:2503.09527, 2025a","venue":null,"work_id":"2e1a31ec-35dd-4448-aace-64849c632344","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:573e4db9795d1687142f9dc8a622735454cc9c53481f250e5c353e216e4e9f64","observation_id":"07a9d8cc-c5b5-4d83-a626-80ea2d0ad0fa","resolution":{"observed_at":"2026-05-21T13:00:09.917410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-07-31T17:39:49.561332Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":"2510.26583","doi":"10.48550/arxiv.2510.26583","metadata_source":"pith","pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Emu3.5: Native Multimodal Models are World Learners","venue":"cs.CV","work_id":"518b061e-87a3-45f9-8419-30a14d89b122","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:1720446c55764a5963d0fcc96b148daacfb4ca436a0f19c8e850961096f86ea3","observation_id":"3a721f1f-b528-43cd-9b49-b910113cc8c1","resolution":{"observed_at":"2026-05-21T13:00:09.819893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:30.986785+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14795","last_updated":"2025-02-21T08:09:14Z","snapshot_observed_at":"2026-08-03T14:55:39.031927Z","submitted_at":"2025-02-20T18:17:11Z","title":"Humanoid-VLA: Towards Universal Humanoid Control with Visual Integration","version":2},"cited_work":{"arxiv_id":"2502.14795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14795","snapshot_observed_at":"2026-07-03T20:38:55.564194Z","title":"Humanoid-vla: Towards universal humanoid control with visual inte- gration","venue":null,"work_id":"dbd2558e-19f1-460a-aec5-839bc04abeca","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2502.14795","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:20bad9c53a7be643d2772a8d316ddfec234a1832a6b20ecff1c55acb16e45953","observation_id":"2843b0aa-9727-4034-a106-5d3bff1f88ab","resolution":{"observed_at":"2026-05-21T13:00:09.825098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15605","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:33:25.093042Z","title":"Srpo: Self-referential policy optimization for vision-language-action models","venue":null,"work_id":"5547ea6d-8228-4614-99ce-323e9ab3355a","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:14df52bf28c5e971c0346e53f6736b39ec87ad636b03637eba14cd72d8e1b74d","observation_id":"8b3cf350-377f-4801-b242-20b4adf402eb","resolution":{"observed_at":"2026-05-21T13:00:09.943727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13054","doi":"10.48550/arxiv.2510.13054","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Vla-0: Building state-of-the-art vlas with zero modification","venue":null,"work_id":"2b9209c3-c0fa-408b-9acf-06ab74e0ef7e","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:8c9450607df4211eee136c3c3198c27a8f47f2f867f63008b0269410dd3f8ebd","observation_id":"f82c2aad-f36e-4573-be43-5453fa722962","resolution":{"observed_at":"2026-05-21T13:00:09.948808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:5ce9bf963839ce79f8aa080a37d7e0346271d402d582b515247fb3f2e1e50b51","observation_id":"b207c2ce-82e7-45ea-878d-caf95d688861","resolution":{"observed_at":"2026-05-21T13:00:09.877521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22643","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:50.893920Z","title":"Vla-reasoner: Empowering vision-language-action models with reasoning via online monte carlo tree search","venue":null,"work_id":"453fdeea-8d60-41c4-99b7-3da24e4135c8","year":2026},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:ec8a4fe6726a2667f56b7c6b251e79a4239f4c2db7b14e1d11158490f5591165","observation_id":"eaa56b9f-aad6-4800-98a0-4a53e04b47e6","resolution":{"observed_at":"2026-05-21T13:00:09.902948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-07-11T00:37:42.845448Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:bda3bee4366286b8dc3beb09bacc154b463f4229510be774f518114b91708502","observation_id":"f0cc7abe-4ecd-4a84-8899-020d74d74d93","resolution":{"observed_at":"2026-05-21T13:00:09.872549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"cited_work":{"arxiv_id":"2507.16815","doi":"10.48550/arxiv.2507.16815","metadata_source":"pith","pith_arxiv_id":"2507.16815","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","venue":"cs.CV","work_id":"a5c17d1f-5739-41bd-bd90-0faf9424af13","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2507.16815","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:8a0e73d57af78d1b3726091ae392515d3fda018b9f78314d339c3c4735c4315a","observation_id":"14e156da-bc7c-4d62-92c7-27c5c93c74ea","resolution":{"observed_at":"2026-05-21T13:00:09.922795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2504.19854","doi":"10.48550/arxiv.2504.19854","metadata_source":"pith","pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","venue":"cs.RO","work_id":"1e89a464-b414-4d5c-a974-b2cb8be33053","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:75680f8e2d7fc067225fc772efdc2dc31367e2fe9f41b6bf68e92c9d5e96bff8","observation_id":"562aa024-58df-464a-823f-066859c496f7","resolution":{"observed_at":"2026-05-21T13:00:09.958097Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":"2511.14759","doi":"10.15607/rss.2025.xxi.128","metadata_source":"pith","pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","venue":"cs.LG","work_id":"7c1b3355-694a-44c6-880f-631e897e1713","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:e6fc05f5411d5b3b689e5978a68106ea71466b82e268238f1dd03467aedb6aac","observation_id":"fb9fa478-13d0-4ec9-b9ca-ca2f7c7e2e85","resolution":{"observed_at":"2026-05-21T13:00:09.863649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.689903Z","title":"Emergence of human to robot transfer in vision-language-action models.arXiv preprint arXiv:2512.22414","venue":null,"work_id":"88fc3778-faad-4626-887f-92a4c4e91800","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:aa25691317aaea1be15c8e34b80ba683af40111015f1c47f2b753527426e77ab","observation_id":"7feaa7fa-d48d-45e3-9943-bdf0ef59ee9e","resolution":{"observed_at":"2026-05-21T13:00:09.953953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-10T23:37:42.946293Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:6949c5e46fcb56e2c71d2ac3da57e41976e5ca77d337105f29e8991c62c6d743","observation_id":"a2995e19-b286-431b-8389-ed660c291555","resolution":{"observed_at":"2026-05-21T13:00:09.983615Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23944","last_updated":"2025-07-01T01:36:05Z","snapshot_observed_at":"2026-07-06T21:49:52.050980Z","submitted_at":"2025-06-30T15:09:14Z","title":"Adapt Your Body: Mitigating Proprioception Shifts in Imitation Learning","version":2},"cited_work":{"arxiv_id":"2506.23944","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23944","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not only rewards but also constraints: Applications on legged robot locomotion.TRO, 2024b","venue":null,"work_id":"932c94fa-42ff-4c76-90af-3cdf803ab087","year":null},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2506.23944","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:f406ee5d98ae95af7bf0d11bfe4b7691832359a950c520bef9759e4cff00f30a","observation_id":"553266e8-9b48-40fd-9460-5071d629a452","resolution":{"observed_at":"2026-05-21T13:00:09.927300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:7f15620a84ea46b2b6f871234b1cba2f7e95f3377639382ade7f703b2b172863","observation_id":"8624a883-38a4-4a8c-a3dc-56efec558575","resolution":{"observed_at":"2026-05-21T13:00:09.933214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19816","doi":"10.48550/arxiv.2506.19816","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling, October 2025","venue":null,"work_id":"98421727-12e6-4220-9a07-01a1e8870d40","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:1c8e965db6fff32ba53b2ed68f5e3c4ccd609910507327b89bf697dadcfc66ee","observation_id":"340d6e3b-10d0-4dff-936f-89ffa78a0dec","resolution":{"observed_at":"2026-05-21T13:00:09.788929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.00975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:37:14.373264Z","title":"Mm-act: Learn from multimodal parallel generation to act.arXiv preprint arXiv:2512.00975","venue":null,"work_id":"b37a5d83-6140-4b55-bc71-06ddd97ee274","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:38d18069a43cc8560039aeba1b74ccf7bb0ac9cc3ef5452155dcbfbb1816b3c8","observation_id":"a004a340-b210-4fa3-a532-5fd319d6f2b5","resolution":{"observed_at":"2026-05-21T13:00:09.897990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:552c1362a64bc3c0807a8a9b420b2b9a72902e8b016ec19e0267bb6958c98333","observation_id":"bb374873-0a04-4ebc-b858-0cd97984f424","resolution":{"observed_at":"2026-05-21T13:00:09.810733Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":"2509.06951","doi":"10.48550/arxiv.2509.06951","metadata_source":"pith","pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","venue":"cs.RO","work_id":"0557ae67-ef52-4cba-a579-208458bc2bbc","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:67601e23f25321153d1c208136e92bf1eb7814a945df3c1322ded2f7f55cacfe","observation_id":"10ea45f0-60d8-4f14-b5c3-0a5129e41dd5","resolution":{"observed_at":"2026-05-21T13:00:09.839448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":"2405.14093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-07-04T13:49:52.027583Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","venue":"cs.RO","work_id":"9492fb3d-d667-4892-81bb-b2878f12ff0c","year":2024},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:87395a157c5830f3551850d8a8842570a7fff99191236a7760c51950cfd235db","observation_id":"81c2b160-50b1-46f6-adb6-5307249002d5","resolution":{"observed_at":"2026-05-21T13:00:09.966662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":"2504.06256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-04T16:39:58.250680Z","title":"Transfer between Modalities with MetaQueries","venue":"cs.CV","work_id":"a89f31c1-6a3f-451e-9971-692c11219ea3","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:8534b96a86452b80bdc65c047c6c05bd5bd16dbd643dc270d6b0b9a4c85b7ce0","observation_id":"7f42c612-968c-4900-abd2-b075f39f4f38","resolution":{"observed_at":"2026-05-21T13:00:09.815233Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-10T11:47:02.947207Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:673a53b6423184e38a9092b4337bc904de8673840550a0fae1ea510c67db8d9a","observation_id":"c2198c2b-e888-4d1f-b497-b45c68da367f","resolution":{"observed_at":"2026-05-21T13:00:09.805192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:63e54af07bbdfb176eb2dfec5d9afdae364612f406a6ffcae1ed343e124bbf62","observation_id":"5e275428-fc9b-4194-94da-00872201c09d","resolution":{"observed_at":"2026-05-21T13:00:09.974891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-07-06T22:24:28.435288Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"cited_work":{"arxiv_id":"2509.04996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04996","snapshot_observed_at":"2026-07-04T13:09:50.096907Z","title":"E., Otto, F., and Lioutikov, R","venue":null,"work_id":"6e9d4312-6717-4e93-9f60-25ede1afe157","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2509.04996","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:67f284b9c05ca58efff34ccba35f526c16b528e8edde616369026d3e0fee6793","observation_id":"3e623b8b-dfec-4782-bb0b-0e1bece95321","resolution":{"observed_at":"2026-05-21T13:00:09.834452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2508.19236","doi":"10.48550/arxiv.2508.19236","metadata_source":"pith","pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-07-10T23:37:43.221441Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"921d4c77-1e8b-489d-987a-1c0c990e5ce8","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:1714ed8484e6c1a2bfde9ae3740942268a74ac495c3cd8d289397c8219473839","observation_id":"e4622c13-61b2-431f-a2fb-aa6d7df9ab69","resolution":{"observed_at":"2026-05-21T13:00:09.882340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":"2506.01844","doi":"10.48550/arxiv.2506.01844","metadata_source":"pith","pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","venue":"cs.LG","work_id":"0c5e9314-5fa7-4613-ad12-605a71d561d2","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:f23139fa8cebad2bce02cbeac0a0cd77c2712c956a7deb265fcec746ab4657af","observation_id":"f83a9739-9b9f-4adf-ae36-042adf8aab82","resolution":{"observed_at":"2026-05-21T13:00:09.892667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-07-10T23:07:47.582320Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:ab5f04728296337d66863b191c994a89b19ae73c952ea1c98aac397aa42378cd","observation_id":"fee226ad-4cf7-4ec4-8e05-8746dc4aae4d","resolution":{"observed_at":"2026-05-21T13:00:09.848903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:8b5cc8235e47af78bea289dd8718497f89f81b7b14d6f0a4d16b491e01897fe7","observation_id":"bb42da93-9506-4e30-bc3c-1fa1ea1ba714","resolution":{"observed_at":"2026-05-21T13:00:09.970523Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16756","last_updated":"2026-04-20T08:04:22Z","snapshot_observed_at":"2026-07-31T21:59:49.485724Z","submitted_at":"2025-10-19T08:45:46Z","title":"End-to-end Listen, Look, Speak and Act","version":2},"cited_work":{"arxiv_id":"2510.16756","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.16756","snapshot_observed_at":"2026-07-03T16:28:39.153832Z","title":"End-to-end Listen, Look, Speak and Act","venue":"cs.AI","work_id":"bd3a5f38-a332-4580-bbaf-fb457fe99b72","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2510.16756","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:77a5ad5efd0f1a3b4d71fb134ba841b71baf5382afecfda90d3f2efb612987b4","observation_id":"2d520977-76dd-4e28-b380-d883e3d437b3","resolution":{"observed_at":"2026-05-21T13:00:09.979464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24948","last_updated":"2026-04-27T05:41:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T15:45:19Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","version":6},"cited_work":{"arxiv_id":"2509.24948","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.24948","snapshot_observed_at":"2026-07-10T08:36:59.803669Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","venue":"cs.RO","work_id":"e43fb37f-61a0-4911-b5e5-880083d7aa30","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2509.24948","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:7c68c50661d16bf1e87941153fb29247fe8f8395da508dcc8e72c7941f62f168","observation_id":"71c88fad-a9b5-4a7f-b2be-7ada6c9808c1","resolution":{"observed_at":"2026-05-21T13:00:09.868211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.22242","doi":"10.48550/arxiv.2506.22242","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:37:43.033483Z","title":"4d-vla: Spatiotemporal vision-language-action pretraining with cross-scene calibration.arXiv preprint arXiv:2506.22242, 2025a","venue":null,"work_id":"3dffac62-c76b-4999-8a72-ea1206089f03","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:be0c075f22e4af2fef52f37f457ed65a1458d27aac649b359eee5d8c38977164","observation_id":"b231477a-b9f9-488e-a402-c4690cd96367","resolution":{"observed_at":"2026-05-21T13:00:09.795112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:16:29.409067Z","title":"Dreamvla: a vision-language-action model dreamed with comprehen- sive world knowledge","venue":null,"work_id":"3ca87b34-6674-47ef-8f34-9816d6a67535","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:89215db1e52358b0c9aab6824821ee223010b1ca2a29f35fd6e09d942eb0f0ac","observation_id":"bf431467-507b-4f2d-8d10-0212c85a8db3","resolution":{"observed_at":"2026-05-21T13:00:09.962649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.18269","doi":"10.48550/arxiv.2508.18269","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Flowvla: Visual chain of thought-based motion reason- ing for vision-language-action models.arXiv preprint arXiv:2508.18269","venue":null,"work_id":"150f4b95-df48-44ae-b5c1-8fb05782abc4","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:ae077e6d1ef73cddb122e488d39001508d35a8a85df13b65db3e326035d3c676","observation_id":"563fcdf1-8af8-4374-a347-18814a6f7153","resolution":{"observed_at":"2026-05-21T13:00:09.858979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"More Experimental Results A.1","venue":null,"work_id":"3c4b93f5-4a1a-4eb2-b77b-394ac4f5d035","year":2020},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:127ac60eee12e5c05fc047fe7de5c0cd3b2f2026442a932786b3a02c4a046e24","observation_id":"65c5a765-12b4-45d2-82a8-53d1723e8c90","resolution":{"observed_at":"2026-05-21T13:00:10.452298Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"primordial soup","venue":null,"work_id":"99324404-dda7-44cf-a834-84665a64a4d4","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:5eb5a2c3ce862ba023cbee059a3aad0c3f574d85508b6030fba39f627a2e558b","observation_id":"bc88e369-620b-4fa8-a040-c67ca39c56a0","resolution":{"observed_at":"2026-05-21T13:00:10.455299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":34,"verified_fuzzy":1},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 7 inbound Pith citation observations for arXiv:2602.18532."}