{"as_of":"2026-08-17T17:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad065d85718c0aa627f67a7f87c4b52636aee9e6dadbf00fab1a2d5d009f8d60","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T11:55:22.498055Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:36:25.569578Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18287","snapshot_observed_at":"2026-08-02T06:36:25.569578Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:25.569578Z"},"links":{"cited_paper":"/paper/2605.18287","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:1771f5d08134e3c3253468f8902260765dd5957ee0fd3740a294d8ba8371c384","observation_id":"b093e008-a336-4fdf-a256-0eca4df13610","resolution":{"observed_at":"2026-08-02T06:36:25.569578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.18287/citation-record","integrity":"/paper/2605.18287/integrity","json":"/paper/2605.18287/citation-record.json","paper":"/paper/2605.18287"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alemi, Ian Fischer, Joshua V","venue":null,"work_id":"0225c323-ae7f-4ed5-906b-5ea881f73c38","year":2017},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:1264335e4ac472c5b7a5d3f49606fa9839333bea8aee4df6a08ea790fe17546b","observation_id":"71955047-ede7-418f-956f-a69f5c026ee9","resolution":{"observed_at":"2026-05-20T12:03:27.728305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xcit: Cross-covariance image transformers.Advances in neural information processing systems, 34:20014–20027","venue":null,"work_id":"9185b562-0f41-4bd1-b461-dc5e674c99b5","year":2021},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:41b9efc8c72fee734405d6e45c5d4854dadc3b24e0a32349508a3db1a3a2125f","observation_id":"2bd32c82-ab67-48d2-9d22-9f659fc72a3a","resolution":{"observed_at":"2026-05-20T12:03:27.731673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:bce7d64864d2a1f54e265854f1d3aeafb8da8fbc70d6b67b04e9458955681c83","observation_id":"a9f5a82e-6a2f-48b0-85f9-800bac36a3fa","resolution":{"observed_at":"2026-05-20T11:58:15.173382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are transformers more robust than cnns?Advances in neural information processing systems, 34:26831–26843","venue":null,"work_id":"3df38c1d-50bb-4c21-87e8-ccf37ba829b0","year":2021},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:17de4d014cbe195ed85614174678d9f41bd67123a83e7466e8089fd684726acd","observation_id":"990407d1-578f-47a0-b539-3a5d27f4b93c","resolution":{"observed_at":"2026-05-20T12:03:27.724628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:3a65ae3cbf64ad7bfc768140c9c93fb7b8e582058ffaeb2c884d60021c046918","observation_id":"b609cd65-b15f-420e-9a44-2b69ee6d4d8b","resolution":{"observed_at":"2026-05-20T11:58:15.170126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:3d5b699366ce6d3de11e851b7bc1b94c759be57cd9eae43bce3288da0ba31e38","observation_id":"7196ccb4-1309-43c6-aaeb-01500c19e9a0","resolution":{"observed_at":"2026-05-20T11:58:15.167091Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":"578e3b02-0ee1-4cc8-ae3c-0557a0c0239d","year":2023},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:1483a0dc1cefa66a1ba5ce7c7048c8da2cac3ac35421dee760fbcf3d48a8a6d5","observation_id":"b062f4f4-2fce-4efa-b160-99257e6a74f8","resolution":{"observed_at":"2026-05-20T12:03:27.729946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:dcad1b59094a32d8caf2ac16258c3772e2c702ebe65a02067da6cda5002894c7","observation_id":"83284948-60d4-42c9-afb4-05b04ec0c156","resolution":{"observed_at":"2026-05-20T11:58:14.767994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.Int","venue":null,"work_id":"3f431b59-3f0f-4134-8292-e45e24d3ac23","year":null},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:4d02070c1506183c43bb9ac9da83a4d8f91761a6c9d4b2eb1cd47a4bc1f2ade7","observation_id":"def13f74-7889-4b80-ab98-f879149070ef","resolution":{"observed_at":"2026-05-20T12:03:27.702961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/02783649241273668","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":"The International Journal of Robotics Research","work_id":"f2220fd3-fb51-4877-b1c1-4f84ab108350","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:b55b8e4c8b0d3e3db750567ca3b2fb13dda1bdc3257c4205bec0cdbcaf18b58c","observation_id":"8b9209b9-5132-494c-a73d-edfbdafb69b2","resolution":{"observed_at":"2026-05-20T11:58:14.764574Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-10T23:38:07.101306+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T23:38:07.101306+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:4514b138a58ffbd5c5bfffa51aa41966cf771017bf8798493903fcc9c31f7dac","observation_id":"0940166a-f009-43ac-9f27-e08f3ed23227","resolution":{"observed_at":"2026-05-20T11:58:15.136560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agibot world colosseum","venue":null,"work_id":"ffb4ed00-4ff2-455c-a792-1e6cac6a026c","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:862db71c81b1f74b70f8bbf2ef333b33567c135516efd4da83a551affc229bf8","observation_id":"5ff1fa70-643a-49e0-970b-a18c124ef4ab","resolution":{"observed_at":"2026-05-20T12:03:27.735442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06747","last_updated":"2026-05-07T15:21:58Z","snapshot_observed_at":"2026-08-09T19:59:54.117138Z","submitted_at":"2026-05-07T15:21:58Z","title":"HumanNet: Scaling Human-centric Video Learning to One Million Hours","version":1},"cited_work":{"arxiv_id":"2605.06747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06747","snapshot_observed_at":"2026-07-04T03:39:29.664308Z","title":"HumanNet: Scaling Human-centric Video Learning to One Million Hours","venue":"cs.CV","work_id":"bd051cae-94ba-4301-b5a2-064abd2705af","year":2026},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2605.06747","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:ad405e206599c31fda266e49184b0c7ca98c1a3fb0836b5500fd1e82be772b1d","observation_id":"55cbf250-217c-4f5e-a8bd-bf7bbea6cd76","resolution":{"observed_at":"2026-05-20T11:58:15.164341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.15282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:59:33.795509Z","title":"Rethinking video generation model for the embodied world","venue":null,"work_id":"8dcfb26c-703c-455b-9967-9d9a3c28f0ad","year":2026},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:38815154e5358359b5355fa7648bceae72bfa123fda27f11e493ed7d044c4e03","observation_id":"8817eccc-c6f2-434a-8879-e4e51139355b","resolution":{"observed_at":"2026-05-20T11:58:15.161652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling cross-embodied learning: One policy for manipulation, navigation, locomotion and aviation","venue":null,"work_id":"11a84aae-9fdd-4a11-9dbb-d07cba9a6ec5","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:9c3b5de40378a2dbf1d0141cab2a8ebd44086601060b391237f0027987a8a231","observation_id":"89d890d8-b207-4627-b537-23a5b88b1dde","resolution":{"observed_at":"2026-05-20T12:03:27.733401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17141","last_updated":"2025-07-23T02:23:41Z","snapshot_observed_at":"2026-08-17T15:59:46.475463Z","submitted_at":"2025-07-23T02:23:41Z","title":"Towards Human-level Intelligence via Human-like Whole-Body Manipulation","version":1},"cited_work":{"arxiv_id":"2507.17141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17141","snapshot_observed_at":"2026-07-03T12:08:06.368037Z","title":"Towards human-level intelligence via human-like whole-body manipulation","venue":null,"work_id":"772b4eb9-58fe-4cac-a54c-8d29b902f305","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2507.17141","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:e0edf11262838453233d82e56bf21538de3846ae3ae5a37a8c03088981262163","observation_id":"a96f9eb6-5bc2-4696-b900-3453c0c8184b","resolution":{"observed_at":"2026-05-20T11:58:15.142464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.263685Z","title":"Benchmarking neural network robustness to common corruptions and perturbations.Proceedings of the International Conference on Learning Representations","venue":null,"work_id":"b4ef039b-f6bb-4258-af64-a0c0918aaedb","year":2019},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:56dc4abe49e6efc256724b66bd11735bc907bfcc4afa0a3305f08152d0c551b5","observation_id":"299f678f-ce8d-46fa-9016-45b0968d7cd7","resolution":{"observed_at":"2026-05-20T12:03:27.722916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization.ICCV","venue":null,"work_id":"fd231f73-faff-4063-8c5f-eedf72952229","year":2021},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:692477fb78995f96c2a7be9ac277874444b1897b34aba119d536659546141ded","observation_id":"021fbe9e-c686-46ca-8a01-21c98422625a","resolution":{"observed_at":"2026-05-20T12:03:27.717307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9511c2f4-adde-48a8-8fa4-9b9566ca8a07","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:7edc65aa2d135ba039f81ce3d9e405790f19af9fc19a156c568c729f3e86ea19","observation_id":"d4c71e2a-bc5d-467e-b756-89ca0afdf78e","resolution":{"observed_at":"2026-05-20T12:03:27.711354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"14e9e854-77cc-4f15-a392-175bee65d992","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:49a52a09e31b8a099c47b68348accbb27c6f84f5e27ea16654aa84a6a1cd92ab","observation_id":"614019a5-b697-4576-ae34-13d21013dd75","resolution":{"observed_at":"2026-05-20T12:03:27.737307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sanketi, Archit Sharma, Cody Simpson, Quan Vuong, Homer Rich Walke, Blake Wulfe, Ted Xiao, Jonathan Heewon Yang, Arefeh Yavary, Tony Z","venue":null,"work_id":"193fb979-5cae-4ff8-a64b-259a97689e8d","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:53818999335022d6ed041315787ac99db0e8b43ee772e10f7468f33d59acd510","observation_id":"b573aaef-d014-405b-a7f7-d410ffc5e92c","resolution":{"observed_at":"2026-05-20T12:03:27.685461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2024.xx.120","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://doi.org/10.15607/RSS.2024.XX.120","venue":null,"work_id":"975b2832-68f4-4b30-83de-f9cae34622a3","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:d859bb7dad47c2cc10ca3a10d1c19b5251e5cd2b7e92679028fa0a4f68f3ef49","observation_id":"d6bb89dc-c2e5-43a6-83b9-8ac0c8c8c214","resolution":{"observed_at":"2026-05-20T11:58:14.770581Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-14T05:49:52.851821+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T05:49:52.851821+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sanketi, Quan Vuong, Thomas Kollar, Benjamin Burchfiel, Russ Tedrake, Dorsa Sadigh, Sergey Levine, Percy Liang, and Chelsea Finn","venue":null,"work_id":"1408d120-f834-4c55-9121-338f09615051","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:1509c0dcf41b8669a862a12e10a406a3ed1968650bc38384508c385ee6ddb543","observation_id":"33ad01ef-49d9-4f57-9795-74514f67d4d5","resolution":{"observed_at":"2026-05-20T12:03:27.701892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.CoRR","venue":null,"work_id":"d1df2c04-a89d-4c37-ba1a-4ace6e648d41","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:40780f33c721956ca73196097b3ab38c4b953d205766f454e5fc7dc67e238d35","observation_id":"797c3b15-6fc1-4ef6-9736-40169f9cef1d","resolution":{"observed_at":"2026-05-20T12:03:27.704770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:fda28b072f9bdfb26217adef0e24038c1960c375d8f6f54f51ec3b02fe1d0319","observation_id":"7fcc94fd-64f8-4210-be26-44d7d2cb0665","resolution":{"observed_at":"2026-05-20T11:58:15.139418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roboflamingo-plus: Fusion of depth and RGB perception with vision-language models for enhanced robotic manipulation","venue":null,"work_id":"a8f0a101-7366-41d8-90f6-ec77f9e81bc4","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:bab270b2004c42644b47ba527045213907c5c669d2955f3067655fba974e7dbc","observation_id":"190ca374-309c-4295-93ea-5713c30979c9","resolution":{"observed_at":"2026-05-20T12:03:27.719273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5431.2025","doi":"10.1109/rcar65431.2025.11139480","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.1109/RCAR65431.2025.11139480","venue":null,"work_id":"a36941ea-ea48-4216-88ed-99a1325f7641","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:dfa8a6981808fd7e212e1a9ccf0d92e0c5c272888af48f65d03e5c38a7acbc2c","observation_id":"afa9f423-e9a9-4b0f-b92c-148ece0f333c","resolution":{"observed_at":"2026-05-20T11:58:14.773798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:06.522456+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:06.522456+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.692988Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791","venue":null,"work_id":"82433860-48a4-470f-a777-2da161172669","year":2023},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:965c280c49a3da20521da21e3a9a3dadee651748dc24583eae290040d3c5edfe","observation_id":"a2a1bb2f-64d7-4887-a4d1-2002365afd76","resolution":{"observed_at":"2026-05-20T12:03:27.693277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.690179Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"115823a2-8918-4227-8872-3d0a36ff07a9","year":2023},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:7b5c64baeb9d3ce47583632188d70ec24dd6a8cb37d07632b5e17e41adea06ad","observation_id":"e9e2ed33-0cb6-48a2-824c-2ea7970899d5","resolution":{"observed_at":"2026-05-20T12:03:27.710680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:4ff6bcf01e450ebd062d36cb9f001181448d7a93b2b20e2b1ef398e0b3060997","observation_id":"827d637a-0d04-46af-bae8-fcc3215e2e08","resolution":{"observed_at":"2026-05-20T11:58:15.155933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot manipulation tasks.IEEE Robotics and Automation Letters (RA-L), 7(3):7327–7334","venue":null,"work_id":"f59ae293-c6e4-4fca-89a0-cb668376a174","year":2022},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:7003ad9054f4ca2b5277c5da9a325d693cc3cce1364a1f10e578ef89b48d0aa3","observation_id":"8155be90-5482-4f7f-81e0-1ac3dbb37368","resolution":{"observed_at":"2026-05-20T12:03:27.713207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.07484","last_updated":"2020-03-31T08:42:46Z","snapshot_observed_at":"2026-08-14T16:05:08.033414Z","submitted_at":"2019-07-17T12:51:10Z","title":"Benchmarking Robustness in Object Detection: Autonomous Driving when Winter is Coming","version":2},"cited_work":{"arxiv_id":"1907.07484","doi":"10.48550/arxiv.1907.07484","metadata_source":"arxiv_reference","pith_arxiv_id":"1907.07484","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking ro- bustness in object detection: Autonomous driving when win- ter is coming","venue":"arXiv (Cornell University)","work_id":"76047635-3cff-471d-94fe-7967d0b4d99e","year":1907},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/1907.07484","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:081fd09007d3a61e2cc0bb13aff6bbfd1746942dff8f95ce3023ffb63c767b21","observation_id":"4be2b843-fac8-423e-b9ec-575d02854d37","resolution":{"observed_at":"2026-05-20T11:58:15.147995Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robotwin: Dual-arm robot benchmark with generative digital twins (early version)","venue":null,"work_id":"07809f99-b1b1-4921-bb1c-f0b0de44e280","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:2daac19a0d345588d94577ae28559bc563830afcf086af658e315cc9b92dff65","observation_id":"79fed709-a4b7-4c5e-91f6-2d306b465f78","resolution":{"observed_at":"2026-05-20T12:03:27.708820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models : Open x-embodiment collaboration","venue":null,"work_id":"9d10ee9b-471f-4b91-95a0-3c4a61fafdd4","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:a3ef23ff2a476a914622b5e5d06e113dd45227353d245f69a61d80abdd833656","observation_id":"deebf55b-fe7f-4d3f-bcac-cad89a71ba21","resolution":{"observed_at":"2026-05-20T12:03:27.712459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:0c129499551e5010ab50d15c70ba6bd0f119b384996a51ff3eb67c2ca25fdaed","observation_id":"8ae8652a-4947-44bc-8b87-8e5007b23ff7","resolution":{"observed_at":"2026-05-20T11:58:15.158759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision transformers are robust learners","venue":null,"work_id":"c0381ba0-8203-44e5-9811-a156e24254a3","year":2071},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:0445b93c83f163405e02cb578b222f83584b751a32ba451e258e70af2f98921c","observation_id":"020750e1-701d-497e-87a9-439dadb69b65","resolution":{"observed_at":"2026-05-20T12:03:27.726701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:7d2eec949a196bf69e148857f338dd6e3614e92b075fd40e99a673670ad5c357","observation_id":"8d3e5c2c-bc1a-4027-aeb8-ce257eefd99b","resolution":{"observed_at":"2026-05-20T11:58:15.153259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-16T09:10:10.815975Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":"physics/0004057","doi":"10.48550/arxiv.physics/0004057","metadata_source":"pith","pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The information bottleneck method","venue":"physics.data-an","work_id":"72655a80-0724-45ad-a330-1f4ed7aa613b","year":2000},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:de956a111be00987c721c4b487c76088330af9ec2bbca2d87d9ae38145e98a45","observation_id":"2a766d65-3d94-4b58-846a-8adf51c5bbcc","resolution":{"observed_at":"2026-05-20T11:58:15.133169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:06.793856+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:06.793856+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":"e0a32984-172f-44b5-b6af-ca4f2d74a1c6","year":2017},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:6a736d7c486cfb508b91f5c80a5f2f4d45d0a33e11dad80431299f06484802e7","observation_id":"8fdfb1a7-bafc-4a86-8e06-3b23f2bc4379","resolution":{"observed_at":"2026-05-20T12:03:27.720017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Augmax: Adversarial composition of random augmentations for robust training","venue":null,"work_id":"77793369-f7b7-46af-8652-cdf8bf9a93e3","year":2021},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:714613eddf532d545696b3ce55d5fbdc868a21b9d1981f7bb19c8cb73c8fb77b","observation_id":"0dc466fe-cffc-463a-96b4-5fd8c49b9121","resolution":{"observed_at":"2026-05-20T12:03:27.718175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vla-adapter: An effective paradigm for tiny-scale vision-language-action model.CoRR","venue":null,"work_id":"78da01b7-9c5f-4a88-894c-8f87e4f6f6b5","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:fc9cfd0906f01075ec1d9d79ed4a7672a06686269f8bd3e5979effb1942c5ee1","observation_id":"ce59cd29-1508-41e0-8a3e-a87b748766a5","resolution":{"observed_at":"2026-05-20T12:03:27.694893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:7ca486e6448c694eb6b72d63c082b9f636691350792d2a9670be917c14ffca59","observation_id":"5598384f-0e68-44ba-856f-3f83ebada8ea","resolution":{"observed_at":"2026-05-20T11:58:15.145375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":"9a2d8864-5908-4117-9509-19eddcc3f757","year":2024},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:0873c080e00f59eac5ea335054e0dbb181073778a1519cc84610d04b93f97852","observation_id":"66ab4261-8476-4cc3-8f93-abdc1f35d5ed","resolution":{"observed_at":"2026-05-20T12:03:27.695629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:12:38.217835Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"7d49d7f8-2cb8-4e91-8b78-0753271fb6a2","year":2023},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:acd392a54647caccffeff7d9d76afd9138de6407164c6e52335ec0d7cc7f9e3c","observation_id":"3768ab48-191b-4ac6-ab30-a3e3e200378e","resolution":{"observed_at":"2026-05-20T12:03:27.721055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2023.xix.016","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":null,"work_id":"21c72e60-7b0d-4b8b-a3d2-dcb077b14621","year":2023},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:7dd8b1b9c946610e34847348aa8f3b57af1d15fd02cd4db542b0782a02cc25fc","observation_id":"d136d2bd-3abc-4304-ae0c-5f63586de58e","resolution":{"observed_at":"2026-05-20T11:58:14.776025Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:20:20.028931+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:20:20.028931+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding the robustness in vision transformers","venue":null,"work_id":"33a458d6-992f-441e-b896-6adfb3f1e1e2","year":2022},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:c76379d7781a4e96b84803fe15686762c847ceb584de3bbc7658853ec3ddf81c","observation_id":"8ee54499-56bf-4f3c-9546-7c808168c652","resolution":{"observed_at":"2026-05-20T12:03:27.698339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:91bd2f09ba4933e07cf6de69c79db19729a8873f5c2f7fc9819f9f8c8f3540bc","observation_id":"3abfb6fc-90ee-4478-9f25-e4de7e526630","resolution":{"observed_at":"2026-05-20T11:58:15.150672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"772222bc-bccc-4e43-a048-d53a2b763235","year":2023},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:40f259471d0258b9fe24f9ff9c085d596dc9e2d9d56f80c80a84fe0a3e97d0f7","observation_id":"325e311d-d63c-49d2-8e8d-b8a322ccdeef","resolution":{"observed_at":"2026-05-20T12:03:27.707725Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc03b43d-a85e-433f-8414-238deee40d12","year":null},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:6ee3f98aa11376448c756e6e07f4301873f541b5557b6fcb2a36eab21e8ffa80","observation_id":"904c6979-8470-4e34-8079-cf713816dfbb","resolution":{"observed_at":"2026-05-20T12:03:27.705530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dd4c7bde-4f69-4195-be75-bac00eac57a6","year":null},"citing_paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T11:55:22.498055Z"},"links":{"citing_paper":"/paper/2605.18287"},"observation_digest":"sha256:5496e9a999ce109ebcba75e0700b401da3d429b5182eaff556dd5af028cb22e7","observation_id":"3b5363f7-b54c-487e-87fb-9c43a9713948","resolution":{"observed_at":"2026-05-20T12:03:27.689625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18287","last_updated":"2026-05-18T12:15:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:05:43.139708Z","submitted_at":"2026-05-18T12:15:16Z","title":"StableVLA: Towards Robust Vision-Language-Action Models without Extra Data"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":3,"verified_exact":16,"verified_fuzzy":26},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2605.18287."}