{"as_of":"2026-08-13T23:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8043c24b857c111f6f0b47bf55d33f66e52f52084d27896a7d9e4551dfb2452e","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:58:38.554805Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T11:18:08.362562Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:19:48.867283Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"cited_work":{"arxiv_id":"2510.00037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00037","snapshot_observed_at":"2026-07-21T02:20:31.091014Z","title":"On robustness of Vision-Language-Action model against multi-modal perturbations","venue":null,"work_id":"2ba86e3b-b861-4b37-83db-927d3d13ad76","year":2025},"citing_paper":{"arxiv_id":"2604.10055","last_updated":"2026-08-07T02:59:21Z","snapshot_observed_at":"2026-08-12T23:09:41.124808Z","submitted_at":"2026-04-11T06:37:47Z","title":"STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:33:16.554905Z"},"links":{"cited_paper":"/paper/2510.00037","citing_paper":"/paper/2604.10055"},"observation_digest":"sha256:e0a48454ef6d25aeed64a4850335a5de95bd7d6294d69ea4c7f69b46404110aa","observation_id":"41a02e7a-a149-45f3-9f0c-e1abf2527fb8","resolution":{"observed_at":"2026-07-21T02:20:31.091014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"cited_work":{"arxiv_id":"2510.00037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00037","snapshot_observed_at":"2026-07-21T02:20:31.091014Z","title":"On robustness of Vision-Language-Action model against multi-modal perturbations","venue":null,"work_id":"2ba86e3b-b861-4b37-83db-927d3d13ad76","year":2025},"citing_paper":{"arxiv_id":"2605.06481","last_updated":"2026-05-07T16:06:08Z","snapshot_observed_at":"2026-08-11T07:38:44.239882Z","submitted_at":"2026-05-07T16:06:08Z","title":"OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T08:52:07.545191Z"},"links":{"cited_paper":"/paper/2510.00037","citing_paper":"/paper/2605.06481"},"observation_digest":"sha256:fb3d7abe9b43a7c695d67fd7d117f6832b80bc81730c84a9bf76e000db29e990","observation_id":"a6ec3215-5d58-4e78-96af-43ee881f117a","resolution":{"observed_at":"2026-07-21T02:20:31.091014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"cited_work":{"arxiv_id":"2510.00037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00037","snapshot_observed_at":"2026-07-21T02:20:31.091014Z","title":"On robustness of Vision-Language-Action model against multi-modal perturbations","venue":null,"work_id":"2ba86e3b-b861-4b37-83db-927d3d13ad76","year":2025},"citing_paper":{"arxiv_id":"2605.26627","last_updated":"2026-06-29T01:38:50Z","snapshot_observed_at":"2026-08-13T23:07:56.702703Z","submitted_at":"2026-05-26T07:03:26Z","title":"Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T16:08:23.588699Z"},"links":{"cited_paper":"/paper/2510.00037","citing_paper":"/paper/2605.26627"},"observation_digest":"sha256:14e97def79ee6947deb1a8799bf7de1515d83f94183807e534ab17d3dce571d7","observation_id":"0f2b45cd-7d25-4d2a-9543-c7061f181417","resolution":{"observed_at":"2026-07-21T02:20:31.091014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"cited_work":{"arxiv_id":"2510.00037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00037","snapshot_observed_at":"2026-07-21T02:20:31.091014Z","title":"On robustness of Vision-Language-Action model against multi-modal perturbations","venue":null,"work_id":"2ba86e3b-b861-4b37-83db-927d3d13ad76","year":2025},"citing_paper":{"arxiv_id":"2605.26627","last_updated":"2026-06-29T01:38:50Z","snapshot_observed_at":"2026-08-13T23:07:56.702703Z","submitted_at":"2026-05-26T07:03:26Z","title":"Breaking the Epistemic Trap: Active Perception Under Compound Uncertainty","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T11:18:08.362562Z"},"links":{"cited_paper":"/paper/2510.00037","citing_paper":"/paper/2605.26627"},"observation_digest":"sha256:3fe1149e2be1c6784efc2ed52670b07c1dbfea70d7395747ecbc77130752f90d","observation_id":"3d81e558-2497-4c19-9d29-0fa4eff0c2eb","resolution":{"observed_at":"2026-07-21T02:20:31.091014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"cited_work":{"arxiv_id":"2510.00037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00037","snapshot_observed_at":"2026-07-21T02:20:31.091014Z","title":"On robustness of Vision-Language-Action model against multi-modal perturbations","venue":null,"work_id":"2ba86e3b-b861-4b37-83db-927d3d13ad76","year":2025},"citing_paper":{"arxiv_id":"2605.28726","last_updated":"2026-05-27T16:44:55Z","snapshot_observed_at":"2026-08-12T12:36:18.915566Z","submitted_at":"2026-05-27T16:44:55Z","title":"How VLAs Fail Differently: Black-Box Action Monitoring Reveals Architecture-Specific Failure Signatures","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T11:40:15.064339Z"},"links":{"cited_paper":"/paper/2510.00037","citing_paper":"/paper/2605.28726"},"observation_digest":"sha256:4589ee3762a39eda6aa5de210b3c155a1924e2bbadae849f97e681c2689f1081","observation_id":"94ea7ac5-e1cd-45b5-869b-65289d836159","resolution":{"observed_at":"2026-07-21T02:20:31.091014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"cited_work":{"arxiv_id":"2510.00037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00037","snapshot_observed_at":"2026-07-21T02:20:31.091014Z","title":"On robustness of Vision-Language-Action model against multi-modal perturbations","venue":null,"work_id":"2ba86e3b-b861-4b37-83db-927d3d13ad76","year":2025},"citing_paper":{"arxiv_id":"2606.12366","last_updated":"2026-06-10T17:34:25Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:34:25Z","title":"APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T09:49:56.894300Z"},"links":{"cited_paper":"/paper/2510.00037","citing_paper":"/paper/2606.12366"},"observation_digest":"sha256:d01056000c014f54f7d8ed0f4382e359c60bd23f227558c787b8e11f6cb9fcb6","observation_id":"5a1d6dc5-1b70-4d21-a5e9-bf1e01fe7688","resolution":{"observed_at":"2026-07-21T02:20:31.091014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"cited_work":{"arxiv_id":"2510.00037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00037","snapshot_observed_at":"2026-07-21T02:20:31.091014Z","title":"On robustness of Vision-Language-Action model against multi-modal perturbations","venue":null,"work_id":"2ba86e3b-b861-4b37-83db-927d3d13ad76","year":2025},"citing_paper":{"arxiv_id":"2606.23641","last_updated":"2026-06-22T17:30:29Z","snapshot_observed_at":"2026-07-06T23:58:20.975630Z","submitted_at":"2026-06-22T17:30:29Z","title":"Flatness Preserves Instruction Following in Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T08:06:36.393665Z"},"links":{"cited_paper":"/paper/2510.00037","citing_paper":"/paper/2606.23641"},"observation_digest":"sha256:fcd456471c4f394bf5cae5c045d64be8d22a79479ea2ba3b7206560a1be8e50f","observation_id":"321c6bde-b5df-4f2e-bc80-b8572ddd5ba8","resolution":{"observed_at":"2026-07-21T02:20:31.091014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"cited_work":{"arxiv_id":"2510.00037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00037","snapshot_observed_at":"2026-07-21T02:20:31.091014Z","title":"On robustness of Vision-Language-Action model against multi-modal perturbations","venue":null,"work_id":"2ba86e3b-b861-4b37-83db-927d3d13ad76","year":2025},"citing_paper":{"arxiv_id":"2606.30613","last_updated":"2026-06-29T17:48:01Z","snapshot_observed_at":"2026-07-07T00:04:25.385438Z","submitted_at":"2026-06-29T17:48:01Z","title":"Sequential Planning via Anchored Robotic Keypoints","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T04:59:12.363425Z"},"links":{"cited_paper":"/paper/2510.00037","citing_paper":"/paper/2606.30613"},"observation_digest":"sha256:78ce57af11512b33a2a3966f34e3e9af6e328d70dfec93f3b6fc3b211d561910","observation_id":"bcfa979a-1433-48c1-ac78-9dade9708810","resolution":{"observed_at":"2026-07-21T02:20:31.091014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.00037/citation-record","integrity":"/paper/2510.00037/integrity","json":"/paper/2510.00037/citation-record.json","paper":"/paper/2510.00037"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.08746","last_updated":"2023-10-12T22:19:36Z","snapshot_observed_at":"2026-08-13T05:50:14.335589Z","submitted_at":"2023-10-12T22:19:36Z","title":"Robustness to Multi-Modal Environment Uncertainty in MARL using Curriculum Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08746","snapshot_observed_at":"2026-08-04T14:58:36.376470Z","title":"Robustness to multi-modal environment uncertainty in marl using curriculum learning.arXiv preprint arXiv:2310.08746,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:36.376470Z"},"links":{"cited_paper":"/paper/2310.08746","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:76a1508cf0e2c00f6a96b2357037ede50234eaf9847b522a2f6ccb717dbecde2","observation_id":"93d059bf-220b-455a-8068-86b1ca67a759","resolution":{"observed_at":"2026-08-04T14:58:36.376470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-04T14:58:37.024872Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:37.024872Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:09cb44059dc31e106a7e40f117fb1da650f5f42fb70ef111ea4b27999b8ffe75","observation_id":"13b5c165-cb7a-43c6-9a7c-9599299a8a2e","resolution":{"observed_at":"2026-08-04T14:58:37.024872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-04T14:58:37.250038Z","title":"Towards deep learning models resistant to adversarial attacks.arXiv preprint arXiv:1706.06083,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:37.250038Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:3f1deeb2f650e8b7e5f1ddba08c33e8b6c4946b6527847c656502a6e3b55d80a","observation_id":"aed448bd-e510-4354-be6d-baa4945462da","resolution":{"observed_at":"2026-08-04T14:58:37.250038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T14:58:37.522955Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:37.522955Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:e3d8d3b8fe1134c139dfc1b572ffa75bd6c5e282fc7192a16bca606a50dfe193","observation_id":"0de6fb67-aa8b-45f4-8da8-a62bb926f755","resolution":{"observed_at":"2026-08-04T14:58:37.522955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-04T14:58:37.704747Z","title":"Spatialvla: Exploring spatial representations for visual-language- action model.arXiv preprint arXiv:2501.15830,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:37.704747Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:4e4cacfd10baac1e200ffa1f6687461426cf9807ffd44b1ee74e28c398d2cba2","observation_id":"2d5cdbe7-f040-4892-af65-3a7cf7e363ea","resolution":{"observed_at":"2026-08-04T14:58:37.704747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:37.834746Z","title":"Vision-language-action models: Concepts, progress, applications and challenges.arXiv preprint arXiv:2505.04769,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:37.834746Z"},"links":{"citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:412b0f46af9d686cb810026fbd2312422ebe782f9fbf009c68160be8d8fc7817","observation_id":"7672aea4-10b7-4194-b65f-2e08c9250624","resolution":{"observed_at":"2026-08-04T14:58:37.834746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-04T14:58:37.974007Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:37.974007Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:2d87d69d061af78d6bfa8e0ef46f57c76fbf7637fea496e085f243053116f37b","observation_id":"528b7f4b-f742-4a42-be34-deed34c3db36","resolution":{"observed_at":"2026-08-04T14:58:37.974007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08452","last_updated":"2021-01-21T05:38:52Z","snapshot_observed_at":"2026-08-13T20:27:38.924770Z","submitted_at":"2021-01-21T05:38:52Z","title":"Robust Reinforcement Learning on State Observations with Learned Optimal Adversary","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08452","snapshot_observed_at":"2026-08-04T14:58:38.134753Z","title":"Robust reinforcement learning on state observations with learned optimal adversary.arXiv preprint arXiv:2101.08452,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:38.134753Z"},"links":{"cited_paper":"/paper/2101.08452","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:5223c7712f5ef368aa26505914cd0fc955b6940c8c732dd5ac19d264511fa205","observation_id":"4a1e4bdd-335c-4b95-8e03-7a2c428acd87","resolution":{"observed_at":"2026-08-04T14:58:38.134753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:38.554805Z","title":"In robustness against VLA input, we additionally use UCB algorithm to select the best perturbation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:38.554805Z"},"links":{"citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:00fd9ac66d0865f399634ed3176b52cb2698504fdfb497b7c49ecf2124d48b2f","observation_id":"07df484b-414d-4dc7-ab4c-71b1074eeebf","resolution":{"observed_at":"2026-08-04T14:58:38.554805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-04T14:58:36.452731Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:36.452731Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:2abf9c8d237fc9d8d51d38159dbaf9ea34fbbc0b7d51fbe496ac7a97acab0e0b","observation_id":"623bb6f6-37c1-47b5-8afd-102391bce1c6","resolution":{"observed_at":"2026-08-04T14:58:36.452731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07516","last_updated":"2020-02-11T10:23:02Z","snapshot_observed_at":"2026-07-06T08:01:06.889849Z","submitted_at":"2019-06-18T12:08:42Z","title":"Robust Reinforcement Learning for Continuous Control with Model Misspecification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07516","snapshot_observed_at":"2026-08-04T14:58:37.384743Z","title":"Robust reinforcement learning for continuous control with model misspecification.arXiv preprint arXiv:1906.07516,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:37.384743Z"},"links":{"cited_paper":"/paper/1906.07516","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:6dabc3e3f6472a149202669e628249630b812fa7fc972faa9830859466025527","observation_id":"a1ca3ec4-4b91-4633-a0fa-9f62958c0589","resolution":{"observed_at":"2026-08-04T14:58:37.384743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-04T14:58:36.912617Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:36.912617Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:c30de479964359ad277820ea0ae669e340198ab0056bbf69f903da0718963b0a","observation_id":"4bf2ccd7-86ba-40a2-9672-9a0f50fc6633","resolution":{"observed_at":"2026-08-04T14:58:36.912617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01925","snapshot_observed_at":"2026-08-04T14:58:38.253146Z","title":"A survey on vision-language-action models: An action tokenization perspective.arXiv preprint arXiv:2507.01925,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:38.253146Z"},"links":{"cited_paper":"/paper/2507.01925","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:d35e60ec535980e4950a66bb9ec34525bddf52c33defe1fc1e8ae46a5f0f6055","observation_id":"a8290e40-00db-4c03-a400-30c712074d45","resolution":{"observed_at":"2026-08-04T14:58:38.253146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06257","last_updated":"2022-05-05T17:01:45Z","snapshot_observed_at":"2026-08-13T20:00:21.472401Z","submitted_at":"2021-03-10T18:45:48Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06257","snapshot_observed_at":"2026-08-04T14:58:36.682378Z","title":"Maximum entropy rl (provably) solves some robust rl problems.arXiv preprint arXiv:2103.06257,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:36.682378Z"},"links":{"cited_paper":"/paper/2103.06257","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:dc72a0ebf8818e855aed546172ee28581cd4f860ea61eec45307aa7e9e319616","observation_id":"4a3fec9a-378b-4b3f-a59a-966e6d35fca0","resolution":{"observed_at":"2026-08-04T14:58:36.682378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-07T23:47:17.083775Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-04T14:58:37.144747Z","title":"Rectified flow: A marginal preserving approach to optimal transport.arXiv preprint arXiv:2209.14577,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:37.144747Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:e40d56e2036de6d6f55c9cace82c70d546164d5c4c91589035745e6413327869","observation_id":"43db3ebd-a31d-4ac1-b4c1-fd96d6a97837","resolution":{"observed_at":"2026-08-04T14:58:37.144747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-04T14:58:36.544334Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:36.544334Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:10d2faa06769587ef12a6d2688e4fb9329bf066e9c932a706142eba96b62de98","observation_id":"368931d7-7fb9-48d5-a52f-578c8297282d","resolution":{"observed_at":"2026-08-04T14:58:36.544334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T14:58:36.786424Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:36.786424Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:b75930242c957fc4be51253a5c5fdc8061c08bc491d66b74af7757ac8ec6d83d","observation_id":"54cacf35-c3c2-465d-a4e0-e4b79061e6bc","resolution":{"observed_at":"2026-08-04T14:58:36.786424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","latest_version":6,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:56:29.076727Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 8 inbound Pith citation observations for arXiv:2510.00037."}