{"as_of":"2026-08-07T07:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a266154bf849774f9a302e5ac5ee5e620977d19c68d1a17590aa36d4ee90f3af","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:42:22.491193Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T15:05:47.993970Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2408.01129","last_updated":"2026-04-06T02:10:55Z","snapshot_observed_at":"2026-07-30T06:31:55.204130Z","submitted_at":"2024-08-02T09:18:41Z","title":"A Survey of Mamba","version":8},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-23T22:09:19.917854Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2408.01129"},"observation_digest":"sha256:34ea659c9d807b1771aa41a351d2cd040b93ffceff432f3f3ed783a09aca3e96","observation_id":"02702282-2022-4da4-96d1-3542817a2aa2","resolution":{"observed_at":"2026-05-23T22:13:30.932811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:318f9213069f98be3b5011b1aa156491919e613381ebb23303b0a07846606540","observation_id":"290b5786-1f73-4067-a976-d11cdcb7f124","resolution":{"observed_at":"2026-05-17T21:37:50.751231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:aec53ce5582602ad32e2d2869af09fd63e11c04371914eb9e868038c90eed7a6","observation_id":"2363350b-bbe2-4354-b5c1-d3eb7f646721","resolution":{"observed_at":"2026-05-15T22:00:48.981558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-07T04:42:22.491193Z","title":"Robomamba: Efficient vision-language-action model for robotic reasoning and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-07T04:32:36.648201Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.491193Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:528fa7ea2b6ca260ec98dec072ae02574d8ce5c5e074c393534cc721744bac32","observation_id":"4028d45d-1f3b-4f46-8544-e66684b8a3ec","resolution":{"observed_at":"2026-08-07T04:42:22.491193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-07T00:57:29.206479Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation.arXiv preprint arXiv:2406.04339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12374","last_updated":"2025-06-24T10:01:18Z","snapshot_observed_at":"2026-08-07T01:24:47.554909Z","submitted_at":"2025-06-14T07:11:44Z","title":"AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:29.206479Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2506.12374"},"observation_digest":"sha256:e1ef143521bc7dbb78b1c623454f56e0ce9b375a94c1056907f6350900a17da9","observation_id":"38cca183-d0f7-48ce-8f4d-94170850d9d4","resolution":{"observed_at":"2026-08-07T00:57:29.206479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-06T20:45:29.955616Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01961","last_updated":"2025-07-05T04:00:38Z","snapshot_observed_at":"2026-08-07T06:49:22.555930Z","submitted_at":"2025-07-02T17:59:54Z","title":"AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:29.955616Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2507.01961"},"observation_digest":"sha256:d7b9631e77c9e5b565721925a0ad03b5349ef1f91857d8ae45c241ccc14aefc9","observation_id":"4afea0c2-b45a-4512-ad4e-b59c05750672","resolution":{"observed_at":"2026-08-06T20:45:29.955616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-06T20:04:38.171370Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03930","last_updated":"2025-07-08T01:07:30Z","snapshot_observed_at":"2026-08-06T19:56:53.126988Z","submitted_at":"2025-07-05T07:29:37Z","title":"RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:38.171370Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2507.03930"},"observation_digest":"sha256:0c00e490dfabe815f8bdfd0eb572ddfafda49039c33a344f3162902f230de7af","observation_id":"09e0e0a6-017d-4cc1-ae66-daf950206a4f","resolution":{"observed_at":"2026-08-06T20:04:38.171370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-06T16:33:57.134511Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-06T16:22:14.738964Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.134511Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:bf9ea1944a5d91a9b4beef382fea073326e6ba97a4de80049dc02c50ac740ddf","observation_id":"c3e0b10e-500c-40ed-9d4b-64a657555ab4","resolution":{"observed_at":"2026-08-06T16:33:57.134511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-05T20:35:45.475365Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-05T20:35:42.234950Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:45.475365Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:37fcbe6a314b2cd828be88866fdd5ebd060e4b3a1878cc4c1cb7e94042668f3b","observation_id":"827e18ad-5ac8-4119-9e93-12a9df8da143","resolution":{"observed_at":"2026-08-05T20:35:45.475365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-05T20:38:42.321331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-05T20:38:36.897476Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:42.321331Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:35e023b3553e418b6438a98d5c22b31f1b4ae154ec78d5e7559aec36cf3d23e0","observation_id":"1272386a-855e-4b88-b10d-489b933db069","resolution":{"observed_at":"2026-08-05T20:38:42.321331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-05T14:42:32.706108Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation.arXiv preprint arXiv:2406.04339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.706108Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:83963f2909a86ec771b28cb4e2f69d1bdac9d25d10df8878db704f14f531a790","observation_id":"279c0bc5-afb6-48cf-adfa-27dc11b302c6","resolution":{"observed_at":"2026-08-05T14:42:32.706108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2603.17573","last_updated":"2026-04-27T12:41:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-18T10:25:08Z","title":"HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:50.963123Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2603.17573"},"observation_digest":"sha256:1801dd0bef65235abb986ec3abcab56c36f9ed23491cafe75d610e197127920b","observation_id":"232d7b16-fcef-45a4-8b47-f1d67965b293","resolution":{"observed_at":"2026-05-15T09:19:54.429268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2604.07935","last_updated":"2026-07-08T13:12:46Z","snapshot_observed_at":"2026-08-03T01:55:34.670351Z","submitted_at":"2026-04-09T07:55:03Z","title":"The Hyperscale Lottery: How State-Space Models Have Sacrificed Edge Efficiency","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:46:11.859634Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2604.07935"},"observation_digest":"sha256:92b72a0cdf3a53d0d6623e7796da5730bf0e3d0726ca7db3e80775d4969e182d","observation_id":"0d2c3558-3b71-41ab-8934-d827233a0666","resolution":{"observed_at":"2026-05-11T06:11:01.047812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2604.24447","last_updated":"2026-04-27T13:12:16Z","snapshot_observed_at":"2026-08-02T20:38:02.984524Z","submitted_at":"2026-04-27T13:12:16Z","title":"Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T03:04:46.460069Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2604.24447"},"observation_digest":"sha256:f76b5c51b7644531471a6644ba3d0122bf9e7dd814bb088274c86bad1bc11479","observation_id":"3deb1b49-17d2-4a9d-89ec-32c44af5808c","resolution":{"observed_at":"2026-05-11T22:16:52.201546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2605.07308","last_updated":"2026-05-18T04:08:11Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T06:17:08Z","title":"AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:24:34.761241Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2605.07308"},"observation_digest":"sha256:6fc680a5da91820eb4bc53ae65461501a4404a04e0f4946d7b826f8c247acb38","observation_id":"eb6e3af0-41c6-4784-a60f-2bba7d547084","resolution":{"observed_at":"2026-05-11T04:25:57.892889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2605.07308","last_updated":"2026-05-18T04:08:11Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T06:17:08Z","title":"AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T23:21:10.571364Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2605.07308"},"observation_digest":"sha256:0b3eee81aeb0a1784608eed28192e889eae521fe40e34480d2eb38287d2d7454","observation_id":"63dccea2-d187-4cec-b06b-c4ded16157da","resolution":{"observed_at":"2026-05-20T23:23:51.545108Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2605.21854","last_updated":"2026-06-06T09:58:33Z","snapshot_observed_at":"2026-08-02T07:58:30.433073Z","submitted_at":"2026-05-21T01:02:41Z","title":"CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T08:07:51.697353Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2605.21854"},"observation_digest":"sha256:99152b50da253c57b756006baa47c15a81471d162dbdd35c816ae2c8b8dd35e7","observation_id":"c44723ea-3401-4271-946b-0bc903555288","resolution":{"observed_at":"2026-05-22T08:11:17.224854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2605.21854","last_updated":"2026-06-06T09:58:33Z","snapshot_observed_at":"2026-08-02T07:58:30.433073Z","submitted_at":"2026-05-21T01:02:41Z","title":"CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T17:48:02.228941Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2605.21854"},"observation_digest":"sha256:dc3c863f78518d268fd2148c4129e754d47826faf847cb31d32272ce1a97319a","observation_id":"14abd914-4aa0-4f37-9e5b-5391753079be","resolution":{"observed_at":"2026-07-01T15:05:47.995575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2606.31909","last_updated":"2026-06-30T16:12:30Z","snapshot_observed_at":"2026-08-06T16:15:27.986824Z","submitted_at":"2026-06-30T16:12:30Z","title":"CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T04:58:31.739325Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2606.31909"},"observation_digest":"sha256:bd51522a74677dccb8ec15974dc77ff00b2579a0063d9e1b48a1caa4f0e89036","observation_id":"5e7ca5f2-56ce-463e-8057-42436297d75f","resolution":{"observed_at":"2026-07-01T10:55:41.904539Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-14T05:40:47.306935Z","title":"RoboMamba: Efficient vision- language-action model for robotic reasoning and manipula- tion.arXiv preprint arXiv:2406.04339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11427","last_updated":"2026-07-13T11:31:53Z","snapshot_observed_at":"2026-07-16T23:19:47.022811Z","submitted_at":"2026-07-13T11:31:53Z","title":"EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T05:40:47.306935Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2607.11427"},"observation_digest":"sha256:7aaab96d5ae0cfd77beff84f77ca47c6392284ce4d4b570a14b1e7522c58ccdd","observation_id":"bc8f7130-84a0-4d70-9e1a-6150da353e7a","resolution":{"observed_at":"2026-07-14T05:40:47.306935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-01T02:21:24.234162Z","title":"2024 , doi =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25487","last_updated":"2026-07-28T09:24:17Z","snapshot_observed_at":"2026-08-06T09:09:27.676695Z","submitted_at":"2026-07-28T09:24:17Z","title":"CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T02:21:24.234162Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2607.25487"},"observation_digest":"sha256:09dca9cadedb295989560be27e4157a21754bd02df28e02361fed1f3fa8ba0f8","observation_id":"e630e1e5-c998-4b01-b933-51fe81955606","resolution":{"observed_at":"2026-08-01T02:21:24.234162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-04T19:45:34.954818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-06T23:33:18.970298Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":154,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:34.954818Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:f860289f3a42cb922b1764a1bf5292b368409bbacc3ec3211fa866a52307220c","observation_id":"0ab7cd4f-ce11-4b07-ac97-2d39d3e53784","resolution":{"observed_at":"2026-08-04T19:45:34.954818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.04339/citation-record","integrity":"/paper/2406.04339/integrity","json":"/paper/2406.04339/citation-record.json","paper":"/paper/2406.04339"},"outbound":[],"paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2406.04339."}