{"as_of":"2026-08-07T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f0461383403f79f768e9fb6b1522a9d616c6f659f6a58b36b452f6cfbf4a734","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:24:48.618223Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:32:46.126998Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:28:16.362582Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10826","snapshot_observed_at":"2026-08-05T20:32:46.126998Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.126998Z"},"links":{"cited_paper":"/paper/2506.10826","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:7606201e1555677c0d5f620f7a222aa1641686a63b30e519e164535be34375b7","observation_id":"aa00de08-9610-42d6-9bd4-d8f86cb31bc2","resolution":{"observed_at":"2026-08-05T20:32:46.126998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"cited_work":{"arxiv_id":"2506.10826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10826","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rationalvla: a rational vision-language- action model with dual system","venue":null,"work_id":"5c377680-43d9-46c8-a9c0-dc5089e6ab43","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":135,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2506.10826","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:8921b6368cf9874772e262a1ab35e5270de7a0977da2f5e6e6641d0c1bfbd4f2","observation_id":"393d89ca-2901-43e6-b271-35aaeadcf5f6","resolution":{"observed_at":"2026-05-17T20:28:16.364814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"cited_work":{"arxiv_id":"2506.10826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10826","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rationalvla: a rational vision-language- action model with dual system","venue":null,"work_id":"5c377680-43d9-46c8-a9c0-dc5089e6ab43","year":2025},"citing_paper":{"arxiv_id":"2605.10921","last_updated":"2026-05-11T17:54:49Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:54:49Z","title":"RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T03:50:18.706396Z"},"links":{"cited_paper":"/paper/2506.10826","citing_paper":"/paper/2605.10921"},"observation_digest":"sha256:a402cfdc85001cbd396e843f464ef756bbf6ec0a962ebd20e12060d61efaaa9f","observation_id":"790f1a97-6d41-44c6-ad6f-6be6bc7ff1da","resolution":{"observed_at":"2026-05-12T06:56:26.744197Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10826","snapshot_observed_at":"2026-07-14T10:23:25.158961Z","title":"Rationalvla: A rational vision-language- action model with dual system.arXiv preprint arXiv:2506.10826, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10625","last_updated":"2026-07-12T07:38:53Z","snapshot_observed_at":"2026-08-07T06:50:58.781901Z","submitted_at":"2026-07-12T07:38:53Z","title":"Dual-Process Atomic Skill Learning: Decoupling Semantic Reasoning and Real-Time Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T10:23:25.158961Z"},"links":{"cited_paper":"/paper/2506.10826","citing_paper":"/paper/2607.10625"},"observation_digest":"sha256:e89738d689dbe2092ac2c1aeae1f140eccf3eeb554bc883c6c14ecdde4095668","observation_id":"88b85e26-b952-4e1d-b7d9-cadf72149d98","resolution":{"observed_at":"2026-07-14T10:23:25.158961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10826","snapshot_observed_at":"2026-08-01T19:56:57.341989Z","title":"RationalVLA: A rational vision-language-action model with dual system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16806","last_updated":"2026-07-18T12:55:40Z","snapshot_observed_at":"2026-08-07T06:25:42.181740Z","submitted_at":"2026-07-18T12:55:40Z","title":"Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T19:56:57.341989Z"},"links":{"cited_paper":"/paper/2506.10826","citing_paper":"/paper/2607.16806"},"observation_digest":"sha256:e4aee4879322fe54d5d398af995ac7dc3c4869dfb18f4fdad64de18e25c1cf48","observation_id":"6512388d-82c6-4906-865d-8e13e2cf7f6e","resolution":{"observed_at":"2026-08-01T19:56:57.341989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10826/citation-record","integrity":"/paper/2506.10826/integrity","json":"/paper/2506.10826/citation-record.json","paper":"/paper/2506.10826"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.869513Z","title":"Embodied intelligence toward future smart manufacturing in the era of ai foundation model,","venue":null,"work_id":"4f3a9618-b162-45f4-a390-7ce1b5062c6f","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:44.868625Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:89f7dbfc80f1ec923540a69ac95b8e8335dbd9438afd3620d80da4d109506205","observation_id":"387c9046-046c-4967-8cae-7428aa95c4dd","resolution":{"observed_at":"2026-08-07T04:24:54.872776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.859469Z","title":"Rt-2: Vision-language-action models transfer web knowl- edge to robotic control,","venue":null,"work_id":"96b78a59-a430-487e-a895-1ea8dd944c42","year":2023},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:44.912237Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:1a339bff357b53a28de62853b49c2c70c45387cfc89cdfa448619dab6c064cb1","observation_id":"d685da79-2213-4a04-a6c2-1c8e28914acf","resolution":{"observed_at":"2026-08-07T04:24:54.862585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.850185Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":"2438b40d-e182-43c8-9c0d-8d845f03b7be","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:44.970763Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:406fba25df5f8de112e5ee8ca0dad3c6d07286edfd7286d55f5820d44b50e03c","observation_id":"49c92e94-8b8a-4f63-8383-505cad7793eb","resolution":{"observed_at":"2026-08-07T04:24:54.853354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.840122Z","title":"Quar-vla: Vision-language-action model for quadruped robots,","venue":null,"work_id":"f40f76ec-f664-49ed-89e3-f9f749833073","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.022103Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:bbb42a1cf5d298f9fa89d7e67bb6fa21018341cf04fd9c3877219b50d3c3bf43","observation_id":"191dc47f-f927-4e3e-b15b-08cb5dbe399d","resolution":{"observed_at":"2026-08-07T04:24:54.843683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:45.113110Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.113110Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:045b865b04bec23b3bd5e328b68a0bd57ea1733137812a0fa0903308414a7e51","observation_id":"119901bc-e5c1-484e-a364-42d78c87e8ae","resolution":{"observed_at":"2026-08-07T04:24:45.113110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:24:45.193155Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.193155Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:84a049b61122eddd5eb02158edbfe3af3d0fd0bdd5e96b57516544ef215afc11","observation_id":"a2de6888-5f24-43f8-92d0-79d4ea827f92","resolution":{"observed_at":"2026-08-07T04:24:45.193155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.824026Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":"f8b28e60-707a-4303-95b9-766f248cae45","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.265895Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:ad2403fb6041e74c0b7dd6ab1552dce8cf5bd647f663f403058d95240fb5e89b","observation_id":"d6b8a8dc-f977-48bc-99ab-4b9d9a293255","resolution":{"observed_at":"2026-08-07T04:24:54.827431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.813535Z","title":"Deepseek-vl: Towards real-world vision-language understanding,","venue":null,"work_id":"f338c6f2-f93b-4948-9dce-b3056f1dde46","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.321252Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:437245ddd5f6c42e2c9131e0fb9f65eb50cd3d618a0d88a4b0916bef1be8f6ec","observation_id":"ae4f1e19-fdd8-4370-ad1e-98d726ddfd71","resolution":{"observed_at":"2026-08-07T04:24:54.816933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.803706Z","title":"Cobra: Extending mamba to multi-modal large language model for efficient inference,","venue":null,"work_id":"b55b4c53-6cf6-4191-afc0-45bf81ad45af","year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.403055Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:61cd4e4384619390dd1a6262d3f8c8878c1900b427c0d4e58689344b3465d6ca","observation_id":"1033c4e6-fda2-44ac-98e2-541e5b8a0e55","resolution":{"observed_at":"2026-08-07T04:24:54.806802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.793865Z","title":"Seeing far and clearly: Mitigating hallucina- tions in mllms with attention causal decoding,","venue":null,"work_id":"c4fa21f4-6cb8-4a5c-b507-5a4726126bae","year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.487310Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:53115f2ac8abc255411861bb70c796c48498b88f322085bbeba088fcebac2149","observation_id":"4f1d83fe-9482-4a2c-9ac0-6dc25704c33f","resolution":{"observed_at":"2026-08-07T04:24:54.796964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.783784Z","title":"Rt-1: 11 Robotics transformer for real-world control at scale,","venue":null,"work_id":"c9c3fea7-94b2-4ab9-b130-c69a444f39fd","year":2023},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.554345Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:c17455eb81b5dc0091d88462a0a3c74eee2f39bb15f19fc49b95a8b392e97341","observation_id":"b5ac0b5a-9979-48d6-a27e-d01bb338344f","resolution":{"observed_at":"2026-08-07T04:24:54.787391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.773455Z","title":"Germ: A generalist robotic model with mixture-of-experts for quadruped robot,","venue":null,"work_id":"59d95300-d386-4b02-b3b4-593f27ca4bfc","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.590200Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:5d40cbe0e55a7fe349edc5b2240eb7e0985e3f4d338e62fcad719a3d5149899b","observation_id":"ebbe92f7-785d-4da9-a2d8-949e31587153","resolution":{"observed_at":"2026-08-07T04:24:54.777271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.763563Z","title":"Octo: An open- source generalist robot policy,","venue":null,"work_id":"5e02e68c-1f68-4aee-8e11-500f06d660a4","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.667528Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:10e473cd4c2e2e6ea126a093605662bfd1ba1cee8e01b938afe5e3204efffe8b","observation_id":"ea117410-28f8-4ea0-a23c-64f356e1d9d4","resolution":{"observed_at":"2026-08-07T04:24:54.766987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08007","last_updated":"2025-03-11T03:13:45Z","snapshot_observed_at":"2026-07-06T20:50:23.458400Z","submitted_at":"2025-03-11T03:13:45Z","title":"MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08007","snapshot_observed_at":"2026-08-07T04:24:45.741915Z","title":"More: Unlocking scalability in reinforcement learning for quadruped vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.741915Z"},"links":{"cited_paper":"/paper/2503.08007","citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:473324b76527f50dc8cea065905e14f9cc44fb8caa72c93b9883b5de5cedfac5","observation_id":"80517fcf-175f-4148-b169-177e2975468e","resolution":{"observed_at":"2026-08-07T04:24:45.741915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:45.805186Z","title":"Accelerating vision-language-action model inte- grated with action chunking via parallel decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.805186Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:2f8e75c6c9c00d3e58618f15da98a0b066fdcaa1162b25eebcd536b1a1517c9c","observation_id":"f131b99b-d0ac-40ac-8297-7f1dd8473089","resolution":{"observed_at":"2026-08-07T04:24:45.805186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.753956Z","title":"3d diffuser actor: Policy diffusion with 3d scene representations,","venue":null,"work_id":"5e800e55-fb0e-4f3f-81c0-96f61c4b3feb","year":null},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.882089Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:15aba936afc2813acc12f12208a8d9d5052d28fd26b88e0d182501600f68e7e4","observation_id":"c4f4ca83-a28a-4d09-ada4-2c9cff80f355","resolution":{"observed_at":"2026-08-07T04:24:54.757176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:45.970657Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:45.970657Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:6a025b00a2298ef65dc35d3b08241715690429e9985c8d945694b25a3dcac805","observation_id":"21c901ab-49cf-4d2e-9f55-8085eff1325c","resolution":{"observed_at":"2026-08-07T04:24:45.970657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-07T13:17:24.769477Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-08-07T04:24:46.040172Z","title":"Vision-language- action model with open-world embodied reasoning from pretrained knowledge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.040172Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:68040ed3282a783110f4cd6eddf9d36216ab64bdb6b96be52104f779bfb3592b","observation_id":"3d798a09-016e-4b4a-badf-e51fd4ed9225","resolution":{"observed_at":"2026-08-07T04:24:46.040172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.666350Z","title":"Dynamic neural networks: A survey,","venue":null,"work_id":"77d32c37-55af-4eae-a833-c4ac80e8f5ab","year":2021},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.112873Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:a5d2f9a5f8ba1d031d673687ac535cf668c5ef5b4d64fe3fbffd2a40dd4f52ce","observation_id":"ca1709af-eec4-4714-a99f-1d3a1b4158ec","resolution":{"observed_at":"2026-08-07T04:24:54.692542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.392042Z","title":"Gsva: Generalized segmentation via multimodal large language models,","venue":null,"work_id":"deddfa80-9088-4c73-bcff-55b55a8e94e6","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.188389Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:49fe896b1a225b957c1fb10aa8300b13533270ccc1d89e9d4498eeb21230ea1e","observation_id":"c75630a4-3e9e-442c-ba4b-4c2fa5580d78","resolution":{"observed_at":"2026-08-07T04:24:54.510967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.307458Z","title":"A multimodal robust recognition method for grasping objects with robot flexible grippers,","venue":null,"work_id":"d2b4530e-f757-456d-a505-6ba04716c5ca","year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.242550Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:f9a5f08d86789a296b23838f2ea943908ebf27ea4304a022f02ca899a3ea2f5e","observation_id":"c8133683-a472-459c-9c0b-c0c7c3506d3d","resolution":{"observed_at":"2026-08-07T04:24:54.380767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:54.089163Z","title":"Learning generalizable vision-tactile robotic grasping strategy for deformable objects via transformer,","venue":null,"work_id":"d748d5da-429e-4bfc-adbb-108de8e3c99d","year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.320504Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:78e56c9a640a2f9c36bca4786ace6172faa1fe29ccf037afdfe49300143d2daa","observation_id":"8dea092c-2df3-4ec7-8a5e-43745a7c72a0","resolution":{"observed_at":"2026-08-07T04:24:54.187612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:53.818160Z","title":"Dih-tele: Dexterous in-hand teleoperation framework for learning mul- tiobjects manipulation with tactile sensing,","venue":null,"work_id":"6da1e44f-9e2b-4ce5-aad5-8a7c3bd50c8b","year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.408258Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:769fd60a066f9934a5cf68ec2aa1b78c94882b375c20b037a34d80b12206e797","observation_id":"2e35c844-d577-4243-837b-9dfdf08756db","resolution":{"observed_at":"2026-08-07T04:24:53.968689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:46.486156Z","title":"Efficient grasp detection network with gaussian-based grasp representation for robotic manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.486156Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:d9816538493e941a32427fac1b81ab28c2a9355592785c4835953e60009e6957","observation_id":"c2a83e1e-9fc5-4800-a7dc-7957fb7ebd44","resolution":{"observed_at":"2026-08-07T04:24:46.486156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:53.552062Z","title":"Language conditioned imitation learning over unstructured data,","venue":null,"work_id":"40a02982-044b-4ee5-826b-b01412d8315b","year":2021},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.561868Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:5323c8c2223c624e4cdd1eebd07d06be35bf55bc0d59e4e273e648c6d6bb986d","observation_id":"1d67e1e7-5647-4986-99a7-78a4812fb4b2","resolution":{"observed_at":"2026-08-07T04:24:53.685780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:46.649628Z","title":"What matters in language conditioned robotic imitation learning over unstructured data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.649628Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:4d21b1eed4f9601360f68766e03f6da927c83650877ba12c23d8f039bcc91ddf","observation_id":"ea9e6e9d-3174-467e-a56a-82cd197b0bf3","resolution":{"observed_at":"2026-08-07T04:24:46.649628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:46.728769Z","title":"Diffusion policy: Visuomotor policy learning via ac- tion diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.728769Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:cad646297d2558abf3418c1bb00b0b56896e012e52d780d80d322089fcd75a76","observation_id":"b4de731c-37d6-46ed-a747-53b8704be40b","resolution":{"observed_at":"2026-08-07T04:24:46.728769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:53.342502Z","title":"3d diffusion policy,","venue":null,"work_id":"659d6638-43f5-44a9-9b2c-c21b9f95d548","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.790181Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:5c64fb1fb4ac109e709dd9973b6bd279d83479c3ade9a009ec9c31198f4453f7","observation_id":"286f726c-5063-499a-80de-a221ea9ee758","resolution":{"observed_at":"2026-08-07T04:24:53.460891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:53.142656Z","title":"Consistency policy: Accelerated visuomotor policies via consistency distillation,","venue":null,"work_id":"e98b67cc-4ba5-45db-9d7a-119bb96f8911","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.844026Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:786c8d40ac825eedd28811c9ed03a564f75a6be697674d601dae1bfb713b22b6","observation_id":"d3216e62-bf3c-4d88-a14c-33c0df62c9bc","resolution":{"observed_at":"2026-08-07T04:24:53.259184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:52.974756Z","title":"RT-trajectory: Robotic task generalization via hindsight trajectory sketches,","venue":null,"work_id":"ce234421-4da6-498c-a25a-470b2e6e54dd","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.898184Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:a7febb151f39786aa49c0d6245a479bbb74812c58a1d6123b705510d39b2befd","observation_id":"b0c7a529-c8b4-4042-90cb-ee5bdb5e4d72","resolution":{"observed_at":"2026-08-07T04:24:53.060753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:52.794306Z","title":"Sara-rt: Scaling up robotics transformers with self-adaptive robust attention,","venue":null,"work_id":"1f97db50-60f7-4233-907f-a703e75e7622","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:46.957774Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:118d252597ed45a0af7bef63c4a6f19798fa39d79872d143c0480f95f126fe97","observation_id":"b8533a63-2a44-4ea7-8caf-241a80272b5d","resolution":{"observed_at":"2026-08-07T04:24:52.862970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:52.564650Z","title":"Inner monologue: Em- bodied reasoning through planning with language models,","venue":null,"work_id":"43c0f9d7-d32a-48b3-ba23-83c568ed2547","year":2023},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.022196Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:85ce1bee79960967d6dfc295acc68024bc4b300f2074cefd5317d70e32e018ad","observation_id":"50e6b248-cc1c-436b-81e9-660457f5e1dc","resolution":{"observed_at":"2026-08-07T04:24:52.691441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:52.313196Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation,","venue":null,"work_id":"352794d2-d251-4b81-9e59-9bdca2f548a2","year":null},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.082933Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:5146ab41b02082ecbc8118c3b03a4f5a65704da57d1d8a5176a6c16412633806","observation_id":"f9abede6-c0b4-4513-b0cb-c0f4cf76bf20","resolution":{"observed_at":"2026-08-07T04:24:52.427299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:52.092144Z","title":"Video language planning,","venue":null,"work_id":"6ce49e5e-ed71-431e-8d47-50bdfefd0dbe","year":null},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.145939Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:61f898290d3ff9259a1b9feba52a8df003dcaf2bd2167e58783ba683ca0ddba7","observation_id":"2eda2f3a-330a-4827-826a-0b95e2ac8715","resolution":{"observed_at":"2026-08-07T04:24:52.151150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:51.983980Z","title":"Robomamba: Efficient vision-language-action model for robotic reasoning and manipulation,","venue":null,"work_id":"224a3087-7ea5-4155-b2be-c86fb0f14456","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.193783Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:25a4a5a488a8e20a3121d60695fe2060a2d472f1e5fe3ce5ccda32d677599af9","observation_id":"9c3534bc-6442-43b5-a17d-b74bc742c8bd","resolution":{"observed_at":"2026-08-07T04:24:52.039687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:51.795226Z","title":"Vlas: Vision-language-action model with speech instructions for customized robot manipulation,","venue":null,"work_id":"d0e22391-30c5-490c-8bac-a21d7936d508","year":null},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.248717Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:ffc4047f6b995c1e48524f51528b4252da698a1bfa52de47d80b91474895990f","observation_id":"2a951cf5-e9f0-4ce4-bf9b-c545e4f26e67","resolution":{"observed_at":"2026-08-07T04:24:51.882889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:51.615053Z","title":"Dual-arm robotic fabric manipulation with quasi-static and dynamic primitives for rapid garment flattening,","venue":null,"work_id":"5209507a-28da-44ea-be3f-35f65b4eb16d","year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.317109Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:fc8fd39b8b22a7644f47c604424921b306f316b0bbe6f08cd26ba42bc2343421","observation_id":"cd995e3c-fb3a-43e7-a78a-355efaaefe90","resolution":{"observed_at":"2026-08-07T04:24:51.696294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:51.413424Z","title":"From llms to actions: Latent codes as bridges in hierarchical robot control,","venue":null,"work_id":"5e14f54d-0408-415d-96df-e876e007bd08","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.373690Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:f001854d7ed83b894f92acd20aa9a548959c4e9ab12e03baf849487dc15d61d4","observation_id":"cf663e19-9a37-4eee-b411-84fde9e53b8c","resolution":{"observed_at":"2026-08-07T04:24:51.511411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:51.214322Z","title":"Hirt: Enhancing robotic control with hierarchical robot transformers,","venue":null,"work_id":"64a482e9-90f9-44eb-abce-6e595d6986e2","year":null},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.438243Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:020c86dcc9d1a75d760602768764136758970666246a80ef917145c94421baee","observation_id":"0c424af0-ad07-4135-855e-f574d34dd158","resolution":{"observed_at":"2026-08-07T04:24:51.318105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:51.034274Z","title":"Towards synergistic, generalized, and efficient dual-system for robotic manipulation,","venue":null,"work_id":"4e9dead7-b884-4605-9ab2-82f4b5bab31c","year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.485857Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:f382671b029157cd3131f70a5ddbabcfe0b1b965539d050d5588d1ed90557124","observation_id":"de8c6ffc-a6fe-4607-b527-41a9ad8022d9","resolution":{"observed_at":"2026-08-07T04:24:51.113011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15549","last_updated":"2024-10-21T00:36:02Z","snapshot_observed_at":"2026-08-07T13:57:47.043583Z","submitted_at":"2024-10-21T00:36:02Z","title":"A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15549","snapshot_observed_at":"2026-08-07T04:24:47.538512Z","title":"A dual process vla: Efficient robotic manipulation leveraging vlm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.538512Z"},"links":{"cited_paper":"/paper/2410.15549","citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:48f8b8790172ce5704f3fa0a242f694a552c83a1feef6c544cce7c18130fa9cb","observation_id":"095963b2-6f1c-4e10-bcb7-0c9684fb567d","resolution":{"observed_at":"2026-08-07T04:24:47.538512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:50.850583Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":"93ca07f5-6813-49d7-a744-b2652ec918f5","year":null},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.589923Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:fb9a97891bfa1a96e03d1a57f1a43f44a6e169fc7d8b56b1accb05b71304eb5b","observation_id":"8132137a-43a1-49da-b5f8-88d0bfcb8855","resolution":{"observed_at":"2026-08-07T04:24:50.939829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:50.615849Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":"2a8db571-928d-4731-a796-3ae0089e3bf0","year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.631099Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:a345bda2b098a4fc8bdccf8fc3283c090ae598f6d6159a3e25c15ec9c647dbf5","observation_id":"6d5ba01f-60b7-4566-a5f4-f9693fc67b41","resolution":{"observed_at":"2026-08-07T04:24:50.721443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03912","last_updated":"2025-05-06T18:35:07Z","snapshot_observed_at":"2026-07-06T21:19:58.642378Z","submitted_at":"2025-05-06T18:35:07Z","title":"OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03912","snapshot_observed_at":"2026-08-07T04:24:47.684400Z","title":"Openhelix: A short survey, empirical analysis, and open-source dual-system vla model for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.684400Z"},"links":{"cited_paper":"/paper/2505.03912","citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:47bfa76920e0c75612a87c1fd369e569d09404045de48b804a1a3531527705bf","observation_id":"7ac11666-e4db-4399-898c-10e4ab4007ec","resolution":{"observed_at":"2026-08-07T04:24:47.684400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:50.349967Z","title":"Hierarchical reinforcement learning with model guidance for mobile manipulation,","venue":null,"work_id":"c3e6ae5c-23f0-46be-82d4-4407bed84ef3","year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.745003Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:fea72c7e96403cf704c30d614ec845fe478658a2c775adaea5ef2c29a6782ed2","observation_id":"55622c64-f47f-4ad1-8a5a-7fecc9d9c88b","resolution":{"observed_at":"2026-08-07T04:24:50.469853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:50.118291Z","title":"Interactive imitation learning of bimanual movement primitives,","venue":null,"work_id":"a411f3f4-0d4f-4cc6-ad52-46ef8dc5280c","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.802533Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:1dfa70e8b6c9848a3dec6880b8e3fc2d413f7bcaf8d5ede5ee7b49a495c140dc","observation_id":"797b14a9-7840-4dba-ace9-80fa9de8d5a5","resolution":{"observed_at":"2026-08-07T04:24:50.246959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:49.941389Z","title":"Navigating beyond in- structions: Vision-and-language navigation in obstructed environments,","venue":null,"work_id":"6d55fe2a-0880-4626-beb5-202ed0750877","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.872273Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:d22e38644a1cd2c3eba72d22e1871bad77682c63929c61bf4ee815cd6e700494","observation_id":"75f51d1f-f10b-4d7d-a507-1f7565cbca43","resolution":{"observed_at":"2026-08-07T04:24:50.037859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12443","last_updated":"2025-05-18T14:33:17Z","snapshot_observed_at":"2026-08-07T15:43:38.987191Z","submitted_at":"2025-05-18T14:33:17Z","title":"BadNAVer: Exploring Jailbreak Attacks On Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12443","snapshot_observed_at":"2026-08-07T04:24:47.924165Z","title":"Badnaver: Exploring jail- break attacks on vision-and-language navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.924165Z"},"links":{"cited_paper":"/paper/2505.12443","citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:ca58999d6cc05471b2f3a5f23b11c46bffdc037caee270cf9458e5437a932083","observation_id":"dd672fc8-f90e-4b37-a440-925b000f4f7f","resolution":{"observed_at":"2026-08-07T04:24:47.924165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:49.713924Z","title":"Safety bounds in human robot interaction: A survey,","venue":null,"work_id":"4a274c79-5b2b-470b-a6aa-28b28a13a45c","year":2020},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:47.963015Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:7d92a3a7710147878b49b992c64188047876cbf4890d8042b782678583e708a3","observation_id":"23b0c067-e096-479b-8d13-fe55ba550797","resolution":{"observed_at":"2026-08-07T04:24:49.819340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:48.002210Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:48.002210Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:d48bec0aabfac917c137d32f2b77415411642d6f64fcb6c243dfd66f87547d17","observation_id":"3d25a37a-ca7d-463e-953a-df8b123260e3","resolution":{"observed_at":"2026-08-07T04:24:48.002210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:49.497346Z","title":"Pybullet, a python module for physics simulation for games, robotics and machine learning,","venue":null,"work_id":"82486387-4f7e-4b75-a340-21bffa2232fd","year":2016},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:48.076903Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:e0f8ac1847831cca77c95747171e47e78a7e41391b007bd14a5709d4d9ba72f7","observation_id":"c5238311-00ae-44b5-a152-7a29b06dce08","resolution":{"observed_at":"2026-08-07T04:24:49.607146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:48.225606Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:48.225606Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:5aedc15f7a14f513088722646f27d121581726ded3de1eb57021cc5aa20a22d0","observation_id":"2f4c3a85-1148-411e-a693-e5cf933c4902","resolution":{"observed_at":"2026-08-07T04:24:48.225606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:48.386974Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:48.386974Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:19eaec7457116bd9258e556a70b549ca7d52205f9206449d6dad65b801d52d3b","observation_id":"d08f8b2b-a536-4225-9c91-cd89043e73a5","resolution":{"observed_at":"2026-08-07T04:24:48.386974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:49.270747Z","title":"Investigating the catastrophic forgetting in multimodal large language models,","venue":null,"work_id":"ece440f3-147a-4514-9194-0655789cb78e","year":2023},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:48.482359Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:e920069b689b3f57a524a67acf546c95acf6c2627b51b93a735a59f098005f57","observation_id":"b6a9d7b3-7121-4f33-80c7-924bcbd4d6ea","resolution":{"observed_at":"2026-08-07T04:24:49.387945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:49.044988Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models,","venue":null,"work_id":"a8c13ab4-6207-4a18-91cd-a07395dfde7a","year":2024},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:48.559986Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:1c7175e834afe0055f5020d8394026cfd58bef7eda25c9e42d463b16f0971bc2","observation_id":"7bfc2d50-168d-4edf-9806-fad476749dbf","resolution":{"observed_at":"2026-08-07T04:24:49.134933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:24:48.899900Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":"d424d6b7-dbeb-4f2f-af43-5357818b92ac","year":2023},"citing_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:24:48.618223Z"},"links":{"citing_paper":"/paper/2506.10826"},"observation_digest":"sha256:99baabcb931fc840e865c36af8ed99b4cc04bf31fce03ecb91093bbfefcaf850","observation_id":"87327f2a-f89b-43fb-814e-4764dd3287a2","resolution":{"observed_at":"2026-08-07T04:24:48.954179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 5 inbound Pith citation observations for arXiv:2506.10826."}