{"as_of":"2026-08-07T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:104c03ea8557cc0378acd35d60c0e28dd6eff52a05c71b9c9dbde75c7648f9dd","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T00:49:13.291897Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T08:00:25.815355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T10:37:56.081712Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2606.17598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.17598","snapshot_observed_at":"2026-07-03T10:37:56.081712Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","venue":"cs.RO","work_id":"dea86218-be60-47b1-b1cf-76e6de92581c","year":2026},"citing_paper":{"arxiv_id":"2607.02501","last_updated":"2026-07-03T02:16:41Z","snapshot_observed_at":"2026-07-12T08:00:25.240507Z","submitted_at":"2026-07-02T17:58:28Z","title":"Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-03T10:37:31.925624Z"},"links":{"cited_paper":"/paper/2606.17598","citing_paper":"/paper/2607.02501"},"observation_digest":"sha256:457668306b40d4db35706d4541f860797fd351200982f8bd52a956147f76fc11","observation_id":"c3869826-5bd1-4b4e-88e2-fc38f7b9a64c","resolution":{"observed_at":"2026-07-03T10:37:56.083179Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17598","snapshot_observed_at":"2026-07-12T08:00:25.815355Z","title":"arXiv preprint arXiv:2606.17598, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02501","last_updated":"2026-07-03T02:16:41Z","snapshot_observed_at":"2026-07-12T08:00:25.240507Z","submitted_at":"2026-07-02T17:58:28Z","title":"Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T08:00:25.815355Z"},"links":{"cited_paper":"/paper/2606.17598","citing_paper":"/paper/2607.02501"},"observation_digest":"sha256:85e6f9c3fd82d6b32ecefb580d8dfe043c759077d8d62f1800f4f3f19c31db32","observation_id":"061015d8-8224-4e91-b492-b5e23be24f5b","resolution":{"observed_at":"2026-07-12T08:00:25.815355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.17598/citation-record","integrity":"/paper/2606.17598/integrity","json":"/paper/2606.17598/citation-record.json","paper":"/paper/2606.17598"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.05800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.820608Z","title":"3d cavla: Leveraging depth and 3d context to generalize vision language action models for unseen tasks","venue":null,"work_id":"10a5d041-6d20-404d-a379-a0782b16f45e","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:753f83001fef408c7f9d7409de40f3e0bf65a243e6f44f5178cc2f114dadc5e3","observation_id":"46797790-d8c0-453b-82dc-85b16fa4f265","resolution":{"observed_at":"2026-07-03T21:08:58.822891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17294","last_updated":"2025-07-29T12:31:26Z","snapshot_observed_at":"2026-08-06T21:43:04.037359Z","submitted_at":"2025-07-23T07:54:10Z","title":"VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback","version":2},"cited_work":{"arxiv_id":"2507.17294","doi":"10.48550/arxiv.2507.17294","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17294","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-touch: Enhancing vision-language- action models with dual-level tactile feedback","venue":"ArXiv.org","work_id":"bbc9afdd-1cb4-4efc-9b65-017800c4f773","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2507.17294","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:1ab2e8404900483cd0ec3a09a3f953b8a7054bcba947e6bab7369ffdabdb2648","observation_id":"e14c2d66-b1b0-45df-a59e-618e141dfc49","resolution":{"observed_at":"2026-07-03T21:08:58.812414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:d1bd1612fa8a854604529a75bcb5cfe2e3fe758928fb6e7453ef0ef5b36ebe64","observation_id":"6dd5dcf6-22f3-4aec-8b83-9d821755f189","resolution":{"observed_at":"2026-07-03T21:08:58.756995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:27369a8fc0295b156396253916a8065d5f6b90648cddefa34e81c6e6029657d7","observation_id":"85314b8f-2b72-4d22-a48f-92cffdf9c9dc","resolution":{"observed_at":"2026-07-03T21:08:58.819623Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:cb0f5cce0b0cfd060ad9bdc0928de40d9a6915d656512fba26a3e7d5dfbbd149","observation_id":"6f3308f4-a742-41cc-8ea8-0095099d5e4a","resolution":{"observed_at":"2026-07-03T21:08:58.817305Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2602.06949","doi":"10.48550/arxiv.2602.06949","metadata_source":"pith","pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","venue":"cs.RO","work_id":"95f2f415-c659-4084-a008-39303bea8638","year":2026},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:21ce2141abaaa7188d6965d3e4c7175d8659d037db927c04716ff7cccd60e500","observation_id":"4b4cb3ff-20d9-4aaa-8d39-55be11425542","resolution":{"observed_at":"2026-07-03T21:08:58.759587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.748171Z","title":"OmniVLA: Physically-grounded multimodal vla with unified multi-sensor perception for robotic manipulation","venue":null,"work_id":"dfad83cb-9643-4610-85e7-5591000f01d9","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:a26864a803122728b78ac8774a56cf7538245be5c2ec0a9c2949be4917d62900","observation_id":"fb6e66dc-dea3-4e49-8fd1-849908118487","resolution":{"observed_at":"2026-07-03T21:08:58.750058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.02477","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.826804Z","title":"arXiv preprint arXiv:2504.02477 (2025)","venue":null,"work_id":"8583025e-52f0-4ad1-9974-82cc5d303adc","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:f9c32e3ead8b0ddb29d914af3b70b4033917e0c4aaaea8142bcd0b5735b0a8ce","observation_id":"6efc9740-b259-4526-bb78-3e383b28ed99","resolution":{"observed_at":"2026-07-03T21:08:58.828629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09160","last_updated":"2025-07-12T06:44:37Z","snapshot_observed_at":"2026-08-06T21:43:06.371713Z","submitted_at":"2025-07-12T06:44:37Z","title":"Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization","version":1},"cited_work":{"arxiv_id":"2507.09160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09160","snapshot_observed_at":"2026-07-03T21:08:58.817723Z","title":"Tactile- VLA: Unlocking vision-language-action model’s physical knowledge for tactile generalization","venue":null,"work_id":"4c03a2e4-feee-4264-8ddf-c0031931b819","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2507.09160","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:bf06b35640b18904125d9a4f4f76666a865b567e5262b98c2244fd95c257515e","observation_id":"04c89fd2-1c34-4d4b-bfb2-66eadae64d45","resolution":{"observed_at":"2026-07-03T21:08:58.819557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":"2604.15483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-07-10T19:47:32.631418Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","venue":"cs.LG","work_id":"7391297f-4dff-465c-9790-cb760a2c0542","year":2026},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:1fd81dd3e26a8b278dbb97ea8b7fcf9efc1e03293ce1bc799d25fff6eb8c2e69","observation_id":"3a412ad3-eade-46ad-b5fd-968b912f5a90","resolution":{"observed_at":"2026-07-03T21:08:58.816613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:8c889ae6b65d3bc279bd60621fbf5fcf4f654b0669050a525fe5bf54e10e93fd","observation_id":"5fe91a17-96bc-4eca-b856-854b34cbc158","resolution":{"observed_at":"2026-07-03T21:08:58.822787Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:fcebd1f3768503f30dd3e289599b072c2076f3b44c2add5d648b9b1decadc394","observation_id":"3e9a22c7-f8ad-4b1f-97e4-184df561b593","resolution":{"observed_at":"2026-07-03T21:08:58.811280Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13542","last_updated":"2024-09-01T03:33:26Z","snapshot_observed_at":"2026-07-06T13:14:21.836046Z","submitted_at":"2022-05-26T17:59:35Z","title":"BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation","version":3},"cited_work":{"arxiv_id":"2205.13542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.13542","snapshot_observed_at":"2026-07-03T21:08:58.812391Z","title":"Bevfusion: Multi-task multi-sensor fusion with unified bird’s-eye view representation","venue":null,"work_id":"c01b4bfc-52e6-448b-b7e7-c5712c659a93","year":2022},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2205.13542","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:a8c37c16b206f5e2fd7e45d5ba65280c0b59974a442b09ec1c3984dc375a7ce8","observation_id":"a93787ab-8e2a-4cf4-b98a-433717efa595","resolution":{"observed_at":"2026-07-03T21:08:58.813823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:44:26.097677Z","title":"Mla: A multisen- sory language-action model for multimodal understanding and forecasting in robotic manipulation","venue":null,"work_id":"5bf5ff40-ba63-4561-8428-cbb76930712b","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:675ae4e810fbce97ffaf5b4a7093f0cbc57b2beb0b09126defc8184fb5ea6003","observation_id":"2ff00401-52cd-4786-8ccd-a4ea929d93ae","resolution":{"observed_at":"2026-07-03T21:08:58.804505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:49:13.291897Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:3f66939c1f8f6c466bb7bdd6db0b26ee51c41d20fb160fced9fd4c5a62ba3c81","observation_id":"80929dfd-fe70-4c5c-bbc1-8b7f56f7de58","resolution":{"observed_at":"2026-06-27T00:49:13.291897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09032","last_updated":"2025-08-12T15:53:45Z","snapshot_observed_at":"2026-08-05T21:12:53.473960Z","submitted_at":"2025-08-12T15:53:45Z","title":"Spatial Traces: Enhancing VLA Models with Spatial-Temporal Understanding","version":1},"cited_work":{"arxiv_id":"2508.09032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09032","snapshot_observed_at":"2026-07-03T21:08:58.805621Z","title":"Spatial traces: Enhancing vla models with spatial-temporal understanding","venue":null,"work_id":"42c8bfd9-10b5-40d7-bc46-cf63683635f9","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2508.09032","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:e51ed538ac54d1014e0c2194ddec51ec85818ac8edc96713b6ebaf6411aecca0","observation_id":"6dd17db8-49e1-424c-aa14-ecd4a8a41852","resolution":{"observed_at":"2026-07-03T21:08:58.807388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:96ce9103227f60ca2f6201219ec4a61bdf5197e46a5ae5776e3783e758b38e22","observation_id":"ea047546-4cc6-4609-94d9-94c17ea398f8","resolution":{"observed_at":"2026-07-03T21:08:58.809725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":"2506.01844","doi":"10.48550/arxiv.2506.01844","metadata_source":"pith","pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","venue":"cs.LG","work_id":"0c5e9314-5fa7-4613-ad12-605a71d561d2","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:c11b59b1a6c93cdfeaa3130bdee5a1bcf20696936e6c44f9f90f850d4f94fe42","observation_id":"9902a336-631e-40fd-8977-91e42189ae2c","resolution":{"observed_at":"2026-07-03T21:08:58.814687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":"2412.03555","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-07-10T13:27:05.580089Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","venue":"cs.CV","work_id":"dc984d60-8996-44cb-8163-88e7526073b7","year":2024},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:f2daf060c8a8931728b5d7e9f6aa554fb3cf6d407ce7c4311e1553e0332b5d66","observation_id":"36827ffb-a7f1-4771-a2ba-85b8dbd480ab","resolution":{"observed_at":"2026-07-03T21:08:58.825380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:1d824325bfc2fbc21d44e10b4de3046c9a69e6f94362d365856f028a2b5c74c5","observation_id":"d0383265-2a3f-47e2-bb6e-205a3d08be8f","resolution":{"observed_at":"2026-07-03T21:08:58.787488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T00:49:13.291897Z","title":"Tai Wang, Xiaohan Mao, Chenming Zhu, Runsen Xu, Ruiyuan Lyu, Peisen Li, Xiao Chen, Wenwei Zhang, Kai Chen, Tianfan Xue, Xihui Liu, Cewu Lu, Dahua Lin, and Jiangmiao Pang","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:f110208aaa5019fbc386342a0cbcb10eafb658bda1535329a1fbeb4b0b8b426a","observation_id":"34c70e45-b242-45b0-b03b-e35f68abf9f3","resolution":{"observed_at":"2026-06-27T00:49:13.291897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":"2502.05855","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-07-10T04:16:48.719609Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","venue":"cs.RO","work_id":"3564a757-5726-4b2a-a28e-114a4a467dfb","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:3110786d8cd5ef24ae3805616c7ba38958913f4918b3763c0e67580b96388369","observation_id":"3c3b8c0d-17ea-4740-98af-b9410d82b5a7","resolution":{"observed_at":"2026-07-03T21:08:58.781134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07746","last_updated":"2025-03-26T08:48:13Z","snapshot_observed_at":"2026-08-06T15:14:33.303432Z","submitted_at":"2024-03-12T15:28:51Z","title":"Unleashing HyDRa: Hybrid Fusion, Depth Consistency and Radar for Unified 3D Perception","version":4},"cited_work":{"arxiv_id":"2403.07746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.07746","snapshot_observed_at":"2026-07-03T21:08:58.788628Z","title":"Unleashing HyDRa: Hybrid fusion, depth consistency and radar for unified 3d perception","venue":null,"work_id":"3cbd845a-a94d-4728-928d-01d067a7b461","year":null},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2403.07746","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:347217b8eb30f801a48e3caf793b999eb2727b038c024602b9c565d7f902c0a7","observation_id":"1ecde03b-1c19-4ab7-9ece-d491ae0cf1a1","resolution":{"observed_at":"2026-07-03T21:08:58.790273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-03T03:53:18.422734Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":"2601.18692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-07-10T07:26:54.460833Z","title":"A Pragmatic VLA Foundation Model","venue":"cs.RO","work_id":"9b5a37fb-5c5d-4fbb-a804-d518173f2011","year":2026},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:bd34cf92ce6f0190c30a8e21907c28c5c1add4906e05066b3bb4aaa17cce8ce3","observation_id":"e846c0ce-820a-45fb-86bf-aa3999ff70bd","resolution":{"observed_at":"2026-07-03T21:08:58.803528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22159","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T07:14:45.419065Z","title":"Forcevla: Enhancing vla models with a force-aware moe for contact-rich manipulation","venue":null,"work_id":"0b6974ec-d23e-487a-8190-e895bab17267","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:312445e5a66d8c6d0c7b9625d828ec5f2aa82887dc03e7e5ff54bd12ad8a87c6","observation_id":"5d816bc4-fa2f-4d66-b12a-1c94e094fce6","resolution":{"observed_at":"2026-07-03T21:08:58.792833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10803","last_updated":"2025-09-09T09:24:29Z","snapshot_observed_at":"2026-08-05T12:04:21.579432Z","submitted_at":"2024-10-14T17:59:00Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","version":3},"cited_work":{"arxiv_id":"2410.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10803","snapshot_observed_at":"2026-07-04T09:19:42.980412Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","venue":null,"work_id":"215844af-97f5-4096-9d66-a0486a5a25de","year":2024},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2410.10803","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:afdfe9c4d086fb4ea24bb2589514b1ba80fecdd265c7c2039ebb7ad8367ab232","observation_id":"ed59098a-cfc3-4986-b4a1-1da622e0bebc","resolution":{"observed_at":"2026-07-03T21:08:58.774480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.04061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.775162Z","title":"Clap: Contrastive latent action pretraining for learning vision-language-action models from human videos","venue":null,"work_id":"78fa4106-a33b-4e83-b424-685397f3f452","year":2026},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:94294529f1c104f8d8b330a3dd64a45c2b64e2c21f805b7aa66be00a1e40047b","observation_id":"f0cd5287-2188-4a2f-8774-2c27d031698b","resolution":{"observed_at":"2026-07-03T21:08:58.776982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13508","last_updated":"2025-02-21T07:01:56Z","snapshot_observed_at":"2026-07-06T20:39:02.049006Z","submitted_at":"2025-02-19T07:53:45Z","title":"VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2502.13508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13508","snapshot_observed_at":"2026-07-04T17:30:00.525942Z","title":"Vlas: Vision-language-action model with speech instructions for customized robot manipulation","venue":null,"work_id":"f4c233ee-d357-4e90-aa02-c8032e8c4fc2","year":2025},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2502.13508","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:19fa16e6708dc829a391d0d7caa064d216f6b4b7972d711266b583245442f6bc","observation_id":"12c552b4-9e30-47a5-9f6e-02907289948b","resolution":{"observed_at":"2026-07-03T21:08:58.769029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:28bd2d37f1c5144f2cafa43fc0ca611aa7f24d0d2d76c644b82a2eb254bd7fd3","observation_id":"d053fa15-d9e8-4290-b91d-136925662772","resolution":{"observed_at":"2026-07-03T21:08:58.765321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.15394","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:58.767173Z","title":"Doracamom: Joint 3d detection and occupancy prediction with multi-view 4d radars and cameras for omnidirectional perception.arXiv preprint arXiv:2501.15394,","venue":null,"work_id":"9988b96d-3647-40a7-886c-82d57a51e061","year":null},"citing_paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T00:49:13.291897Z"},"links":{"citing_paper":"/paper/2606.17598"},"observation_digest":"sha256:acb218f3428fd89e76a697adf85946d65255a0f4aa2d4cc3c61122167c6ed9a9","observation_id":"959b0368-ad92-44e5-896c-1ce841bf1b05","resolution":{"observed_at":"2026-07-03T21:08:58.769127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.17598","last_updated":"2026-06-16T07:04:13Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:04:13Z","title":"MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":2,"verified_exact":24,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 2 inbound Pith citation observations for arXiv:2606.17598."}