{"as_of":"2026-08-09T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35e85f6770fd9b933d66e47d93e50a9ec14654f64d35044207cb6d99a165200d","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:32:47.949431Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:04:05.199011Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-04T09:34:44.154129Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-05T03:01:04.996856Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T09:34:44.154129Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2510.14836"},"observation_digest":"sha256:04a6f43abecaff39037d84b50516b6aa1a89087e47817a544c3de1d0bca4a154","observation_id":"19af9271-5ab4-4013-9b05-dd7b6cf08d83","resolution":{"observed_at":"2026-08-04T09:34:44.154129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-05T07:51:27.008234Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T06:28:22.652509Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2511.18960"},"observation_digest":"sha256:bb6bb26e380eb7c5a52f524e5103ec11676bf432841b8f10c2d5ce18067ec6f6","observation_id":"0fe86c0c-8d69-4c55-ab72-8922135f7214","resolution":{"observed_at":"2026-05-17T06:29:09.956059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:99b2941342863023593586a0644507a75637f8cd4f5e9e0c0b689d0c4fe4cd04","observation_id":"fa147f79-109b-48ed-8d65-e62d9182f7f1","resolution":{"observed_at":"2026-05-21T13:24:11.084402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2603.15620","last_updated":"2026-06-30T14:22:00Z","snapshot_observed_at":"2026-08-05T18:05:02.204734Z","submitted_at":"2026-03-16T17:59:57Z","title":"Towards Generalizable Robotic Manipulation in Dynamic Environments","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:26.446868Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2603.15620"},"observation_digest":"sha256:d699abdca4611421f7f5d64338e5451b463534704cd1fca0c52b5f2d24c65251","observation_id":"687336c7-bd92-4c6d-9459-ecc1d17ac7e6","resolution":{"observed_at":"2026-05-15T09:49:54.270525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-14T00:13:51.580603Z","title":"arXiv preprint arXiv:2508.10333 (2025) 14","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15620","last_updated":"2026-06-30T14:22:00Z","snapshot_observed_at":"2026-08-05T18:05:02.204734Z","submitted_at":"2026-03-16T17:59:57Z","title":"Towards Generalizable Robotic Manipulation in Dynamic Environments","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T00:13:51.580603Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2603.15620"},"observation_digest":"sha256:49676939a0b81254f2bbd6fe83f4219088ae84ea2cc70be3714a9668299da625","observation_id":"ac8c78d4-7a12-45ed-a724-9bff414a72fd","resolution":{"observed_at":"2026-07-14T00:13:51.580603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.11751","last_updated":"2026-04-13T17:25:41Z","snapshot_observed_at":"2026-07-06T23:00:03.762376Z","submitted_at":"2026-04-13T17:25:41Z","title":"Grounded World Model for Semantically Generalizable Planning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:05:29.465402Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.11751"},"observation_digest":"sha256:80960f7a471337c7ab8fbfd34b393bde0274546c2d650b54d03374f9b97854c4","observation_id":"61734d00-9f8d-434e-97c7-60a46713027d","resolution":{"observed_at":"2026-05-10T15:05:32.233313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.14125","last_updated":"2026-05-10T14:25:46Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:50:07Z","title":"HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T14:01:50.429917Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.14125"},"observation_digest":"sha256:4feeb50854ac7de81c7b7d1d05d755821580fdd9de954c57a5300e921e153c3e","observation_id":"37ad6c86-c8ef-4dee-9050-fe0b8a291e96","resolution":{"observed_at":"2026-05-10T14:05:29.539890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.14125","last_updated":"2026-05-10T14:25:46Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:50:07Z","title":"HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T01:51:46.849464Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.14125"},"observation_digest":"sha256:7c6e59fee56a2e300ff4bf70ddad7e59dabb1fe3469f9c7884373d1551d834b9","observation_id":"a89019a4-ca2b-49da-b1b5-e39e3a5f0e8f","resolution":{"observed_at":"2026-05-12T07:46:52.410964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T02:14:17.676675Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.19683"},"observation_digest":"sha256:0fb566eceef5a4629a3ac934fa656a14d9f4fdd195bac1733b1f973cd5c31cd5","observation_id":"8b519540-cf1a-4cb5-bf3d-dd72203cd8ee","resolution":{"observed_at":"2026-05-11T13:11:06.115031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T22:07:24.208555Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:be46d68438f6c9b60ca7ff758dd42a04bc21564eeb36c103d7409f7f43223521","observation_id":"8596f8aa-4994-4f4a-bdb5-6a505effefb7","resolution":{"observed_at":"2026-05-11T14:16:25.118343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-12T18:39:49.173828Z","title":"Reconvla: Reconstructive vision- language-action model as effective robot perceiver,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T18:39:49.173828Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:3e1c4d217564cbec918a022ed35e5e061e9b3edde570c011d94920a8343c1849","observation_id":"0b5e01cd-11ba-4333-a186-a3d1e3e36d45","resolution":{"observed_at":"2026-07-12T18:39:49.173828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2604.24182","last_updated":"2026-07-05T10:54:06Z","snapshot_observed_at":"2026-08-02T12:46:51.494465Z","submitted_at":"2026-04-27T08:44:12Z","title":"$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T03:13:36.437080Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.24182"},"observation_digest":"sha256:40febf8d2e06304888b72c40baeef1b8ad31234c1d46bf46e41bc95810aad53d","observation_id":"b834c9a3-a4f5-42f6-9030-286defb1a253","resolution":{"observed_at":"2026-05-11T22:11:16.014701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-12T18:17:43.564400Z","title":"Reconvla: Reconstructive vision- language-action model as effective robot perceiver,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.24182","last_updated":"2026-07-05T10:54:06Z","snapshot_observed_at":"2026-08-02T12:46:51.494465Z","submitted_at":"2026-04-27T08:44:12Z","title":"$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T18:17:43.564400Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2604.24182"},"observation_digest":"sha256:f159cf2af805b818245c5ca541ecbdcdea63d1c2077285875073ac7bc92eac12","observation_id":"120946ea-c5c6-4db0-bf1b-2c4431ab940b","resolution":{"observed_at":"2026-07-12T18:17:43.564400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.10903","last_updated":"2026-05-11T17:41:54Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:41:54Z","title":"CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:07:52.566360Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.10903"},"observation_digest":"sha256:fc8b314dab65f4a13f71d0d5f75281d4ffe937cac3048d16c0813b5b18f25786","observation_id":"ebe3b632-0602-4730-bbed-32727529d609","resolution":{"observed_at":"2026-05-12T06:36:26.986030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.12160","last_updated":"2026-05-12T14:10:54Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:10:54Z","title":"Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T04:55:23.145492Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.12160"},"observation_digest":"sha256:51feb9044e987cf9482adb3f558c7610751b87ec1bdf90b1c839d60acb3e08e1","observation_id":"633e7192-f355-4783-9050-9e01dab00802","resolution":{"observed_at":"2026-05-13T04:57:17.450518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:52.461348Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:c4a6656d77ad4d364509be195e9c0d0e18fc9b8f53d93ec3c4b7cbe31eacd436","observation_id":"3f82cfcf-3285-4442-82fa-fb2cff8805a0","resolution":{"observed_at":"2026-05-22T06:06:08.676554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T16:52:05.565650Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:0bcaaf240df34fe279d4273ccbb195c5a3b590066b09deeea7625ae1739f6c89","observation_id":"b45b1ea2-afc0-4140-a249-687f7ee2fdc2","resolution":{"observed_at":"2026-06-30T16:54:58.253115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:4e160960ec79b197a4e99ca0df367365aa7fe83bb6c395ff51e3797ac55e7f17","observation_id":"9fb6d44f-2a71-4c89-bed3-bc563272dbff","resolution":{"observed_at":"2026-06-29T13:43:28.942277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2605.31116","last_updated":"2026-05-29T10:27:32Z","snapshot_observed_at":"2026-08-02T02:51:10.320818Z","submitted_at":"2026-05-29T10:27:32Z","title":"NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T22:57:01.742536Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2605.31116"},"observation_digest":"sha256:04b7da4b2fe648c4eb09a6a2cd1c5713bb12e29729475eec7fb4b89e56f858c2","observation_id":"97f062d7-ed85-48d7-9bdd-387dd4e394a0","resolution":{"observed_at":"2026-06-28T23:02:45.777855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2606.01241","last_updated":"2026-06-02T03:11:27Z","snapshot_observed_at":"2026-08-07T02:28:05.002889Z","submitted_at":"2026-05-31T13:43:23Z","title":"OneVLA: A Unified Framework for Embodied Tasks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:08.124096Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2606.01241"},"observation_digest":"sha256:c9b1e9f3a7e1a3aaaec2bf4f59ace5dbd237825430f703dc06b9ce12cc32ec83","observation_id":"c7e9f867-668a-4f8d-abba-10e39c14a3f0","resolution":{"observed_at":"2026-07-01T21:26:14.110096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":"2508.10333","doi":"10.48550/arxiv.2508.10333","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver.arXiv preprint arXiv:2508.10333","venue":"arXiv (Cornell University)","work_id":"ea87a4e1-98d3-47b0-8a30-607509d2d727","year":2025},"citing_paper":{"arxiv_id":"2606.06155","last_updated":"2026-06-04T13:28:51Z","snapshot_observed_at":"2026-07-29T15:22:02.359291Z","submitted_at":"2026-06-04T13:28:51Z","title":"AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T01:23:02.576098Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2606.06155"},"observation_digest":"sha256:4f8e1297cc4cf373afed95bd3af425557398950199c0a9a4cf972e9254ca308b","observation_id":"def8b06d-2585-490c-9a1c-43e1c96c8825","resolution":{"observed_at":"2026-07-02T13:16:59.252395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Reconvla: Re- constructive vision-language-action model as effective robot perceiver,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-07-16T23:18:02.667998Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:2a2333e5cbf457aa415eb7b161e581170e764b9af32dea86f0adc0fee87ccaa7","observation_id":"679555cc-f140-41bf-872f-17c2adabb100","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-02T05:16:41.306473Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-07T12:37:37.871440Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.306473Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:4153fdadb33257609ceb9f9e5b461c2eda9fb6e51d425b66ed762971a6418da6","observation_id":"432ac8cd-3b5a-4d82-bd7f-38db2c5679f7","resolution":{"observed_at":"2026-08-02T05:16:41.306473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-06T00:30:08.940833Z","title":"arXiv:2508.10333","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01221","last_updated":"2026-08-02T13:11:22Z","snapshot_observed_at":"2026-08-08T21:56:02.159830Z","submitted_at":"2026-08-02T13:11:22Z","title":"EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:08.940833Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.01221"},"observation_digest":"sha256:746ebf26382048582d40df5226e5246b40f4b768aa273caeb4ea01be6dde9755","observation_id":"7c3528a9-9a6d-477e-9437-b8c2a6af53d9","resolution":{"observed_at":"2026-08-06T00:30:08.940833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-06T19:43:02.573394Z","title":"ReconVLA: Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04657","last_updated":"2026-08-06T12:11:22Z","snapshot_observed_at":"2026-08-09T12:15:28.230335Z","submitted_at":"2026-08-05T10:12:37Z","title":"MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:02.573394Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.04657"},"observation_digest":"sha256:2c31fc103df55ab79d98693c9be0656b5a9a6f6bb3de43dc72fcd6fafad3c3bd","observation_id":"a229022d-8beb-4610-9978-6d1de4977e9e","resolution":{"observed_at":"2026-08-06T19:43:02.573394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-08T18:04:05.199011Z","title":"ReconVLA: Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04657","last_updated":"2026-08-06T12:11:22Z","snapshot_observed_at":"2026-08-09T12:15:28.230335Z","submitted_at":"2026-08-05T10:12:37Z","title":"MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:04:05.199011Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.04657"},"observation_digest":"sha256:d3ce6288a0cdf5630ef119e60e6c151afa74ed06555f5493789aa321e458165f","observation_id":"f2086ba7-6ef6-43ed-bffe-b0771fb280dd","resolution":{"observed_at":"2026-08-08T18:04:05.199011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10333/citation-record","integrity":"/paper/2508.10333/integrity","json":"/paper/2508.10333/citation-record.json","paper":"/paper/2508.10333"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:42.157327Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.157327Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:4e36772d591c881dd7d3110db66f21b5f022467a2073c60b4e5b456a2e8938e2","observation_id":"016cf2e5-6ffc-416b-b2ae-b2216e04b144","resolution":{"observed_at":"2026-08-05T20:32:42.157327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:42.256938Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.256938Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:5449c05c4e2b99158ad510355bfc2b16c8ac4da7b0e40a44f2a6f1a0a9655632","observation_id":"51f44ab3-2844-4713-9497-581cd0c11de9","resolution":{"observed_at":"2026-08-05T20:32:42.256938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T20:32:42.335373Z","title":"W.; Ilharco, G.; Wortsman, M.; and Schmidt, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.335373Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:ca46bd1b6acdf8b4386c2476383bb7208ea3dc3464c445331b5fa75055176039","observation_id":"aeeb2696-acee-489f-a136-bc444a61c5b6","resolution":{"observed_at":"2026-08-05T20:32:42.335373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T20:32:42.445023Z","title":"S.; Kolesnikov, A.; Wang, X.; Salz, D.; Neumann, M.; Alabdulmohsin, I.; Tschannen, M.; Bugliarello, E.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.445023Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:6eec33a0e0eab45c7351152a3262c06c375cd7ca92829e1f22c3b142555cdbfe","observation_id":"55b44d0f-e875-4922-be3e-02fe9f8fd682","resolution":{"observed_at":"2026-08-05T20:32:42.445023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:55.223829Z","title":"R.; Finn, C.; Kumar, A.; and Levine, S","venue":null,"work_id":"45c94ffa-c531-48ad-9c75-4b1b20c7ecdd","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.532847Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:f1bd695b91abf7ecc1767364ae5246ffd67a05bd22d9a818a3f733ad115fd758","observation_id":"c00ad31d-fa76-43a3-90a4-ad61a16998c0","resolution":{"observed_at":"2026-08-05T20:32:55.339761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:55.009705Z","title":null,"venue":null,"work_id":"54dee4fa-6c81-45e3-9cf1-e9c98d2b3642","year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.649791Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:2229ea0161856a03ed9e2aad168528edf50b9ef88f5da703c5c8ae103f7b53bc","observation_id":"06acae65-edc6-4903-8305-99374a8069ba","resolution":{"observed_at":"2026-08-05T20:32:55.111512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-05T20:32:42.733209Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.733209Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:c7d0229a8df643d78b3ecf1aa8820d876e6466545d9cd45a1e1236f9905213e1","observation_id":"198b9eed-5966-4a5b-925f-906ed4ef824f","resolution":{"observed_at":"2026-08-05T20:32:42.733209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:54.817467Z","title":null,"venue":null,"work_id":"97d5355a-4bbd-40b3-95a1-7cc5adae6f93","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.870859Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:546072174c07b6ff6439c0022b420be1af33eab951b1d1e6b6f90563b82d414c","observation_id":"c547134b-6b44-49d3-8058-63b9bcfabe75","resolution":{"observed_at":"2026-08-05T20:32:54.891716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-07T12:15:14.265779Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-05T20:32:42.981102Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:42.981102Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:4dd7fa19361bf8376593889a41a2c21ab8ddf5d8564b3478f4a6f5fb603097eb","observation_id":"a0da2fd6-ec44-4efb-b3ca-6e38b27f6f4b","resolution":{"observed_at":"2026-08-05T20:32:42.981102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07194","last_updated":"2023-02-14T17:02:35Z","snapshot_observed_at":"2026-07-06T14:51:48.920020Z","submitted_at":"2023-02-14T17:02:35Z","title":"Score Approximation, Estimation and Distribution Recovery of Diffusion Models on Low-Dimensional Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07194","snapshot_observed_at":"2026-08-05T20:32:43.065743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.065743Z"},"links":{"cited_paper":"/paper/2302.07194","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:a56f82839ec3b83221d042d8234a103ec7ca01b6a12fa380965792ae51caf068","observation_id":"ab4bafc3-28af-4703-879e-7fe899692918","resolution":{"observed_at":"2026-08-05T20:32:43.065743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:54.566274Z","title":"2016--2019","venue":null,"work_id":"6f8be93e-1e24-4aa6-86d3-277a9b7b8c13","year":2016},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.146408Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:a71476b51f084578ff286c819336c3ed2081e4951cac8716c7cb8a7a594ab6ca","observation_id":"714ce289-afb3-4d49-997b-99ce921d69b2","resolution":{"observed_at":"2026-08-05T20:32:54.667834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03912","last_updated":"2025-05-06T18:35:07Z","snapshot_observed_at":"2026-08-07T15:49:25.272514Z","submitted_at":"2025-05-06T18:35:07Z","title":"OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03912","snapshot_observed_at":"2026-08-05T20:32:43.242879Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.242879Z"},"links":{"cited_paper":"/paper/2505.03912","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:d349d94169152e04caf1bb2b4f1bb75f18d4d169d757a88089d7856b5110b2b8","observation_id":"69e98311-e672-4d82-a735-259fddfe5f32","resolution":{"observed_at":"2026-08-05T20:32:43.242879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-05T20:32:43.318557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.318557Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:9ab9ae882003f3d91b8ae8754ce5dcfe2bf00de272da9bda5f2bc16975c76f80","observation_id":"551c752c-1b81-4542-9afb-cc94e77c9086","resolution":{"observed_at":"2026-08-05T20:32:43.318557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:54.335899Z","title":null,"venue":null,"work_id":"480660d3-13a3-4985-90e4-ac64a301105e","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.423867Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:5e75cd5688f766a9f041feaada32087ba1b5bc2cbaa3ee33f0ab2b77e36852cc","observation_id":"938d2317-9e60-46c1-a3f9-030549681f0e","resolution":{"observed_at":"2026-08-05T20:32:54.442791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:54.125633Z","title":null,"venue":null,"work_id":"b0356b2d-23b3-4fdd-bc11-006f78997c9a","year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.559992Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:d35b64831b9d76d2ce1232cb21405dd1452ba449cbf9bd5a52dbecdeadc2b1d9","observation_id":"d35117dd-cc1c-4143-9414-317818c7bc8b","resolution":{"observed_at":"2026-08-05T20:32:54.217460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:53.908481Z","title":null,"venue":null,"work_id":"434334bf-9478-4f35-9923-04214fd59926","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.659725Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:750cc71489885ae9c18ac9dd29da24246f17d761e64bc8f55ec1a42c99fea476","observation_id":"53a7fbd4-1b51-41ca-82a2-d25b7325feb7","resolution":{"observed_at":"2026-08-05T20:32:54.003307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18179","last_updated":"2024-11-27T09:54:58Z","snapshot_observed_at":"2026-08-09T02:02:35.001770Z","submitted_at":"2024-11-27T09:54:58Z","title":"Prediction with Action: Visual Policy Learning via Joint Denoising Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18179","snapshot_observed_at":"2026-08-05T20:32:43.779814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.779814Z"},"links":{"cited_paper":"/paper/2411.18179","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:08edbb60373cfa41fa46f06cabfabf39f1e4f0daf62fc42b914486ef46f2100b","observation_id":"1202615c-7b2a-4fb4-ae69-df1faa8315fa","resolution":{"observed_at":"2026-08-05T20:32:43.779814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:43.866349Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.866349Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:a5cb7ae8ff8364cd28e48ac33b1cbae1c973b2b0657a5356cb31f48ecc5f92b0","observation_id":"5ea62d55-fde7-489e-a6e8-98527acce49e","resolution":{"observed_at":"2026-08-05T20:32:43.866349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-05T20:32:43.969912Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:43.969912Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:7713e76d8a478c8f44db08a240bb571aecec79689227b651ae1438cdca00d86b","observation_id":"1689ff9b-2280-4c5d-98aa-43d842ff1973","resolution":{"observed_at":"2026-08-05T20:32:43.969912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:53.732679Z","title":null,"venue":null,"work_id":"96f8b52a-2238-45ea-946d-7535e4d18307","year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.077675Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:ed5f33a97190cf34e23abc7647d75472a276f8086e1e5622873f49b647c49c00","observation_id":"6087975a-809b-457d-9aa9-8bbee619fd25","resolution":{"observed_at":"2026-08-05T20:32:53.809157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00364","last_updated":"2022-10-11T13:20:30Z","snapshot_observed_at":"2026-07-06T13:16:16.926712Z","submitted_at":"2022-06-01T10:03:24Z","title":"Elucidating the Design Space of Diffusion-Based Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00364","snapshot_observed_at":"2026-08-05T20:32:44.168164Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.168164Z"},"links":{"cited_paper":"/paper/2206.00364","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:45b977b968ff09b447fefa7f2f9db5f7fae381b88c439c5aac3ce21d1dc796f2","observation_id":"ab0ec46e-731b-4f0b-abf5-efcf72132ebd","resolution":{"observed_at":"2026-08-05T20:32:44.168164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-05T20:32:44.246525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.246525Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:4f26b292cfb2df50ee52342ad99b3c400bcb9b2a8a50effdb14a302b61f6bce3","observation_id":"a9876cd6-eab2-4244-8bdd-b648e0c9944c","resolution":{"observed_at":"2026-08-05T20:32:44.246525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:53.475320Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E","venue":null,"work_id":"cd9c12e9-88ce-4930-888f-e70c054d2670","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.342040Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:c239b1171f80eafd9330df9f232c2babdfd3914ba1ed845d643e9abc2dec4376","observation_id":"dcc27518-8402-45ab-8d2d-e921d14404e3","resolution":{"observed_at":"2026-08-05T20:32:53.600727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T20:32:44.447704Z","title":"P.; and Welling, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.447704Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:0accbf5522c1ebcfa3b7b70610b80525e1d20b92035c743bfa6d0b679d39f282","observation_id":"da5c8f71-2c0d-4347-a6e9-a711655e2601","resolution":{"observed_at":"2026-08-05T20:32:44.447704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-06T07:43:56.889679Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-05T20:32:44.554728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.554728Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:58cdab50bc2fcf8538e3a8a789ea800fd126a7f507189a7cea317440c628f4f6","observation_id":"9fca09ee-667d-40b0-9ce7-6108f3bd8d1f","resolution":{"observed_at":"2026-08-05T20:32:44.554728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:53.200146Z","title":null,"venue":null,"work_id":"e9ac60d3-3f6e-490f-91e6-f21344cac7d8","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.669023Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:e14bfe9fae50ec31d024346bf0f89dd8e701b1fa9610c73b4830dafdf349b14d","observation_id":"b70c07cb-7301-41f9-bb17-c5cbbd37e5a1","resolution":{"observed_at":"2026-08-05T20:32:53.342812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:52.993507Z","title":null,"venue":null,"work_id":"a47c9f21-2173-487b-b6a4-42a431cd9fcb","year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.765284Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:953a3024d6c8a9398bb235db77ff2290746ddf82e266518d926ee19d5bc09e2f","observation_id":"c6d3a858-2cef-4a18-868a-14a5e7a7fa19","resolution":{"observed_at":"2026-08-05T20:32:53.096576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:52.680647Z","title":null,"venue":null,"work_id":"ea0a738a-de88-4991-9a00-53155b0068ec","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.866675Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:5bbad7af36dab9f260ca739e985965580124dfe93eac9a8ccaf0e93ca27a36b6","observation_id":"c4ffcb0e-a213-4910-8ad6-d0482e7ffc4f","resolution":{"observed_at":"2026-08-05T20:32:52.824198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:52.435394Z","title":null,"venue":null,"work_id":"dd03dba7-d4d6-4f3e-83c9-fcc16e937c70","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.956249Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:d4e4cad3bf560536c4c24d4780ea56bc36ee3b54df5e8deac61b91955f2e1923","observation_id":"07a1d701-131b-4fb7-81de-748660bc9c78","resolution":{"observed_at":"2026-08-05T20:32:52.552907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:52.106769Z","title":null,"venue":null,"work_id":"93788f20-3ec1-4e43-9e65-7990060be3ae","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.066281Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:148b7d1bc3a545342c4719794cbfe5caa6736d10a2c15600d4c9f7b4e80eaab1","observation_id":"ae041e0c-9b5f-4608-8038-a44070d822f3","resolution":{"observed_at":"2026-08-05T20:32:52.262406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T20:32:45.212485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.212485Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:ad6f30093139816b27216260964378f6e6b999b5c4b5fe6deda03d2b4adb8938","observation_id":"cc708740-53df-4841-9066-d53e6a38ec97","resolution":{"observed_at":"2026-08-05T20:32:45.212485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:51.810514Z","title":null,"venue":null,"work_id":"6b1de07f-ed87-466a-a160-16fb525bfb6b","year":2021},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.297037Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:606950b7b3eb94a9fcd736bc1dccb0760bd3ed103ddd27114a4d302af9f8d47e","observation_id":"19505c9c-a177-4790-8423-3693c94b90c0","resolution":{"observed_at":"2026-08-05T20:32:51.940390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11815","last_updated":"2024-06-17T17:55:29Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:55:29Z","title":"LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11815","snapshot_observed_at":"2026-08-05T20:32:45.390488Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.390488Z"},"links":{"cited_paper":"/paper/2406.11815","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:7ba5622b447edc5fddca4c00a8226892674a0221cceb92872462827eda4f08a9","observation_id":"dc6d773c-9e4a-4678-94a5-6d73163ec34e","resolution":{"observed_at":"2026-08-05T20:32:45.390488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:51.487601Z","title":"Y.; Sanketi, P.; Vuong, Q.; Xiao, T.; Sadigh, D.; Finn, C.; and Levine, S","venue":null,"work_id":"cdb7f6db-2a66-414e-a4ca-5a1562e4707e","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.482182Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:1373e73e73c038b096002aab9731f27a0da76dd5e68f1ea69d9d4c65479a867b","observation_id":"89925814-2c7a-48a3-96e5-87396f0cc01b","resolution":{"observed_at":"2026-08-05T20:32:51.617250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:51.116620Z","title":null,"venue":null,"work_id":"8ad1d4ed-e37a-4d3b-a28c-2c54214ee81a","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.579047Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:d01ace84af1a78278ad9d436aa3d5bc3e5d52a2583fb83290bbb795b65d4b267","observation_id":"df7fb02b-7e2b-4311-a8b1-676ab029924f","resolution":{"observed_at":"2026-08-05T20:32:51.298656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-05T20:32:45.709820Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.709820Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:3e94aea6af53e0d2a6e2662e425f54b38a711a8a945f8c66774a247a9e226351","observation_id":"8276046b-c484-4278-8264-49318ee9d348","resolution":{"observed_at":"2026-08-05T20:32:45.709820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-05T20:32:45.824230Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.824230Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:0900da947132692f6de443bc85cf6eee13ba51147bfa2bd7896745c007452fd7","observation_id":"1cdedee4-544a-4af8-a9b4-0b3a8e676f7c","resolution":{"observed_at":"2026-08-05T20:32:45.824230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-09T08:04:04.356216Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13725","snapshot_observed_at":"2026-08-05T20:32:45.934582Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:45.934582Z"},"links":{"cited_paper":"/paper/2506.13725","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:06694d6b580a1680aa7143af8186719d0b356e79c7fce566da6dcbb4eff05b3c","observation_id":"be481c99-2867-4366-a198-bc684b3d9df4","resolution":{"observed_at":"2026-08-05T20:32:45.934582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:46.054694Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.054694Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:c433d52113861c18e43854bffc93bf0b56695deaa1a1f9564645da456dad39aa","observation_id":"dc72166d-d190-4471-abc2-81fee668cfae","resolution":{"observed_at":"2026-08-05T20:32:46.054694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10826","last_updated":"2025-06-13T12:14:44Z","snapshot_observed_at":"2026-08-07T13:59:09.057652Z","submitted_at":"2025-06-12T15:44:51Z","title":"RationalVLA: A Rational Vision-Language-Action Model with Dual System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10826","snapshot_observed_at":"2026-08-05T20:32:46.126998Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.126998Z"},"links":{"cited_paper":"/paper/2506.10826","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:7606201e1555677c0d5f620f7a222aa1641686a63b30e519e164535be34375b7","observation_id":"aa00de08-9610-42d6-9bd4-d8f86cb31bc2","resolution":{"observed_at":"2026-08-05T20:32:46.126998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:50.874559Z","title":null,"venue":null,"work_id":"0c564c18-79f8-4e7f-a33b-16e609a0bfd7","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.259758Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:18f73d465c6aa9afcb38370fda42dd24a50c3de5df39e791f824c56ecbd1ac08","observation_id":"962310b2-29a4-435c-8c94-a14bacd57d74","resolution":{"observed_at":"2026-08-05T20:32:51.007699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05600","last_updated":"2020-10-10T07:46:19Z","snapshot_observed_at":"2026-08-01T16:44:46.833530Z","submitted_at":"2019-07-12T07:37:26Z","title":"Generative Modeling by Estimating Gradients of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05600","snapshot_observed_at":"2026-08-05T20:32:46.370745Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.370745Z"},"links":{"cited_paper":"/paper/1907.05600","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:89fb80ee6a4bd0a9b40c1fd2aca187d053d46036addaad61c2ade1865d7f152b","observation_id":"c8a4849e-a5f7-4daf-ab83-e3007ad3de02","resolution":{"observed_at":"2026-08-05T20:32:46.370745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:50.553678Z","title":null,"venue":null,"work_id":"07d71290-d8b4-402d-95dd-11a7ac3f9233","year":2020},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.479452Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:67f85501eea4145893a1ddcc7b91c65cdd152e749f6eda2f9d12e089dda5fc60","observation_id":"555eac16-8dc4-49c0-8c20-45642aa8b9e4","resolution":{"observed_at":"2026-08-05T20:32:50.728268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-05T20:32:46.559044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.559044Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:a7d086b862953e693b2764c6e1a9df65d5c8591e793b0e03c32e82e5b139f49d","observation_id":"d881a641-d32d-4186-baf1-a0d8bba7cae6","resolution":{"observed_at":"2026-08-05T20:32:46.559044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15576","last_updated":"2025-05-27T07:05:44Z","snapshot_observed_at":"2026-07-06T20:10:41.978020Z","submitted_at":"2024-12-20T05:17:06Z","title":"QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning","version":5},"cited_work":{"arxiv_id":"2412.15576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.15576","snapshot_observed_at":"2026-08-05T20:32:48.204027Z","title":"QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning","venue":"cs.RO","work_id":"8e03241d-4e83-46fd-924d-d99a874a870d","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.642262Z"},"links":{"cited_paper":"/paper/2412.15576","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:934dc3b3cfc3e65257fccfbe609a1ec22418106c353fc151845540e481079b33","observation_id":"04fd7e57-eaf3-4ceb-b882-4eea9e122eba","resolution":{"observed_at":"2026-08-05T20:32:48.264716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:46.725496Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.725496Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:6c6657b1d003434ed61e0bd0221c7fa6a8d47df74894832c55f48e99f1eafdd5","observation_id":"78b3481b-d7df-4f6c-b1ad-bf84737163a5","resolution":{"observed_at":"2026-08-05T20:32:46.725496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-02T23:50:48.668259Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-08-05T20:32:46.783305Z","title":"J.; Du, M.; Zheng, C.; Zhao, T.; Hansen-Estruch, P.; Vuong, Q.; He, A.; Myers, V.; Fang, K.; Finn, C.; and Levine, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.783305Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:4b0b9db57a2fdb65639a34e04da2f1bfcc0064626eccb7b4fd13a8db6723a852","observation_id":"c1cd9d61-8884-436f-b469-261b8210cb6e","resolution":{"observed_at":"2026-08-05T20:32:46.783305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:50.147395Z","title":"R.; Black, K.; Zhao, T","venue":null,"work_id":"10486014-63af-4917-8fd4-b6877ade0e86","year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.873909Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:a6a0b05e8435bc051e7b1bc83ccb82b111e1bff3815879a34db118b241c18fa7","observation_id":"5e261572-3b55-4c88-b4be-eb504e83cbf3","resolution":{"observed_at":"2026-08-05T20:32:50.320404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09575","last_updated":"2024-12-31T02:38:30Z","snapshot_observed_at":"2026-07-06T19:32:24.202391Z","submitted_at":"2024-10-12T15:54:29Z","title":"Reconstructive Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09575","snapshot_observed_at":"2026-08-05T20:32:46.962180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:46.962180Z"},"links":{"cited_paper":"/paper/2410.09575","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:9cf4a6becdf0ee24f279053ef8393842e41b3fabfc6ad7a03c7f7e805cf0a7cb","observation_id":"961c6b19-704e-4cf5-8b3d-43130886e1a4","resolution":{"observed_at":"2026-08-05T20:32:46.962180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-06T22:59:06.087089Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-08-05T20:32:47.040368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.040368Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:963889d6c26483abd5815a51f674c87e7aeb3f70ab4dad9435fc7ff1beb4897d","observation_id":"35480d38-3d8d-435c-a75a-6db8a4a4b601","resolution":{"observed_at":"2026-08-05T20:32:47.040368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.804258Z","title":null,"venue":null,"work_id":"176d76e9-11d7-4539-8ed2-6c4af130afc5","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.125046Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:e46b414f4d498a0fd2da3117a056fb8eb9283460ecf5b4f87fd2ef8c6608f0c8","observation_id":"ab9de928-841d-4d9c-b2d6-9bac4f94c513","resolution":{"observed_at":"2026-08-05T20:32:49.945212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.649341Z","title":null,"venue":null,"work_id":"a2f446aa-4bcd-4164-8ca8-f450b5e01860","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.234493Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:4c6297deb53e4f1faeb3a3ac6b7c36c3777189b24a92734b6795f3067ad6e153","observation_id":"f7912514-9f6e-441a-a431-939058de3eed","resolution":{"observed_at":"2026-08-05T20:32:49.736982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T20:32:47.323607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.323607Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:14a994b15336b5db40f8ac99037eb4f560be75ba5392039f995bfe047c36951a","observation_id":"e3675e46-39e6-40c1-8a83-8b3963868738","resolution":{"observed_at":"2026-08-05T20:32:47.323607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.468899Z","title":null,"venue":null,"work_id":"18116286-9bc4-400d-8d6f-253acc44b40c","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.410676Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:77210290e00036fab19915f5f42aa85a369f0a6d076d4c2b49f2f1863ed5a55f","observation_id":"9b121ff5-6903-468a-b8b1-5072aa742e75","resolution":{"observed_at":"2026-08-05T20:32:49.535472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-05T20:32:47.498001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.498001Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:45a73e8cd50707b63cb05a30d28dd60ccdb8177ed01c480c3ea7bf14080a5ec9","observation_id":"c72d3213-3f3d-4590-99c1-76b9ef2cd74e","resolution":{"observed_at":"2026-08-05T20:32:47.498001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-05T20:32:47.563746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.563746Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:e65ac0a2ec5a1f451ec649c5ff8f2e4a36effae22c72401cbe117f6218180c02","observation_id":"e5c2536f-6e29-4fd2-9a13-780548522aeb","resolution":{"observed_at":"2026-08-05T20:32:47.563746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.255995Z","title":null,"venue":null,"work_id":"4fc926fa-7916-44d7-9a58-e8301ad5c420","year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.644076Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:91ebef2f4f683b03dde31eee178f1b0e4d916cb7487dd3abb19b02a38d8820a1","observation_id":"4e7d3ff6-6072-4b93-ba59-62fe787ce832","resolution":{"observed_at":"2026-08-05T20:32:49.340025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08007","last_updated":"2025-03-11T03:13:45Z","snapshot_observed_at":"2026-08-07T17:14:29.980290Z","submitted_at":"2025-03-11T03:13:45Z","title":"MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08007","snapshot_observed_at":"2026-08-05T20:32:47.702884Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.702884Z"},"links":{"cited_paper":"/paper/2503.08007","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:7abb3f7cbda7d9fee02bcaaf3fcbd94281853fa11e836fe50cf2248a5eea1f25","observation_id":"2878e17c-26e5-4437-902a-464de73e7722","resolution":{"observed_at":"2026-08-05T20:32:47.702884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:49.081264Z","title":null,"venue":null,"work_id":"b653c24c-443e-4f18-984b-d8828e8343b2","year":2025},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.766165Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:45d961321b0fe1f41e60c63e494c4a9a8da071fd455904f1986cc1b552505211","observation_id":"30b05cf0-1631-4f7f-802e-65e17540558d","resolution":{"observed_at":"2026-08-05T20:32:49.158036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:48.921380Z","title":null,"venue":null,"work_id":"4261a2ea-e7e7-4097-b4c8-920f92f4fa82","year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.881596Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:56059cb30fc13321e889609d1a43143dbf6902bc09c45a531b7e87f425ac611d","observation_id":"c5a20b2a-d22f-4280-bcaa-1753625b240b","resolution":{"observed_at":"2026-08-05T20:32:48.985244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:48.757010Z","title":null,"venue":null,"work_id":"1bbd7652-5fa7-4a35-b962-28b68418e565","year":2023},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:47.949431Z"},"links":{"citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:d34fc1b001bcd9c8c7b0737acca6e6b5a5dfdf90204cddb2085796abe09d7e1c","observation_id":"c1bca469-ffdb-400d-bdd3-e767492d0800","resolution":{"observed_at":"2026-08-05T20:32:48.824489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 26 inbound Pith citation observations for arXiv:2508.10333."}