{"as_of":"2026-08-07T22:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a92126f7cfe2acac7ce099a6c3ed87cc4ed80e2d4b6308a42269a34a1423c070","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:44:18.247570Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05042/citation-record","integrity":"/paper/2608.05042/integrity","json":"/paper/2608.05042/citation-record.json","paper":"/paper/2608.05042"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:11.836856Z","title":"OpenVLA: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:11.836856Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:c8819b08388783fab0ef55a5e6d0a8a3708922879472a64a038e7c0ee0872c08","observation_id":"da635c3e-14ba-454c-ad3a-f0147571b3d3","resolution":{"observed_at":"2026-08-06T10:44:11.836856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-06T10:44:11.920374Z","title":"π0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:11.920374Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:d69acdabc503e46d3ed57b7450fab7d35bc429702ebd4b71a3976330c1896cce","observation_id":"30ef66ac-b196-4113-845a-b1c1b5b72135","resolution":{"observed_at":"2026-08-06T10:44:11.920374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-02T17:03:10.577295Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30877","snapshot_observed_at":"2026-08-06T10:44:12.106434Z","title":"W ALL-OSS-0.5 technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.106434Z"},"links":{"cited_paper":"/paper/2605.30877","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:dd48cb8154ebb26a44a44f4e7674d4876db538003a882fc73d7fed2f14c9ffee","observation_id":"4c4286e5-ac21-4ebc-becb-0504efc4af64","resolution":{"observed_at":"2026-08-06T10:44:12.106434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.052466Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":"8e9697cd-210c-4604-acaf-7c308276c715","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.235379Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:2f4e1e5b594792d79c93112724a1caceee8f2f77aad2cd94f6ee78df4dcf5d1e","observation_id":"9ae2648e-564a-4774-8ef4-35d5a4bf726b","resolution":{"observed_at":"2026-08-06T10:44:19.055685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.042432Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"0382dc55-c8a7-4627-b6c9-16c05c15a7c3","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.390934Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:6e34bc8fad275500287affc7e9f0d5e08c4f9dd67bf8e7bbdc23f4dfa43e12c0","observation_id":"72f95a25-9bc3-4002-aaa5-25cae51bd56a","resolution":{"observed_at":"2026-08-06T10:44:19.046255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.033150Z","title":"Perceiver-Actor: A multi-task transformer for robotic manipulation,","venue":null,"work_id":"383440fb-edbe-4d56-9ce9-f85682a06fdc","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.523105Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:6d4fd625abf882238492023db8bc3879752e3e8abd863fc7942dcb752f051e51","observation_id":"36ec393a-1107-4976-8e73-5b110a128bc7","resolution":{"observed_at":"2026-08-06T10:44:19.036180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.024698Z","title":"3D Diffuser Actor: Policy diffusion with 3D scene representations,","venue":null,"work_id":"6380d134-55c2-4a26-ba07-e2feef47cade","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.644589Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:bbb844e3d72dc9db4081297de567d9dedf935e162b0bd3e654cdc70867a4989f","observation_id":"62fa746e-6e30-4d58-bd9a-fbd27cc63775","resolution":{"observed_at":"2026-08-06T10:44:19.027748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.016317Z","title":"Act3D: 3D feature field transformers for multi-task robotic manipulation,","venue":null,"work_id":"c7423f55-113f-4397-ac14-0c60c274f25f","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.852518Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:211571fe1567fabc0965c167a30920b73201aa3a11d32c8dabdc315caad8d9a6","observation_id":"8b5524d3-a092-490e-a37f-9b0b724fa9be","resolution":{"observed_at":"2026-08-06T10:44:19.019261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:19.007509Z","title":"RVT: Robotic view transformer for 3D object manipulation,","venue":null,"work_id":"d7d9f822-8704-4f4f-9dbb-eb94b6ca8183","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:12.979457Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:29c14144c03d42e3e18f68b87d529109f16c2c8a24734fd7b9f243f709ef083d","observation_id":"c172a669-c510-4cd3-84cc-a552d268c8b2","resolution":{"observed_at":"2026-08-06T10:44:19.010416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.998863Z","title":"RVT-2: Learning precise manipulation from few demonstrations,","venue":null,"work_id":"4aaf2ce1-77ab-43cd-b074-7b7a05647354","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.078472Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:b428ceb2b5074265c16ae6ceb984ee4e79af0c8459e9af77fd7a4ca5d5e59637","observation_id":"132b4569-ec0d-4f4b-9f54-2f83a980c37f","resolution":{"observed_at":"2026-08-06T10:44:19.001863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.990186Z","title":"3D-VLA: A 3D vision-language-action generative world model,","venue":null,"work_id":"c4ab96b3-793f-489f-86f4-1bf89d5d0794","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.210283Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:6cc3e389cbc5070faede088bdc79450f9f24e87246c552635e06808768655328","observation_id":"111db71a-e83c-4bf4-ae07-e402e17c8359","resolution":{"observed_at":"2026-08-06T10:44:18.993333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.981810Z","title":"SpatialVLA: Exploring spatial representations for visual- language-action models,","venue":null,"work_id":"caae2ee0-1e40-482d-bea9-4ad4f99556b5","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.350018Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:902a25b923705f089b048c6c231ab810cef4a15146436b6fe8c9e621d8465a6a","observation_id":"abec4001-6626-4f0a-aa60-e1d5f1aae51a","resolution":{"observed_at":"2026-08-06T10:44:18.984740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.973452Z","title":"RLBench: The robot learning benchmark & learning environment,","venue":null,"work_id":"fc1c4efc-0da6-403b-93cb-f79aec30344f","year":2020},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.499499Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:3997063c6647c28b2d92cb1712b12a2e40e67a0607b2b4a3eb7879b58592d287","observation_id":"e7176949-b0a9-44bd-8dc7-6660c0d0d8c7","resolution":{"observed_at":"2026-08-06T10:44:18.976335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08191","last_updated":"2024-05-28T00:37:02Z","snapshot_observed_at":"2026-08-05T06:18:26.955637Z","submitted_at":"2024-02-13T03:25:33Z","title":"THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08191","snapshot_observed_at":"2026-08-06T10:44:13.672028Z","title":"The Colosseum: A benchmark for evaluating generalization for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.672028Z"},"links":{"cited_paper":"/paper/2402.08191","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:c9d9ccbd9eacbc6dbf46550acdb5047fa7d4fa58f32c82ee150649f6e3289aa6","observation_id":"edbb9f7e-c70c-4f75-96bf-10ee976757d3","resolution":{"observed_at":"2026-08-06T10:44:13.672028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.963516Z","title":"Towards generalizable vision- language robotic manipulation: A benchmark and LLM-guided 3D policy,","venue":null,"work_id":"ef14d54e-7142-424a-8432-735e360f8eea","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.754442Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:7a42557a167a103b84467adc79a6026b5bc4a532481074f377710f5c90a13b5e","observation_id":"6973dddc-827f-46de-a672-d9483518cd54","resolution":{"observed_at":"2026-08-06T10:44:18.966940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01229","last_updated":"2026-07-30T17:55:22Z","snapshot_observed_at":"2026-08-06T16:30:48.418848Z","submitted_at":"2026-03-01T18:59:59Z","title":"RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.01229","snapshot_observed_at":"2026-08-06T10:44:13.849049Z","title":"RMBench: Memory-dependent robotic manipulation benchmark with insights into policy design,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.849049Z"},"links":{"cited_paper":"/paper/2603.01229","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:ef98a4cf620df19404b82a010338d8888bd2bf63384e11297b74867ffd3d1b3d","observation_id":"fe57631e-5ac7-41f1-a37f-d84c9630ec0d","resolution":{"observed_at":"2026-08-06T10:44:13.849049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.953100Z","title":"SAM2Act: Integrating visual foundation model with a memory architecture for robotic manipulation,","venue":null,"work_id":"d566cde2-19d7-4d67-ac22-a6910065c974","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:13.970866Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:845699415b7183a3894f2b180deda4ae77e27d4c88edff8493f8c91548f641eb","observation_id":"10fe969f-77ba-4af8-8513-e8fb104d71cf","resolution":{"observed_at":"2026-08-06T10:44:18.956456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.942610Z","title":"BridgeVLA: Input-output alignment for efficient 3D ma- nipulation learning with vision-language models,","venue":null,"work_id":"dc594c98-f752-4cbf-b29c-00722ba9e31d","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.064287Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:20d4838f91d3211f9b948634e6b8fcec0c1d02097227feb3b6b84eb95e1fb48e","observation_id":"496c8dc8-a445-49a6-8865-e1fe4a147bc7","resolution":{"observed_at":"2026-08-06T10:44:18.945963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.931754Z","title":"RT-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":"b26e7fe9-bc09-4ca8-ab22-81f2ccae4e55","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.135586Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:0c180a59da7e34511600ca8c29b9ec3e1b963c5c2548a0039c4a1700d161a92c","observation_id":"b4bcc8d6-2459-47ba-b90b-71f01c45a501","resolution":{"observed_at":"2026-08-06T10:44:18.935088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.921436Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":"41ca0265-aa82-428b-a624-4db7601331a2","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.302562Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:4f92715e3d70e854e3fc5895121c67632870b43d3ac529501b16414b02ee18b3","observation_id":"a9af96c5-bcb5-4b3d-a666-3695f9e631c1","resolution":{"observed_at":"2026-08-06T10:44:18.924717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.909948Z","title":"FAST: Efficient action tokenization for vision- language-action models,","venue":null,"work_id":"f4d30865-9532-48bd-b0ea-7f4e424f8076","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.470124Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:6eef6e54d82b6540ffb14c0f4c724a5a3cdb2ccbd968c086eafe4d8a7e778bf7","observation_id":"371af7de-dfa1-40a4-806f-f70e409abec5","resolution":{"observed_at":"2026-08-06T10:44:18.914178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-06T10:44:14.652245Z","title":"π ∗ 0.6: a vla that learns from experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.652245Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:b1f803f7b339cbb703117ebf079e98d6f62740eebc6a0a843769e4f70b5c5963","observation_id":"2c2b5ade-1432-48d0-830c-4575e227a1bf","resolution":{"observed_at":"2026-08-06T10:44:14.652245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-06T10:44:14.797218Z","title":"π 0.7: a steerable generalist robotic foundation model with emergent capabilities,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.797218Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:bd9676d560e726ddf2f032d425ec5153c267335be34064e5f58dd0cd84984712","observation_id":"371df10c-c4af-4cec-bc5e-716115ee111e","resolution":{"observed_at":"2026-08-06T10:44:14.797218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.899318Z","title":"GEN-0: Embodied foundation models that scale with physical interaction,","venue":null,"work_id":"23820865-8b4e-49c7-bdbf-dbea534d4d6b","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:14.955267Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:acd725ed018a7c444654245501c524acf9cb8c4832593cd4a68e43053890f65b","observation_id":"8cf5754c-5969-4399-95a6-b3c9f23c9da4","resolution":{"observed_at":"2026-08-06T10:44:18.902689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.888776Z","title":"GEN-1: Scaling embodied foundation models to mastery,","venue":null,"work_id":"0f67cfcc-18f6-4c0f-b66d-c3f8aea5515a","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.131468Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:49386a1207e83d6e434e7ec4bfbc71965f580d7afc0ca8c75c474851888f829d","observation_id":"5ddf7257-1253-40f0-a59d-5e17719dbaa1","resolution":{"observed_at":"2026-08-06T10:44:18.892286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.878377Z","title":"GENE-26.5: Advancing robotic manipulation to human level,","venue":null,"work_id":"fcc17c2f-2801-4abc-8246-919370d39086","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.233329Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:4157fc2d3c14173f6190cec912abff966f5e0fe318bdc39d4f871c9dd992f3f4","observation_id":"ec1cd722-0cfb-4adb-babe-5a00236107cd","resolution":{"observed_at":"2026-08-06T10:44:18.881643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.867401Z","title":"ACT-2 preview: Generalizing reliability,","venue":null,"work_id":"8da5c5ff-878f-454c-b606-e63ab98367d1","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.384527Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:1c75d470534718172209f2e5943dfeb72ad1c947ddac2cd3487a10cc9b0b1885","observation_id":"821c082a-2eb8-4751-a1ee-4bec48253783","resolution":{"observed_at":"2026-08-06T10:44:18.871047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.856173Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models,","venue":null,"work_id":"92bb61dc-c686-4778-b4e7-ead893732260","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.548311Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:dae2ea9a8e8729c954b0fc3a8ce6ce3e096d24ded17be3156be739e6d92784f6","observation_id":"e1484038-fc1c-4daa-839f-7bfc9bf6ca4f","resolution":{"observed_at":"2026-08-06T10:44:18.860168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.845160Z","title":"PolarNet: 3D point clouds for language-guided robotic manipulation,","venue":null,"work_id":"4056d87a-fd07-4bd3-8df2-51bc47fe5ae5","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.653628Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:26b70013cc3cce9b08ae2b3d11d012ceb8ed2f3d9b0d64bfbbf6cae5f748606d","observation_id":"cd1f516d-f3ef-42f3-9164-897156e98ac9","resolution":{"observed_at":"2026-08-06T10:44:18.848674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.833749Z","title":"M2T2: Multi-task masked transformer for object-centric pick and place,","venue":null,"work_id":"7dccfa41-1a24-470f-b042-da7ecbcade2d","year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:15.829628Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:aa292125ab3287ae77faed619b4aa4974d84f9df9921eae492bbbe328104a4ef","observation_id":"eb140a8d-ce8b-4c83-9b44-15e09803f790","resolution":{"observed_at":"2026-08-06T10:44:18.837170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08950","last_updated":"2025-03-11T23:01:08Z","snapshot_observed_at":"2026-08-07T17:11:34.321061Z","submitted_at":"2025-03-11T23:01:08Z","title":"FP3: A 3D Foundation Policy for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08950","snapshot_observed_at":"2026-08-06T10:44:16.040209Z","title":"FP3: A 3D foundation policy for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.040209Z"},"links":{"cited_paper":"/paper/2503.08950","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:4c136d8a453b232a243e95a1009325242364a460c536b52fb88321ad458850ee","observation_id":"c4caa6bb-3519-40db-92e1-62c5f229d026","resolution":{"observed_at":"2026-08-06T10:44:16.040209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.822780Z","title":"Coarse-to-fine Q- attention: Efficient learning for visual robotic manipulation via discreti- sation,","venue":null,"work_id":"35e083a1-2ab9-4d5f-bd28-5150230b980a","year":2022},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.225713Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:05bc508199aacf7040abcc065c28de0084d5c4648183eceb7670233465e5995d","observation_id":"12c3079f-f9fd-4bd7-b466-94c5828442f2","resolution":{"observed_at":"2026-08-06T10:44:18.826462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.810974Z","title":"PointVLA: Injecting the 3D world into vision-language-action models,","venue":null,"work_id":"ceb45008-0961-44bd-b6e7-295b620ad888","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.363898Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:5325caf88409ee5ddc5e7208f0fc0f66956ced28276dfd900fe6e1b4a507d259","observation_id":"deeacec7-9962-42cf-ab9b-33007842f9c6","resolution":{"observed_at":"2026-08-06T10:44:18.814607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.799819Z","title":"Lift3D policy: Lifting 2D foundation models for robust 3D robotic manipulation,","venue":null,"work_id":"0916f5fa-a662-40a7-9334-c20567232d78","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.530929Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:510effe48a2f33cb1f238518fc2a62b9df885af4146858be6b04865d0bd11edf","observation_id":"518fea34-2208-4803-80f6-e2a854ba2e3a","resolution":{"observed_at":"2026-08-06T10:44:18.803293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.788400Z","title":"DINOv2: Learning robust visual features without supervision,","venue":null,"work_id":"2ede7e06-8fb5-454c-a744-1b6645731f03","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.777096Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:8a24634153767715f1fbcabdfb74642b99ab11673a940f947369b348dea2f41d","observation_id":"deb3e36c-995d-4e7d-9f68-269b8fdf977a","resolution":{"observed_at":"2026-08-06T10:44:18.791935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:16.921827Z","title":"OG- VLA: Orthographic image generation for 3D-aware vision-language action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:16.921827Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:4eb22ad9ebd43dca71f08e9609ab603dc9a2286e4aca202907b0272a4c2f52aa","observation_id":"dd8f4b74-cad6-4f31-b450-c15e922ec900","resolution":{"observed_at":"2026-08-06T10:44:16.921827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:17.011327Z","title":"Instruction-driven history-aware policies for robotic manipulations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.011327Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:448e6300002e4271684db921381eac038a83cedaf0cd0e7c5be92a85c35a83d6","observation_id":"0c222d1c-b006-4f1c-a73e-1d935006267a","resolution":{"observed_at":"2026-08-06T10:44:17.011327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-06T10:44:17.098344Z","title":"Causal world modeling for robot control,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.098344Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:c75e13367f53dfbb690e66fb4d001cc4a5bbaac4156118b6ec61e6c11458607f","observation_id":"e8352d45-348c-455d-9e25-5fba4dab6404","resolution":{"observed_at":"2026-08-06T10:44:17.098344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05979","last_updated":"2026-06-04T10:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T10:23:01Z","title":"World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis","version":1},"cited_work":{"arxiv_id":"2606.05979","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.05979","snapshot_observed_at":"2026-08-06T10:44:18.470160Z","title":"World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis","venue":"cs.RO","work_id":"640ad13f-fe94-4971-90f6-9b65ecddb769","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.241212Z"},"links":{"cited_paper":"/paper/2606.05979","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:44a5d2a8f67982e1c9845ae2465bbf02064fdd38941fbf0eeb66d812fe4cdf2c","observation_id":"19f9ba14-2da4-423f-9532-901e793b4ed8","resolution":{"observed_at":"2026-08-06T10:44:18.473850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.20562","last_updated":"2026-06-18T17:59:51Z","snapshot_observed_at":"2026-07-06T23:55:43.830896Z","submitted_at":"2026-06-18T17:59:51Z","title":"MemoryWAM: Efficient World Action Modeling with Persistent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.20562","snapshot_observed_at":"2026-08-06T10:44:17.373966Z","title":"MemoryW AM: Efficient world action modeling with persistent memory,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.373966Z"},"links":{"cited_paper":"/paper/2606.20562","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:d0a02b6dadf7ce89640a7427813f67c53c2e9cae25e710d05d70f0efca7d362c","observation_id":"f0b9dd4f-6e94-459e-9229-cbfa958934ba","resolution":{"observed_at":"2026-08-06T10:44:17.373966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.768884Z","title":"TraceVLA: Visual trace prompting enhances spatial- temporal awareness for generalist robotic policies,","venue":null,"work_id":"b0fa72d3-925e-4ca1-aa33-cfa7e228dbff","year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.477048Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:ad0e52e99a86c5dc24bd0f4cd34f241030aa8c2e537433007bcc51fe633e8b09","observation_id":"0e8265e4-ae1c-47cd-b236-f55b4fc3419c","resolution":{"observed_at":"2026-08-06T10:44:18.773326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:17.604914Z","title":"RoboMemory: A brain-inspired multi-memory agentic framework for interactive environmental learning in physical embodied systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.604914Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:095d02dcb8e8335891f43ac174309019bd54e8785d56931a295732682f814255","observation_id":"f3038fbd-6cc5-4a77-a2eb-dfc5a65702df","resolution":{"observed_at":"2026-08-06T10:44:17.604914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.757852Z","title":"MemoryVLA: Perceptual-cognitive memory in vision- language-action models for robotic manipulation,","venue":null,"work_id":"9ac6a798-4272-4089-b1c0-9dd48e888207","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.711839Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:11ecc377baf3887ae7d3cfb24b08ebb78c7dbab9973d6b1a869847d3d0a5d870","observation_id":"066b05a7-3096-4d78-a0b3-e3387bb86b98","resolution":{"observed_at":"2026-08-06T10:44:18.761545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18933","last_updated":"2026-08-03T20:19:45Z","snapshot_observed_at":"2026-08-07T22:09:29.197311Z","submitted_at":"2026-04-21T00:14:50Z","title":"Gated Memory Policy: In-Context Memorization and Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18933","snapshot_observed_at":"2026-08-06T10:44:17.858828Z","title":"Gated memory policy,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.858828Z"},"links":{"cited_paper":"/paper/2604.18933","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:b80e7d3525727e18f84da7ee71ceb30e75dd46ed3548ddf1350967a5a5767bc3","observation_id":"f8a91fcd-be30-4561-8774-439ae3e83a76","resolution":{"observed_at":"2026-08-06T10:44:17.858828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.746515Z","title":"You only scan once: A dynamic scene reconstruction pipeline for 6-DoF robotic grasping of novel objects,","venue":null,"work_id":"2c7526a1-bf7e-4485-b28a-b612ca83d6d2","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:17.940226Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:1283ae52eb32ff4a254f3708a8ac33a4a5a106100ef73da782ce88410939384a","observation_id":"b26ee186-b1d0-4ab4-8c02-0d0e5df61fff","resolution":{"observed_at":"2026-08-06T10:44:18.750220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18960","last_updated":"2026-06-18T07:33:11Z","snapshot_observed_at":"2026-08-01T14:33:56.926730Z","submitted_at":"2026-06-17T11:42:00Z","title":"Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2606.18960","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.18960","snapshot_observed_at":"2026-08-06T10:44:18.368232Z","title":"Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation","venue":"cs.CV","work_id":"f9cf5836-ec25-4d1a-be32-fade63c6e332","year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.000401Z"},"links":{"cited_paper":"/paper/2606.18960","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:a92b753e408e672b49c63a5c5bd57f17cb82d956312d1043f05e42f44a909541","observation_id":"3619bfb8-af15-4b3b-91be-2ab580a5fb28","resolution":{"observed_at":"2026-08-06T10:44:18.373945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.103744Z","title":"Coarse-to-fine imitation learning: Robot manipulation from a single demonstration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.103744Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:b9a2a7fac2e08f80970185085e7f0041681ef73fd1adab14fe9ce330f4d68331","observation_id":"62d4a375-70d3-4ef6-b231-9adb322ae235","resolution":{"observed_at":"2026-08-06T10:44:18.103744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T10:44:18.160988Z","title":"RoboPoint: A vision-language model for spatial affordance prediction for robotics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.160988Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:a75db6512d8b9659c2bb263bab6092660e6bf90faf75f17c807e2666213e79b1","observation_id":"c7340192-801b-4d8f-bdc4-a939dbc5ee48","resolution":{"observed_at":"2026-08-06T10:44:18.160988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T10:44:18.188176Z","title":"PaliGemma: A versatile 3B VLM for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.188176Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:46be7dad4b25a1365d2c3a0b2035c7228ccefc23be06083be47c93e9ac358978","observation_id":"501a8a7a-ba8b-4f0f-b121-2bf46dfbbda3","resolution":{"observed_at":"2026-08-06T10:44:18.188176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.200108Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.200108Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:5ba6a7eb4300670eec044ae210a4c2efe1ada111893640ee9572e6a3c9fc0a91","observation_id":"1bcbf714-17a6-4890-b530-0d816e21e272","resolution":{"observed_at":"2026-08-06T10:44:18.200108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T10:44:18.203663Z","title":"Gemma: Open models based on Gemini research and technology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.203663Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:158c230f884c858f8250b8b4662b2ce7499445694ff3ac2509585e8fc7713658","observation_id":"2bea7c9e-b7be-4b08-bd06-822a2d3a4ac7","resolution":{"observed_at":"2026-08-06T10:44:18.203663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.719175Z","title":"RAFT: Recurrent all-pairs field transforms for optical flow,","venue":null,"work_id":"9bce15db-f6a6-4e25-8c53-e83056f6f36e","year":2020},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.207095Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:1e180ccab29c527e98aa95734e8b99217ed3355abe4c85ead59e970fd94a15a4","observation_id":"3db468e6-720e-4258-be7d-34058747e6b7","resolution":{"observed_at":"2026-08-06T10:44:18.722936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.210377Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.210377Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:27773c23784a6ddaf9e606ee9288328ae3c200cfda096be0c52082a8ef43987e","observation_id":"6b10100f-42fc-4a01-b8d3-4adf5a1fce6c","resolution":{"observed_at":"2026-08-06T10:44:18.210377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.213450Z","title":"On the continuity of rotation representations in neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.213450Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:fdf4a7e02e50ddba6bbd20c1aca44243794558088eac52457320987a51a74300","observation_id":"2ffc9fc0-45bf-4d03-b590-220ec82989dc","resolution":{"observed_at":"2026-08-06T10:44:18.213450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.690860Z","title":"V-REP: A versatile and scalable robot simulation framework,","venue":null,"work_id":"d9df76de-e4a8-44a9-b8b0-698fa588c643","year":2013},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.216594Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:52b036da0266ce4118085f7c95805b30b941c50393ced6abdf4aef3ce7d48247","observation_id":"06e3c500-0a7f-4650-bbef-286b2a71ad30","resolution":{"observed_at":"2026-08-06T10:44:18.694734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.679175Z","title":"Perceiver IO: A general architecture for structured inputs & outputs,","venue":null,"work_id":"c44a91f8-d892-4670-96f3-54191b99f561","year":2022},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.220226Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:c8eab6af8562e757125b6e895d75cb08b44cf3244c3240f49096b876df29f4c1","observation_id":"ad897fab-5612-4722-991c-6aaf338a20a4","resolution":{"observed_at":"2026-08-06T10:44:18.682780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.667052Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":"8c76a2d8-3970-4996-af39-9d4ee4de141d","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.223196Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:454fff6c49f5e993db4c95bbcd34d591c0bc8bfaf5cf79322ee12718ff4fc289","observation_id":"ec093242-9c4c-44f6-a66a-7587bc53cf7c","resolution":{"observed_at":"2026-08-06T10:44:18.670900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.226213Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.226213Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:91f3c80905ce87f216a9f4fbb8da1531538ceab5a9b1aba070e3d6d9efae21de","observation_id":"e2fd6278-b836-44b6-b6a4-eb6503c2a138","resolution":{"observed_at":"2026-08-06T10:44:18.226213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-06T10:44:18.229394Z","title":"X-VLA: Soft-prompted transformer as scalable cross- embodiment vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.229394Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:fe60940f675243c25f90e4737f0c3a390835ff5c0416626a4b1b26e414da7b3c","observation_id":"78055c9f-cb59-46fe-bac4-338dfdddb5e7","resolution":{"observed_at":"2026-08-06T10:44:18.229394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-06T10:44:18.232308Z","title":"Fast-W AM: Do world action models need test-time future imagination?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.232308Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:1f93287074672e5cab9bd10c18213fc37d17c9ae90ee2c64d682a0a62d9fd8b8","observation_id":"748933a2-7d86-4b24-82ee-7c8ab8cb267d","resolution":{"observed_at":"2026-08-06T10:44:18.232308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-06T10:44:18.235552Z","title":"R3M: A universal visual representation for robot manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.235552Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:4de9c0b43deb5e1d82e5934aa10330f7b461d1c903ae70ff3887fc70d8438966","observation_id":"5477a936-baab-46d6-8daf-b8bae834b0e5","resolution":{"observed_at":"2026-08-06T10:44:18.235552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-06T10:44:18.238620Z","title":"Masked visual pre- training for motor control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.238620Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:61d48cd3c294e3dab299adb5fbbbf7d3a84e9fcb2e52b1f551ea636440eab684","observation_id":"222af3a0-3646-46b8-a56f-b3f57fb18cd0","resolution":{"observed_at":"2026-08-06T10:44:18.238620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-06T10:44:18.241421Z","title":"RoboTwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipu- lation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.241421Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:8bf184a6b1821dd0db24e44f7e615905d409c82f2f3bdd3e6e44d2564a11461a","observation_id":"e3908d42-3017-427a-bc38-7ad0c4f92bfd","resolution":{"observed_at":"2026-08-06T10:44:18.241421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.647027Z","title":"SAPIEN: A simulated part-based interactive environ- ment,","venue":null,"work_id":"3c60e13c-2e3d-458f-950b-63a6923c47e6","year":2020},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.244590Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:835a96f42b9974e68fc2b43176f07bf6c145b83e82fcdeeac94cd444257b6f67","observation_id":"09676efc-b973-4a1e-b88d-813e430e0d34","resolution":{"observed_at":"2026-08-06T10:44:18.650643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:44:18.634879Z","title":"Point transformer V3: Simpler faster stronger,","venue":null,"work_id":"74e29941-60e1-4526-b8d8-9e5295ab1bdf","year":2024},"citing_paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:18.247570Z"},"links":{"citing_paper":"/paper/2608.05042"},"observation_digest":"sha256:57c6fafc37032e7df0acc71dad7bb3ebb84b21c9f41e8e676ceccfdd9a2eb541","observation_id":"884d5e23-93a0-4550-b4cc-d1e6055735fa","resolution":{"observed_at":"2026-08-06T10:44:18.638849Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05042","last_updated":"2026-08-05T16:54:25Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T22:18:50.260900Z","submitted_at":"2026-08-05T16:54:25Z","title":"BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2608.05042."}