{"as_of":"2026-08-11T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb8865c12acc396038e70332e4a8eb86612cfa08914412c5224067de8aa9bba3","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:50:26.697393Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04396/citation-record","integrity":"/paper/2608.04396/integrity","json":"/paper/2608.04396/citation-record.json","paper":"/paper/2608.04396"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T00:50:22.779361Z","title":"RT-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:22.779361Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:6356ec5e8093537e139c1da2d1165a447a5c4cd55b7e67d2ed682a1328c9bb56","observation_id":"b6f71cab-e266-4bca-a4b2-a37a35ac6020","resolution":{"observed_at":"2026-08-07T00:50:22.779361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.654508Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"379369b1-02f7-477b-ba44-5fef03c91e9a","year":2023},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:22.845872Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:ce66302bd1ff30e2a04998961a4d1969975afefa3192a54d712e2c8ab853ad15","observation_id":"e0d3629f-de88-4a33-afae-05b55bf2769b","resolution":{"observed_at":"2026-08-07T00:50:30.659067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:22.923393Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:22.923393Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:3ec4319325d9e732045adf61ce752b056cec6f581ec63a4eb363b23bf5085045","observation_id":"8054f6bc-7f7d-49b3-8c2c-7d38459445be","resolution":{"observed_at":"2026-08-07T00:50:22.923393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.629679Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation","venue":null,"work_id":"d168d8b7-df3e-4cd5-aa79-5ec3540d0840","year":2024},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.010380Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:cac949f567dd088790de4749e660f8384554f0cbeff1ed8968baea15dcb161d0","observation_id":"4e4d9d27-88a6-43eb-801b-a74f053256e0","resolution":{"observed_at":"2026-08-07T00:50:30.634338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T00:50:23.096156Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.096156Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:d0787575ffb42f014377ade8fe921f2e567f3a61413b29cf8f773f3f601eff7d","observation_id":"de901bc5-da2d-4a13-8a56-60ef2f258d72","resolution":{"observed_at":"2026-08-07T00:50:23.096156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.615257Z","title":"Moto: Latent motion token as the bridging language for learning robot manipulation from videos","venue":null,"work_id":"439ad7fe-b8d0-436c-80c0-7d67f802dca5","year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.183105Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:8d8c3b5f202d283cb98076875e6d575b0adc82f6fb6d3c9a4910a451d358acf1","observation_id":"a84c605b-de37-4893-b914-3ab9d360c93b","resolution":{"observed_at":"2026-08-07T00:50:30.619984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.600236Z","title":"TraceVLA: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies","venue":null,"work_id":"79e0fff8-c0ef-4aef-9047-fd8d43cbb3d5","year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.271170Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:0a26290f66c2dc65e4c431a2cc35c6fcf5cde69acebeed82d16208551d967db5","observation_id":"fa97f0b7-d4f5-4d50-a2eb-f89691d234d0","resolution":{"observed_at":"2026-08-07T00:50:30.605687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.576619Z","title":"GraspVLA: a grasping foundation model pre-trained on billion-scale synthetic action data","venue":null,"work_id":"3755325c-947f-43bb-bc6c-f8bdbbfa0fbe","year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.346135Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:136bf4d47107635da0629eba7d06e5dc55fd7883c908dbaf46c28a0d3820e90a","observation_id":"3dccfc03-3048-4a58-aa66-18bc8943b220","resolution":{"observed_at":"2026-08-07T00:50:30.585764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.551891Z","title":"Hi Robot: Open-ended instruction following with hierarchical vision- language-action models","venue":null,"work_id":"2c8063cc-0027-4c6e-bad1-6776f0d211f9","year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.458815Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:925a225a5d52a64146f0c1dda2884914b2f7cc4525ca887382b86093b93716b7","observation_id":"950d67d4-e34a-42e8-9020-189a221d7359","resolution":{"observed_at":"2026-08-07T00:50:30.561099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-07T00:50:23.546418Z","title":"Libero-plus: In-depth robustness analysis of vision-language-action models.arXiv preprint arXiv:2510.13626, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.546418Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:f543f36605fe60bc803793bc3f93dde70ada8fb3819289ef39aaf8dcc4db5b3e","observation_id":"b2e030c3-90e5-4512-a19b-bde21f40aaf4","resolution":{"observed_at":"2026-08-07T00:50:23.546418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13446","last_updated":"2026-06-08T21:52:42Z","snapshot_observed_at":"2026-08-07T21:58:57.623091Z","submitted_at":"2025-08-19T02:01:06Z","title":"CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13446","snapshot_observed_at":"2026-08-07T00:50:23.635635Z","title":"Cast: Counterfactual labels improve instruction following in vision-language-action models.arXiv preprint arXiv:2508.13446, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.635635Z"},"links":{"cited_paper":"/paper/2508.13446","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:0c1fcf59dcbe825474f4b5579ad7edfab007af11537de5265ee86534c39216da","observation_id":"334f9ecf-77de-4d50-b55e-cc5c419d6bb2","resolution":{"observed_at":"2026-08-07T00:50:23.635635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:23.716866Z","title":"Counterfactual vla: Self-reflective vision-language-action model with adaptive reasoning.arXiv preprint arXiv:2512.24426, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.716866Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:d5f1ecf644579ea000270cd47d1d1d00ef07c752e0bb733435c22dfb39121316","observation_id":"70fa75bf-ec1c-4514-ad6d-9a5b8400625d","resolution":{"observed_at":"2026-08-07T00:50:23.716866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T00:50:23.784864Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.784864Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:3da183f4cc74b6be9ca1e369535e16ffb642ececab19177956675696a24d66c7","observation_id":"76cc0ade-143d-440d-93dd-9885211e7555","resolution":{"observed_at":"2026-08-07T00:50:23.784864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T00:50:23.872232Z","title":"OpenVLA: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.872232Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:8983c4e90de8c41156973e69568ad4790fd1bd818c022cf3685418f8c271baaa","observation_id":"a0e05596-ebcc-4894-b6e8-0fd1a317c0e0","resolution":{"observed_at":"2026-08-07T00:50:23.872232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:23.973337Z","title":"SimpleVLA-RL: Scaling VLA training via reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:23.973337Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:9cf007f58c3a49d62541d37e76cc151e2d56249db79660a57c347809c3a1e03e","observation_id":"328daaaf-493d-4209-ab76-dba55535505a","resolution":{"observed_at":"2026-08-07T00:50:23.973337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-07T00:50:24.060801Z","title":"SmolVLA: A vision-language- action model for affordable and efficient robotics.arXiv preprint arXiv:2506.01844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.060801Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:ba56976e9c4286f7a380c44b7d88078dc63c7ab02216102bc40bb6fd5fff0d19","observation_id":"aa8e7fd5-2319-4cea-958d-92ed7357fc33","resolution":{"observed_at":"2026-08-07T00:50:24.060801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-07T00:50:24.175572Z","title":"π0.5: a vision-language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.175572Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:bb4cb78f96dbc968f2c9c4194662a0e511325042804f68a239ce06e086540c2a","observation_id":"96a12dda-f2d5-48a8-9880-5ec808568bd6","resolution":{"observed_at":"2026-08-07T00:50:24.175572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-07T00:50:24.270042Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.270042Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:2b6032218c6b5922715eefb2389ead1488920b5f4c0fc3b691e871e10a96b343","observation_id":"1e64a4e7-578d-4e02-b565-a1dc4f37b850","resolution":{"observed_at":"2026-08-07T00:50:24.270042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:24.353418Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.353418Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:00402afa2b59ce903358b81d5f685b3ed7b49e0cd823591f1d2f4fa403c961ba","observation_id":"982ebd07-d75a-44f5-84ae-80905517c7cc","resolution":{"observed_at":"2026-08-07T00:50:24.353418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.304624Z","title":"Vla-adapter: An effective paradigm for tiny-scale vision-language-action model","venue":null,"work_id":"a810035e-359c-4a95-b86f-75028b2c698a","year":2026},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.417889Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:c841afd13253f3b80d444318e75bafec99d3050efab44651d203c6475b712c87","observation_id":"9da8812f-a214-4a2a-bc9b-7f517c603a13","resolution":{"observed_at":"2026-08-07T00:50:30.403862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.042437Z","title":"Modality-experts coordinated adaptation for large multimodal models.Science China Information Sciences, 67(12):220107, 2024","venue":null,"work_id":"5b80352c-ea1e-430c-923f-9721bb9300ee","year":2024},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.510018Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:b9fa2d8aa907bde934ab0ef78edef3f037d0c5231c4f75ee8f1b356adcf82161","observation_id":"8f0d7a59-8f2c-4ec3-89a7-146f29d6cbb3","resolution":{"observed_at":"2026-08-07T00:50:30.177614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:29.806034Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":"5697eb86-f3f3-4a91-8e3b-4a7ce59b5191","year":2026},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.597474Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:9c431d292699eff06c2fb86d875d24ce7e36f6466d43f47aa7bee0d41c80d032","observation_id":"989d7759-df49-48b8-8d10-8d5dc02bf9fd","resolution":{"observed_at":"2026-08-07T00:50:29.928195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:29.658423Z","title":"Ren, Homer Walke, Quan Vuong, Lucy Xiaoyang Shi, and Sergey Levine","venue":null,"work_id":"5d5badd1-c2d6-4324-9e5f-1b6df4a377bd","year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.682916Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:d50381e107589d081225a9039e6939f3e57d2a71588aba46e1bd0cd126b1e203","observation_id":"d027d5e6-f9fa-4b9e-b998-5674eb2b85ff","resolution":{"observed_at":"2026-08-07T00:50:29.722818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:29.500324Z","title":"Mole-vla: Dynamic layer-skipping vision language action model via mixture-of-layers for efficient robot manipulation","venue":null,"work_id":"0f810b12-0170-455c-81b8-ad685a454259","year":2026},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.772533Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:9f86694b06b5b219f0c9338aeed63f305b0ce9a23f3d61819cec66c5937c8e07","observation_id":"ef64f7c8-53f2-411b-bfa1-bf139dc3d026","resolution":{"observed_at":"2026-08-07T00:50:29.576787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:29.316694Z","title":"Spec-vla: speculative decoding for vision-language-action models with relaxed acceptance","venue":null,"work_id":"5a130c58-64d4-4a9a-a697-6467f33253b5","year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.860165Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:c17adc7de176ab05e89d4c494b27f75a88f9671cf81d6d5dedf501d3651cafc3","observation_id":"0bdd637b-2375-4ef6-ba94-f6dae6e81490","resolution":{"observed_at":"2026-08-07T00:50:29.370742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:29.122583Z","title":"CogVLA: Cognition-aligned vision-language- action models via instruction-driven routing & sparsification","venue":null,"work_id":"76954108-8a33-4453-8b44-e110d0f87edd","year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:24.986073Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:2ca16c6a4960c098751b736981aa66466db61f3aa12764ae5e0655c1775b77e7","observation_id":"05c8d3a0-d08d-4427-87ed-eb25f436b9b0","resolution":{"observed_at":"2026-08-07T00:50:29.232451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:28.904528Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"7d2bd21d-775e-4960-aefa-7b6bb9895ea4","year":2020},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.077882Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:8683c8262beeb66b7a9c5defa76b3479bb268de5c6b85e6751c06d1d1b558728","observation_id":"74a9e8c4-7ed1-45d4-82aa-6729f3ee0575","resolution":{"observed_at":"2026-08-07T00:50:29.005648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:25.175066Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, 44(10-11):1684–1704, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.175066Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:bc25132b01c2b56d7c2b562cd2f1b383f8b2f3e092c66542e1a40a2321230f50","observation_id":"9fbb998f-301e-4a7d-9d4d-c4c1c02f40df","resolution":{"observed_at":"2026-08-07T00:50:25.175066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:28.607523Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"a13e84d0-bbd4-4018-8b6a-2eb37a918a09","year":2023},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.241353Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:2b2d9af14c87613075e3f16797f63783c72a446ca7a0f05667f585e543df38dd","observation_id":"f7bc1185-a8ee-46ef-b8be-95de4db797dd","resolution":{"observed_at":"2026-08-07T00:50:28.771650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:25.326690Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.326690Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:661da981c106ef7f6764b7ebb33240c6246e2ee70b278a870d227589858184fe","observation_id":"84406f65-ee5a-4195-a3f6-ab8de5a8e57c","resolution":{"observed_at":"2026-08-07T00:50:25.326690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:25.380701Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.380701Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:9d6f58b5a999cab75ccd7508ea054b947d7e478e198b1fc173ae1dcfd01641ef","observation_id":"db5fcb8d-4137-4673-9b66-8116ba002fb0","resolution":{"observed_at":"2026-08-07T00:50:25.380701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:25.431921Z","title":"RDT-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.431921Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:0916392521ea44ba57433b879bda1c88ce3b13bb2f4406d14637b13504bb71bb","observation_id":"73767142-335e-4cc5-ac9a-25f01b4b4263","resolution":{"observed_at":"2026-08-07T00:50:25.431921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:25.499650Z","title":"One-step diffusion policy: Fast visuomotor policies via diffusion distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.499650Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:c1998d3e9bf1435681a8622cda178aab967724ca600fb3ad5b9e70f582d559f6","observation_id":"4434afed-374d-4c48-9a2a-b4f9a02ec9ad","resolution":{"observed_at":"2026-08-07T00:50:25.499650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T00:50:25.563377Z","title":"π0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.563377Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:ee02b6bb8db981d3dd87a463c10e31ab1a1721d3b05a6cef2286bb40625b2924","observation_id":"e42e281f-9351-4c78-942a-60da2f88e4e6","resolution":{"observed_at":"2026-08-07T00:50:25.563377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-07T00:50:25.631024Z","title":"Hybridvla: Collaborative diffusion and autoregression in a unified vision-language-action model.arXiv preprint arXiv:2503.10631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.631024Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:e920dc1a6aaa209e52031ef2b066e43e0cec319911b033b5183cc187a2d0dde1","observation_id":"b3445cde-6445-4ff2-8205-2ae91651aa53","resolution":{"observed_at":"2026-08-07T00:50:25.631024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:28.351055Z","title":"Toward causal representation learning.Proceedings of the IEEE, 109(5):612– 634, 2021","venue":null,"work_id":"0684aa92-11a7-49ee-bafb-c5cd237cdf4a","year":2021},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.697551Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:5588e4bd5ed621e3a2f10eba0051a77a9c162afb04d5a5153560a08a42b1e8ab","observation_id":"c28f8b25-f58c-447a-98a8-e9e4117e7712","resolution":{"observed_at":"2026-08-07T00:50:28.480887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:28.192014Z","title":"Robust agents learn causal world models","venue":null,"work_id":"04fbf16e-57e9-49a2-913d-053f5cb5c624","year":2024},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.744032Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:df2edc9ce82b58f4354bb85cd184b28b8fbaca319499503837cdd28b71977c27","observation_id":"4f17e05d-003b-4982-8a36-037f59e12389","resolution":{"observed_at":"2026-08-07T00:50:28.267867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:28.040589Z","title":"Causalworld: A robotic manipulation benchmark for causal structure and transfer learning","venue":null,"work_id":"3f0d3674-749b-4ddc-8965-d8af33d83cc2","year":2021},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.794703Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:9fb2f1a8016556f091b535ca559ada77601b2bc41ca619d319fadadca43dfe98","observation_id":"7cfb8aa3-cc4b-4258-b3d7-2da483407873","resolution":{"observed_at":"2026-08-07T00:50:28.110818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:27.978132Z","title":"CDP: Towards robust autoregressive visuomotor policy learning via causal diffusion","venue":null,"work_id":"6e96faf5-d298-4e46-ada1-437ccb3af78b","year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.861570Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:fe42bc6ace0942190cbfdbf64c17591ed3cd673994762d7521dfb4455c9e3aca","observation_id":"3f3d1f1c-b783-4c1d-8853-01868deeac0f","resolution":{"observed_at":"2026-08-07T00:50:28.007250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-11T12:44:14.562608Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.17659","snapshot_observed_at":"2026-08-07T00:50:25.944143Z","title":"When vision overrides language: Evaluating and mitigating counterfactual failures in vlas.arXiv preprint arXiv:2602.17659, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:25.944143Z"},"links":{"cited_paper":"/paper/2602.17659","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:8935c9ee7b720221387aee3ecf345c04e393301eb27e2342abdca98ed51e3cce","observation_id":"a797afcb-a6b0-4019-a748-25670f9c45f8","resolution":{"observed_at":"2026-08-07T00:50:25.944143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:27.911895Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":"8c98c205-85b3-4c05-ad45-1a04a6044abf","year":2023},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.007215Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:dc0322fb15d63afd0ad222628b63bc9bdb1243687eb402d7866118fa769b30b5","observation_id":"66296234-8303-4ae9-bf87-c98c28877ba3","resolution":{"observed_at":"2026-08-07T00:50:27.941903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:27.729726Z","title":"DreamVLA: A vision-language-action model dreamed with comprehensive world knowledge","venue":null,"work_id":"4df9c558-bd84-4478-ae15-ed9a7c70c0ed","year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.057062Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:57159716ab39c3005672ee7935273b1a324def356af6416c258b1d2f82107ea7","observation_id":"691f0a42-a22b-4acd-9884-a271c21c9b58","resolution":{"observed_at":"2026-08-07T00:50:27.844071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:27.557349Z","title":"X-VLA: Soft-prompted transformer as scalable cross-embodiment vision-language-action model","venue":null,"work_id":"0bbdd46c-abc6-437b-a76e-6af764f87f63","year":2026},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.128371Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:fe310539187a126a1b52a69a2811ea06b882999f868d5141a6ca8ecdba7ad410","observation_id":"8ed0afc1-d33b-4a28-8a35-021510895d9a","resolution":{"observed_at":"2026-08-07T00:50:27.648242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-07T00:50:26.194504Z","title":"NORA: A small open-sourced generalist vision language action model for embodied tasks.arXiv preprint arXiv:2504.19854, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.194504Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:c3e45f2b9435927bf27e4957d7c5f97ae969d5437338607dfa9e68310412d2ee","observation_id":"08851ab8-5ee7-4209-ad8d-2bbaed0d8fd4","resolution":{"observed_at":"2026-08-07T00:50:26.194504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-10T07:22:51.573401Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-07T00:50:26.254317Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.254317Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:ce4d61e774e29a964e0b56435cdbe4323f19f127edc7a7687dd2827b449f0240","observation_id":"f043e5b6-9f45-40ab-87a8-37eee2e7b6d7","resolution":{"observed_at":"2026-08-07T00:50:26.254317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-07T00:50:26.320751Z","title":"UniVLA: Learning to act anywhere with task-centric latent actions.arXiv preprint arXiv:2505.06111, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.320751Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:2f0ee01f4731f836993d3f72d4fd32b1396e0d8468d69b5c9cb545abc2b3f611","observation_id":"529042c5-7ed2-4491-881c-669a61b1ffc2","resolution":{"observed_at":"2026-08-07T00:50:26.320751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-07T00:50:26.384984Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.384984Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:3327d6d254eb69ed243242c79f1c64f09a8de240841283be73adb0e6314bbdce","observation_id":"8976f62e-7d14-4537-a903-38dfc0e62830","resolution":{"observed_at":"2026-08-07T00:50:26.384984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:26.448351Z","title":"Chance- constrained flow matching for high-fidelity constraint-aware generation.arXiv preprint arXiv:2509.25157, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.448351Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:ed98208c76d908f7f3472109232298e277478bb951399f48e0772b69f2983386","observation_id":"45f4e954-eadb-44ce-b3d2-cce441c7b7ec","resolution":{"observed_at":"2026-08-07T00:50:26.448351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15043","last_updated":"2025-04-26T17:22:58Z","snapshot_observed_at":"2026-08-07T18:00:37.903758Z","submitted_at":"2025-02-20T21:00:21Z","title":"DDAT: Diffusion Policies Enforcing Dynamically Admissible Robot Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15043","snapshot_observed_at":"2026-08-07T00:50:26.507752Z","title":"Ddat: Diffusion policies enforcing dynamically admissible robot trajectories.arXiv preprint arXiv:2502.15043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.507752Z"},"links":{"cited_paper":"/paper/2502.15043","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:f6f9b9520888cc45d4018547f7d6275f4f910a89644dcf7e3efcd64ba75613ee","observation_id":"3744e82a-5315-4c4b-bc5a-918182fb1a6b","resolution":{"observed_at":"2026-08-07T00:50:26.507752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:27.394602Z","title":"LeRobot: An open- source library for end-to-end robot learning","venue":null,"work_id":"d7e93659-8ab4-4085-a32e-4c092f00605a","year":2026},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.576375Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:27bbc6ea734a150266fe14e1c20aba68472021d001e5d49b0759bde56d440779","observation_id":"0c11d84a-a8ba-4999-a779-48b54ea3248d","resolution":{"observed_at":"2026-08-07T00:50:27.475474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03827","snapshot_observed_at":"2026-08-07T00:50:26.636070Z","title":"put ... on","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.636070Z"},"links":{"cited_paper":"/paper/2510.03827","citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:7c674184857221b35effdcb49b322e93aae92a37f5b291de05eafc58fc01b4e3","observation_id":"485b8b7b-004a-4ad0-b326-07755b41e02b","resolution":{"observed_at":"2026-08-07T00:50:26.636070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:27.215619Z","title":"remove the cuboid from the blue plate","venue":null,"work_id":"4399b78c-c106-425b-b3c1-225a8e3d0662","year":null},"citing_paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:26.697393Z"},"links":{"citing_paper":"/paper/2608.04396"},"observation_digest":"sha256:1556b2ab40ced68f7c2e995919db67d0822e8fb8566ec09e68b78b49a80404c1","observation_id":"5956c433-731f-4b2f-bdaa-dc692277a9d3","resolution":{"observed_at":"2026-08-07T00:50:27.296826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.04396","last_updated":"2026-08-05T02:58:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T22:03:53.270586Z","submitted_at":"2026-08-05T02:58:41Z","title":"CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.04396."}