{"as_of":"2026-08-08T06:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa87f58159ef33af5eeb6b3b1cc792fa12c22c8c069b76acac9abf1dd8bd2b4f","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T13:05:32.374206Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04816/citation-record","integrity":"/paper/2607.04816/integrity","json":"/paper/2607.04816/citation-record.json","paper":"/paper/2607.04816"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Beyer, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:bbd010aa24785e1847e0013df88aa0436f25d4dd199d3419a65a03f4d94f2bfc","observation_id":"315ab2c0-e8af-464d-92f2-02e94ca608e6","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:a7498fb7fc2196e69c51f4bfce252ab359983217c82dc35dd432165147bbf292","observation_id":"d47fe771-9804-4a22-b498-7b8aca5424cb","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:86a86307d79903d4be0c63aabd5e535326b1a00fd96bcdae13a9b0ca88208851","observation_id":"baefb505-a5dd-4b18-b45f-7c36923c37c7","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:aee0c986fc3a87c80c97a62f65216c8eef12c980fa1770b7d833cd83f39bf904","observation_id":"6cf5b582-942a-4e5a-b919-2aac2cb6945d","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Black, N","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:e28bbac324eb2ce959cc0eaa1c9c144af67b7dfdec64a226e62f66c4f348552f","observation_id":"4f1bc16c-6f9c-41aa-9b48-fcca32223a94","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:cb2e90efe37e001330e2364c5b46ab243e085726d9531308a4b6bc5070105883","observation_id":"a75b97f2-882e-4d37-bdce-8f29b6c2008c","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Marafioti, O","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:fa059b9e6d0cd469d055e5c8e0f5d71ee46d88534b0f0cd7ad84b7c1581d1c94","observation_id":"3e7d09e3-8af6-4d43-9a03-0d70d1d774b5","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:f871e92a592ab380cc35abfad5edf981dd5c4dd876fade983f6192fcdba22885","observation_id":"d565a5f5-1e67-4026-b9d1-a28384c1ec44","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:5791df322e87fc9858b6580f60d6f1a29315c862bf0482e038ba54935eab0457","observation_id":"04021a2e-4c65-4e92-a35e-1b5767cb905c","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-07T12:15:14.265779Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:1a63db936b69ab612bbbd1135c9e7d437a1f09c760a20255c477631d6c0e3160","observation_id":"68f79407-156c-4f71-8226-db01734ded59","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Zhong, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:3d1e70eb783eaded2a7f3632df0d7a1cf264919184c83a918b356baa24e71d6a","observation_id":"6b2d9cf8-d3c1-422e-aaa9-e9f954538a08","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:64826daa5016d9eb4fbcda3b3fa744693614534774fee29d45d2f547fe702efe","observation_id":"8030c696-54d0-4b96-947d-2fe738b3f36f","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:9fa6702389a265484915006b9371c281dc90a8efa0e4dcb08a2e19ebe0d9b48f","observation_id":"fe7f0f72-a813-457f-be6b-a548eb5933b8","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:a42fbbac76268db5ad1c4b8d43b43cab5692582e66826ace45dd90529c03205b","observation_id":"59f712d3-f4d9-4a33-9a0d-975324b423c4","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Driess, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:85d514db06ec64a678282a9ac9b5c4917692ae5928ec871535d9a5c6f5cba767","observation_id":"72cc23be-f1cb-4cbb-8f06-fcef6c4b883f","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:19b7d4fbd7a99f7c05c2077aa30154753b9b5dba9d695420b7edc1329dcac794","observation_id":"3c3cf98b-f23a-4914-ba04-834b1c5f3490","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:a763eb5fab056e5787351c2f8bfd7633f2520591320dc974b736558f1ff0672b","observation_id":"d75aeb22-3fda-42da-b52d-b22137296222","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Ghosh, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:808dfbbd9b5f785971bf4ce230582280991975a7972d994e2e9c4a1279f65810","observation_id":"61455660-9337-4a06-9bef-b5836328037d","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:f1554d072d5bc245e1262f014bec7ea5dcf7f402f81c118f4d367e02347abaf3","observation_id":"123e2b96-1520-4e97-a1ca-717e58127c3c","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18792","last_updated":"2025-04-26T04:13:14Z","snapshot_observed_at":"2026-08-07T15:59:03.096312Z","submitted_at":"2025-04-26T04:13:14Z","title":"STDArm: Transferring Visuomotor Policies From Static Data Training to Dynamic Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18792","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2504.18792","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:208de74047474e8d6e0dcb8a3303620733806f2a5b6cdb9bd9b328ea13277c98","observation_id":"c61624a3-de1f-4bd8-bb13-8030e1b5a405","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03540","last_updated":"2026-04-21T12:50:07Z","snapshot_observed_at":"2026-08-03T01:07:56.727651Z","submitted_at":"2026-04-04T01:32:01Z","title":"Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03540","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2604.03540","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:43c4a51df290df4fa8ca77ba7c4c8415b738b20ea45d940cf025066dc08095ad","observation_id":"a92b1eb3-b412-46e4-a2af-9b12b0f01627","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:c49d9a18841fc8ba089fa30a62e8c110757f2ee54463a8f2817ba928e52198e8","observation_id":"43e43fbf-4d9f-4984-bf03-74544447af01","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:71161437a9ffc295d6c33d4366277902c853ee31e1d6db2fea149304106ed10d","observation_id":"3efee3e2-70c2-4b03-b2c0-c1e03738e5c1","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:a2b3c1b4028f867f77d5164a925d6f0900a6ab6e53faaf1a6dc91bc60d507dd7","observation_id":"43754a26-b3c0-4cf1-8831-c573e1ef0851","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:87f9e0fbcfa3153cce98310f4bc11ab8ee817df62e38b5cace094814f7952f8c","observation_id":"0c3ae281-2b67-4f30-8ca3-a605268288d6","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:a9a62707bf0c191b411ed4cf3b7f924fe958c7a2cce452746d47fdc9594db24d","observation_id":"be4d8762-6ab6-4432-bc2a-a021f99200fb","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Zheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:6150fda8fe32ffec63fcf07c867f578dfd7b94d4c1c7376f78e6989e7db70c5f","observation_id":"82c40b4a-a32b-46cd-b348-d15f4604b9e7","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:b7fca85dbb60ce498938d3cdaac07ccc814fc2a6b9bfa3ac7805ccb2f84412a2","observation_id":"44a82846-8fe2-457e-a5e7-733d65776fe5","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16815","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Huang, Y .-H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2507.16815","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:33a8a72046bc5f624bfa70f54545c1e0815151ed7973b31071aaa49b25e4be1e","observation_id":"8b5efae5-c2d2-4e41-825e-7ca55d8ed78f","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:fc6042d915510122c4897d07ddde6decba07ecc855b47f55578dd0014102c387","observation_id":"dcee2d3c-88c7-4e2e-844d-b139b5a23f22","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:71bd3c660d31571fb11ddadb2a3f098e406d1b9e08ff9e38c86a9784554a5e5c","observation_id":"636b1f07-75d0-43e0-b117-0e0973093bd1","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Shukor, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:2a45d1623a46cd6348e827b4b89633428c09a5885ed37e82ee2a0fb164863592","observation_id":"378dfc3a-80e1-4e08-93d9-f88cb8ff0b21","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Bjorck, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:e0c7b487cbe66220c9a7291e626f034ba6b7d4f14b48bb33be125730aabd8e94","observation_id":"71961ff2-57cc-4d12-a196-f524c493d4fc","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:7f2978786028e2923b5a67c02049dd1ecdeb43e80b2925a1b0ba1f01d300c6e6","observation_id":"d15d2863-e8b3-4417-8d56-e77da90b645f","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20072","last_updated":"2026-05-31T15:50:43Z","snapshot_observed_at":"2026-08-05T15:11:00.360328Z","submitted_at":"2025-08-27T17:39:11Z","title":"Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20072","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":"Liang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2508.20072","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:ddc7169a8f90af774e77c57ae33cbccf1a874d9b07eea9717b7d1d02f3dc8736","observation_id":"063cba2c-47ac-43c2-8e88-d54c0a002beb","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:52b8be6378ddea8f0b142bbfc4947078c9118f97f9d74e801e237558c4f27bae","observation_id":"b242ca6b-4b5a-4d79-af95-3751dd337a3e","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:78b87fe393af5b5c06b39396a0b5622ab488b2a02ae7e336f4a018741e8b55fc","observation_id":"df95c2b1-dfec-4ef6-9d8b-3ed722a5a254","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:d7d4093e1eeecd6bd21314ad4bf855848bace400ee7733ca1583a948c42cdf43","observation_id":"bfabf4d4-1b4b-43ee-9f42-559ffa4f174b","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:68e95e2fe169e34c9f355e0ad24057d1fd55f3fc7cd617656aa7c69a5ee363f5","observation_id":"6e7372ef-fc3a-4beb-91c3-39be35f9cf06","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:3ad13caa0db57501e3dd9b7edb6bd586fd3f9bd769623bfe9a9ba4df59804f25","observation_id":"6d074ee0-ab35-4ba1-857c-964ebbd76738","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.04816."}