{"as_of":"2026-08-17T15:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2a20a0c7247383da7427ec1a2b9a9dc38b4ab5cdbcee2ada8054da9150ab683","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T15:19:27.489381Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09818/citation-record","integrity":"/paper/2607.09818/integrity","json":"/paper/2607.09818/citation-record.json","paper":"/paper/2607.09818"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20072","last_updated":"2026-05-31T15:50:43Z","snapshot_observed_at":"2026-08-15T16:46:32.902409Z","submitted_at":"2025-08-27T17:39:11Z","title":"Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20072","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Discrete diffusion vla: Bring- ing discrete diffusion to action decoding in vision-language- action policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2508.20072","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:2698d90d4fa9cfe967bbab16f9f5276db230eb79b64e6a07f80c547005e94c59","observation_id":"1b267005-5ab1-44ed-97b8-954325acfd22","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-13T21:14:45.123295Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06932","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Llada- vla: Vision language diffusion action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2509.06932","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:4a43043f45cb455ebf67252fb7eeebf81cf6ae543d154e8fa2f70ce27d0a31b0","observation_id":"edc2f0b6-8ead-423b-8773-7cadbacbc3cd","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:218f6c62b60bbcff4e2e57aa91717e9acc10b8c1de95b5dc3826fbb23fade5da","observation_id":"859a8458-897c-4e3e-b624-649a9597d353","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:b9bb7c4ace224930448df8136678e5f63a7ee43711d7c48ba4b50e44b03a6d51","observation_id":"1e9b0bf7-589f-4912-a635-7616040e92fc","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-13T11:17:54.365190Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Smolvla: A vision-language-action model for affordable and efficient robotics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:a4a885cfbb4640215d87cedcb1f3c67c2d933c4922af9e3c4370378f63204178","observation_id":"a1a644a8-9ad8-4ef4-9c83-6870ec0aaf79","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-08-16T13:36:08.629560Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Multimodal diffusion transformer: Learning versatile behav- ior from multimodal goals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:2faac4136479625850b564b25d511671e4c15c0ef775ad17b23a89cac12ce99d","observation_id":"369bdd64-4844-48fb-95e8-985d5619ca7b","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Vla-adapter: An effective paradigm for tiny-scale vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:a625f87a86c1ea42e25106c5f4ae9f80fa14c4a04517fa7b1037b84fc0c856a0","observation_id":"1259e6dc-5590-49af-98f1-7a7f4d5846e3","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10010","last_updated":"2025-03-02T07:42:20Z","snapshot_observed_at":"2026-08-16T13:09:50.215188Z","submitted_at":"2024-10-13T21:11:04Z","title":"InterMask: 3D Human Interaction Generation via Collaborative Masked Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10010","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Intermask: 3d human interaction generation via collaborative masked modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2410.10010","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:62db7a3b38b07fd517e854dd06eb6bb8c0dae015850a7f145f8a2f52835b99f4","observation_id":"706c131b-1f93-4bdd-85d6-3befd6e6e406","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:6c90a8414fecbdf7bbb0421cb0fca077313b2e83f5cecfa20fb7ecea9eda33a1","observation_id":"07a52544-01ca-4b0f-9804-8ac9042403f7","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Calvin: A benchmark for language-conditioned policy learn- ingforlong-horizonrobotmanipulationtasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:59e3f24bd5c718d25206a0c53ecbd8c1ae58bf4200b1929b29924492e99935ca","observation_id":"79606a1f-34e9-497b-bbbf-e86757255dc6","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"π0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:b6b69867dbd33be99c48213042a30a26a914cfe67b50a04e0a69a9544f099aa1","observation_id":"00ffe3d2-333d-4c64-8e7c-9990893e3afa","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:61a06fd5b33fce6021c53de4f007714f346121a4b9320583bf86fd560bd6916e","observation_id":"2c193481-5430-49ad-9a74-b8a516e399ca","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Rt-2: Vision- language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:6483cbafb0675d6ec0b8d3d6a0928ff30443f23dbe66097f9829f7f528ed8515","observation_id":"3b82ab7c-12e0-4319-aff2-f7a6811707e9","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Structured denoising diffusion models in discrete state-spaces,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:8d9b09f6734a0849bf9d49523d00e63e23f9aef0587c2ac15ba813bdb1f72fc6","observation_id":"d20bc52c-5272-486a-8d8c-0dc5ed4240f6","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Argmax flows and multinomial diffusion: Learning categori- cal distributions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:58d5d2efb5cd112bd303e397e1ca06cad9a265fd0953619e1d7c844347eb7bad","observation_id":"f08fef00-7267-48db-8903-a0cc860cd472","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Vector quantized diffusion model for text-to- image synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:adecd01ca7b584b6e839a06fcaed21bc273d068e645cf1ddddf7e3c03315ec74","observation_id":"33b84dd6-d4dc-4b8f-a1a8-7120febb38bc","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Diffusion-lm improves controllable text gener- ation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:8cad8a07b7733edcde89b22ef4300c3c37a78a70d89e0b4c53fa5ba2e51e270d","observation_id":"74ee7fd2-4233-423c-a90e-60b1b5a7c823","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Maskgit: Masked generative image transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:63bcc971d0f90c6316667e93b31ba68758562b96c54da2090473095acb2cdfd5","observation_id":"c19a742a-c009-4406-af5c-2505fd47970f","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Large language diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:c1e4ec4703a66c30705a31d5bcb55beb11273ce2f16100e99abfc47c4349f144","observation_id":"9ec63cf4-bed7-4917-8670-0bea5fe5b8fc","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Dinov2: Learning robust visual features without super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:9ce94b6920e0b5f489ccb3122370e14145fa20a9ca62fc18c173b785a3b53074","observation_id":"9e9f574d-00ba-4c30-8cb5-3eeffc71803b","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Sig- moid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:4c85eb6242f390ec27197468da4f21d593dc598421db709a14d81ab6a93a9392","observation_id":"b7eec16c-baa7-4a21-b11e-8dc943a30131","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Qwen2.5-coder technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:0061bdb65c0b4402e26c5dc88261db88b5de84f44824bf443274d3e0e4477493","observation_id":"fd2566e3-8b05-4789-bede-072094f40b39","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Flowvla: Thinking in motion with a visual chain of thought,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:3476225ec2d1220606c2f27a539d8604433498f9aae4df78bee9bf6ec0407150","observation_id":"8b27e478-b6d8-4e74-836d-5d0a8d330349","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Cot-vla: Visual chain-of- thought reasoning for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:8c8c547989f47ab9a1ac16091881a05bd123b40c679e6a9bf8f89d0ca30bc5f0","observation_id":"ac4b013c-ed50-4fd0-9e15-e7a256802667","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16815","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Thinkact: Vision-language-action reason- ing via reinforced visual latent planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2507.16815","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:97fecb13601ba54308015b05557b79660459599cf4b32bb4f235c73fa39a5cf8","observation_id":"2d5d561e-cbf3-44ed-9d84-650fbcb13f37","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Univla: Learning to act anywhere with task-centric latent actions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:3e93cbb16b8f3ef62f2053d83f4edf4f50ed0df46f49edf91b03defc03b27d9a","observation_id":"ec5eb7c4-13bc-43c4-90c1-7ce0a8b08a25","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Fine-tuning vision- language-actionmodels:Optimizingspeedandsuccess,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:a4806de159a8b23365260bc0ae9ef3465a73e9da2e200ef817a0bad8bf0989e5","observation_id":"8daba2e4-ffd5-4a45-a0fa-89c32a412ad7","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-16T18:26:33.270093Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Towards synergistic, generalized, and effi- cient dual-system for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:da0880da5788d7e1ac1d51a60ba4cf83ce01a6b1e0263d48aac668b05b55d7de","observation_id":"05c4d5c3-5759-4335-9d8b-b72751d51077","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03912","last_updated":"2025-05-06T18:35:07Z","snapshot_observed_at":"2026-08-17T09:33:25.661308Z","submitted_at":"2025-05-06T18:35:07Z","title":"OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03912","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Openhelix: A short survey, empirical analysis, and open-source dual-system vla model for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2505.03912","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:4f2e2e4e93a6284172172fd5b90d4e56d58a209a81ce538362ec76a295c202b6","observation_id":"756c7481-332b-4c0b-a611-265b8f4fbe84","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Reconvla: Re- constructive vision-language-action model as effective robot perceiver,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:d6a8f0f79f5f86ca0479b1e2281693ffb27b107dbf16a183daf1ca10c4c28cbb","observation_id":"679555cc-f140-41bf-872f-17c2adabb100","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:32b38dfcad01e06d03a7b73df6f7471a45747f424f295f576c65eea4d8385273","observation_id":"f67087ff-e350-4716-9512-a028039cd180","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:db79f68c53649773e2028cd2c7e889f8358a625ab6da4f12cf72cc693660eea3","observation_id":"b2217ddb-d8c4-43e1-ae7b-9aa2aeb76629","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:b274b7d80c6f0fbb6b47920a17743663d4c6bc0b4b3c5687983bea8e7fe049fc","observation_id":"65a9fb3d-95c6-47ff-a54b-f1815e42c368","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Vision-language foun- dation models as effective robot imitators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:8630b63e6b7b0c8cc5b962a3ad5466f7c1a6116d64ab772c8ee394a167093c5c","observation_id":"da9a171c-ec69-422b-b275-2573ef587e77","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:d49c054e33b534660cc2427950b0952f0378218230757c52f15cc81620a9175c","observation_id":"95876727-8414-4d8d-9cfd-a16fda10e621","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:eca717bb994b66861a2afc7e8186de0a6d42689ab47f51a0b29784a2c8305914","observation_id":"fae95702-3314-47fe-92ec-32a640721d30","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:c4b94252fb2d61b4d5084e2de8bc4f9b4b9882ad978d90ef59e64009e39a3196","observation_id":"3541f0cc-245d-4df8-a6af-7f0f93129804","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12953","last_updated":"2024-12-17T14:34:51Z","snapshot_observed_at":"2026-08-15T00:08:31.858899Z","submitted_at":"2024-12-17T14:34:51Z","title":"Efficient Diffusion Transformer Policies with Mixture of Expert Denoisers for Multitask Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12953","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Efficient diffusion transformer policies with mixture of expert denois- ers for multitask learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2412.12953","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:981044c9b6c799a457f48510ef2ad038358a881f28517e4667bef476db9eb63c","observation_id":"3fde7b3c-846c-4c76-a20f-43311929f11f","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T08:35:00.742041Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2607.09818."}