{"as_of":"2026-08-07T05:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73d521c11faaa0d9b0cd31e47725008d701efba7c2570d0a62bc2f16e3bbc7be","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:55:52.058916Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:09:50.161878Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:8bc81f47b332c6622401c7b2a0cd1e3225093b5ef0cf84b073ac464d9cd6e91d","observation_id":"8d349d7c-ca9e-4355-a268-b399094cd15d","resolution":{"observed_at":"2026-05-24T01:25:54.447400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-12T18:38:11.110166Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2412.14803"},"observation_digest":"sha256:8e8ba6bb7e0950cb947cd32d9ceaf441c5e842741140d0fb201d0ad3d99db1ef","observation_id":"2ad859e1-dc7e-4e85-928d-49d597bcbacf","resolution":{"observed_at":"2026-05-12T18:38:11.308512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:21f459bc8b1ca8c66444f8585241689d665fd6a20ac8129cbc95ebb31c31a1ad","observation_id":"f8e1ec0b-6798-440c-a082-68b7a88a3788","resolution":{"observed_at":"2026-05-11T04:35:32.782607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T14:25:47.178714Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2505.17016"},"observation_digest":"sha256:13da8e18d38f878f8fa8970d18f9573a7a779b05620144a5696919f060e97562","observation_id":"d5626ecc-b478-4453-9d54-eb8a36d32af6","resolution":{"observed_at":"2026-05-21T14:25:47.258877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:b27e51de55fcc0246a6083b3ccd93ede7afcce194d95ad7b4cac468362e214d7","observation_id":"ca04556d-919d-4dd7-b074-3d4ea17824ee","resolution":{"observed_at":"2026-05-17T08:04:12.547881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-05T16:55:52.058916Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17449","last_updated":"2025-09-04T16:46:34Z","snapshot_observed_at":"2026-08-05T16:55:50.271610Z","submitted_at":"2025-08-24T17:01:15Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:52.058916Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2508.17449"},"observation_digest":"sha256:17073689c8450e24c24ef1ac6df31c8fa56991c3325d9c018c1479585578f5d1","observation_id":"76e7b3a8-92e5-4153-b977-6f651ae96d02","resolution":{"observed_at":"2026-08-05T16:55:52.058916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T20:43:24.417901Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2508.19236"},"observation_digest":"sha256:1db720a9b2732a9e03857f622f851913c99e92f33988e8da5c6d30e7fe9e00e6","observation_id":"fd48f158-af31-4e1f-9d87-0fe1f2dc01fc","resolution":{"observed_at":"2026-05-15T20:43:24.525433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-05T10:30:23.635769Z","title":"E.; Wenzel, F.; and Lioutikov, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.635769Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:38dc5f5df6901f8d37d1a65b69f265de35f64dea9f0ede8e57be7376178d626a","observation_id":"ffee3e7b-3f88-4282-9ee9-d2b050e62ed1","resolution":{"observed_at":"2026-08-05T10:30:23.635769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2510.12710","last_updated":"2026-04-09T08:55:45Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-14T16:44:39Z","title":"Reflection-Based Task Adaptation for Self-Improving VLA","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T07:28:11.187479Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2510.12710"},"observation_digest":"sha256:7cf709c3928f9070ad2ae12cea6257543fa53f4c6416e2efd4dda4abd7b0580c","observation_id":"7951d0f7-f695-444d-90ee-be9ed1e47dac","resolution":{"observed_at":"2026-05-18T07:31:02.986035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-03T20:59:52.285243Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals.arXiv preprint arXiv:2407.05996,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:52.285243Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2511.17502"},"observation_digest":"sha256:dde3e884f0d1a07b7a6532d700086ad951af985f3edfe3ede42a20ce537970d1","observation_id":"ee7f89a2-ab41-4a9a-b748-95bfdec19392","resolution":{"observed_at":"2026-08-03T20:59:52.285243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:51f763c5fa232b5ebe13513e814d274b478d80e5cd5b5eb17810fc0b4bbc348b","observation_id":"fc590509-8576-4970-bb43-2010eedc415b","resolution":{"observed_at":"2026-05-16T15:08:02.002359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-03T03:56:05.396182Z","title":"E., Wenzel, F., and Lioutikov, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.396182Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:f6baf61ba8717b7a917779c99911a38f30689073148a6bb6ffea30a289df4be1","observation_id":"15fbe715-5e6c-4768-9716-468af86a2bc5","resolution":{"observed_at":"2026-08-03T03:56:05.396182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-03T00:02:14.643503Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals.arXiv preprint arXiv:2407.05996, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.11934","last_updated":"2026-06-08T09:01:34Z","snapshot_observed_at":"2026-08-04T13:02:28.723589Z","submitted_at":"2026-02-12T13:30:24Z","title":"Robot-DIFT: Correspondence-Sensitive Diffusion Features for Contact-Rich Robot Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:14.643503Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2602.11934"},"observation_digest":"sha256:96ca6d711977fef11b2e55c6816b37e073d09b7bed2e26a6a23a555f981b5e0c","observation_id":"54761429-a8f5-4208-9360-2821397c809c","resolution":{"observed_at":"2026-08-03T00:02:14.643503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-02T18:49:51.103217Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.04910","last_updated":"2026-07-23T05:22:39Z","snapshot_observed_at":"2026-08-02T18:49:49.564552Z","submitted_at":"2026-03-05T07:52:50Z","title":"VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:49:51.103217Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2603.04910"},"observation_digest":"sha256:fd17534a8ee7fc42ebaddd08cae77c7363603ac781a9032c72923c2795880d24","observation_id":"3bbb0ec4-6d9c-496f-9a46-98a8775494e1","resolution":{"observed_at":"2026-08-02T18:49:51.103217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-13T23:00:31.128534Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.17720","last_updated":"2026-07-01T05:08:44Z","snapshot_observed_at":"2026-07-13T23:00:29.789388Z","submitted_at":"2026-03-18T13:40:24Z","title":"VolumeDP: Modeling Volumetric Representation for Manipulation Policy Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T23:00:31.128534Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2603.17720"},"observation_digest":"sha256:6d785f9880d0d21ba5ec5b2662f6b42595e4e7ad84a3dd20e92ce779b598d19a","observation_id":"254afa48-c502-4b35-ae74-3827c9e0af7f","resolution":{"observed_at":"2026-07-13T23:00:31.128534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2603.25903","last_updated":"2026-04-16T00:09:18Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T20:50:36Z","title":"Emergent Neural Automaton Policies: Learning Symbolic Structure from Visuomotor Trajectories","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T00:08:16.186576Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2603.25903"},"observation_digest":"sha256:6df828eb4e8328c92bab0a926800229fa5a0f927b9d8375459193fc2d203b747","observation_id":"cdeb824a-dafd-4038-a29b-6688a7a3bf9c","resolution":{"observed_at":"2026-05-15T00:08:21.377605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:a5d743c9ab81f93094bf6ada20b621c070314e8a490e605ae1160145d18a0a55","observation_id":"9508c971-13d5-46a9-ac4b-f393b047b750","resolution":{"observed_at":"2026-05-10T22:50:51.465622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2604.24622","last_updated":"2026-04-28T15:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T15:51:40Z","title":"CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:32.677434Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2604.24622"},"observation_digest":"sha256:2b377f2bc3a6e2cd0ecafb2af04c43a0587e8341cbe2539a3f04cd244fc5eb5d","observation_id":"931e186a-74ee-431a-a788-864391bcccf0","resolution":{"observed_at":"2026-05-11T21:41:17.564383Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2605.17923","last_updated":"2026-05-18T06:30:31Z","snapshot_observed_at":"2026-08-03T06:19:48.849871Z","submitted_at":"2026-05-18T06:30:31Z","title":"AdaptiveLoad: Towards Efficient Video Diffusion Transformer Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-20T01:03:08.765350Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2605.17923"},"observation_digest":"sha256:4f2e0087c9d2b89ec8fb3a79910784bb8f688c496b24ee05a74c106e514f0493","observation_id":"9ea12bec-3613-4844-bf3b-0cae5d759fef","resolution":{"observed_at":"2026-05-20T01:03:18.366526Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-03T04:05:29.788502Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:278e9c07c3a555337b00dd381285098a3c6c33b8637e531865011272b8ea2f39","observation_id":"685b7205-5126-4cb6-b2cb-1f1abe86f475","resolution":{"observed_at":"2026-05-22T04:46:04.600695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2606.04233","last_updated":"2026-06-02T21:33:28Z","snapshot_observed_at":"2026-08-05T14:25:49.046518Z","submitted_at":"2026-06-02T21:33:28Z","title":"What Are We Actually Benchmarking in Robot Manipulation?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T09:31:39.345777Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2606.04233"},"observation_digest":"sha256:5ca065447154d44229a20a57ca5b6fd3302f1f24061136d73e020895a98237ce","observation_id":"ad7ffa25-6642-44fc-b6ec-fe6c10308560","resolution":{"observed_at":"2026-07-02T03:56:35.333611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2606.21501","last_updated":"2026-06-19T14:53:40Z","snapshot_observed_at":"2026-07-30T13:23:20.103275Z","submitted_at":"2026-06-19T14:53:40Z","title":"UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T14:27:40.585782Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2606.21501"},"observation_digest":"sha256:21d3b47ec3d4f16aeae6c1802304a277056e6a1dc0c1f9bc1193549e80c659a8","observation_id":"558b8666-e791-44fd-980b-315c4bfa1be3","resolution":{"observed_at":"2026-07-04T06:29:37.506820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":"2407.05996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-04T13:09:50.161878Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":"988b5d0d-a604-46c5-8d86-72a48f501f25","year":2024},"citing_paper":{"arxiv_id":"2606.26588","last_updated":"2026-06-25T04:20:08Z","snapshot_observed_at":"2026-08-02T20:22:03.294527Z","submitted_at":"2026-06-25T04:20:08Z","title":"Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T05:32:52.472573Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2606.26588"},"observation_digest":"sha256:5660e25d5e4e88eb9704b7aa1097217810f11977136ba26195d40fa9cd121cfe","observation_id":"d84f9e18-49a6-4d60-812c-133f99a2d089","resolution":{"observed_at":"2026-07-04T13:09:50.163333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Multimodal diffusion transformer: Learning versatile behav- ior from multimodal goals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-07-16T23:18:02.667998Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:2c0d4b9154009c234f341204b927e97453f452c458358dbc6b8fdb71cfc21d36","observation_id":"369bdd64-4844-48fb-95e8-985d5619ca7b","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-04T19:45:35.162534Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-06T23:33:18.970298Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":213,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.162534Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:b1f42e3bc1351a14e059ca45ed42405bf5b03bc3b27258c56d1ced125760b50b","observation_id":"1ae464e7-d62a-4c6c-83a4-c5bc459552ef","resolution":{"observed_at":"2026-08-04T19:45:35.162534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.05996/citation-record","integrity":"/paper/2407.05996/integrity","json":"/paper/2407.05996/citation-record.json","paper":"/paper/2407.05996"},"outbound":[],"paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2407.05996."}