{"as_of":"2026-08-07T18:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f7ac2e793323ca61b7c2cba32e2932de3412ff4390514852c3d15edc4d683d4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:16:10.945513Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T14:25:47.243057Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T14:25:47.178714Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2505.17016"},"observation_digest":"sha256:4017ac5cd68dae16c67ba172add8e302a4da3bf8238aa3169d6447605ff38bc5","observation_id":"45883420-8b1b-49c5-b289-cdd0952cddb7","resolution":{"observed_at":"2026-05-21T14:25:47.245817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-07T12:16:10.945513Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-07T12:09:30.561528Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.945513Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:bf172191dc02fd10fd117e45e583ae3232dfc3c1d17448b2b03ee32d1acb14d4","observation_id":"ae01a1b4-d01c-473e-8aa0-0758d5d666d8","resolution":{"observed_at":"2026-08-07T12:16:10.945513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2506.13456","last_updated":"2026-05-13T10:49:00Z","snapshot_observed_at":"2026-08-07T16:19:33.135284Z","submitted_at":"2025-06-16T13:14:58Z","title":"Block-wise Adaptive Caching for Accelerating Diffusion Policy","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T09:36:09.790248Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2506.13456"},"observation_digest":"sha256:64fde3b05ef51fd9d7aec5b79711d1e08adb27b529d47cd2b3379350f51c6992","observation_id":"81c2056a-eaf7-420e-95d3-022c4fd77128","resolution":{"observed_at":"2026-05-19T09:37:13.968090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:f3f98f4defc87e201f75aa2cf22994a353ed599bbd5b7e1590aa542c64d16515","observation_id":"529a2236-55b9-43e9-bbd7-244fb6f8dbf0","resolution":{"observed_at":"2026-05-16T15:42:41.584985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T21:16:50.629382Z","title":"Dita: Scaling diffusion transformer for generalist vision-language- action policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.629382Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:5538d6bb614ebc6e29ce3afe187ffd641a1c9c631674e8e4880b2d81db1d16a7","observation_id":"8779decc-64d5-427b-a144-f8ce6795cb08","resolution":{"observed_at":"2026-08-05T21:16:50.629382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T20:35:43.793652Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-07T13:33:54.413844Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:43.793652Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:0a56f005bce8d8079a5315362458662b2662b61ec282529cd11d290424f64e4f","observation_id":"cd0ec015-300b-4053-aadc-25259e758238","resolution":{"observed_at":"2026-08-05T20:35:43.793652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T20:38:40.247428Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-07T13:33:53.442792Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:40.247428Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:724ee461f815673c165d635708ef093be8367b360cc6fd7065eb487b22929a88","observation_id":"77f6fd8f-3d92-47dc-981a-a7cbc7c3b8b9","resolution":{"observed_at":"2026-08-05T20:38:40.247428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T14:42:32.628932Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.628932Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:bb0c90568df3a73624cc24824f58cc04db3e1286ef49248709c6e43945dec5ce","observation_id":"9c4cbf47-44f7-46b8-8c6b-00ce61b3bda3","resolution":{"observed_at":"2026-08-05T14:42:32.628932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T12:02:28.274529Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02055","last_updated":"2025-09-05T06:24:50Z","snapshot_observed_at":"2026-08-06T20:42:39.880464Z","submitted_at":"2025-09-02T07:51:59Z","title":"Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T12:02:28.274529Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2509.02055"},"observation_digest":"sha256:fd59f47ec429552656070a697049f332c5afd7dda45f0f4e8c2ef5d5e8f2220c","observation_id":"1d7a26cb-bc20-4393-9bc1-12fc57289878","resolution":{"observed_at":"2026-08-05T12:02:28.274529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T10:30:23.552915Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.552915Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:1a1ed42b514ba1ad3a840e1d417c9e3e5051b3894cc4335b435224f179ab2256","observation_id":"ce01b314-0f73-42dd-81e9-bb2039a2668e","resolution":{"observed_at":"2026-08-05T10:30:23.552915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T21:28:18.630934Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2511.14148"},"observation_digest":"sha256:b0b7a58c4f3079061fa6ebd77cbf4a2524590bac881c3c9573ba95db8fcf9438","observation_id":"a3f25050-fd4b-489d-9bea-fcd5afbff5ed","resolution":{"observed_at":"2026-05-17T21:30:18.245994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T14:50:12.804707Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2601.16163"},"observation_digest":"sha256:b0dc2f3ac92b6bf944167d4546f2948edd4ca207c97deb995cc329f3d9c264ba","observation_id":"867a5f79-f679-49e5-9187-90e85b92fdf8","resolution":{"observed_at":"2026-05-12T14:50:12.928751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-03T03:56:04.338230Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.338230Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:4ddd4f6e58370ad8bcb4b5aec4c7559e5a0e0a9aad04886f00e04444ef3d8bb5","observation_id":"c4026ade-74dc-4276-8eaf-1bf3f6496f0c","resolution":{"observed_at":"2026-08-03T03:56:04.338230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-02T20:18:05.038317Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-07T10:00:45.484265Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:05.038317Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:3e346448699b69882e2ec3fdb3712c7bc140f1720d2fc712e8830b0a53226373","observation_id":"7f3888f9-e553-430c-aa38-42c8124f6990","resolution":{"observed_at":"2026-08-02T20:18:05.038317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2604.21331","last_updated":"2026-05-05T14:40:04Z","snapshot_observed_at":"2026-08-02T17:23:17.670041Z","submitted_at":"2026-04-23T06:37:22Z","title":"FingerViP: Learning Real-World Dexterous Manipulation with Fingertip Visual Perception","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T22:00:06.298685Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2604.21331"},"observation_digest":"sha256:bb2e5970eccaf83dff211810fbbc994538c464e9192624ea51097a8d65e0be56","observation_id":"f42c87c8-2ccc-48bc-9c1d-ecf8e8e44b1c","resolution":{"observed_at":"2026-05-11T14:21:06.529823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2605.05126","last_updated":"2026-05-06T16:55:44Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:55:44Z","title":"ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T16:40:19.057979Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.05126"},"observation_digest":"sha256:ffcffcd6062551f22d8dbc66ee594899af8d08fea47cef301e6faf9d3574b3ca","observation_id":"ecf86412-32d0-4d38-a605-6e5ac4a440c0","resolution":{"observed_at":"2026-05-11T18:06:06.263709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2605.07381","last_updated":"2026-05-08T07:35:24Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:35:24Z","title":"Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-11T02:25:23.710842Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.07381"},"observation_digest":"sha256:183f1901913f7b39298eeeddf373aef034ed179003e19af0d7319ffbe436688b","observation_id":"a2ccbabb-8d6a-4879-9fec-c936219a8c24","resolution":{"observed_at":"2026-05-11T02:25:53.215480Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-02T14:19:47.159631Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T01:05:44.188530Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:d442e34af8adf586a5050169262d055ce2128cb92a0d4922f37f6170a1a0643e","observation_id":"d53dc7d5-3131-4113-b37b-d60799f5d88c","resolution":{"observed_at":"2026-05-13T01:07:00.139142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-02T14:19:51.313611Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-02T14:19:47.159631Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T14:19:51.313611Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:ef0de4928d1f0d690993f0d250d9aec920ae546c725c29b56380be6f10c034cc","observation_id":"9c652f31-f114-43ee-b75b-03749e6410f7","resolution":{"observed_at":"2026-08-02T14:19:51.313611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":"2503.19757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":"3b62b17b-cf99-4d53-8589-9eca22c28d28","year":2025},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:3a364916d63541859bf771060954e54019dc65ca3fdb3f06548e99be863be068","observation_id":"87a5084d-c753-4d62-ab24-8d4b5e328164","resolution":{"observed_at":"2026-05-20T12:43:16.973759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.19757/citation-record","integrity":"/paper/2503.19757/integrity","json":"/paper/2503.19757/citation-record.json","paper":"/paper/2503.19757"},"outbound":[],"paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2503.19757."}