{"as_of":"2026-08-12T22:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc8bc31f42551bda5aaafd7a9dddebedb8d6d52bc7de760f4648175b5e15ab22","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:58:57.214702Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":"2305.13311","doi":"10.48550/arxiv.2305.13311","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VDT: General-Purpose Video Diffusion Transformers via Mask Modeling","venue":"arXiv (Cornell University)","work_id":"353adf25-cb13-416f-abb4-75e75d50cfc0","year":2023},"citing_paper":{"arxiv_id":"2411.16748","last_updated":"2026-05-08T09:16:59Z","snapshot_observed_at":"2026-08-04T02:06:42.093429Z","submitted_at":"2024-11-24T04:46:00Z","title":"Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T17:19:51.411937Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2411.16748"},"observation_digest":"sha256:b200d92b1cf8c7d85e9981e6d5c63d65cda336c16546e6c0d026c4458f4a7a0d","observation_id":"d53398ab-3360-43d6-8f0c-cbf5fd591dd9","resolution":{"observed_at":"2026-05-23T17:23:15.373441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-12T12:58:57.214702Z","title":"Vdt: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17470","last_updated":"2024-12-31T16:25:39Z","snapshot_observed_at":"2026-08-12T14:57:08.104077Z","submitted_at":"2024-11-25T18:59:04Z","title":"Towards Precise Scaling Laws for Video Diffusion Transformers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:58:57.214702Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2411.17470"},"observation_digest":"sha256:6da25ebf0cabcd3d009cea96adba916a3879b06b4e08b77e92e5ebfd782d8389","observation_id":"98c15704-7791-411b-ab39-520ae39c2635","resolution":{"observed_at":"2026-08-12T12:58:57.214702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-11T16:43:08.347341Z","title":"VDT: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-12T00:16:05.464145Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:43:08.347341Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2412.09856"},"observation_digest":"sha256:1d5a42f65c10234339dfaef2919d7a462fb6fee199b3c8453779ad152e52cf69","observation_id":"aba8da3d-3592-41ea-862f-9e30436b6564","resolution":{"observed_at":"2026-08-11T16:43:08.347341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-11T15:40:19.928134Z","title":"Vdt: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10783","last_updated":"2025-03-22T08:53:33Z","snapshot_observed_at":"2026-08-11T20:10:49.995786Z","submitted_at":"2024-12-14T10:39:55Z","title":"Video Diffusion Transformers are In-Context Learners","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T15:40:19.928134Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2412.10783"},"observation_digest":"sha256:e656d3d02db4c146228862ce1c9ea901134352d0fc23e77aeb665f5d7f7d9297","observation_id":"dfea9a48-193f-4814-a19e-181fdeb859fc","resolution":{"observed_at":"2026-08-11T15:40:19.928134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-11T14:11:39.762166Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12444","last_updated":"2025-03-21T15:52:39Z","snapshot_observed_at":"2026-08-11T14:02:19.647972Z","submitted_at":"2024-12-17T01:12:35Z","title":"LazyDiT: Lazy Learning for the Acceleration of Diffusion Transformers","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T14:11:39.762166Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2412.12444"},"observation_digest":"sha256:658885a61cd4aedf9b0735a77ab1a572122706da47b59964d968784bdd1a6c97","observation_id":"07c42016-85f5-472c-adc4-66a3b3c75d9f","resolution":{"observed_at":"2026-08-11T14:11:39.762166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-10T22:25:25.713784Z","title":"Vdt: General-purpose video diffusion transformers via mask modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-08-11T03:10:45.092988Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:25.713784Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2501.01790"},"observation_digest":"sha256:c8da8c727f215af4ceece87a8e51257ec89ea4a86e98464c9fa49402f7a01c5d","observation_id":"c1e3a516-e946-44a5-aa02-3b496557c10a","resolution":{"observed_at":"2026-08-10T22:25:25.713784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-08T21:27:27.665102Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04809","last_updated":"2025-06-02T14:32:56Z","snapshot_observed_at":"2026-08-12T17:18:07.831913Z","submitted_at":"2025-02-07T10:28:39Z","title":"Humans Coexist, So Must Embodied Artificial Agents","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T21:27:27.665102Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2502.04809"},"observation_digest":"sha256:1605d476727067b6c0cd816628d0ef401fde1610a30e18f4baf34cae2b66ee9a","observation_id":"02c3d018-1e44-432b-82c3-c7ee1224f517","resolution":{"observed_at":"2026-08-08T21:27:27.665102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-07T15:30:11.076093Z","title":"Vdt: An empirical study on video diffusion with transformers.arXiv preprint arXiv:2305.13311, 3(5):9,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14948","last_updated":"2025-05-20T22:17:47Z","snapshot_observed_at":"2026-08-12T12:54:06.531317Z","submitted_at":"2025-05-20T22:17:47Z","title":"Programmatic Video Prediction Using Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:30:11.076093Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2505.14948"},"observation_digest":"sha256:15ef9cde8fcc8839274de9158837cd3876cdc162a03ab13555b7ac3b92b8f133","observation_id":"3f2a45de-1123-4c3e-b497-16d9f3cc2d8e","resolution":{"observed_at":"2026-08-07T15:30:11.076093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-07T10:52:20.620553Z","title":"arXiv preprint arXiv:2305.13311 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04116","last_updated":"2025-06-09T01:39:48Z","snapshot_observed_at":"2026-08-09T06:55:39.326252Z","submitted_at":"2025-06-04T16:09:19Z","title":"A Diffusion-Driven Temporal Super-Resolution and Spatial Consistency Enhancement Framework for 4D MRI imaging","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:20.620553Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2506.04116"},"observation_digest":"sha256:bb7ffee7d461227d098ffbd1b7c43d85e3256ed332e97896e588dd06cc3d1567","observation_id":"94751a73-db32-4b8d-b28a-33147d4d9178","resolution":{"observed_at":"2026-08-07T10:52:20.620553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-07T04:25:21.115345Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10778","last_updated":"2025-06-12T14:53:36Z","snapshot_observed_at":"2026-08-10T01:56:30.052101Z","submitted_at":"2025-06-12T14:53:36Z","title":"SlotPi: Physics-informed Object-centric Reasoning Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:25:21.115345Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2506.10778"},"observation_digest":"sha256:b63d1235b27cd442e64ab16b040ac0cfc8c7ed4396151b5422f8026aa66c7436","observation_id":"7b5dc2f1-8125-41bc-abbf-083e22672a89","resolution":{"observed_at":"2026-08-07T04:25:21.115345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-07T00:15:36.767344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14769","last_updated":"2025-08-09T11:31:44Z","snapshot_observed_at":"2026-08-08T13:44:42.076256Z","submitted_at":"2025-06-17T17:59:12Z","title":"CDP: Towards Robust Autoregressive Visuomotor Policy Learning via Causal Diffusion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:36.767344Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2506.14769"},"observation_digest":"sha256:95019c814803e088826dd57f9d4072f7e93d4b78707135d92030e462671b8387","observation_id":"b3cc039d-b35b-40d2-a7e8-2fd8a4a2cfeb","resolution":{"observed_at":"2026-08-07T00:15:36.767344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-06T18:32:07.604326Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08137","last_updated":"2025-09-14T03:40:57Z","snapshot_observed_at":"2026-08-09T06:55:41.267430Z","submitted_at":"2025-07-10T19:56:10Z","title":"Occlusion-Aware Temporally Consistent Amodal Completion for 3D Human-Object Interaction Reconstruction","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:07.604326Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2507.08137"},"observation_digest":"sha256:40df38a2c5ded58ebfd0659ff434b3d74ff23b154632c4b09e5accbcc89c7d12","observation_id":"d953c5ed-78b1-4ec9-b630-eafd96c91208","resolution":{"observed_at":"2026-08-06T18:32:07.604326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":"2305.13311","doi":"10.48550/arxiv.2305.13311","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VDT: General-Purpose Video Diffusion Transformers via Mask Modeling","venue":"arXiv (Cornell University)","work_id":"353adf25-cb13-416f-abb4-75e75d50cfc0","year":2023},"citing_paper":{"arxiv_id":"2603.09721","last_updated":"2026-04-18T11:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-10T14:28:32Z","title":"FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T13:27:23.641294Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2603.09721"},"observation_digest":"sha256:56891b06dd4291321df0b0e6eab1d3f220e9afea78aa2d75b2a5959d31e0cd70","observation_id":"e63c317d-8fb1-4ab8-834a-a3f293f0c9f1","resolution":{"observed_at":"2026-05-15T13:30:01.641887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":"2305.13311","doi":"10.48550/arxiv.2305.13311","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VDT: General-Purpose Video Diffusion Transformers via Mask Modeling","venue":"arXiv (Cornell University)","work_id":"353adf25-cb13-416f-abb4-75e75d50cfc0","year":2023},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:dfe754a3f85eaaf4d77ee757ca9488aec9e0eefffc5b2fd8959a17c833218c5e","observation_id":"f0f3de94-adc4-462e-bb64-48cdb652fa7f","resolution":{"observed_at":"2026-05-11T00:05:51.901440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":"2305.13311","doi":"10.48550/arxiv.2305.13311","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VDT: General-Purpose Video Diffusion Transformers via Mask Modeling","venue":"arXiv (Cornell University)","work_id":"353adf25-cb13-416f-abb4-75e75d50cfc0","year":2023},"citing_paper":{"arxiv_id":"2604.20936","last_updated":"2026-04-22T13:11:21Z","snapshot_observed_at":"2026-07-06T23:07:36.996629Z","submitted_at":"2026-04-22T13:11:21Z","title":"AttentionBender: Manipulating Cross-Attention in Video Diffusion Transformers as a Creative Probe","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T22:42:52.758195Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2604.20936"},"observation_digest":"sha256:12352e12566566207c1dee697a239c49ca75f56faf3dea9a0bf26a3b68aa0e76","observation_id":"b2d8d975-3e1f-4fd2-8d86-bb9b76a574b5","resolution":{"observed_at":"2026-05-09T22:44:14.223864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":"2305.13311","doi":"10.48550/arxiv.2305.13311","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VDT: General-Purpose Video Diffusion Transformers via Mask Modeling","venue":"arXiv (Cornell University)","work_id":"353adf25-cb13-416f-abb4-75e75d50cfc0","year":2023},"citing_paper":{"arxiv_id":"2605.20659","last_updated":"2026-05-20T03:24:50Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T03:24:50Z","title":"RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T05:55:24.854370Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2605.20659"},"observation_digest":"sha256:bbe0f23bc908279f2493652e79caa856402fbeba19ed7b9eeb3c3113f1ddced1","observation_id":"990ea3a2-01aa-4a43-ae24-9d4cb62f2915","resolution":{"observed_at":"2026-05-21T05:59:41.193525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":"2305.13311","doi":"10.48550/arxiv.2305.13311","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VDT: General-Purpose Video Diffusion Transformers via Mask Modeling","venue":"arXiv (Cornell University)","work_id":"353adf25-cb13-416f-abb4-75e75d50cfc0","year":2023},"citing_paper":{"arxiv_id":"2605.31603","last_updated":"2026-05-29T17:59:50Z","snapshot_observed_at":"2026-08-12T21:07:03.038294Z","submitted_at":"2026-05-29T17:59:50Z","title":"Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T22:56:21.783415Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2605.31603"},"observation_digest":"sha256:edbcd5f1f98a12dcfb1aa825f4d6de5170a22a92c3f4e2cceb709fb07f5aa68c","observation_id":"5add65a5-3203-43e5-8015-5ce370165b68","resolution":{"observed_at":"2026-07-01T19:16:00.515140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":"2305.13311","doi":"10.48550/arxiv.2305.13311","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VDT: General-Purpose Video Diffusion Transformers via Mask Modeling","venue":"arXiv (Cornell University)","work_id":"353adf25-cb13-416f-abb4-75e75d50cfc0","year":2023},"citing_paper":{"arxiv_id":"2606.10183","last_updated":"2026-06-08T21:21:01Z","snapshot_observed_at":"2026-08-07T00:53:32.267796Z","submitted_at":"2026-06-08T21:21:01Z","title":"Making Time Editable in Video Diffusion Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T16:36:43.699031Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2606.10183"},"observation_digest":"sha256:cf29e9b06cb8354102535334a2ca66b4c7278d0ead684a3c05ab965108ad0a47","observation_id":"ae5a5a8c-e90f-41f3-bcc4-52db6470c2c7","resolution":{"observed_at":"2026-07-03T01:27:30.543674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":"2305.13311","doi":"10.48550/arxiv.2305.13311","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VDT: General-Purpose Video Diffusion Transformers via Mask Modeling","venue":"arXiv (Cornell University)","work_id":"353adf25-cb13-416f-abb4-75e75d50cfc0","year":2023},"citing_paper":{"arxiv_id":"2606.13501","last_updated":"2026-07-02T13:06:12Z","snapshot_observed_at":"2026-07-06T23:52:14.348914Z","submitted_at":"2026-06-11T15:51:10Z","title":"GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T05:35:01.339479Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2606.13501"},"observation_digest":"sha256:f490266dd33ed1301c50dee9b35f97cff1a886c5852035e59bc0de419acb6986","observation_id":"1ed778b5-98cf-465b-b266-3402215d1a42","resolution":{"observed_at":"2026-07-03T16:28:39.264040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":"2305.13311","doi":"10.48550/arxiv.2305.13311","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VDT: General-Purpose Video Diffusion Transformers via Mask Modeling","venue":"arXiv (Cornell University)","work_id":"353adf25-cb13-416f-abb4-75e75d50cfc0","year":2023},"citing_paper":{"arxiv_id":"2606.13501","last_updated":"2026-07-02T13:06:12Z","snapshot_observed_at":"2026-07-06T23:52:14.348914Z","submitted_at":"2026-06-11T15:51:10Z","title":"GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T23:50:39.241880Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2606.13501"},"observation_digest":"sha256:0fb71b33f0acfc65437cdd9be05362762e526da6bea7294e23c331393b8615c6","observation_id":"203d95ca-f739-4e03-a6c7-298f6bf60b50","resolution":{"observed_at":"2026-07-03T23:59:06.282886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13311","snapshot_observed_at":"2026-07-13T05:19:39.977367Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09114","last_updated":"2026-07-10T05:58:52Z","snapshot_observed_at":"2026-08-06T23:14:42.002662Z","submitted_at":"2026-07-10T05:58:52Z","title":"Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-13T05:19:39.977367Z"},"links":{"cited_paper":"/paper/2305.13311","citing_paper":"/paper/2607.09114"},"observation_digest":"sha256:907f4ddf216133085f5971b027ba0baacbdc486625c8540cc62eb1b4dd33c12a","observation_id":"ad69f700-651d-40a0-ad7c-ccff0ffc90c6","resolution":{"observed_at":"2026-07-13T05:19:39.977367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.13311/citation-record","integrity":"/paper/2305.13311/integrity","json":"/paper/2305.13311/citation-record.json","paper":"/paper/2305.13311"},"outbound":[],"paper":{"arxiv_id":"2305.13311","last_updated":"2023-10-11T06:28:41Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:54:52.641338Z","submitted_at":"2023-05-22T17:59:45Z","title":"VDT: General-purpose Video Diffusion Transformers via Mask Modeling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2305.13311."}