{"as_of":"2026-08-15T02:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7524684497c97b8444f15f3a87be925c55e28796c09561092245a39ad54aa4f2","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:16:47.640589Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:54:58.686040Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:33:15.180082Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:33b99bf0aad5fae6b228bf8e0f2df4ebfa607fa94fc9210498935b4a9fdf5027","observation_id":"345c7c81-7ca0-4f60-9dcd-030355ebec85","resolution":{"observed_at":"2026-05-19T08:02:23.524350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T23:05:17.201790Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2503.19325"},"observation_digest":"sha256:3a97de01b4d19d2fcb532d162e8f399f9c795d6f8d0cf2a67e81ddea90dfb966","observation_id":"55028210-12d4-41f0-a85b-e1e6bffa0950","resolution":{"observed_at":"2026-05-16T23:05:17.429070Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-12T22:02:52.918587Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:beaa105593cf5a5dd25cf2131fbd6695d71922ed465ee18ec68083d723389638","observation_id":"3c4f6c91-da64-4f9a-bd15-5b1934e03dc2","resolution":{"observed_at":"2026-05-17T07:24:04.751003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-08-07T00:30:29.656888Z","title":"Taming teacher forcing for masked autoregressive video generation.arXiv preprint arXiv:2501.12389, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14168","last_updated":"2025-06-18T09:44:09Z","snapshot_observed_at":"2026-08-13T05:38:52.343886Z","submitted_at":"2025-06-17T04:08:18Z","title":"VideoMAR: Autoregressive Video Generatio with Continuous Tokens","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:29.656888Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2506.14168"},"observation_digest":"sha256:63affe52ef1038b25d4ecc6186bba6af0b028b72633459ba1f9135cd1810554a","observation_id":"b302fce3-bb57-4116-9db3-a28e75632476","resolution":{"observed_at":"2026-08-07T00:30:29.656888Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T03:52:59.287555Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2509.22622"},"observation_digest":"sha256:2df1bb720284e3bf7a82fc3c6a91670f1c2fd3fcc027728726a7e76a2a478918","observation_id":"6fa80ef5-e219-4eeb-9890-eb40db8a9af9","resolution":{"observed_at":"2026-05-15T03:52:59.443581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":"2501.12389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-06-29T08:33:15.180082Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":"e1a95892-4377-4549-938b-cfb4947576e9","year":2025},"citing_paper":{"arxiv_id":"2605.30083","last_updated":"2026-05-28T15:30:04Z","snapshot_observed_at":"2026-08-08T04:25:10.823052Z","submitted_at":"2026-05-28T15:30:04Z","title":"Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-29T08:30:00.438334Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2605.30083"},"observation_digest":"sha256:cf5b605f45d9ee6bbf1898caec8e459af7f817ba7a25fc90213bd9892d8bd20a","observation_id":"802ff53e-027c-462f-90df-0204cb5e436c","resolution":{"observed_at":"2026-06-29T08:33:15.181604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12389","snapshot_observed_at":"2026-08-08T04:54:58.686040Z","title":"Ni, and Heung-Yeung Shum","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05648","last_updated":"2026-08-06T06:46:35Z","snapshot_observed_at":"2026-08-14T05:01:24.809733Z","submitted_at":"2026-08-06T06:46:35Z","title":"Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T04:54:58.686040Z"},"links":{"cited_paper":"/paper/2501.12389","citing_paper":"/paper/2608.05648"},"observation_digest":"sha256:a857db39691b350efee29b0a4552321dfac212cae3d6d282ec02330164e700a5","observation_id":"ea3bcdc1-ed91-4ee5-aa03-278c26125255","resolution":{"observed_at":"2026-08-08T04:54:58.686040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12389/citation-record","integrity":"/paper/2501.12389/integrity","json":"/paper/2501.12389/citation-record.json","paper":"/paper/2501.12389"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.399672Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.399672Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:40602f06b5081ac56e4a262c1acc3a4ae95a6f7b7dc11bb93a3315a75de96448","observation_id":"c8217c3c-1ec2-4900-92fd-e6926197cce8","resolution":{"observed_at":"2026-08-10T17:16:47.399672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.215786Z","title":"Ge- nie: Generative interactive environments","venue":null,"work_id":"09c28cfc-b8ac-4405-aa41-d96d6b513216","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.404985Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:3d3c80801fda533dfd8233c0ecb334fba6990a4279163de7649968b4e92a1a94","observation_id":"ffde491b-2e00-4ec5-8920-a7b15e856a4b","resolution":{"observed_at":"2026-08-10T17:16:48.220054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.410911Z","title":"A short note about kinetics-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.410911Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:def2afd51a84243f2021956fe1116fac955bda7e71e6ed2678c08d3652941c2a","observation_id":"a0ad7479-a4f6-4d31-92cd-85adb495846b","resolution":{"observed_at":"2026-08-10T17:16:47.410911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.197806Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"afc34b66-faa8-4cc7-8a75-7e00301d89b8","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.423531Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:5a4aba5909086c0009fa255e2d7ad9ee9d1074ea73442d9eab64681b423775a3","observation_id":"0f6a07e0-4a77-47f0-90b2-a47632a79e8b","resolution":{"observed_at":"2026-08-10T17:16:48.201480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-13T13:10:50.058243Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-10T17:16:47.428417Z","title":"Freeman, Michael Rubinstein, Yuanzhen Li, and Dilip Krishnan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.428417Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:c3adefd89f4d4eb51553dcb87a42491d2f18db705bb3b07eaadd0236c1468fee","observation_id":"732eac7f-53c7-4c1b-a645-30a724bc8542","resolution":{"observed_at":"2026-08-10T17:16:47.428417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01392","last_updated":"2024-12-10T01:32:23Z","snapshot_observed_at":"2026-08-12T23:31:10.623373Z","submitted_at":"2024-07-01T15:43:25Z","title":"Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01392","snapshot_observed_at":"2026-08-10T17:16:47.433670Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffu- sion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.433670Z"},"links":{"cited_paper":"/paper/2407.01392","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:b1f0c669188ba00d4e8547febc45f58593a39f6799ed63a53528430247fa5081","observation_id":"c65c365c-b92e-45bf-b664-3df86884fa53","resolution":{"observed_at":"2026-08-10T17:16:47.433670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.438930Z","title":"Pixart-α: Fast training of dif- fusion transformer for photorealistic text-to-image synthesis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.438930Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:c6fdd94e7c98971783842fe070cf0ac84abbc1551a7d27c8e47cff0299b45999","observation_id":"4938ebbd-83b1-41e1-94ed-0f664cc0ba32","resolution":{"observed_at":"2026-08-10T17:16:47.438930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-13T23:30:37.164749Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-10T17:16:47.443669Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.443669Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:149fa796d1df5aaff5495b14aa990f4d5124c77f00361abe1395b52478ca72ea","observation_id":"cbcca705-c57c-42c6-801d-1a7716c2711d","resolution":{"observed_at":"2026-08-10T17:16:47.443669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.180207Z","title":"Model tells you what to discard: Adaptive KV cache compression for llms","venue":null,"work_id":"8dd4ddc8-b0c0-4029-8803-ca8ce640ac96","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.448666Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:4d6bfb9f4683e10b2b4314aabb8435e38d34d288cf5a5775394f8a12fd2d2bcb","observation_id":"1445b4f2-170d-4b06-8734-2ab442a3606c","resolution":{"observed_at":"2026-08-10T17:16:48.183696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.169485Z","title":"Courville, and Yoshua Bengio","venue":null,"work_id":"7de4dc31-5b10-447f-a92a-ca7aa838a936","year":2016},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.453799Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:341e4dd3b6ffde9a44ee5c9ff7af736745f49f871760a4eafbb3363427ab463a","observation_id":"3747f35a-5d14-43f0-91d7-ffaa29e449cc","resolution":{"observed_at":"2026-08-10T17:16:48.173588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-10T17:16:47.459726Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.459726Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:5e02788e26f4e3c60c26d3c80c8a112e8dabf615b9887501bad98f876e13c4fb","observation_id":"5c2b762b-3225-4277-8b34-04e9748f73ae","resolution":{"observed_at":"2026-08-10T17:16:47.459726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.157314Z","title":"Girshick","venue":null,"work_id":"5d1bc914-dae0-4a67-9366-41f64ca0ea40","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.466231Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:a0717a624507de4d600c0d044d6767083067ce2df5118911ae39895168a08df0","observation_id":"7d6aa9f6-43dd-4825-9437-05471e6be217","resolution":{"observed_at":"2026-08-10T17:16:48.162173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-10T17:16:47.471762Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.471762Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:c8160e4c5123bfcd3a585f1ac8a47a354836277f1ca2addade7d7e3a75ea81c7","observation_id":"9f9aade9-01a3-42b4-b197-10715474df14","resolution":{"observed_at":"2026-08-10T17:16:47.471762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.146129Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"b0c7e6ea-e3ab-4df1-8333-cb5ba34347d3","year":2020},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.476470Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:305362d1e965d6322e44a8124a81d782fc62780f8284cb1a0286d8cd46b38a16","observation_id":"1fef39fe-5590-46f6-86dd-06d1877d2ddd","resolution":{"observed_at":"2026-08-10T17:16:48.150461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.134674Z","title":"Video dif- fusion models","venue":null,"work_id":"fed04266-05cf-4e40-802c-5bcc137467a4","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.480978Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:1462e1e5a77a27434922340e3b881b758ec64d83da38e4c33f443f6c80722dea","observation_id":"20159b2a-dec4-49b3-a901-7709bb2635ef","resolution":{"observed_at":"2026-08-10T17:16:48.138967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11972","last_updated":"2023-06-14T03:32:57Z","snapshot_observed_at":"2026-08-13T13:15:36.821586Z","submitted_at":"2022-12-22T18:55:45Z","title":"Scalable Adaptive Computation for Iterative Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.11972","snapshot_observed_at":"2026-08-10T17:16:47.485858Z","title":"Scalable adap- tive computation for iterative generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.485858Z"},"links":{"cited_paper":"/paper/2212.11972","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:542021f0edcc5d5444528253252b7822374362ed8808858427615ae7d03a9ef9","observation_id":"b9eed922-6652-4e54-b265-d2e2379095d5","resolution":{"observed_at":"2026-08-10T17:16:47.485858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-10T17:16:47.490673Z","title":"Videopoet: A large language model for zero-shot video gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.490673Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:f3c1272560d9a1a92e73dd967cd42ec664f6998fe89d0e962e2447446e753437","observation_id":"360b747a-18fe-4dfd-b74e-0848a829e321","resolution":{"observed_at":"2026-08-10T17:16:47.490673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.121168Z","title":"Dart: Noise injection for robust imitation learning","venue":null,"work_id":"b31e6694-532b-444c-88ac-698fb967b478","year":2017},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.495655Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:40b0e4ee6c47722f14a090c857275508cb5ec2301732b35ce6bb79b1c56577ca","observation_id":"81b6d41c-4923-40d1-8397-0282b6c91ce6","resolution":{"observed_at":"2026-08-10T17:16:48.125866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.107696Z","title":"Autoregressive image generation without vec- tor quantization","venue":null,"work_id":"2e01ef21-26a8-4228-a3f9-61b5c9c436c6","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.500178Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:8ef74c7a24ba5d920213f61949493ef159af7e75ba7f9611b68af396471398eb","observation_id":"fcb101ee-7e9c-4071-bc4e-82a394b57b61","resolution":{"observed_at":"2026-08-10T17:16:48.112751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.093249Z","title":"Keep the cost down: A review on methods to opti- mize LLM’s KV-cache consumption","venue":null,"work_id":"9e2a6a7b-e18b-4c47-ad4a-090a088f9129","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.505391Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:9fee0ef8a848857e8fa6f88315e3910fd8fe8074d25783e180d2a943717acc4b","observation_id":"4bc11b39-4bc1-4e78-b94c-91c8ebb49620","resolution":{"observed_at":"2026-08-10T17:16:48.098726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-10T17:16:47.509903Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.509903Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:3289d86206fc422246cf417e74eb63280d906f373e4affa18d20994e1518b6ea","observation_id":"c565ebda-6104-4ab8-8f56-29cb9a5cc815","resolution":{"observed_at":"2026-08-10T17:16:47.509903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15881","last_updated":"2024-05-24T18:50:27Z","snapshot_observed_at":"2026-08-13T08:48:07.875595Z","submitted_at":"2024-05-24T18:50:27Z","title":"Scaling Diffusion Mamba with Bidirectional SSMs for Efficient Image and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15881","snapshot_observed_at":"2026-08-10T17:16:47.515030Z","title":"Scaling diffusion mamba with bidirectional ssms for efficient image and video gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.515030Z"},"links":{"cited_paper":"/paper/2405.15881","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:072bd3def2e4c5bd4dc666aa9ffe2c7d66bdeea00e2211c0138af425d258bf41","observation_id":"c9bd6572-827e-4f82-9b6a-c9a64e551df3","resolution":{"observed_at":"2026-08-10T17:16:47.515030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.079613Z","title":"Cosmos tokenizer","venue":null,"work_id":"d0b2b80c-273d-42d9-8bed-8788258c5b73","year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.519984Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:a49613c671559adbb7a89d009bd953c3fed3b9269849390ee37556d9639fe4f5","observation_id":"8ca12290-9639-49e7-931b-b5d69692e94d","resolution":{"observed_at":"2026-08-10T17:16:48.085171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.066636Z","title":"Improving language understanding by gener- ative pre-training","venue":null,"work_id":"4aeb959f-9823-4146-a2ce-1362ebbc7b10","year":2018},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.524356Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:55b07e1c0a770cd34153054d03f6255c742d525699c695a3d177d7751707e3da","observation_id":"5f30d9b2-3407-4071-95f8-236f20103467","resolution":{"observed_at":"2026-08-10T17:16:48.071303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.052828Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":"3dd88f49-6ea9-4f40-9259-d745a196321a","year":2019},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.528509Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:8f2d4984c1f0d0c1a1843c66a59ebbad64ab3f0232ce1533b0a53759bbb0fbc6","observation_id":"4841542e-b71a-45a4-ba93-583127cb2c90","resolution":{"observed_at":"2026-08-10T17:16:48.057648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-10T17:16:47.533348Z","title":"Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea V oss, Alec Radford, Mark Chen, and Ilya Sutskever","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.533348Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:1b567a4539af4f73ac27fcf3e8eee306c279976470ef279f1970333f32bafbab","observation_id":"0fd74360-c00e-47ac-959d-3f07d4277060","resolution":{"observed_at":"2026-08-10T17:16:47.533348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.039396Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"b81db217-064c-492a-bcfe-78c5519bc951","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.538415Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:0328d2d18546ac0df8278d3e31c48c3014046a4d4b897086f9493e4e0d992c6d","observation_id":"4cfb776c-15b3-4afa-b194-77d3ae117dce","resolution":{"observed_at":"2026-08-10T17:16:48.044619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.025639Z","title":"Generalization in generation: A closer look at exposure bias","venue":null,"work_id":"110b2441-78eb-4e7a-a638-86984d75b733","year":2019},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.542539Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:aeb5c0a4eefe56b38dde14d1f867f87ac5f201e4412f9ed54effa2ff00ddee69","observation_id":"1b4086cd-b949-400e-bb3e-e2f776919639","resolution":{"observed_at":"2026-08-10T17:16:48.031417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:48.012017Z","title":"Mostgan-v: Video generation with temporal motion styles","venue":null,"work_id":"774dd3a3-4546-4bec-87f3-7524e37fdc91","year":2023},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.546816Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:9183a3622886f00b03e6d98028bded7711f42217d4683d9b6fa5baf75593e77c","observation_id":"2e1a87e8-e7f9-4084-a594-9a27adf35bb0","resolution":{"observed_at":"2026-08-10T17:16:48.016832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.998040Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"a6bbed66-d1b8-4df4-8a8f-d09d4d4f92ab","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.550916Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:6cddd4569584f96e56a22d8a6640aa442be8c3296fb0c8cf5c9db3087e37e650","observation_id":"ab58ef13-103c-403c-a0e1-709477ce37cd","resolution":{"observed_at":"2026-08-10T17:16:48.003201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-10T17:16:47.555283Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.555283Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:5dc3e5f6976ebe95970fcfc432d8fab343752385e73bb34b60b046e7558e82f2","observation_id":"712eb7b0-13ba-4a16-9873-7280b52418ca","resolution":{"observed_at":"2026-08-10T17:16:47.555283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14224","last_updated":"2024-07-10T09:02:11Z","snapshot_observed_at":"2026-08-14T07:43:43.585018Z","submitted_at":"2024-05-23T06:53:18Z","title":"DiM: Diffusion Mamba for Efficient High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14224","snapshot_observed_at":"2026-08-10T17:16:47.559474Z","title":"Dim: Diffusion mamba for efficient high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.559474Z"},"links":{"cited_paper":"/paper/2405.14224","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:93c4ec0fa39ea7fc062301656a47841d1e6f289540f8d43c55f78ea5c9141a2d","observation_id":"781189e5-eab2-4e27-972f-02b01933f344","resolution":{"observed_at":"2026-08-10T17:16:47.559474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.15069","last_updated":"2021-04-30T15:38:41Z","snapshot_observed_at":"2026-08-09T15:45:25.081394Z","submitted_at":"2021-04-30T15:38:41Z","title":"A Good Image Generator Is What You Need for High-Resolution Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.15069","snapshot_observed_at":"2026-08-10T17:16:47.563491Z","title":"A good image generator is what you need for high-resolution video synthe- sis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.563491Z"},"links":{"cited_paper":"/paper/2104.15069","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:89797befcad7122e3e71b3d93857943aad15fe083642bbee498d747209c7afab","observation_id":"b7f2e466-cb66-47fe-b237-27131a2c7756","resolution":{"observed_at":"2026-08-10T17:16:47.563491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.568171Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.568171Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:2b3a1fcc83b9de06ec3bd9ba6796413d97aa49c1196280dcc54a6b14cabc744a","observation_id":"620a12e9-8525-42e0-833a-bdddd904b986","resolution":{"observed_at":"2026-08-10T17:16:47.568171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-10T17:16:47.572241Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.572241Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:e876cd3a80d9402103159e66b976d8bb670878488f0088c793cc23e7b64b135e","observation_id":"eb982e26-a697-4d87-bdb8-d9b38f1bf0e4","resolution":{"observed_at":"2026-08-10T17:16:47.572241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-10T17:16:47.576958Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.576958Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:5ff5ac4ff1f6400f7b621e219a4512ff4c466113307f0a102fe3f1a9cbebcb3f","observation_id":"55f9b719-ed24-401f-88fb-51c87abc9ecd","resolution":{"observed_at":"2026-08-10T17:16:47.576958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.977862Z","title":"Neural discrete representation learning","venue":null,"work_id":"18d509f8-bfd9-447d-9fbf-a7faf7359dd4","year":2017},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.581515Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:27250bd9e4a9716d88762c543cc4cda0f67f0dde1e59ceffc9d57ce2f9e3eac7","observation_id":"6ccbc150-f911-4b07-8925-2c523cbc6894","resolution":{"observed_at":"2026-08-10T17:16:47.983020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.965337Z","title":"Attention is all you need","venue":null,"work_id":"580a87ca-fc61-490c-9eca-6216e839b4d9","year":2017},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.585602Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:dc3b42ae657a9c6fe2420403139ff3cb11646e695b42401f6089c5f4187e9494","observation_id":"d09973aa-30d3-4d5e-a283-40586f223a62","resolution":{"observed_at":"2026-08-10T17:16:47.969438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.953319Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"d1ee593a-9734-4533-8b2a-6bad03a27fbf","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.590142Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:abd11617a6501dac2c4b748e7c6540ba4c51882805e9138cca4e285e4e9a2c8a","observation_id":"05191d2d-92ee-447f-bcbf-bb57554b3d3a","resolution":{"observed_at":"2026-08-10T17:16:47.957586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.01950","last_updated":"2021-03-02T18:59:10Z","snapshot_observed_at":"2026-07-06T10:46:11.856932Z","submitted_at":"2021-03-02T18:59:10Z","title":"Predicting Video with VQVAE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.01950","snapshot_observed_at":"2026-08-10T17:16:47.594537Z","title":"Pre- dicting video with vqvae","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.594537Z"},"links":{"cited_paper":"/paper/2103.01950","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:a2243b4a074306314a59208e795ee3897e8181b08c89d08ef95a16e620d6cec2","observation_id":"80260792-2f5c-477d-a704-a08243a0995d","resolution":{"observed_at":"2026-08-10T17:16:47.594537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09399","last_updated":"2024-06-13T17:59:26Z","snapshot_observed_at":"2026-08-12T23:43:17.830965Z","submitted_at":"2024-06-13T17:59:26Z","title":"OmniTokenizer: A Joint Image-Video Tokenizer for Visual Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09399","snapshot_observed_at":"2026-08-10T17:16:47.599371Z","title":"Omnitokenizer: A joint image-video tokenizer for visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.599371Z"},"links":{"cited_paper":"/paper/2406.09399","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:ccf6e0de590b24955a79dba7784cd2338337c628788e961b7985a7338b3a03c4","observation_id":"df6172df-8e15-4382-aa81-bcc7abf63b89","resolution":{"observed_at":"2026-08-10T17:16:47.599371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-10T17:16:47.604165Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.604165Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:3064fa2b6711a85f6c187bc71950b023a948eb7da92e4131e796955e9529bcab","observation_id":"7f39279b-c28e-4617-bd95-c2194542e5bf","resolution":{"observed_at":"2026-08-10T17:16:47.604165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.941809Z","title":"Williams and David Zipser","venue":null,"work_id":"255e11b1-066a-4d71-916a-4380e1d44c24","year":1989},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.608815Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:caf8d9bd7c9ee222d43ca20331a418c0ca56d68e2653bf8e74dbfb5eda69e23a","observation_id":"a85941ed-ffd9-4442-a632-1245d13c93db","resolution":{"observed_at":"2026-08-10T17:16:47.945800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.927453Z","title":"N ¨uwa: Visual synthesis pre- training for neural visual world creation","venue":null,"work_id":"4d4ae705-a54d-481a-9621-00edec18a534","year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.613408Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:e85990c3c88fac0b62d1a7294830ddc601323af664a353fb7f5a5ac28f5049b1","observation_id":"8e5f15cc-13c9-4714-9b9c-a9ba42b1bce1","resolution":{"observed_at":"2026-08-10T17:16:47.932679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-13T14:30:50.605700Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-10T17:16:47.617853Z","title":"Videogpt: Video generation using vq-vae and trans- formers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.617853Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:e464192827539b4c9d4f2c37b5b1680b961d6c96541991d7437de141b88f1a11","observation_id":"1a778c2c-eb55-42ff-a069-2a61d8e47074","resolution":{"observed_at":"2026-08-10T17:16:47.617853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.912892Z","title":"Magvit: Masked generative video transformer","venue":null,"work_id":"a214bcf4-0faa-4cf6-afce-df718cad88b5","year":2023},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.622561Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:003e05f2e773941b1daca0a627a10bd5404ef927224c6227ce0b03974bfe175b","observation_id":"f9606f3f-391e-49cf-a136-982f5ac0cdef","resolution":{"observed_at":"2026-08-10T17:16:47.919331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-10T17:16:47.626847Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.626847Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:d87106377a9b160f32ad3f117cef9fca2b7e26e4d8344f0e7f2e2bb528a1e2cb","observation_id":"02f907dd-8d63-440c-8fb2-970dcbbf1b5e","resolution":{"observed_at":"2026-08-10T17:16:47.626847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10571","last_updated":"2022-02-21T23:24:01Z","snapshot_observed_at":"2026-08-08T04:57:58.303438Z","submitted_at":"2022-02-21T23:24:01Z","title":"Generating Videos with Dynamics-aware Implicit Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10571","snapshot_observed_at":"2026-08-10T17:16:47.631553Z","title":"Generating videos with dynamics-aware implicit generative adversarial net- works","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.631553Z"},"links":{"cited_paper":"/paper/2202.10571","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:dd566a6c5123a295c019345b0dfe1de806205f370ba2b40d328574049490d57b","observation_id":"38ab387c-7f8e-4f81-901f-9c640634f9eb","resolution":{"observed_at":"2026-08-10T17:16:47.631553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:16:47.636085Z","title":"Video probabilistic diffusion models in projected latent space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.636085Z"},"links":{"citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:03e618292d1647dc04a29dd4df2eab24b7f588fe65313e70a312754d2b904486","observation_id":"adb9fa19-0050-4e3e-9ea8-a9e00091d17f","resolution":{"observed_at":"2026-08-10T17:16:47.636085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02448","last_updated":"2019-06-17T11:54:01Z","snapshot_observed_at":"2026-08-14T16:20:00.324943Z","submitted_at":"2019-06-06T07:15:52Z","title":"Bridging the Gap between Training and Inference for Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02448","snapshot_observed_at":"2026-08-10T17:16:47.640589Z","title":"Bridging the gap between training and in- ference for neural machine translation","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.640589Z"},"links":{"cited_paper":"/paper/1906.02448","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:24babc5a5d943ec8187ecafc98048532dcae2d85306492d46dc873d7d1ec1a37","observation_id":"b6517ac2-4092-4ea4-b88b-0c4730de4ddd","resolution":{"observed_at":"2026-08-10T17:16:47.640589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-14T18:44:38.993682Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-10T17:16:47.415805Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation","version":1},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:47.415805Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2501.12389"},"observation_digest":"sha256:51eeea23c918dc650e4402101d07c0e3df43e5bc03a1b0546f994ed28bcd5d55","observation_id":"e6e7aa42-9bc0-4694-a878-c8052c99a8b8","resolution":{"observed_at":"2026-08-10T17:16:47.415805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.12389","last_updated":"2025-01-21T18:59:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T03:10:15.912759Z","submitted_at":"2025-01-21T18:59:31Z","title":"Taming Teacher Forcing for Masked Autoregressive Video Generation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 7 inbound Pith citation observations for arXiv:2501.12389."}