{"as_of":"2026-08-11T13:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ddcfade27623e9ad55f4b8fbf091ba23697094188ab388c1c9a0317af3f9e895","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:00:16.005187Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.30317/citation-record","integrity":"/paper/2605.30317/integrity","json":"/paper/2605.30317/citation-record.json","paper":"/paper/2605.30317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:6479b88cff8ff51173fe2e7b4d49aaa8e1683f73c0dc80d4611742111ca6fd27","observation_id":"ed3b6c15-2b04-4260-bcac-4123f1d00003","resolution":{"observed_at":"2026-06-29T08:03:14.053299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Self-rectifying diffusion sampling with perturbed-attention guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:40f5d88059da2383ee01afa4f1588ce25267d1baf83cc7fc41d7697ec362b050","observation_id":"93b16958-4035-4284-ab1a-64a6bcaf27dc","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-acl.58","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Findings of the Association for Computational Linguistics: ACL 2022 , publisher =","venue":"Findings of the Association for Computational Linguistics: ACL 2022","work_id":"534c14af-b9fe-4e9e-8bfb-de2678293eec","year":2022},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:42450ddcc13fb58c9847d9b4531c39df755d811f62969fe9c83bbcd7e24aa96a","observation_id":"3f27767c-42e8-4eea-8fd4-6c305beda22c","resolution":{"observed_at":"2026-06-29T08:03:13.618766Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Scheduled sampling for sequence prediction with recurrent neural networks.Advances in Neural Information Processing Systems, 28, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:afac7d0de6a61b3a0a8bde9870e5b5eaeb4e72685cfbd350d687e02aaa7ecc17","observation_id":"95dc5809-f98c-4ea4-993c-0d9e3324bd7a","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:55e9bb399a92a34a6e53e1c3d6711ca30a54c1164d6629982382d743ec04a31c","observation_id":"98c96b3d-7a37-4884-8ca2-439d4a4de3a6","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-11T10:16:40.394612Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:22b314e904824f502e9d0f0ab94f79f207ff645b51a1259c1097d11e6e464864","observation_id":"6b471dcf-9997-4c40-9171-3ea36359ac57","resolution":{"observed_at":"2026-06-29T08:03:14.050583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:7c149c802e0e59ca578f20a5c450474fd9a0d04bcf25e3134555ad90d97c5b89","observation_id":"a4c74d2e-963c-48bc-b7c8-d6cbfe9d16d4","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:46cae7dc7c2bad89fc09ec53726f33e097ab29cebbd3aea260429e078abd26fb","observation_id":"400e1312-d99b-42a3-86e5-8dd993ef4428","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.Advances in Neural Information Processing Systems, 36:52132–52152, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:1238f39161b2243717ec610b2383a4767c60b7b962acb3f51038606609da0eae","observation_id":"73b74f10-6c50-46b8-abab-0853bdd662b1","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Deep autoregressive networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:e0b08d4cf55ebaf880aa9a0cf07642f0e5f4e7162da83bcd596f4e95debe243b","observation_id":"0b7a5381-863c-4e21-8f0c-aa7c8c0a3322","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Suboptimal behavior of bayes and mdl in classification under misspecification.Machine Learning, 66(2):119–149, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:ff44abd4bfba239f38f277a6a28cb7a8b4ed27a1e7a42f07e858dc1a4d8e63f1","observation_id":"0e3b39a0-77ec-48da-a31f-42593d997426","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:fe591ff38bcb0166697e379efc36eabdab7f3269eeaee359a21ae4edcf7c9d3f","observation_id":"31124dfc-aa24-450a-b2dd-c8e59e2e13a3","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06568","last_updated":"2025-03-09T11:54:08Z","snapshot_observed_at":"2026-08-07T17:19:06.908792Z","submitted_at":"2025-03-09T11:54:08Z","title":"Conceptrol: Concept Control of Zero-shot Personalized Image Generation","version":1},"cited_work":{"arxiv_id":"2503.06568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06568","snapshot_observed_at":"2026-07-02T03:26:29.461039Z","title":"Conceptrol: Concept control of zero-shot personalized image generation","venue":null,"work_id":"19d097e3-81f8-454a-9543-e3eee51e7450","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2503.06568","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:d2cf4fa48f145abf3d03ff4c3e2561a2683775bbdca7c35491efc6bf62f73499","observation_id":"a3df8ecd-32d0-4cc0-ba45-436ff05cbab3","resolution":{"observed_at":"2026-06-29T08:03:14.006326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17924","last_updated":"2024-10-04T17:09:40Z","snapshot_observed_at":"2026-07-06T17:51:28.420385Z","submitted_at":"2024-03-26T17:57:05Z","title":"AID: Attention Interpolation of Text-to-Image Diffusion","version":3},"cited_work":{"arxiv_id":"2403.17924","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17924","snapshot_observed_at":"2026-06-29T08:03:14.039667Z","title":"Aid: Attention interpolation of text-to-image diffusion","venue":null,"work_id":"09217a78-35cb-420d-9409-5d97ea152c25","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2403.17924","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:ff27f554ef0bc8538c49428eb618facbcc12c9181aa054657ace09fdc28967b1","observation_id":"f607d092-18b6-4404-b2c6-6e747271918c","resolution":{"observed_at":"2026-06-29T08:03:14.041712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:03:13.990478Z","title":"REAR: Rethinking visual autoregressive models via generator-tokenizer consistency regularization.arXiv preprint arXiv:2510.04450, 2025","venue":null,"work_id":"ce1e2487-1340-4331-8dfb-037f67a408fb","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:075365dc0fa9d925a1a8cdb78ca3f56c4761473fbde97af12b15640f8054e605","observation_id":"9083b459-91cf-404e-9352-98adfe80ea31","resolution":{"observed_at":"2026-06-29T08:03:13.991902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:264a41ad53a64e62d9e933e8e9c64ec6470a45d9e0dee2151ca9e43da2697de5","observation_id":"75051b49-dd15-4a8d-92f0-1338ca6f9fb7","resolution":{"observed_at":"2026-06-29T08:03:14.003382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Smoothed energy guidance: Guiding diffusion models with reduced energy curvature of attention.Advances in Neural Information Processing Systems, 37:66743–66772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:ea2317535f561b9e06edf495704a31eb7965647904ea824d187348a058d74b5d","observation_id":"cbf2529d-be3f-4743-9b91-f1f78e4566c5","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:8b7310ec6ffe95664424933a8a35ceed7de99639691370673c69b34a6d014952","observation_id":"6057887a-a83a-4bf6-be73-32b9d480e92b","resolution":{"observed_at":"2026-06-29T08:03:14.026465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:84e43a5eea16e4b3a7c0ca332c83df13e2fb4a926a71a7092bca1475ad25e500","observation_id":"2c046fa5-3350-4f41-b1e6-556a71750e6f","resolution":{"observed_at":"2026-06-29T08:03:13.986844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:3b663a0d3d7bbdd9a3b5d8c6aa79d7754ff18badc275dde422494286b34b54a4","observation_id":"07eb17f9-7820-462b-b61b-488dff237447","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Guiding a diffusion model with a bad version of itself","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:b98f17d04754f1de18ae2e5922d5a5c3ff57856e66f8d5c5b42e9f17495dd123","observation_id":"c6c66a4c-7d7d-4b70-b362-002311b3800d","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:997cc779570b3f2fc9085b185ae944231be31d7e12cf3635ee21101b1b7ecae0","observation_id":"bef1f905-a5e6-4dca-8756-6ba81abe32d8","resolution":{"observed_at":"2026-06-29T08:03:14.000811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"FLUX.2: Frontier Visual Intelligence.https://bfl.ai/blog/flux-2, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:f61005cf616b898bb7f69e83c8d6efaa407fa07b3dcb592ff38ac8aae6d5e1de","observation_id":"2c2eadf8-e9c0-40ae-b4fe-2014487d94d9","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Lamb, Anirudh Goyal, Ying Zhang, Saizheng Zhang, Aaron C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:eef9cb7fdc14cb8b0ff014642b6fb2cf27219e1f3ce4adf22612e12fdffa478c","observation_id":"5d139193-acd6-4058-8e74-0999205b0ab0","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Autoregressive image generation without vector quantization.Advances in Neural Information Processing Systems, 37:56424–56445, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:2c46113ed0c312b96e62e2c3cf819bd3f03d32c54d6bf86725c55da09e9fa219","observation_id":"a4e4e4e6-d8eb-4a08-8fc3-28f786052ca0","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.19680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:35:00.312631Z","title":"arXiv:2512.19680 (2025) 5","venue":null,"work_id":"1ba4d47f-36db-4a3c-b1f7-857c48fb76cb","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:56b3a0672ddb5ae302a90b775c4f41a975733fb189d35e5ea069fc116d6650c4","observation_id":"8a83ec89-a026-414e-8ce8-b7400950421a","resolution":{"observed_at":"2026-06-29T08:03:14.044788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"cited_work":{"arxiv_id":"2505.19196","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19196","snapshot_observed_at":"2026-06-29T08:03:13.983158Z","title":"Step-level reward for free in rl-based t2i diffusion model fine-tuning","venue":null,"work_id":"cf021125-1fd3-49b4-9144-9fefbe53e155","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2505.19196","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:9a6f43591e1e69fb5fad3bf30c7af799db9fa0d38b4b9ff88e8405f3dd0814d8","observation_id":"e2f44700-b3bf-4fee-b294-a22df8a5e414","resolution":{"observed_at":"2026-06-29T08:03:13.984555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:58:32.625805Z","title":"Infini- tystar: Unified spacetime autoregressive modeling for visual generation","venue":null,"work_id":"e3d06309-1944-454b-be20-f4ffef259bf7","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:dffa1a56adaaaad8460526912ff23c6677e9079ec59b233bee151239f68ef187","observation_id":"3e2fce92-ecd4-4df1-ace6-002cd328c80c","resolution":{"observed_at":"2026-06-29T08:03:13.998565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Interp3d: Correspondence-aware interpolation for generative textured 3d morphing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:5757b567cb7a6ba8475268f2ef4c46b25012b4a69f891173218df69203c83d03","observation_id":"4db29d96-217c-45f7-a594-85352b5f3947","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:a04ee61ea8b69c32f54993fd15cc26900ad7ed429f71856bb15dcddb7a8cf0a0","observation_id":"90e4471b-9750-40f8-a803-89c407d567c9","resolution":{"observed_at":"2026-06-29T08:03:14.038473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":"2309.15505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-07-10T02:16:42.481403Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","venue":"cs.CV","work_id":"34dd22bc-0de9-4e11-9a1b-1358e10fbfe1","year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:9b9e63ff7c19888918eb2431a63a538ff64a25e61c90da8f2fabd28fdcda5de2","observation_id":"b4fce583-aa95-4a38-ac42-7b53996283d3","resolution":{"observed_at":"2026-06-29T08:03:14.035462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Image transformer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:f2540611033ab634c00a07003b13e0bd4f9bef3f6df1d246a9a4081dcf3edd9f","observation_id":"18777129-4c80-40b6-aa14-d1d680a1f58b","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20388","last_updated":"2025-03-20T18:15:30Z","snapshot_observed_at":"2026-08-09T06:15:55.650722Z","submitted_at":"2025-02-27T18:59:08Z","title":"Beyond Next-Token: Next-X Prediction for Autoregressive Visual Generation","version":2},"cited_work":{"arxiv_id":"2502.20388","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20388","snapshot_observed_at":"2026-07-04T20:50:11.364862Z","title":"Beyond next-token: Next-x prediction for autoregressive visual generation","venue":null,"work_id":"0e9ba908-c13e-44d1-993a-2ce2994b1cc9","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2502.20388","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:d156eab1478316c71240308b95f3d9b10f3bcd1c06d9d6862651379e04d662e0","observation_id":"2ef82b06-ad04-43e7-b1e7-e8bf54ea51ba","resolution":{"observed_at":"2026-06-29T08:03:14.032693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:bfe9fe3b341590717af7d8abbe858de34f5e12f4f83b69a5709a8cf2594b7c9b","observation_id":"2e13bba3-f311-43e2-b66f-5e8e7ace93e9","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d19-5616","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalization in generation: A closer look at exposure bias","venue":null,"work_id":"9e839924-f946-480e-98b2-a0510caf04eb","year":2019},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:5d6b11cadc4cf7c9129f13ccdef463ad90f2c63e31d68f3a45a5e860d6e563a6","observation_id":"1b532297-0cc7-4230-9e72-7bd436286f91","resolution":{"observed_at":"2026-06-29T08:03:13.622848Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"SSG: Scaled spatial guidance for multi-scale visual autoregressive generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:b64a7362afa3566e965b96201146f8dad0e88410adcfdd8d08ed0ce45fc6e605","observation_id":"a0dab1f5-8885-4b0c-985f-dad850f4a79d","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":"2406.06525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-10T11:37:03.266757Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","venue":"cs.CV","work_id":"41efe203-9377-4c63-b1d6-e499cd6e46f6","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:f52d967f6e816a967db722cc3a0b7465197b86ff2997626b1cef8282da37b439","observation_id":"6fea1418-0209-443c-9c0b-52757ead38d6","resolution":{"observed_at":"2026-06-29T08:03:14.020689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:eb5adf71ee2992fe9324bd1b2774d6ea526338dabfd0f69e75e7303864a6e20d","observation_id":"4991b45d-f9ca-4900-a43a-82df66351c11","resolution":{"observed_at":"2026-06-29T08:03:14.011397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:39a87350b66c17683e2e123951917bdad5675ad2fe05be4a753b10c9a52edee3","observation_id":"fa2401a5-0ed9-4ae7-a9aa-c4162a9fbe12","resolution":{"observed_at":"2026-06-29T08:03:14.005561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:d463513cf8c8afe97c0da621fc0d6f156237bcd6826998ce8585eead7e836500","observation_id":"c0a7076f-c789-4122-9f2e-e96ed35b0d93","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:d1cb2a0cde95208bd1abeb78c667f14bdceda0a40ea13a9fe8dae0af5d1247a3","observation_id":"6c1dd962-3c73-45f3-80bc-6ef55b7e4142","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:3dfbeb971b6c8984dccec093fc68babde6a8cf2b9a9560121eba1540cedd663b","observation_id":"1151c0a7-cda7-4d45-8b4e-cc39787496fb","resolution":{"observed_at":"2026-06-29T08:03:14.029311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03642","last_updated":"2020-05-07T17:46:02Z","snapshot_observed_at":"2026-08-10T11:54:04.771665Z","submitted_at":"2020-05-07T17:46:02Z","title":"On Exposure Bias, Hallucination and Domain Shift in Neural Machine Translation","version":1},"cited_work":{"arxiv_id":"2005.03642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.03642","snapshot_observed_at":"2026-06-29T08:03:14.045889Z","title":"arXiv preprint arXiv:2005.03642 , year=","venue":null,"work_id":"86ea5fa8-a5e5-446c-a5b5-25d611f5d40f","year":2005},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2005.03642","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:ba75f579c4a4af4c82c5f1053874041f408a988d0c646e7486924f2e1d20241d","observation_id":"8c1d0f35-8b15-4af2-8133-d6d0c427f24b","resolution":{"observed_at":"2026-06-29T08:03:14.047424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"Blaschko","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:524040226df0c4e3fc08dda71dc45eeb2a1e314f345032b4d67f7b638d9eb831","observation_id":"0ed9c76e-7e73-46df-9462-2063178dcb34","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:1527df5aa2afdcce39ac2ff59489a1e746cf6433a276d8f398149bf070e372d8","observation_id":"c7df9d30-7ee3-4de0-a9a7-7c3d1b2aa685","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16975","doi":"10.48550/arxiv.2512.16975","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Infotok: Adaptive discrete video tokenizer via information- theoretic compression","venue":"Open MIND","work_id":"a75f190f-a25f-4878-aedf-4e795b41cc37","year":2025},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:09ac3432e404c6a8be64aca89b998eac5d13ffc4e601b0f0baac330316db0f0a","observation_id":"72d0987f-c2ca-4c5e-a5a5-0a17ef30a38b","resolution":{"observed_at":"2026-06-29T08:03:14.024593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:53622795b4e31fcadf9678b71c50f8e0861a87350fe890cfaca171d8a1db291f","observation_id":"601e44bc-c052-4d4b-89f9-e011dd6a7e21","resolution":{"observed_at":"2026-06-29T08:03:14.019333Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:00:16.005187Z","title":"An image is worth 32 tokens for reconstruction and generation.Advances in Neural Information Processing Systems, 37:128940–128966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:cf2228a8e82b910b108a5d895c9864596fcfc1f6c35a25a3d18f56c9a59108c8","observation_id":"d2b5d881-b1e2-413b-b412-6f87a6623a31","resolution":{"observed_at":"2026-06-29T08:00:16.005187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08048","last_updated":"2026-04-09T09:54:49Z","snapshot_observed_at":"2026-08-11T06:54:24.418344Z","submitted_at":"2026-04-09T09:54:49Z","title":"Guiding a Diffusion Model by Swapping Its Tokens","version":1},"cited_work":{"arxiv_id":"2604.08048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08048","snapshot_observed_at":"2026-06-29T08:03:14.022321Z","title":"Guiding a Diffusion Model by Swapping Its Tokens","venue":"cs.CV","work_id":"abe04f08-4af9-427c-9a2e-0e25961c86aa","year":2026},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2604.08048","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:6da3d8b0e08267c7f8654f8196fd302e6855469bfd7a1b3235213ecbe76072cd","observation_id":"f6202b98-316e-46fa-b1a7-5f1084975064","resolution":{"observed_at":"2026-06-29T08:03:14.023553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1426","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"author Feng, Y","venue":null,"work_id":"08b4a008-6559-49d2-a88f-e50a9fe3771b","year":2019},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:9994aa224ca7dbd5ebd9de10ab1aaaa59a221d9e9a039ec7c3a7c16d1a43bc97","observation_id":"02c37d58-e6fb-466a-b1e0-f19f5d5dcb95","resolution":{"observed_at":"2026-06-29T08:03:13.620657Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07548","last_updated":"2024-06-11T17:59:53Z","snapshot_observed_at":"2026-08-05T21:17:06.014910Z","submitted_at":"2024-06-11T17:59:53Z","title":"Image and Video Tokenization with Binary Spherical Quantization","version":1},"cited_work":{"arxiv_id":"2406.07548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07548","snapshot_observed_at":"2026-07-04T19:30:07.369173Z","title":"Image and video tokenization with binary spherical quantization","venue":null,"work_id":"68f42337-bf16-4e4c-857e-ed48861a3968","year":2024},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2406.07548","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:8192370b0bfd8c2690ab2662e1a0e33061fcac2ebda36b6625b90328cba108fd","observation_id":"5195f449-27e6-47ae-aa2a-7076b077e4c8","resolution":{"observed_at":"2026-06-29T08:03:14.008832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05425","last_updated":"2026-05-27T15:11:58Z","snapshot_observed_at":"2026-08-07T12:27:02.125731Z","submitted_at":"2026-03-05T17:45:47Z","title":"RelaxFlow: Text-Driven Amodal 3D Generation","version":2},"cited_work":{"arxiv_id":"2603.05425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.05425","snapshot_observed_at":"2026-06-29T08:03:14.016496Z","title":"RelaxFlow: Text-Driven Amodal 3D Generation","venue":"cs.CV","work_id":"8d28c49b-c246-45be-8031-1dba9be124d7","year":2026},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2603.05425","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:147082a8e06223c67676bc4dbd4e0f1cffc8a0f2835ce409ed9f48a484364dc9","observation_id":"14e6710d-d70c-4bd7-a6ca-16c18b370ed5","resolution":{"observed_at":"2026-06-29T08:03:14.017742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":24,"verified_exact":25,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2605.30317."}