{"as_of":"2026-08-06T16:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4cfaf402b65be2de487b72222688a1dc0c8e7d8fee44b44ce2d9c07c9d924f2","coverage":[{"denominator":291,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T20:06:44.480769Z","state":"measured"},{"denominator":189,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":189,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":89,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:33:45.572085Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":21,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T13:43:11.024069Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2402.17177"},"observation_digest":"sha256:81a364ca501b4aee57c075cfac26e41577ee7c02b866ed78824f58b145f5b2a6","observation_id":"a62e11c0-6585-4629-b8df-a1cfe76fbb73","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:4c737632243bd7c3386e158a69e4b450f36e829222ef11b2a718f04f946659c6","observation_id":"8269caef-9368-47f3-809b-a6a66bde15fd","resolution":{"observed_at":"2026-05-15T12:26:37.406253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:37.599691Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2406.03520"},"observation_digest":"sha256:3629ba40e4b9460243469cfaf3bbb345948b5c9067ff94e0d4902eb7d8fdeb00","observation_id":"15746614-99f9-4b56-8cc4-fe93c6945b72","resolution":{"observed_at":"2026-05-20T11:34:37.748499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T22:09:16.622717Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2406.06525"},"observation_digest":"sha256:9402c9e7ef7f2ad8a38b281d79cdc697f8011d78dbf015c4d49289a270f21d83","observation_id":"34637a02-55ce-429a-a114-635fbfca1a05","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:22.224924Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2408.06072"},"observation_digest":"sha256:2d24f364d3e1512b7a7552e3de1ee0b8e1cf8d6c326f48f0765592a26f0b1cc6","observation_id":"508b355d-d7e3-4d34-831c-985a8144f9a1","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T21:03:33.427939Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2408.12528"},"observation_digest":"sha256:57974ac5c970fcf7bdccdb699cda5f2fbabfbebf1a17755d0ac6299b141e5438","observation_id":"7299ffa5-4cf3-4801-8188-88774f622139","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:f72bd0b06f1dcdf1246df98554d79d2c762bbe6d1761e097614138c78b4ee390","observation_id":"86105db8-b705-4c88-b1ba-c5b8893b03e3","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T07:33:25.188358Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2411.19650"},"observation_digest":"sha256:5e174e2504a81da56451f8bfefb68326c0ea95172e31848c214329982eae1e52","observation_id":"b73c6851-bd68-4f63-9cf0-aff0883c8baa","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:441594aaed55ef3540f05aa7c89220a9010a617793b6a395229689177e86ebc6","observation_id":"59659b5e-f1e0-40d6-9c41-f52e293a3c1b","resolution":{"observed_at":"2026-05-23T07:42:43.594956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T12:01:51.366667Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2412.20404"},"observation_digest":"sha256:8159eca53d522185ab8ab692eab1ca201abe8aa0a1a9fbbd1154ad05396f96b3","observation_id":"6f2433d4-b724-41b0-9d5d-7983d0457623","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-16T12:00:14.672729Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2502.06764"},"observation_digest":"sha256:c0e3b7d861bda3418ec571b375ff78dbcd823904cd4363b79dd14d67122ae833","observation_id":"88e2e2a3-6266-4263-a184-e0603270b0ce","resolution":{"observed_at":"2026-05-16T12:00:14.778781Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T23:51:43.934329Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2503.14324"},"observation_digest":"sha256:4529df0f84103143736872f54a2eff81fc537876342db2a321ea445ee5577540","observation_id":"f24f2499-65a8-456d-87d6-b5d79340aacd","resolution":{"observed_at":"2026-05-22T23:52:16.744030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T23:05:17.201790Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2503.19325"},"observation_digest":"sha256:af9fab3668c92751c8db1eb01641b4ea6dd1aa414d4df5930f06b0b26369ef47","observation_id":"9c24c522-6d85-4ffc-adf3-a8c0e566b2d0","resolution":{"observed_at":"2026-05-16T23:05:17.319698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T23:05:32.595632Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2503.20314"},"observation_digest":"sha256:d1b06b80dfed4b30f7982718ab4cc410a2d6f96bffd7c47b4fe887d4ad1ed3a1","observation_id":"861e91f5-a972-47f1-9302-86ab9090e24e","resolution":{"observed_at":"2026-05-22T23:07:14.230472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:b2fe27e4dbfeefdd0f28f7fe4cafd2e10f7febd3e8e9e21b2fa30012c74944e6","observation_id":"47ddc277-904f-43b0-a2d7-987c74eeb0ae","resolution":{"observed_at":"2026-05-15T14:50:59.838917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T12:09:56.836351Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2506.09113"},"observation_digest":"sha256:c438840d0a69ef1a3cf487f9b40cc8c6e45517ee9d2621cac4f5c58c40ee1f16","observation_id":"988a970a-d54e-43ab-a159-202120020f99","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T15:33:45.572085Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.572085Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:dec2bf1f8faf2c6d0018890750daa9482adeda412c98434dcab4b2948d1598d0","observation_id":"42a3761b-fb1e-4cd7-9020-57caeba12fd1","resolution":{"observed_at":"2026-08-06T15:33:45.572085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T22:35:50.958123Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06895","last_updated":"2025-08-09T09:00:45Z","snapshot_observed_at":"2026-08-05T22:34:59.302688Z","submitted_at":"2025-08-09T09:00:45Z","title":"BASIC: Boosting Visual Alignment with Intrinsic Refined Embeddings in Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T22:35:50.958123Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.06895"},"observation_digest":"sha256:612d8621a0bf5c82493ade9ee8ff1b5eb4f20e9b528bee4e3efa9fa72ea8ffc8","observation_id":"ece70674-f426-4caa-8b23-94f5688ab990","resolution":{"observed_at":"2026-08-05T22:35:50.958123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T22:13:13.818684Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07409","last_updated":"2025-08-10T16:15:04Z","snapshot_observed_at":"2026-08-06T09:48:10.806700Z","submitted_at":"2025-08-10T16:15:04Z","title":"CharacterShot: Controllable and Consistent 4D Character Animation","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-05T22:13:13.818684Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.07409"},"observation_digest":"sha256:a123cdcfbef140de38d5bfde638be3a599bc50665d8271acbf10f31f8cc7142e","observation_id":"e7e379fc-a4a9-4efe-9405-b7485f2192dd","resolution":{"observed_at":"2026-08-05T22:13:13.818684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T21:55:00.299651Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-05T21:54:55.588290Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.299651Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:2778e0bcd4931ccde2ae39248ed5702efbd2e89490027374c2045c7a3de2c6e2","observation_id":"085c8fec-7879-4d83-9ba4-3c5a4fa9332b","resolution":{"observed_at":"2026-08-05T21:55:00.299651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T20:50:29.163351Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09827","last_updated":"2025-08-13T14:03:10Z","snapshot_observed_at":"2026-08-05T20:50:26.544153Z","submitted_at":"2025-08-13T14:03:10Z","title":"Time delay as the origin of oscillations in anodic Si electrodissolution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:50:29.163351Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.09827"},"observation_digest":"sha256:9632131b565bd3487ede14fe8cd146997aad48accb2dfeb5f420a3eaa4b90f8a","observation_id":"5cd7c1a4-8aa2-4023-9c60-36f65d93ae02","resolution":{"observed_at":"2026-08-05T20:50:29.163351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T20:49:53.496674Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09858","last_updated":"2025-08-13T14:50:19Z","snapshot_observed_at":"2026-08-05T20:49:47.618789Z","submitted_at":"2025-08-13T14:50:19Z","title":"HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T20:49:53.496674Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.09858"},"observation_digest":"sha256:0f64fea3f0335267c2cba7b7c430ca77e2cd6cdf2552c5460008c7d8174c57cc","observation_id":"0ab7a641-5b0a-42ee-8e98-a496394c79d8","resolution":{"observed_at":"2026-08-05T20:49:53.496674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T19:54:58.673271Z","title":"Language model beats diffusion – tokenizer is key to visual generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-05T19:54:57.933142Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.673271Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:c9b71a83cd397e0c1bd45e26d999516d7403ff26da828afa94705dc41de73db7","observation_id":"c0098db9-3dc5-4551-b07b-e52f6010aaf4","resolution":{"observed_at":"2026-08-05T19:54:58.673271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T17:34:01.775720Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-05T17:33:53.846862Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:01.775720Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:062565312872dad34d437a6dceb9d79a81174c891845416d18cd0038a4efaafe","observation_id":"aaea03a9-88b0-4faa-9aa9-509c2580afd1","resolution":{"observed_at":"2026-08-05T17:34:01.775720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T12:07:36.996492Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01984","last_updated":"2025-09-03T05:25:38Z","snapshot_observed_at":"2026-08-05T12:07:30.616216Z","submitted_at":"2025-09-02T06:01:52Z","title":"Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T12:07:36.996492Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2509.01984"},"observation_digest":"sha256:f0632fe1be8baf5962bc419903d0c85322197083df44fee358bcbf8425a60130","observation_id":"8521cf50-b046-4cac-a5d8-a67202885bac","resolution":{"observed_at":"2026-08-05T12:07:36.996492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T10:19:54.524189Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04394","last_updated":"2025-09-04T17:05:59Z","snapshot_observed_at":"2026-08-06T05:46:13.034506Z","submitted_at":"2025-09-04T17:05:59Z","title":"Transition Models: Rethinking the Generative Learning Objective","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T10:19:54.524189Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2509.04394"},"observation_digest":"sha256:6fca828d5d9b10fee00fd4835cf70e11e7e631f1c50788dfc7fff27735810029","observation_id":"bb26dbb5-a894-490c-a3ec-a7245e1dde27","resolution":{"observed_at":"2026-08-05T10:19:54.524189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T05:27:34.352559Z","title":"B.; Versari, L.; Sohn, K.; Minnen, D.; Cheng, Y.; Birodkar, V.; Gupta, A.; Gu, X.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05441","last_updated":"2025-09-10T22:15:25Z","snapshot_observed_at":"2026-08-06T13:34:56.299668Z","submitted_at":"2025-09-05T18:49:08Z","title":"Missing Fine Details in Images: Last Seen in High Frequencies","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T05:27:34.352559Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2509.05441"},"observation_digest":"sha256:16c281e91677d22d303a0baecf64e133306533e5a4b24306aebc96eb1cc0cd21","observation_id":"84bb5c98-9958-4157-bbcd-1e90c5fc36c1","resolution":{"observed_at":"2026-08-05T05:27:34.352559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-04T23:57:19.690271Z","title":"Language model beats diffusion–tokenizer is key to visual generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06311","last_updated":"2025-09-08T03:26:18Z","snapshot_observed_at":"2026-08-04T23:57:17.623065Z","submitted_at":"2025-09-08T03:26:18Z","title":"WindFM: An Open-Source Foundation Model for Zero-Shot Wind Power Forecasting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:57:19.690271Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2509.06311"},"observation_digest":"sha256:8aec67289621747811615e60d6f4d86c64b608bda7d2b057a9db3213e1bb0714","observation_id":"fe512b93-21aa-4a66-ac9c-d1b067709c97","resolution":{"observed_at":"2026-08-04T23:57:19.690271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-04T16:43:53.195927Z","title":"B.; Versari, L.; Sohn, K.; Minnen, D.; Cheng, Y.; Birodkar, V.; Gupta, A.; Gu, X.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12046","last_updated":"2026-07-04T12:10:43Z","snapshot_observed_at":"2026-08-06T10:47:51.701860Z","submitted_at":"2025-09-15T15:27:29Z","title":"Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T16:43:53.195927Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2509.12046"},"observation_digest":"sha256:198eb2e55180d686c06c373ccc671a5706f30e248da01d2f06a9a25065424289","observation_id":"76786ac9-fcd0-4a3a-ab66-6a0575b633b9","resolution":{"observed_at":"2026-08-04T16:43:53.195927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2509.12052","last_updated":"2026-04-20T18:20:15Z","snapshot_observed_at":"2026-07-06T22:29:58.066459Z","submitted_at":"2025-09-15T15:34:02Z","title":"FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T16:42:25.803856Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2509.12052"},"observation_digest":"sha256:8c8a9c7a76d14820833886d920373f5669de20b42f953170d245214075f3c47a","observation_id":"3adcad21-1e27-4228-9f05-d45dfd5735e5","resolution":{"observed_at":"2026-05-18T16:42:43.875344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-02T12:47:50.534468Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:a69b50d5b33f504b06c3b4e5b14dff68d4af76285abecd0c447866b908fb4bce","observation_id":"f015d29f-1849-4513-8d6f-98fb47f7c4e6","resolution":{"observed_at":"2026-05-18T13:01:24.294582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2510.06637","last_updated":"2026-05-10T00:27:22Z","snapshot_observed_at":"2026-07-06T22:31:58.848080Z","submitted_at":"2025-10-08T04:37:32Z","title":"Control-Augmented Autoregressive Diffusion for Data Assimilation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T09:02:38.416697Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2510.06637"},"observation_digest":"sha256:e69a3e8c26153c69084ba3382c6a080ad705eb500529fe7112ae58f2a78b45d3","observation_id":"89c5cd24-a3fe-4422-935f-aaae85fb6685","resolution":{"observed_at":"2026-05-18T09:06:09.268139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-04T11:08:02.602491Z","title":"Language model beats diffusion–tokenizer is key to visual generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06928","last_updated":"2026-05-27T05:34:49Z","snapshot_observed_at":"2026-08-04T11:07:55.834219Z","submitted_at":"2025-10-08T12:08:21Z","title":"IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T11:08:02.602491Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2510.06928"},"observation_digest":"sha256:b7c660e074c22b91c61ba112f05b95bec37ea32f4063cd3eb7d13b83f74ab040","observation_id":"ed0b44ed-8e16-4de4-b403-31258fdda2e3","resolution":{"observed_at":"2026-08-04T11:08:02.602491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2510.18457","last_updated":"2026-04-23T08:02:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-21T09:30:45Z","title":"VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:05.125849Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2510.18457"},"observation_digest":"sha256:512b37f32d4040b81c7a744ac29d79e27238377dae7e2b7b7c64934e13e8028c","observation_id":"a8de84c0-39f0-4236-bdb3-511cd157aaad","resolution":{"observed_at":"2026-05-18T05:22:23.910210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-03T17:55:08.235444Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.07778","last_updated":"2026-06-28T16:02:21Z","snapshot_observed_at":"2026-08-04T10:23:32.451665Z","submitted_at":"2025-12-08T17:59:47Z","title":"Distribution Matching Variational AutoEncoder","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T17:55:08.235444Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2512.07778"},"observation_digest":"sha256:1a31f5e1ab3c0c0695d836d0d7a0f3088e4ddce9cf2c7d5a82df3dafe527152b","observation_id":"fdd71819-bcf5-4be2-842d-7a77301b0a35","resolution":{"observed_at":"2026-08-03T17:55:08.235444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-03T16:07:37.936876Z","title":"Language model beats diffusion– tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.15133","last_updated":"2026-06-11T09:01:01Z","snapshot_observed_at":"2026-08-04T17:45:40.551452Z","submitted_at":"2025-12-17T06:46:27Z","title":"HD-Prot: A Protein Language Model for Joint Sequence-Structure Modeling with Continuous Structure Tokens","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T16:07:37.936876Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2512.15133"},"observation_digest":"sha256:56aa780bf0fd56fe8c463a5a0e94973ee0fb6e21e2668c10602359e892471d6d","observation_id":"2abe063b-81db-4fb9-b09c-345f987c8e35","resolution":{"observed_at":"2026-08-03T16:07:37.936876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-03T14:53:03.206913Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.19311","last_updated":"2026-07-12T14:26:35Z","snapshot_observed_at":"2026-08-04T22:19:20.712501Z","submitted_at":"2025-12-22T12:00:12Z","title":"MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T14:53:03.206913Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2512.19311"},"observation_digest":"sha256:f7e9ba0f89c204d58a89e99b983aef7a05d4c52b0c627b231fa0c9283341f5ff","observation_id":"ed5a70c3-3676-43e2-a4be-1426cfbdd2fd","resolution":{"observed_at":"2026-08-03T14:53:03.206913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-03T13:29:53.536777Z","title":"Language model beats diffusion–tokenizer is key to visual generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-06T15:18:44.154246Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:53.536777Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:a9314d4de43da3c6255281519ea8acf080d5b7d076194d6799cf29eb3d5cfeaa","observation_id":"888fe29a-1065-4260-be74-1b29cd10fe46","resolution":{"observed_at":"2026-08-03T13:29:53.536777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-02T22:43:28.446943Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16086","last_updated":"2026-07-02T20:51:32Z","snapshot_observed_at":"2026-08-02T22:43:25.845230Z","submitted_at":"2026-02-17T23:20:26Z","title":"LGQ: Learnable Geometric Quantization for Image Tokenization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:43:28.446943Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2602.16086"},"observation_digest":"sha256:cadc66748967cc740536a2a0b8436d32b4115e87f99172f363f864a14af6a01c","observation_id":"6a57b081-e11c-4424-9b81-839f312ebd74","resolution":{"observed_at":"2026-08-02T22:43:28.446943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2603.00110","last_updated":"2026-04-23T12:54:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-18T14:58:18Z","title":"Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T21:22:41.935691Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2603.00110"},"observation_digest":"sha256:05dccebcf8aa37d274015182c7f17938379f61616a7caa292dc03c073f42be58","observation_id":"b336320e-fa4a-48fd-83ef-7f48cfaae028","resolution":{"observed_at":"2026-05-15T21:30:20.846856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2603.17812","last_updated":"2026-04-07T18:00:52Z","snapshot_observed_at":"2026-07-06T22:49:33.482934Z","submitted_at":"2026-03-18T15:04:57Z","title":"ChopGrad: Pixel-Wise Losses for Latent Video Diffusion via Truncated Backpropagation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T09:42:26.074609Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2603.17812"},"observation_digest":"sha256:15b25a7fadd1dbb62a81e3301f157b2b9bf9ecb1b996f92d5c37039b154ffdec","observation_id":"dca2d457-9a40-456d-9ff3-7f3afbdcf5fa","resolution":{"observed_at":"2026-05-15T09:45:23.318920Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-07-13T17:23:44.758186Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26661","last_updated":"2026-07-01T17:46:52Z","snapshot_observed_at":"2026-07-13T17:23:44.301154Z","submitted_at":"2026-03-27T17:58:05Z","title":"GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-13T17:23:44.758186Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2603.26661"},"observation_digest":"sha256:a3b35fad069c38690734f8ef377c22849a7aeedcf82c16afe25faa506e5a72e7","observation_id":"edb49e94-8b98-44d5-aae1-6ffe96c59bbb","resolution":{"observed_at":"2026-07-13T17:23:44.758186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2604.02714","last_updated":"2026-06-29T00:47:01Z","snapshot_observed_at":"2026-07-13T13:47:04.485036Z","submitted_at":"2026-04-03T04:14:13Z","title":"ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T20:52:25.139770Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.02714"},"observation_digest":"sha256:2211dddb05afa17d69e513ffdad7113942be0dca661cdcc4b0e3e94af4c7f2af","observation_id":"0f4bc646-fcdf-40ef-a45e-09190cda0827","resolution":{"observed_at":"2026-05-13T20:53:15.590642Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2604.09168","last_updated":"2026-07-23T07:42:32Z","snapshot_observed_at":"2026-08-06T11:01:30.223629Z","submitted_at":"2026-04-10T09:53:27Z","title":"ELT: Elastic Looped Transformers for Visual Generation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T17:19:22.543462Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.09168"},"observation_digest":"sha256:dc77c93502514997c01f05bd60361272a3969b795891ea543b661394261186f6","observation_id":"1686961d-e361-43b4-a16d-4daa5e7666ad","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-02T16:35:03.423853Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.09168","last_updated":"2026-07-23T07:42:32Z","snapshot_observed_at":"2026-08-06T11:01:30.223629Z","submitted_at":"2026-04-10T09:53:27Z","title":"ELT: Elastic Looped Transformers for Visual Generation","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T16:35:03.423853Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.09168"},"observation_digest":"sha256:98e927fb8d97530fa11b55dd446169bdb2e14175608dc0c6012b8edc13fbf81a","observation_id":"2138cc31-9281-498c-bc4d-ae00c8605193","resolution":{"observed_at":"2026-08-02T16:35:03.423853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2604.14591","last_updated":"2026-04-16T03:47:35Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T03:47:35Z","title":"Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T11:48:00.163951Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.14591"},"observation_digest":"sha256:4a01ba47c407cee820cdd20b53823adba07aa2421087a037b3d89cdd26d257d3","observation_id":"a4da9180-7516-417e-8d90-f7502fd141d2","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2604.16479","last_updated":"2026-04-12T04:45:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T04:45:51Z","title":"Latent-Compressed Variational Autoencoder for Video Diffusion Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:19.583713Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.16479"},"observation_digest":"sha256:07d7f6ecfdf1a8013b24eb8303fb5a3e255d2f438e680240498832e5d164d4ae","observation_id":"77bafbe1-84b6-488a-acff-59a4c5739655","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2604.22152","last_updated":"2026-04-24T01:50:53Z","snapshot_observed_at":"2026-07-06T23:08:37.811548Z","submitted_at":"2026-04-24T01:50:53Z","title":"dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T11:45:18.081248Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.22152"},"observation_digest":"sha256:e416dff8f608b99575e07c88389839882f53b2b3b1916e0be831d45445c290ef","observation_id":"38bb0a5a-7dd2-4464-b8ce-4ba21c79d784","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2604.24885","last_updated":"2026-04-27T18:08:05Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T18:08:05Z","title":"VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:58.100610Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2604.24885"},"observation_digest":"sha256:ddbfb8a34db4bc0d88640e09043adc767898042b5c747dba9e5a9ecd68f2b679","observation_id":"df0314d0-fa8c-49ba-ab81-30ee5c88deba","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.00503","last_updated":"2026-05-04T10:19:31Z","snapshot_observed_at":"2026-07-06T23:13:57.367556Z","submitted_at":"2026-05-01T08:25:51Z","title":"End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-09T19:41:03.302303Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.00503"},"observation_digest":"sha256:5087c200bbcf3abd822d1496e8e10abad09e928ed441e13d92af2a361f901dbe","observation_id":"b6aa4ab8-6696-4c74-b20a-5c45614a2fa3","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.00948","last_updated":"2026-05-01T10:39:49Z","snapshot_observed_at":"2026-07-06T23:14:15.780028Z","submitted_at":"2026-05-01T10:39:49Z","title":"Co-Generative De Novo Functional Protein Design","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-09T15:18:49.411291Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.00948"},"observation_digest":"sha256:f474bc0cd681bc7bdc39dfd00b30af5b906dbc07da143147462f2a6efdf363c2","observation_id":"935a52f3-4e73-4203-a007-14b27697ad20","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.01662","last_updated":"2026-05-03T01:30:29Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:30:29Z","title":"Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T19:17:20.745425Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.01662"},"observation_digest":"sha256:433030f09796e6bd09b0061b6fc5420888f6abfc03691c39101e41f69c355533","observation_id":"1edb73f1-2eec-447e-914b-f89d4cf37902","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.05646","last_updated":"2026-05-07T03:53:54Z","snapshot_observed_at":"2026-08-03T14:49:05.703728Z","submitted_at":"2026-05-07T03:53:54Z","title":"MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality","version":1},"reference_index":159,"source":"arxiv_source","source_observed_at":"2026-05-08T15:04:41.518195Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.05646"},"observation_digest":"sha256:6d26c4f97e4fcdd893d0e6f84d97db2883bf56180b97111c9980eb13a6918a96","observation_id":"7e4b04a8-56ee-4e5a-a1c1-edbb41265288","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T12:25:52.847432Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:c433973fad1c58d2782bb48d7f0507bf7221c445f96d1094a26a870e08d486bb","observation_id":"28cbb921-8f5d-4fd2-b5f5-c73a38ecf191","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T23:14:32.494076Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:511253651e6fb2e3a2fc675408247f1b964b8ec65f22fa070f096f8ce8a63f95","observation_id":"7b51f058-dbde-4dc6-ace1-67255cdc55fe","resolution":{"observed_at":"2026-06-30T23:15:07.766612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.07230","last_updated":"2026-05-08T04:32:17Z","snapshot_observed_at":"2026-08-01T04:13:43.004857Z","submitted_at":"2026-05-08T04:32:17Z","title":"CASCADE: Context-Aware Relaxation for Speculative Image Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T02:08:27.374066Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.07230"},"observation_digest":"sha256:c95ee5f0b73c6e7a39faef4b8474f8152b9064e1307209a92ebb2bb48ca7fb3f","observation_id":"2583d372-b0fc-4cea-99c1-279d73e86670","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.09981","last_updated":"2026-05-11T04:49:47Z","snapshot_observed_at":"2026-08-03T14:27:49.163957Z","submitted_at":"2026-05-11T04:49:47Z","title":"Yeti: A compact protein structure tokenizer for reconstruction and multi-modal generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:05.492969Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.09981"},"observation_digest":"sha256:13560c087aa54c3603ce1be6ed5fa102113bd7cc57d16eb41401a69adc30afc5","observation_id":"518836b1-b8e2-495b-834e-56e6e130c9aa","resolution":{"observed_at":"2026-05-13T20:06:45.090605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.14333","last_updated":"2026-05-14T03:57:25Z","snapshot_observed_at":"2026-08-02T04:28:22.039399Z","submitted_at":"2026-05-14T03:57:25Z","title":"InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T02:10:18.004724Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.14333"},"observation_digest":"sha256:6772c380cbca09662300acc761a90091b41c95b57572a987f25c667fc830b1e0","observation_id":"514b5810-22c4-47f6-8eeb-59abaf9cc22f","resolution":{"observed_at":"2026-05-15T02:13:30.598211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.14935","last_updated":"2026-05-14T15:09:49Z","snapshot_observed_at":"2026-08-02T21:52:07.191937Z","submitted_at":"2026-05-14T15:09:49Z","title":"Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-30T21:48:55.350493Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.14935"},"observation_digest":"sha256:ce0d6d9e52fbea9edf798e3c7883e633ebda39793ee09a72e40ed08ee61cb048","observation_id":"2c41be14-9832-4ba3-bf6e-b31ea9c5b618","resolution":{"observed_at":"2026-06-30T21:55:06.078194Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.16384","last_updated":"2026-05-11T10:51:02Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-11T10:51:02Z","title":"Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T22:41:44.510546Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.16384"},"observation_digest":"sha256:eb5bcb6d7274621bc2e0527c0852bc16f507608f0f8663b3dd7b80b956fd9740","observation_id":"57a7a722-9287-4357-b770-63e6dcf9360f","resolution":{"observed_at":"2026-05-20T22:43:51.089664Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.18267","last_updated":"2026-07-24T06:29:36Z","snapshot_observed_at":"2026-08-02T13:49:17.490757Z","submitted_at":"2026-05-18T12:03:41Z","title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:54.139888Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.18267"},"observation_digest":"sha256:c653023b0feccca6a11a4607f0bc13b894804c68549394dc6a2a18a94c518ec1","observation_id":"ffb30c11-ffcc-44f4-be5c-86670fed6589","resolution":{"observed_at":"2026-05-20T12:03:15.313939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.18267","last_updated":"2026-07-24T06:29:36Z","snapshot_observed_at":"2026-08-02T13:49:17.490757Z","submitted_at":"2026-05-18T12:03:41Z","title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T18:39:40.667006Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.18267"},"observation_digest":"sha256:4dbc1669dccd4113732f34993e182cb451cc7da6fa5d0cef080fc5ddf7ac5304","observation_id":"2a2a847e-4a26-4a51-88df-75340501e293","resolution":{"observed_at":"2026-06-30T18:45:00.693501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-02T13:49:21.531757Z","title":"Language model beats diffusion – tokenizer is key to visual generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.18267","last_updated":"2026-07-24T06:29:36Z","snapshot_observed_at":"2026-08-02T13:49:17.490757Z","submitted_at":"2026-05-18T12:03:41Z","title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T13:49:21.531757Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.18267"},"observation_digest":"sha256:e6901de8a39dbc844a014db101c254de7956bab668d18470e29bc6adc2e7054d","observation_id":"f45aacf6-8785-4197-a7b1-8b5502e1f04d","resolution":{"observed_at":"2026-08-02T13:49:21.531757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.21058","last_updated":"2026-05-20T11:43:46Z","snapshot_observed_at":"2026-08-03T21:36:49.518850Z","submitted_at":"2026-05-20T11:43:46Z","title":"A Dialogue between Causal and Traditional Representation Learning: Toward Mutual Benefits in a Unified Formulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T05:42:48.667216Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.21058"},"observation_digest":"sha256:0ed12497aa56af3ea22734efc7e3570bc71be5b3c845ba1e8284534d895f5bfc","observation_id":"d56a88f3-8438-479c-867a-d87b6a4025ba","resolution":{"observed_at":"2026-05-21T05:43:58.744717Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.21573","last_updated":"2026-05-20T17:59:58Z","snapshot_observed_at":"2026-08-02T08:45:09.575827Z","submitted_at":"2026-05-20T17:59:58Z","title":"Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-22T09:34:14.596976Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.21573"},"observation_digest":"sha256:da079e5b5e45a53930d7ff2ddda12fa0540b883acb30a5014464a2386f21288c","observation_id":"d767dc13-57fe-4618-9e43-318bcf8fd947","resolution":{"observed_at":"2026-05-22T09:34:46.664366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.23902","last_updated":"2026-05-22T17:59:42Z","snapshot_observed_at":"2026-08-02T23:45:38.334397Z","submitted_at":"2026-05-22T17:59:42Z","title":"PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-25T04:18:45.403718Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.23902"},"observation_digest":"sha256:2e2b3ecdc6ca8291cb138b2423283698c2947b1198e2d58840f73b0984969973","observation_id":"83b96a24-3a42-46d2-8315-bc5cf9be4832","resolution":{"observed_at":"2026-05-25T04:20:19.314786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2605.30317","last_updated":"2026-05-28T17:55:06Z","snapshot_observed_at":"2026-08-03T10:02:44.497447Z","submitted_at":"2026-05-28T17:55:06Z","title":"VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T08:00:16.005187Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2605.30317"},"observation_digest":"sha256:a5cc701bf50d1605ba7bd82c6180ede890d5dd33a2848e8a9c3aabde7c7bda9e","observation_id":"601e44bc-c052-4d4b-89f9-e011dd6a7e21","resolution":{"observed_at":"2026-06-29T08:03:14.019333Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.04461","last_updated":"2026-06-03T05:10:51Z","snapshot_observed_at":"2026-08-06T16:03:42.037175Z","submitted_at":"2026-06-03T05:10:51Z","title":"ChannelTok: Efficient Flexible-Length Vision Tokenization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T07:09:25.049534Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.04461"},"observation_digest":"sha256:606f2090f202efaacb93b578207f86a386770582ec203c2ea7c3ea4036c062d2","observation_id":"93cf740d-f35d-42ec-98ba-da75e6a91569","resolution":{"observed_at":"2026-07-02T07:06:44.337086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.05068","last_updated":"2026-06-03T16:29:44Z","snapshot_observed_at":"2026-07-06T23:45:06.925235Z","submitted_at":"2026-06-03T16:29:44Z","title":"MaCo-GAN: Manifold-Contrastive Adversarial Learning for Single Image Super-Resolution","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T06:53:27.042821Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.05068"},"observation_digest":"sha256:4312b88e5c654545d05335ec4be4a63dbb2cd038277b1ba55ac73fa8992f7df3","observation_id":"ab2c642d-3fee-4b1b-9fd2-99fc6af91f94","resolution":{"observed_at":"2026-07-02T07:36:44.752572Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.05552","last_updated":"2026-06-04T01:06:52Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-04T01:06:52Z","title":"Balancing Image Compression and Generation with Bootstrapped Tokenization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T03:07:33.054518Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.05552"},"observation_digest":"sha256:f34c9b701709a079888c9f115a787feb7acb6e9ea50363be7e15ab85604991a3","observation_id":"63658c79-b988-405c-9f83-afbf15a113ce","resolution":{"observed_at":"2026-07-02T11:46:55.476386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.07185","last_updated":"2026-06-05T11:49:28Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:49:28Z","title":"AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T22:43:09.489524Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.07185"},"observation_digest":"sha256:1030c7b62cf77fa11330a73c4f33b1eaa6c0bcc171ad472a4e0d868132b01ea8","observation_id":"78906622-c9d2-4555-9241-f3efd9a81819","resolution":{"observed_at":"2026-07-02T16:27:09.097579Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.09861","last_updated":"2026-05-31T16:04:11Z","snapshot_observed_at":"2026-08-04T08:48:57.321452Z","submitted_at":"2026-05-31T16:04:11Z","title":"Time Series as Language: A Universal Tokenizer for General-Purpose Time Series Foundation Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T17:57:07.869965Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.09861"},"observation_digest":"sha256:e2d47f0da80b3c5d10bc49035222a93c19258d37b92e1ba9ae65ab9fc71486f6","observation_id":"55e97e9a-910f-472d-9925-78803d6b634e","resolution":{"observed_at":"2026-06-28T18:02:27.050012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:fbdf08c562682a13ad8c34300c3e54061a5f6e784b09958784afe35ad908f68d","observation_id":"a4981707-dbb8-4620-8c92-5dfff0059716","resolution":{"observed_at":"2026-07-03T16:08:37.471517Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:db3498b105303b1e3c857dbbbcd931a97a9f41c703fcae82803f7998662ed903","observation_id":"e9d36f68-0d8f-4812-9bec-57ab91a2194f","resolution":{"observed_at":"2026-07-03T14:38:28.909903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.22480","last_updated":"2026-06-21T12:49:46Z","snapshot_observed_at":"2026-07-06T23:57:18.596834Z","submitted_at":"2026-06-21T12:49:46Z","title":"ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T10:14:42.111428Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.22480"},"observation_digest":"sha256:19fbfa287a07804807c4bb0aca7fe1857db84b91dd5ce989f625b1a0ede2e6e0","observation_id":"23f9c086-50ec-48a0-8512-9b65556db51e","resolution":{"observed_at":"2026-07-04T09:19:43.447089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.22481","last_updated":"2026-06-21T12:50:07Z","snapshot_observed_at":"2026-07-06T23:57:18.596834Z","submitted_at":"2026-06-21T12:50:07Z","title":"Lighting-Consistent Object Transfer Across Radiance Fields","version":1},"reference_index":265,"source":"arxiv_source","source_observed_at":"2026-06-26T09:46:46.216810Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.22481"},"observation_digest":"sha256:b01c3839ae3622fa8696e6181f7f2dc5491778368bd935bfe89176b64167a2ea","observation_id":"2ed7dea8-8e8b-4a1a-9d63-584d3d265d23","resolution":{"observed_at":"2026-06-26T09:49:18.026808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.24888","last_updated":"2026-06-23T17:59:55Z","snapshot_observed_at":"2026-07-06T23:59:23.407216Z","submitted_at":"2026-06-23T17:59:55Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T00:06:11.951205Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.24888"},"observation_digest":"sha256:39f2211a7483c2c6591437b2aa9603de97b05d75d2bf979c9157f651207761b6","observation_id":"b8cdd610-6234-4765-81cb-daa427a2d524","resolution":{"observed_at":"2026-07-04T16:59:58.103164Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T06:07:55.600338Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:6a4ac974c7310636535373998adae999779550c545067696ce6a6f8ebcc2dd96","observation_id":"0e2d65ef-42fe-49e3-92c2-f5832fd50a3d","resolution":{"observed_at":"2026-06-30T08:14:26.629603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-02T09:39:34.321400Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29814","last_updated":"2026-07-15T22:31:14Z","snapshot_observed_at":"2026-08-02T09:39:29.759731Z","submitted_at":"2026-06-29T05:48:41Z","title":"Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T09:39:34.321400Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.29814"},"observation_digest":"sha256:82bc31804e8351eb1180c0713637502453a136f326bd096c1844bc7b7ae367e1","observation_id":"855dce2e-4ccf-4494-8121-13b6e690c3e5","resolution":{"observed_at":"2026-08-02T09:39:34.321400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:c35a292fee34d0c2fb2cf82815438141b994da7db91d706f6b0fef1acbaccc4f","observation_id":"3c219fdf-a4a5-4e4e-9497-efd3339d6dd2","resolution":{"observed_at":"2026-07-01T11:55:42.292952Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2606.32039","last_updated":"2026-06-30T17:59:57Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-30T17:59:57Z","title":"GEAR: Guided End-to-End AutoRegression for Image Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T05:19:21.647714Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2606.32039"},"observation_digest":"sha256:63cb5f5e318a28f332f043a53eb9edcbbe1d4f90ec52a50103eab4d36c053c56","observation_id":"8ec98d85-a776-4087-9667-32ecea3de434","resolution":{"observed_at":"2026-07-01T10:35:42.656650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":"2310.05737","doi":"10.48550/arxiv.2310.05737","metadata_source":"pith","pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","venue":"cs.CV","work_id":"c81c5be2-0655-4234-a3e9-6c32753f136b","year":2023},"citing_paper":{"arxiv_id":"2607.01701","last_updated":"2026-07-02T04:50:33Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T04:50:33Z","title":"Arachne: Orchestrating Cascades for Efficient Text-to-Video Model Training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-03T06:27:48.935774Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2607.01701"},"observation_digest":"sha256:c074b39457e8e4f7c9c9a9dbc605b9651d6455cf14d8d02b335c11f53c3caabc","observation_id":"7c0c8cb3-a989-42e4-9360-8062e2ceca53","resolution":{"observed_at":"2026-07-03T06:37:42.063124Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2310.05737 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:c8626debe2c5661ff1e0dbc17f637ae5711dc6f7412a9374908d13b3f739462b","observation_id":"ed704826-f99b-473b-a598-18623d53d049","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-07-14T03:51:24.547781Z","title":"arXiv preprint arXiv:2310.05737 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11689","last_updated":"2026-07-13T15:22:56Z","snapshot_observed_at":"2026-08-02T18:20:32.168835Z","submitted_at":"2026-07-13T15:22:56Z","title":"From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-14T03:51:24.547781Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2607.11689"},"observation_digest":"sha256:af196630e16e1b7acff91e63ec24ee50e19825dcd512f287455ac9624d2dda39","observation_id":"f26a8f91-2e8d-4c2b-b5b0-b2da464e77bd","resolution":{"observed_at":"2026-07-14T03:51:24.547781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-01T15:49:34.744699Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18198","last_updated":"2026-07-20T17:38:12Z","snapshot_observed_at":"2026-08-06T12:48:34.537594Z","submitted_at":"2026-07-20T17:38:12Z","title":"Three-Body Scattering for Generative Modeling","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T15:49:34.744699Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2607.18198"},"observation_digest":"sha256:4904cd8215a4d39597326394f462f608d179ba29000a004e7bf9b8173ee8384f","observation_id":"168a649a-0a32-4b07-a546-4b80edc34ebd","resolution":{"observed_at":"2026-08-01T15:49:34.744699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-01T05:45:53.082144Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22148","last_updated":"2026-07-24T09:47:32Z","snapshot_observed_at":"2026-08-05T13:34:18.996225Z","submitted_at":"2026-07-24T09:47:32Z","title":"dRAE: Representation Autoencoder with Hyper-Spherical Codes","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T05:45:53.082144Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2607.22148"},"observation_digest":"sha256:3099639a6683f1c0af2db57c864699ea9614a3bfa9ad54a004e03a3957b2f9f2","observation_id":"9870d400-c33e-4aa4-9102-eee85c43cac1","resolution":{"observed_at":"2026-08-01T05:45:53.082144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-07-31T01:50:30.716875Z","title":"Language model beats diffusion– tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28624","last_updated":"2026-07-30T17:59:46Z","snapshot_observed_at":"2026-08-03T00:12:51.051086Z","submitted_at":"2026-07-30T17:59:46Z","title":"PhiZero: A World Model Built Around Physical Language","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-31T01:50:30.716875Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2607.28624"},"observation_digest":"sha256:ae7e4d610387abc0dd4beb1c67b44fa688b9f2025368687e83735877591104b5","observation_id":"93c76633-4f2c-4a27-a6f4-4e89acadfbcf","resolution":{"observed_at":"2026-07-31T01:50:30.716875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-03T00:34:35.560384Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28760","last_updated":"2026-07-30T18:26:19Z","snapshot_observed_at":"2026-08-06T02:19:22.424309Z","submitted_at":"2026-07-30T18:26:19Z","title":"WaiT for the Signal: Simple Frequency-Aware Flow-Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T00:34:35.560384Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2607.28760"},"observation_digest":"sha256:36647bd47768bfc662b0488fae799564b7fa1251b7f4b6f1a890fd24d2c5b2e4","observation_id":"27df76a9-3985-4e09-8eea-2d6d47d6a9e6","resolution":{"observed_at":"2026-08-03T00:34:35.560384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T00:44:16.956126Z","title":"arXiv preprint arXiv:2310.05737 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00562","last_updated":"2026-08-01T10:00:42Z","snapshot_observed_at":"2026-08-06T16:16:47.837802Z","submitted_at":"2026-08-01T10:00:42Z","title":"Beyond Token-Level Cross-Entropy: Fr\\'echet Distributional Post-Training for Autoregressive Image Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T00:44:16.956126Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2608.00562"},"observation_digest":"sha256:49f220a9c0b4cc57aa289bb74e6fee01d48ce13f63c01897650cb477eea89c8f","observation_id":"e53f494d-78b6-4fdf-bbac-a1574ff4f02a","resolution":{"observed_at":"2026-08-05T00:44:16.956126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.05737/citation-record","integrity":"/paper/2310.05737/integrity","json":"/paper/2310.05737/citation-record.json","paper":"/paper/2310.05737"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7b9f0ae3-eeb5-4452-95dd-e22979c50787","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:a2e67d4085fb314ae40fab8c990f6ce90b2935451ae02f3e1692e761af3b5609","observation_id":"0c80a096-a91d-4cb5-8c3a-a40bdc115bc7","resolution":{"observed_at":"2026-05-14T02:23:39.690311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long video generation with time-agnostic","venue":null,"work_id":"1ae8b3a8-08eb-4091-85d9-f9c677f70e48","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:4dc204708b19d328b9a1ceba92381492030c2b6ec53f80e1499aff133f3641d7","observation_id":"b7931924-488d-4b0c-af73-ca8b858e9a17","resolution":{"observed_at":"2026-05-14T02:23:39.657081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VISIGRAPP (5: VISAPP) , year=","venue":null,"work_id":"3b22436f-bfea-4cf1-88dc-24f5a9ec7361","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:e08a71f2a5736600170429584c162992d1060e8a63457fd62cf4770938e4b239","observation_id":"b43eb763-81f7-403c-bfa1-92a7e356b3f2","resolution":{"observed_at":"2026-05-14T02:23:39.686044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"be5005f7-32b8-49c7-aa7a-5a078d4bc278","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:ee5db4cb99f712a48123f72b0a37e2a1c352afbc84776f604077f2097e36c730","observation_id":"73449078-4699-4e37-a9b0-8569183a8d93","resolution":{"observed_at":"2026-05-14T02:23:39.694139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b433a9b-a99a-4d52-b8a4-4f6789949498","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:7d204faa25f3f916fa0f8626166e408278f453438598a65135bb7dd7958f56b1","observation_id":"b2f1cea4-7721-45ee-b677-c6eda590348c","resolution":{"observed_at":"2026-05-14T02:23:39.679663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06571","last_updated":"2019-09-25T16:37:55Z","snapshot_observed_at":"2026-07-06T08:07:47.943239Z","submitted_at":"2019-07-15T16:27:04Z","title":"Adversarial Video Generation on Complex Datasets","version":2},"cited_work":{"arxiv_id":"1907.06571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.06571","snapshot_observed_at":"2026-07-03T20:08:55.456063Z","title":"2019 , journal =","venue":null,"work_id":"b77c75b7-de8e-4a51-99f7-5093aeed16b3","year":1907},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/1907.06571","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:c5a214457bfc62d952eeba587b1d93d81f9512fe54dd91ebf1365f800d65b029","observation_id":"ec3178e0-2d1f-4e48-a4f7-3633c8d864b5","resolution":{"observed_at":"2026-05-13T20:06:44.731017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef6daae1-dc39-4b57-88a9-f3a6c954d4c6","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:0c511887dfa17f915dac831331aa96125b0faa260865a156b1bc3f3d6c86c12d","observation_id":"e4311910-bf4e-46a0-be6a-52caa1ce0a3f","resolution":{"observed_at":"2026-05-14T02:23:39.707721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7da056d4-2b35-4488-994e-e090d2472bd8","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:50bc965dca933d1fbaf500b3b377a5bb8f276dcab76ea85fa9e3f48b86705b84","observation_id":"562299c7-96a4-49eb-8918-9755296d3976","resolution":{"observed_at":"2026-05-14T02:23:39.668027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"32001af3-8489-42b1-832e-6c16307a45a8","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:15b8e0d942134089b8808f35ab3256669f463b3fa7528f77e96ea28363c6651f","observation_id":"61733854-0bed-430c-a775-3bf8c20d9551","resolution":{"observed_at":"2026-05-14T02:23:39.671869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04035","last_updated":"2021-11-17T17:56:08Z","snapshot_observed_at":"2026-07-06T09:03:16.366929Z","submitted_at":"2020-03-09T10:52:25Z","title":"Transformation-based Adversarial Video Prediction on Large-Scale Data","version":3},"cited_work":{"arxiv_id":"2003.04035","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.04035","snapshot_observed_at":"2026-06-29T08:53:16.000410Z","title":"Transformation-based adversarial video prediction on large- scale data","venue":null,"work_id":"7774a42c-03a4-4edd-b86f-1cc6025030d9","year":2021},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2003.04035","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:3633d53a925c963a718986698b43c839e58a2bbc7ad5e17c93f92410cdb61e57","observation_id":"435d4781-8562-4efd-ad1b-287f074bbf80","resolution":{"observed_at":"2026-05-13T20:06:44.593279Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09494","last_updated":"2022-05-09T17:02:49Z","snapshot_observed_at":"2026-07-06T12:49:14.981089Z","submitted_at":"2022-03-17T17:48:32Z","title":"Transframer: Arbitrary Frame Prediction with Generative Models","version":3},"cited_work":{"arxiv_id":"2203.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.09494","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transframer: Arbitrary frame prediction with generative models","venue":null,"work_id":"7bf93c42-9a04-4e34-99ea-6e3c74dcbaaf","year":2019},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2203.09494","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:e1f0886cc90d527d13e75d4cc1735b47207245567757b8dbf308ba45a575a49d","observation_id":"3783bab3-398c-43bd-af34-e7bddc7a3748","resolution":{"observed_at":"2026-05-13T20:06:44.612652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2d682ded-4945-4a75-ac3c-659b4ac34a94","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:0580e7da805e728140a255809a1c0cc3b2ba831f2a72e00e8779ec072277c9b7","observation_id":"85bd2d48-26b8-4b67-8c18-6919797453e9","resolution":{"observed_at":"2026-05-14T02:23:39.660912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13195","last_updated":"2021-06-24T17:20:21Z","snapshot_observed_at":"2026-07-06T11:22:38.453675Z","submitted_at":"2021-06-24T17:20:21Z","title":"FitVid: Overfitting in Pixel-Level Video Prediction","version":1},"cited_work":{"arxiv_id":"2106.13195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13195","snapshot_observed_at":"2026-07-03T11:38:04.583669Z","title":"Fitvid: Overfitting in pixel-level video prediction.arXiv preprint arXiv:2106.13195","venue":null,"work_id":"98b75ffa-1d61-4641-a59f-5967267b7d2c","year":2021},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2106.13195","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:83c4887b533aa83267c25f56bac6b68f959445621530870e1fbfd5226b688ea9","observation_id":"69b97509-1433-41ef-a792-cb9db08b0e5a","resolution":{"observed_at":"2026-05-13T20:06:44.737606Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e4cd1833-7452-43d7-9ed2-15706546f5a6","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:69013c3f89664ab12f37f31c62a744b6f60c46687313b74ba9905498bbe3a2ff","observation_id":"80785f33-4eb3-4a86-bc2f-8e8fd8fe5100","resolution":{"observed_at":"2026-05-14T02:23:39.697480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"40b02e93-b89d-4856-98b2-b086499c2e96","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:4e0c103cbc68f0b4188f378d7cb0885080f3f98ee354a179fc307fc9040edbb0","observation_id":"ba1b4fa5-76e5-4efe-b64f-3d2fdfbbb781","resolution":{"observed_at":"2026-05-14T02:23:39.711609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , publisher=","venue":null,"work_id":"0dd50291-cccc-4864-a597-82f12e4bd8b9","year":2020},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:dc033ec492d157f137863034ab3bfe56f6ca1ae68fb361b5755e0eb00f440478","observation_id":"db166f65-efce-4cd9-822e-802c0873a13f","resolution":{"observed_at":"2026-05-14T02:23:39.644414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0d657b3d-0129-47df-b93f-9c905c0f25af","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:498551cffa85978912fd028d6d8a8d8a4a9db7f3f8edcd98395674dd23059920","observation_id":"c4afdd8b-f6ea-4103-b667-d28d6b56c287","resolution":{"observed_at":"2026-05-13T20:08:13.791471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"175c0ec6-a2da-4f7d-b7de-c4f8c6b68600","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:31e0d02b0819f4235df5d680303a27a012ac7a9174eed3703ee20fd0e5f506cf","observation_id":"76450f03-38f1-4d97-b18f-388c5eef2fc2","resolution":{"observed_at":"2026-05-14T02:23:39.649281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4388194f-e265-4207-b269-51e978a9a5e5","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:9cdbc777a22be508ce86798e6736bd27efe0e85d6320d64f3e958b6017ce9f91","observation_id":"a5987eea-9132-4f1b-8748-5ba02ff7c257","resolution":{"observed_at":"2026-05-14T02:23:39.701241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02419","last_updated":"2018-12-06T15:57:41Z","snapshot_observed_at":"2026-07-31T17:24:20.685162Z","submitted_at":"2018-10-04T20:41:48Z","title":"Towards High Resolution Video Generation with Progressive Growing of Sliced Wasserstein GANs","version":2},"cited_work":{"arxiv_id":"1810.02419","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.02419","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards High Resolution Video Generation with Progressive Growing of Sliced Wasserstein GANs","venue":"cs.CV","work_id":"1780d6a2-0740-4549-a5c9-cccac0c4a21f","year":2018},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/1810.02419","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:a20346c11e4bd4bf1a9cd5deee4f2e2a3ea4643261f21b960f31e42feceb99cc","observation_id":"5ce3c670-021c-421e-9969-f1da665ddca4","resolution":{"observed_at":"2026-05-13T20:06:44.672072Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural Networks , volume=","venue":null,"work_id":"7b5d281d-95a1-4d88-ad8d-0f4d4132f9aa","year":2020},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:61fc4afff419b7cd1a40dea19b2b39ffb47a637151c63de7beedecdccd206bf4","observation_id":"360805d3-001c-4b92-b92a-c0666815fde0","resolution":{"observed_at":"2026-05-14T02:23:39.640743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e43b6428-ca6a-4eaa-af90-68170f6e9379","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:beff7a81aa61de1c11159a8ad27041bbfe1522295296e4bcd0e4e94ffa9e9433","observation_id":"adbfb8d9-cc2d-4079-a90c-fe407772489d","resolution":{"observed_at":"2026-05-13T20:08:13.664583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b7ab6cad-0d34-44ff-ad9a-0780dc883440","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:22405b361f0510915118f58dd405ea9a5cfcf85f0ca9fb8f0a20218a1211c4b6","observation_id":"540cabe7-8921-4dfa-b7b3-c23895f2d3a9","resolution":{"observed_at":"2026-05-13T20:08:13.789629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7761d8b6-ab4d-436a-af35-b06e18a2cba8","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:63c068fb5ab6902e86a7f40f8de27690f52b99b9ace399b45b4ffb4aa2dd8020","observation_id":"51e84f06-e777-4160-9cb3-3227db99bce8","resolution":{"observed_at":"2026-05-13T20:08:13.615524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image as a Foreign Language","venue":null,"work_id":"f75f40ac-a95f-441a-a97c-f3765fae6dac","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:23c19fce808c1d73edb792d76f8bf54454fe058ada7f458f2f07651b887f5d2b","observation_id":"28dfeb95-a301-4119-9d5b-0330b63dd06f","resolution":{"observed_at":"2026-05-13T20:08:13.649381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5a9de980-7215-4edf-8080-5ffa5033aa2a","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:db5aecfb61641a6e13671a1d628428b6d00f956d9f2bcbce27afa011e54b16fc","observation_id":"0cfa03d1-471c-4801-9df3-e31889c6964d","resolution":{"observed_at":"2026-05-13T20:08:13.597250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author=","venue":null,"work_id":"0f96b704-e686-464f-8a44-c1b0156271ef","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:ba80e01c300e061aafae8eb65b4ee327dc2cfe506e8581d401081fa3c4e6297d","observation_id":"4d7c6c92-b0d4-4f42-b9bb-c5851395a31e","resolution":{"observed_at":"2026-05-13T20:08:13.593448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A short note about","venue":null,"work_id":"87debf73-3a34-4c03-8e36-624d5453a0b7","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:15b8aedf7ba2255ea9b13ba341041fec3ffcc0a6db8934af610f3b39b7f2c16e","observation_id":"b56e9092-9f65-4fd7-b848-1a84c3704f26","resolution":{"observed_at":"2026-05-13T20:08:13.595432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8de76531-278e-498d-981d-62be26f7ae89","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:d789b0afdf83af398ea9fd99e26bdbf1e84e7279fca5d0d1cf5d7fcdf03ecc7c","observation_id":"0af78fd3-a098-4f32-ba20-93ed967d42fb","resolution":{"observed_at":"2026-05-13T20:08:13.605216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":"1812.01717","doi":"10.48550/arxiv.1812.01717","metadata_source":"pith","pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","venue":"cs.CV","work_id":"72f42543-17d5-49aa-ba5a-25d67ffbb88a","year":2018},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:8c89a8d9435bb638e5f75136ec7c953be29b789e070f7308fee73b636c888e89","observation_id":"549e54d8-a871-4012-b56f-466558975023","resolution":{"observed_at":"2026-05-13T20:06:44.619893Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo vadis, action recognition? a new model and the","venue":null,"work_id":"df9fd519-679a-4679-a011-c3549843159e","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:e362f4dc9c69260a73470bb7161ac1a953d3b0348dbb19029167db738421f8e3","observation_id":"dd86efd3-3b09-4f04-a9cb-3b0cab702a39","resolution":{"observed_at":"2026-05-13T20:08:13.603321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning spatiotemporal features with 3","venue":null,"work_id":"0d71ef06-8ae0-45db-9527-8caea90e7890","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:ba107757e73357e820356021446761c707d58f5d347da742c61fd2d1a1ca8faf","observation_id":"5c4f39d2-8cc8-4217-92ce-bdbf63ecc526","resolution":{"observed_at":"2026-05-13T20:08:13.647325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7c6015c8-8782-464f-98e1-1ecfebc2dbea","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:4e5982f505fadb954efcd5179661270898d57f70c94d30a11306cbc595deeb25","observation_id":"f26a62e3-2eec-4825-9313-6fdf5d9eb374","resolution":{"observed_at":"2026-05-13T20:08:13.659725Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:09.912507Z","title":null,"venue":null,"work_id":"c9763656-e7e2-4997-bbf0-b66b1bf27374","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:7dce02038bd613d3c08705cdaa47c9218d833a0b1924fac1b0fcf64230c39df6","observation_id":"6d7e2ccd-d58b-4187-aab6-79934656e29e","resolution":{"observed_at":"2026-05-13T20:08:13.676829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10789","last_updated":"2022-06-22T01:11:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-06-22T01:11:29Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2206.10789","doi":"10.48550/arxiv.2206.10789","metadata_source":"pith","pith_arxiv_id":"2206.10789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","venue":"cs.CV","work_id":"0a105815-ff2e-43ce-8566-966cdcae1af4","year":2022},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2206.10789","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:e020a9a183fb7431c99c3b3e3aebd925b34786517b1c98a6359d715e1b8ab1f6","observation_id":"55ba762c-7bae-4b10-bcc2-99ac10481875","resolution":{"observed_at":"2026-05-13T20:06:44.602357Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"51bf59cb-612b-4a0f-b3d2-83ef8fe06639","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:6ff5d2613f3cd2e0f41ec49804be3b5d35daa77ae9e2efde3fc428592a663682","observation_id":"af97548c-a3da-4d33-8a76-6f01edfa55eb","resolution":{"observed_at":"2026-05-13T20:08:13.720345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b1990c86-13e4-45f7-a032-e16a54f11c97","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:49db85a62af38b3b5818c71b5f61fc20cec3f815543dea4358f3c46be02fc436","observation_id":"ebab0b46-9af3-4ddc-8e4b-ab8f78f45f73","resolution":{"observed_at":"2026-05-13T20:08:13.759038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11250","last_updated":"2021-06-21T16:48:19Z","snapshot_observed_at":"2026-08-01T16:15:25.004756Z","submitted_at":"2021-06-21T16:48:19Z","title":"VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning","version":1},"cited_work":{"arxiv_id":"2106.11250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11250","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2106.11250 , year=","venue":null,"work_id":"027ef24d-32dc-4811-acb5-fbe62daaf143","year":2022},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2106.11250","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:3a33f60aad0571832c8d6dede72ac0dec84c1cdb0a103cfc312ca30c4b88ae63","observation_id":"f829d4aa-d66d-47f4-a23b-9b54d7ec30bc","resolution":{"observed_at":"2026-05-13T20:06:44.647062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:44:26.615545Z","title":null,"venue":null,"work_id":"cf06c1cf-82f8-4dc0-b7d1-622ac484737a","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:2c4e8051f135f3ea8c555c9f9281f7faf0e8d66e370a366a7aa752b913a64710","observation_id":"8f1974c8-f3f8-444e-b3be-f278697a64ec","resolution":{"observed_at":"2026-05-13T20:08:13.754385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vector-quantized image modeling with improved","venue":null,"work_id":"0a794e6c-cebf-4534-a8cf-53523a510efe","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:d197d616d9aa4faaf488e37b1d59b89499c93adb50e927a80f7034b4f061910a","observation_id":"830c8e2c-af25-4b60-b2a8-be90067e1c72","resolution":{"observed_at":"2026-05-13T20:08:13.784897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"81659315-3022-459a-af1b-ab7d1bed572d","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:bcc544169dfff3f7ccbe73faa5e4f518a09cf649e2076ee840995df2239e3a1e","observation_id":"6bcd2896-1e50-453f-a84d-64889a2b9190","resolution":{"observed_at":"2026-05-13T20:08:13.746723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2004 , publisher=","venue":null,"work_id":"14ee6905-24db-4073-b4f7-dda5ace3af29","year":2004},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:7ff545d16d72360853986a5c078520a4c42ce02b39cb8143aa27457989826922","observation_id":"5b285656-be66-4d39-b807-31c6b992848a","resolution":{"observed_at":"2026-05-13T20:08:13.713487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T00:10:26.386630Z","title":null,"venue":null,"work_id":"7fad1b6c-343b-4d31-8a43-63fc8b8d8670","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:2220f033593d2317b4a8ce45f6a1a19ba3a8771f0a39022bc96459f12b2efcd7","observation_id":"3bdf8527-8951-4b98-af43-50290974b30d","resolution":{"observed_at":"2026-05-13T20:08:13.727527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07696","last_updated":"2022-11-14T08:38:19Z","snapshot_observed_at":"2026-07-06T13:21:17.244944Z","submitted_at":"2022-06-15T17:44:47Z","title":"Diffusion Models for Video Prediction and Infilling","version":3},"cited_work":{"arxiv_id":"2206.07696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.07696","snapshot_observed_at":"2026-06-29T00:12:50.376801Z","title":"Diffusion models for video prediction and infilling","venue":null,"work_id":"e82514ed-6901-4481-917b-76201040c256","year":2022},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2206.07696","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:cf19cd7e5dfe8a0cfe336035bf804369fe0c29e7427921e5f1ea1cdc201be52c","observation_id":"0147ad35-08fb-4488-8b58-51a060b82629","resolution":{"observed_at":"2026-05-13T20:06:44.605737Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large Scale","venue":null,"work_id":"25f4616c-1430-420c-8603-d0e029b56c8a","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:1309976ca4c73f9a97d7f1d92c168c3615966e065d3981adcdd4e22c46a47624","observation_id":"1399ec90-b92c-49f2-b18a-a46103967558","resolution":{"observed_at":"2026-05-13T20:08:13.683351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad544c7e-9c7f-4dca-ba8a-64e767a2137f","year":2009},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:181cc1897e37da6a80ec25a2ed922ba4d0ddb9ea97d5c3f59988a31c0756bd53","observation_id":"3221e029-9328-409f-85af-9bfad0d2d9e6","resolution":{"observed_at":"2026-05-13T20:08:13.662330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved Masked Image Generation with","venue":null,"work_id":"12ab2070-10dd-447c-9db9-e23c295075c3","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:e61c8fedfcaa6c3dcc01cd86eead4ca7510384de81b7600561b7f514dc36bd48","observation_id":"8d8dc07a-2b83-441b-af5e-60c9bb8c6a33","resolution":{"observed_at":"2026-05-13T20:08:13.672527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7cc5f3dd-fa30-4bf4-9c57-9b3b40a3e56e","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:589f5cec331cab766da1ef92d5c908e67bd41248d236ca3c7f05464137e69c66","observation_id":"642e89e2-de80-4732-bf1a-537c9ca823c9","resolution":{"observed_at":"2026-05-13T20:08:13.678840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"943037bf-90e4-4a7c-b444-de8b5761360f","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:d60b7b2fa12356969402ee94f6bc1a85622e54f04a4f9692b7db664e7a3563ec","observation_id":"a30ce423-1cae-49ed-8e3a-6e729dad1fb5","resolution":{"observed_at":"2026-05-13T20:08:13.681202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"298eaf6f-d9c7-4b5c-b814-9798e1fde716","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:bcc1a0d983221b3957988f3626237ffca3f2040dc421b8de10a6b80308232d40","observation_id":"beece267-aeeb-4f7d-9df3-dea665378fa3","resolution":{"observed_at":"2026-05-13T20:08:13.716934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"afa0efc7-d630-4d2e-a0f8-46243bcb2740","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:921d3859c1a84b772654004833b641b0b055c431d3c2979aa05b394a68785e97","observation_id":"02a638fb-162c-440b-a9e8-81f9a0af6a01","resolution":{"observed_at":"2026-05-13T20:08:13.781660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ff81de8-c61e-4588-b4d9-87895c41f53c","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:bc8811484732ea71069101afb3c6740d234626bc50c59e18497f8c43d97cc215","observation_id":"4f0bc0a3-07e9-4707-9069-37c8a0f1b06b","resolution":{"observed_at":"2026-05-13T20:08:13.617470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"682e3e1f-cc23-4b8d-8d05-77bd26e64083","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:7535f74a9f082fa29dcea85d912c3fe30cd07828ca2e4ca90442ef86684afc4f","observation_id":"8e72e09d-826e-4c6d-8f4e-d07e3aa96a47","resolution":{"observed_at":"2026-05-13T20:08:13.623615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0d504d3-4bf6-4e68-b14a-e937257df223","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:bd639672954dc36cc063862c78d5c49dc5ae5541519dd8c700b2db634639dbfc","observation_id":"7410faa7-1428-45bf-b946-939e8e33034e","resolution":{"observed_at":"2026-05-13T20:08:13.633490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"804a1e9f-653a-4561-8308-05e7a8554df0","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:0d58dc11397050169ea29fe42e71426a6f08d2c4d23dbda1fcc00a784625f8be","observation_id":"a4b67684-62dd-4fcf-9664-841cf7a40eaf","resolution":{"observed_at":"2026-05-13T20:08:13.625383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T00:10:26.400857Z","title":null,"venue":null,"work_id":"06edcb60-aa2c-4714-b250-399201c0b45b","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:14f213665a3528390ac1144cad460927e0855e84df48ee756d5445b7391fec38","observation_id":"2a5b21a2-6dd5-41fb-99ee-32d8f3611af5","resolution":{"observed_at":"2026-05-13T20:08:13.589570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T05:06:48.504303Z","title":null,"venue":null,"work_id":"f722cabc-fda6-4889-82c5-313113edc5fb","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:c14ce6b32e46dc0918fdda989d1e2393613b1fe5c4f402319cbc71bb47aa7244","observation_id":"9d1239c0-420c-4668-a6d4-f55a4ef1d2eb","resolution":{"observed_at":"2026-05-13T20:08:13.599241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"62a001cb-9525-4a52-ae1a-4313ee31c22a","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:5282494d39b8278f1772d9b9d4af0c62d0e7949be4b1185f8dedc10b6b920fe3","observation_id":"c332e76e-de41-4af9-b39e-7435fa4e75e9","resolution":{"observed_at":"2026-05-13T20:08:13.627227Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distill , year =","venue":null,"work_id":"d4f33d41-1012-4d58-87e2-b0d846dd54dd","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:33eb440ad74ea85031f0e33660098546a530ecec535b7fe63cf147d13e1e4fcb","observation_id":"3c96234c-ddd9-476f-af1e-48202613838f","resolution":{"observed_at":"2026-05-13T20:08:13.737618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:40.819440Z","title":null,"venue":null,"work_id":"3f583ff4-cbf8-4f42-a94d-eaeed80940b9","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:fdf6aafe7cc57401dd4514ac0359d52403f0c8bd680c91d27a40e91ca7032d6e","observation_id":"6928b5d3-696b-4290-b352-340ddcf69430","resolution":{"observed_at":"2026-05-13T20:08:13.703839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ten lessons from three generations shaped Google’s","venue":null,"work_id":"a5ebab8d-4d48-4d9a-b8cb-1695f60ff4af","year":2021},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:23831b963896e8c52735ca366072f032d7719885d5c24257dad73c30262c0b46","observation_id":"8d1d9120-f4ed-421d-82ac-27c43095cee3","resolution":{"observed_at":"2026-05-13T20:08:13.724298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:10.038710Z","title":null,"venue":null,"work_id":"b4894d61-39c6-485e-961a-1ff90a35f8b6","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:3474ea316046cbe888f8b3dc30c3dc5d9575b546f439506644b17e968ec40fed","observation_id":"22cc81ab-cdc2-4b48-8694-c393d50d2ecc","resolution":{"observed_at":"2026-05-13T20:06:44.740046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e2a6b00a-441f-466c-af55-19e995a37b36","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:71baf2cbb41a87e53f20cbfd79ab82866865fd426d295f26bc5a6b0271c66cb4","observation_id":"c07b3c99-e177-475e-b952-ff8f20cf261d","resolution":{"observed_at":"2026-05-13T20:06:44.742600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f5adc6e0-1d1a-4a5c-aa68-591320571087","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:c1ed36272183fd9ddbef632b9b0387f58e42e72a84cc11cfde4361286d1a2257","observation_id":"8d28620f-6d99-42c2-8ed6-bd8b69ab02e2","resolution":{"observed_at":"2026-05-13T20:06:44.744813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:03:49.094740Z","title":null,"venue":null,"work_id":"c5657aec-5420-4c20-b90b-39ca928743d9","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:25f782c4f44443a78bdd45e639ade5f5643a08a87d7a164a6c005e1148f7a04a","observation_id":"13bb4a70-5241-49aa-8840-6694e36bfa73","resolution":{"observed_at":"2026-05-13T20:06:44.747020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:6597a5120c7108ca1a2eaa53b54fb49a5c17ed710bf60a70adadd2850adb78e2","observation_id":"164eb0b2-8fc1-46e1-9504-cf95cc2410ac","resolution":{"observed_at":"2026-05-13T20:06:44.668646Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"defa13ab-5d62-4f6c-9bb6-f58b2844918b","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:7c17bd1f8cbe13031940dc87a06264697b8b899ad8c3cb1c3af3ee1004480a44","observation_id":"d7278b64-b0fc-4e51-978c-ea4eba6e5628","resolution":{"observed_at":"2026-05-13T20:06:44.749051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"013b7390-3d89-468b-83cf-629346d50ba9","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:9c8bdce1f1a817c4f7b2e5cf1829333082fb7fbf11f73e84851f67deba8fed5f","observation_id":"903a5d19-dce7-4342-bc54-48e17815eabd","resolution":{"observed_at":"2026-05-13T20:06:44.751337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T00:10:26.408894Z","title":null,"venue":null,"work_id":"2071a772-f462-40a4-8c17-0b5b261d6acf","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:a3f3c131f61e98ca8de2bca455cf5533128cf691741252232b44caefdeb9636b","observation_id":"8d9c2254-d51a-445a-8868-6dd4d2faf4f9","resolution":{"observed_at":"2026-05-13T20:06:44.753394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c90d8012-dd9e-46f0-9884-e22a377333e2","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:2ca19ac8f606836cc1c382672ca14660cf2a2487bf23542007746d17ea31e2f1","observation_id":"40433807-76b3-4146-9ce5-44520110c018","resolution":{"observed_at":"2026-05-13T20:06:44.755461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"831374e2-b3fd-4295-95ad-d62a61d96b02","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:ad72868f1148747d5f727241a75fc779a50eeafa924f234c26ae9692d3816e95","observation_id":"d85fef5b-6c70-446f-b26f-e37fa790235e","resolution":{"observed_at":"2026-05-13T20:06:44.757723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixel Recurrent Neural Networks , booktitle = ICML, year =","venue":null,"work_id":"a45597b9-fa7c-4341-b115-da0d73562de9","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:6b1559225d327465dfaa40a5f8e5b3293a61c1934be9c2a2082a949e9377e9f0","observation_id":"934b4a3a-3e3e-428c-b59d-f2890f2e45f4","resolution":{"observed_at":"2026-05-13T20:06:44.759889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dad8d2b8-26ce-4127-9685-388ca861edf7","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:a83fb7279c0ff7b0599b3f104100ace605c71331ba0676af888b4b8fff0c362e","observation_id":"5605f809-485a-4857-a051-298965aca8ea","resolution":{"observed_at":"2026-05-13T20:06:44.762144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:09.924609Z","title":null,"venue":null,"work_id":"16b640f9-5d77-4f69-8336-5aadf5bab8fe","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:608dc8c9d239f772479e6069c39967c1f48e86a9756934277edbf30fe8c2d637","observation_id":"195c0f03-1ee1-4eb9-8824-ea6a7036c4c9","resolution":{"observed_at":"2026-05-13T20:06:44.764302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kingma and Tim Salimans and Ben Poole and Jonathan Ho , title =","venue":null,"work_id":"4fba95c8-13b6-4611-98c8-f2d83a8e17d0","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:f92cf8b84dca700ac1190b0772a4eb74e10c8abf7cd02d86fbc746f4e82204e2","observation_id":"191d29ba-931e-4fdc-a983-18b5fb3cafab","resolution":{"observed_at":"2026-05-13T20:06:44.766232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:a776668e47acf924dd1d6fea8c3933f8993b92dbf686e1ca573b2a5775b1ede4","observation_id":"c6a3b219-d040-4b9d-a721-554d931cb228","resolution":{"observed_at":"2026-05-13T20:06:44.658654Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09883","last_updated":"2019-10-28T02:15:47Z","snapshot_observed_at":"2026-07-06T07:55:05.948249Z","submitted_at":"2019-05-23T19:30:16Z","title":"Neural Stochastic Differential Equations: Deep Latent Gaussian Models in the Diffusion Limit","version":2},"cited_work":{"arxiv_id":"1905.09883","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.09883","snapshot_observed_at":"2026-07-03T09:47:59.658444Z","title":"Neural Stochastic Differ- ential Equations: Deep Latent Gaussian Models in the Diffu- sion Limit","venue":null,"work_id":"ed8d79fb-2dde-4889-8996-cfef2f9d5642","year":2019},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/1905.09883","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:22d816281054534220174beef5f7381aa4cce178064258d7c6b649c0af123d84","observation_id":"208f4c38-333e-41bf-afa1-727a8dea55a0","resolution":{"observed_at":"2026-05-13T20:06:44.662299Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising Diffusion Probabilistic Models , booktitle = NIPS, year =","venue":null,"work_id":"7ef79026-b38b-42c4-bf9c-0447ef7674dd","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:2c185c8aac4ca656e0b8a624652c80ce6b2984fb13ac20c30fb969dcadcd3e7f","observation_id":"afcd270b-9be8-4327-98c4-902ba7e7a80d","resolution":{"observed_at":"2026-05-13T20:06:44.768463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:09.975453Z","title":null,"venue":null,"work_id":"a78a341c-406b-438d-8d99-2b9e45ebc410","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:8883e8148481ea79a2bcdad8fc207f6c83a463b8696ce9ddac64cdf90f74cb29","observation_id":"70d330dc-9dd8-4b44-8d78-c6bd29f1aa36","resolution":{"observed_at":"2026-05-13T20:06:44.770452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:2d4b2bb4687cae59998fda8277d8dc04ed02478735aff721365c8eade20e0ddd","observation_id":"ca7c8ea1-2f4e-4603-b5bc-6db0eceeec75","resolution":{"observed_at":"2026-05-13T20:06:44.692639Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-04T09:09:48.463217Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":"2210.02399","doi":"10.48550/arxiv.2210.02399","metadata_source":"pith","pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","venue":"cs.CV","work_id":"a325cd53-6549-4726-b3e9-94509f0df168","year":2022},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:f5c87c2b60a036bf234d2a5f991d6a9e0fb57043389d93de0fe8b564227b53db","observation_id":"32f4bd0d-7a33-4a07-8b75-adfacb5357d0","resolution":{"observed_at":"2026-05-17T01:43:34.268786Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03429","last_updated":"2022-06-09T06:24:12Z","snapshot_observed_at":"2026-08-04T00:54:14.266317Z","submitted_at":"2022-06-07T16:29:51Z","title":"Generating Long Videos of Dynamic Scenes","version":2},"cited_work":{"arxiv_id":"2206.03429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03429","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Karras, Tero , year =","venue":null,"work_id":"443f47a8-d87d-4758-80b8-84e5a8c0f8b4","year":2022},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2206.03429","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:fc215dbb93a5b584d158bce046784ccac10b07756e754c658f20e65ba20fa2e2","observation_id":"9078a094-0bff-40e8-90ff-29a36dd503ad","resolution":{"observed_at":"2026-05-13T20:06:44.718280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7abae7b4-91fe-4342-af3f-f2d9f42dbe38","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:85ee181279c0b99f48169d8d76a51c201acf93ab9269fd6a003cbd41320f7957","observation_id":"93422a9c-c635-4b1b-8403-37651c6ec5de","resolution":{"observed_at":"2026-05-13T20:06:44.772344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cbc83ee9-ba35-4880-ac9f-a1464bc6894e","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:9d2bb8817a12b97422a53cbaaed1db67f7761f7e18711d241e7c21bedcd06db2","observation_id":"8b61aac9-a439-40fd-87f5-de5110afafa8","resolution":{"observed_at":"2026-05-13T20:06:44.774224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"07207a30-b448-45f7-ae77-40673854b780","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:7700c19a8d533cff81e6ae6ce013799b4d49d676e96fd8d64dcfa3681541584c","observation_id":"7e285878-c227-463f-bc4d-dcee0577926e","resolution":{"observed_at":"2026-05-13T20:06:44.776661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0d91eb85-c1e8-4b2d-8cb4-fcfa521d83ab","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:bbfe743070ca44a3b0e14bf11f4f56ee6f3acb283a86d95ddf0c7b546c812c1e","observation_id":"16cb701e-f3df-4202-9383-c2ba931ae565","resolution":{"observed_at":"2026-05-13T20:06:44.778744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"50fe9477-c97d-4460-a6f6-6b382f9f70aa","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:d54f1245bd5412b9a96f48f40182d49bf7e8e4faef8806f9836165da7598cf39","observation_id":"8b9fa479-0104-4228-aaa3-44fc7e9a6850","resolution":{"observed_at":"2026-05-13T20:06:44.780557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:c16b14d46a21dced275580aa5eaa72226401ce069ec24b1b4a044c2b117dc9e4","observation_id":"f6e37385-1f34-4ad7-8714-806f902e4d9d","resolution":{"observed_at":"2026-05-13T20:06:44.609181Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T02:03:09.928054Z","title":null,"venue":null,"work_id":"099845dd-6d9a-4e0c-a9f2-0f6843660d5f","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:06786ca76b9a7241f6d7a186c9cdbcb267bf606358464892fbc865536d927653","observation_id":"daed45de-beb6-430d-b81a-dbda4e5610cf","resolution":{"observed_at":"2026-05-13T20:06:44.782513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2016 , ignorganization=","venue":null,"work_id":"c8f1b949-d9b3-4645-8fa3-89d3f8ac71e5","year":2016},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:cf55b57d539ff74578c5d0a0f15f69faf221fbcdd813020fc26a11c77304f09d","observation_id":"2d65e868-947e-47d5-b6b2-e821dd911a26","resolution":{"observed_at":"2026-05-13T20:06:44.784966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-07-06T05:12:28.446812Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":"1609.08675","doi":"10.48550/arxiv.1609.08675","metadata_source":"pith","pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","venue":"cs.CV","work_id":"6b543bd8-75e8-4c53-9718-b4545e4bc424","year":2016},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:f38a34948c4a7f887b7ccea9c58aaf6110ceb8a80bc13e89103d3b276f139e08","observation_id":"1b40324a-7307-484c-98ff-f470b9b48f34","resolution":{"observed_at":"2026-05-13T20:06:44.631852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00990","last_updated":"2022-10-03T14:56:05Z","snapshot_observed_at":"2026-07-06T13:59:04.148900Z","submitted_at":"2022-10-03T14:56:05Z","title":"Visual Prompt Tuning for Generative Transfer Learning","version":1},"cited_work":{"arxiv_id":"2210.00990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.00990","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2210.00990 , year=","venue":null,"work_id":"1092d47f-9a2c-429f-86f1-404bd4b713ad","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2210.00990","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:df98365f33825d506559ca5444ff5d629ce2cc7fd44407d9f8081f36c56e435c","observation_id":"c2aa6aa5-0c4f-4451-a527-072689507745","resolution":{"observed_at":"2026-05-13T20:06:44.635330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f53223e9-6f6f-4ddf-a2d1-6593035ca04c","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:b2c30759b418de6fa72ce009fe1cbd7c5ed69a54ab5cde3813d30e1ae5c2df17","observation_id":"fc2492fe-9c88-404a-a361-afbb789153fc","resolution":{"observed_at":"2026-05-13T20:06:44.787127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00902","last_updated":"2023-02-03T05:06:46Z","snapshot_observed_at":"2026-08-01T14:41:00.411260Z","submitted_at":"2023-02-02T06:38:44Z","title":"Language Quantized AutoEncoders: Towards Unsupervised Text-Image Alignment","version":2},"cited_work":{"arxiv_id":"2302.00902","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.00902","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2302.00902 , year=","venue":null,"work_id":"e3fba0d9-e31e-44d7-b710-2414f017b541","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2302.00902","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:bb06336bdb9d4a2f7e334ada22db33d1098061e730c3a5152a92a1a90c2c5ae5","observation_id":"4fa017c6-bfc8-4ada-b616-45d6bbd50ccf","resolution":{"observed_at":"2026-05-13T20:06:44.655014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2d86dc6b-2695-4385-98e9-4eef3173c341","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:c908f8d4b95370367db112d09e3f0cd93fd7f78a8fb7c3895320c1f57099832b","observation_id":"b0199353-3fb8-4dee-8bb0-bf1ac5200243","resolution":{"observed_at":"2026-05-13T20:06:44.789169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9b872ef7-2b19-402e-8c47-760005447db0","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:e48f3b21ab6ee9419b6f33dbbab545561936af8fc6630fff9b1313e732d92c3f","observation_id":"1806216b-60e4-4f66-8ae9-00cad181b858","resolution":{"observed_at":"2026-05-13T20:06:44.791217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0d169fb0-24e6-4073-82ec-e33cdbb1dc4c","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:859215232216ab922d5988bd069a437f7eec8b8ff8624f81d6179d86561fec77","observation_id":"625d236b-1196-4ee4-b9ba-a13bf3430083","resolution":{"observed_at":"2026-05-13T20:06:44.793398Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:40.786084Z","title":null,"venue":null,"work_id":"e8225588-e4bb-4dca-aa01-9c20d2d6f649","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:2b74d03dac7220c8823b9818635c1ea03314755ca1f0c4a271fdf90145c0938c","observation_id":"d2cf5f89-2b2f-483d-a146-e3d3aff27b29","resolution":{"observed_at":"2026-05-13T20:06:44.795228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"67047a43-0a52-4a00-8c96-859953923446","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:5c1d461433b7c3e38afac08b6a3c647069fbd87ebe1110699dd9794726362f0e","observation_id":"9cc7d358-7aa4-4fbb-804d-10f1f9c1728a","resolution":{"observed_at":"2026-05-13T20:06:44.797106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"706f542d-4f36-41ca-ac96-68990921e833","year":null},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:44b823c9f46ce3791d94611d458b86a2fc2d288f9d15ade6926d8dc00b8da7c7","observation_id":"2061d523-f4af-4e49-a001-ce905f7ebd7c","resolution":{"observed_at":"2026-05-13T20:06:44.799011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":14,"parse_uncertain":0,"unresolved":62,"verified_exact":5,"verified_fuzzy":19},"total_outbound_references":291},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 291 outbound references and 89 inbound Pith citation observations for arXiv:2310.05737."}