{"as_of":"2026-08-07T06:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:73923cdc578914d60dba7c999e1861fe62bb2ea791728a39dc73a338e93353e8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:02:59.700606Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T22:09:16.622717Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2406.06525"},"observation_digest":"sha256:c71fbe866e3a933f3544e2fe5d3f80c84afa566e4c443eac10dc1930b2c0b078","observation_id":"d91e267a-b3a2-4d8c-8cf8-9ca90a95bf04","resolution":{"observed_at":"2026-05-11T22:09:17.082429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:7fe55f59fd0aa041183d2a727a1032c011f76acee8c290ca75509e86a0147ef1","observation_id":"aa59adfe-778c-44d2-9b3f-206b7dbd019e","resolution":{"observed_at":"2026-05-15T22:09:16.295516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:d5f7421a6d46b31ab90f217b7c49a9c1fa565a9efc9cd80cf6726c72873fa7e5","observation_id":"1c6270e0-1e58-47e8-9950-89e91be7415e","resolution":{"observed_at":"2026-05-17T15:07:39.912883Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-07-06T20:49:51.505079Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:097c098aa579cec266d61b45692df4886ea80398c349549ff7cbb8d96770e47f","observation_id":"e1c44baf-a60b-4c92-a621-f698ecaee904","resolution":{"observed_at":"2026-05-15T16:24:27.751864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T06:02:59.700606Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06276","last_updated":"2025-06-06T17:58:39Z","snapshot_observed_at":"2026-08-07T05:54:45.631508Z","submitted_at":"2025-06-06T17:58:39Z","title":"STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:59.700606Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.06276"},"observation_digest":"sha256:b16320dd721eb6945e7a8acba95e733f90481b0fc1b4e168c4e7c156db977266","observation_id":"944abb33-b42e-401b-a854-8334322d4ede","resolution":{"observed_at":"2026-08-07T06:02:59.700606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T05:26:02.325132Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07999","last_updated":"2025-06-09T17:59:01Z","snapshot_observed_at":"2026-08-07T05:18:11.719150Z","submitted_at":"2025-06-09T17:59:01Z","title":"MADFormer: Mixed Autoregressive and Diffusion Transformers for Continuous Image Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:26:02.325132Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.07999"},"observation_digest":"sha256:d43a81d8079f779318a861fa39359c5244dbe743e8b930ede7fa0b4f3eedbf56","observation_id":"5a82c5ce-1d22-45c3-b8f0-cae910510371","resolution":{"observed_at":"2026-08-07T05:26:02.325132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T23:28:07.776955Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18095","last_updated":"2025-06-22T16:51:09Z","snapshot_observed_at":"2026-08-06T23:20:59.622434Z","submitted_at":"2025-06-22T16:51:09Z","title":"ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T23:28:07.776955Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.18095"},"observation_digest":"sha256:45c5dfce402a7b060d59557b89caa8b2f9e81730102510823d3f03b9c23f65d3","observation_id":"6c6b19f1-d144-4ac2-baae-41fc252e9ec4","resolution":{"observed_at":"2026-08-06T23:28:07.776955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T22:43:04.234499Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21022","last_updated":"2025-06-26T05:48:36Z","snapshot_observed_at":"2026-08-06T22:33:11.920710Z","submitted_at":"2025-06-26T05:48:36Z","title":"Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:43:04.234499Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.21022"},"observation_digest":"sha256:78634b616fae2045576cf0f58aac73edcc4327b545871f9f793c946cb79c5ff5","observation_id":"7e1f0a75-9876-4c36-8caa-c1527bff8700","resolution":{"observed_at":"2026-08-06T22:43:04.234499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T21:49:44.581169Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23347","last_updated":"2025-07-07T16:20:58Z","snapshot_observed_at":"2026-08-06T21:42:42.610984Z","submitted_at":"2025-06-29T17:43:04Z","title":"CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.581169Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.23347"},"observation_digest":"sha256:0657680f88b473171c07e8d7e2c5eca093f35ea760a15b61eaf283c6b6054fd9","observation_id":"9dc51c88-7357-4f98-a4a9-1de3b1eb3ffd","resolution":{"observed_at":"2026-08-06T21:49:44.581169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T21:46:29.478571Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23589","last_updated":"2025-06-30T07:51:58Z","snapshot_observed_at":"2026-08-06T21:34:46.635732Z","submitted_at":"2025-06-30T07:51:58Z","title":"Transition Matching: Scalable and Flexible Generative Modeling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T21:46:29.478571Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.23589"},"observation_digest":"sha256:c6e8ba83b79745bad33e01f54ae3fd0d8f9821795968d8d80d68904dc0f2e181","observation_id":"e6940ed3-9957-47f0-88c4-acdfa6af7c69","resolution":{"observed_at":"2026-08-06T21:46:29.478571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T21:19:45.091175Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-06T21:11:02.923227Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.091175Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:2993260f2094eddaec4c6881ec275c5ea8c9eaec9f32fad811e11bdb719f114e","observation_id":"72462e34-fbb2-48d0-9d92-2f6d9989153a","resolution":{"observed_at":"2026-08-06T21:19:45.091175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:53:50.735276Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction.arXiv preprint arXiv:2404.02905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01652","last_updated":"2025-07-02T12:27:06Z","snapshot_observed_at":"2026-08-06T20:43:58.970747Z","submitted_at":"2025-07-02T12:27:06Z","title":"Autoregressive Image Generation with Linear Complexity: A Spatial-Aware Decay Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:50.735276Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.01652"},"observation_digest":"sha256:95a44fc0da4ed6a2d6382440a717ad5cb73f31eeee6e6da9626ef18eaf058944","observation_id":"5cdea1a8-c53a-44ee-8b72-d77010d5c024","resolution":{"observed_at":"2026-08-06T20:53:50.735276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:38:57.032639Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02358","last_updated":"2025-07-11T09:06:39Z","snapshot_observed_at":"2026-08-06T21:34:24.738600Z","submitted_at":"2025-07-03T06:44:26Z","title":"Hita: Holistic Tokenizer for Autoregressive Image Generation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:38:57.032639Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.02358"},"observation_digest":"sha256:aa1070d987008aad6f7bfc29b2a00a5a7d22b51035cea9fd0c9b28150dd9fe16","observation_id":"0545d7ab-e8ab-4af0-aa92-0f0e0a056a55","resolution":{"observed_at":"2026-08-06T20:38:57.032639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:32:59.851177Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02664","last_updated":"2025-07-07T08:00:38Z","snapshot_observed_at":"2026-08-07T06:50:07.918084Z","submitted_at":"2025-07-03T14:26:31Z","title":"AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:32:59.851177Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.02664"},"observation_digest":"sha256:a75a0cc265bc641bbf7d99a1655cceb9bcfbd47568ec47506d596cd99d373636","observation_id":"c331c4ef-5f0d-4885-8015-dc306921171d","resolution":{"observed_at":"2026-08-06T20:32:59.851177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T20:39:13.582808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03038","last_updated":"2025-07-23T08:06:29Z","snapshot_observed_at":"2026-08-06T20:29:38.424752Z","submitted_at":"2025-07-03T05:49:18Z","title":"Cautious Next Token Prediction","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:39:13.582808Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.03038"},"observation_digest":"sha256:9d6a355a390ea14db1ada553ade2baec3fffa872905c216cb1f71f191bf93bf3","observation_id":"a7b8f6bf-c5f6-41d4-af45-62a8b04c1406","resolution":{"observed_at":"2026-08-06T20:39:13.582808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T19:52:28.093409Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04559","last_updated":"2025-07-06T22:23:27Z","snapshot_observed_at":"2026-08-06T19:42:41.010893Z","submitted_at":"2025-07-06T22:23:27Z","title":"MambaVideo for Discrete Video Tokenization with Channel-Split Quantization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:52:28.093409Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.04559"},"observation_digest":"sha256:cdd02e81926d6133f7d428dff4fa7a172596ef6a9d4750ab1bb766941cd99feb","observation_id":"6922dc7f-bc2e-4614-b45c-672fe72dca08","resolution":{"observed_at":"2026-08-06T19:52:28.093409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T17:12:34.614860Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11441","last_updated":"2025-07-28T14:28:07Z","snapshot_observed_at":"2026-08-06T17:05:24.559885Z","submitted_at":"2025-07-15T16:05:30Z","title":"Implementing Adaptations for Vision AutoRegressive Model","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:12:34.614860Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.11441"},"observation_digest":"sha256:147ba4912c74a3168b3c479deaf4a35216f31b73b9c3808e81f090547b7e50bf","observation_id":"b085723f-8da0-459c-b4b6-83be057144a1","resolution":{"observed_at":"2026-08-06T17:12:34.614860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T11:38:36.823952Z","title":"arXiv preprint arXiv:2404.02905 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22530","last_updated":"2025-07-31T03:01:47Z","snapshot_observed_at":"2026-08-06T11:38:34.040761Z","submitted_at":"2025-07-30T09:57:38Z","title":"HRVVS: A High-resolution Video Vasculature Segmentation Network via Hierarchical Autoregressive Residual Priors","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:38:36.823952Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2507.22530"},"observation_digest":"sha256:520d314189d066246534c69b5a1ce7cccab9a12378f3d4e90d8965fa13a18eca","observation_id":"7e04678f-8b4e-4b4a-af7b-5d204de7e867","resolution":{"observed_at":"2026-08-06T11:38:36.823952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T05:31:33.619804Z","title":"Visual autoregres- sive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01782","last_updated":"2026-07-24T01:22:37Z","snapshot_observed_at":"2026-08-06T05:31:28.698833Z","submitted_at":"2025-08-03T14:45:51Z","title":"Joint Lossless Compression and Steganography for Medical Images via Large Language Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:31:33.619804Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2508.01782"},"observation_digest":"sha256:d2988435450305c5a0b09fd5889a20e4c1371409acb0a6de5581fab14fc4cb29","observation_id":"e041e701-8573-4ea0-8ccf-a6072d7f67d8","resolution":{"observed_at":"2026-08-06T05:31:33.619804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-06T05:19:29.750778Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02056","last_updated":"2025-08-09T02:25:59Z","snapshot_observed_at":"2026-08-06T05:19:21.920831Z","submitted_at":"2025-08-04T04:50:05Z","title":"StarPose: 3D Human Pose Estimation via Spatial-Temporal Autoregressive Diffusion","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:19:29.750778Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2508.02056"},"observation_digest":"sha256:01786e4bf4573bd8b9fe707fbcd866279030104233c25d7e53e8f5593765fc8a","observation_id":"6adb60b0-7778-4b42-bb90-895e2d417c12","resolution":{"observed_at":"2026-08-06T05:19:29.750778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T20:25:12.063091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10615","last_updated":"2025-08-14T13:12:29Z","snapshot_observed_at":"2026-08-06T19:53:35.593518Z","submitted_at":"2025-08-14T13:12:29Z","title":"FuXi-\\beta: Towards a Lightweight and Fast Large-Scale Generative Recommendation Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:25:12.063091Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2508.10615"},"observation_digest":"sha256:c37fae8c95f9f63912ac1b91c7159920134015a2ebdb3c51c7296c054169266b","observation_id":"b364c00e-154f-4734-abc1-0f1e1dc0afa7","resolution":{"observed_at":"2026-08-05T20:25:12.063091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T12:07:36.753406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01984","last_updated":"2025-09-03T05:25:38Z","snapshot_observed_at":"2026-08-05T12:07:30.616216Z","submitted_at":"2025-09-02T06:01:52Z","title":"Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:07:36.753406Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2509.01984"},"observation_digest":"sha256:e632821157bac1caa1063d340008762d6b4bf14738e0f42307747ff645610336","observation_id":"03ea97dd-cb5b-469d-87a8-c4b36faeda82","resolution":{"observed_at":"2026-08-05T12:07:36.753406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-04T18:12:47.607231Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10140","last_updated":"2025-09-12T11:08:21Z","snapshot_observed_at":"2026-08-06T19:31:43.391901Z","submitted_at":"2025-09-12T11:08:21Z","title":"Scalable Training for Vector-Quantized Networks with 100% Codebook Utilization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T18:12:47.607231Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2509.10140"},"observation_digest":"sha256:13434714fb3f4468990911bc96ec6f13f7bb2891ad99e4a56e26b076c023939b","observation_id":"e72b48e1-f76a-42fb-86b3-dcad5db7bf7e","resolution":{"observed_at":"2026-08-04T18:12:47.607231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-04T07:22:17.259251Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27497","last_updated":"2026-07-18T14:25:55Z","snapshot_observed_at":"2026-08-06T07:07:19.926806Z","submitted_at":"2025-10-31T14:19:50Z","title":"InertialAR: Autoregressive 3D Molecule Generation with Inertial Frames","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:17.259251Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2510.27497"},"observation_digest":"sha256:b57d7e5e6fed62d2f9b24e71b003952f267e596d62dc6e21dc4c2e246a2ffed6","observation_id":"3f8d344b-98b5-4ca1-9b5b-65080d7c805d","resolution":{"observed_at":"2026-08-04T07:22:17.259251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-03T15:34:59.272712Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction.arXiv preprint arXiv:2404.02905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.16636","last_updated":"2026-07-18T11:24:13Z","snapshot_observed_at":"2026-08-04T17:54:02.928635Z","submitted_at":"2025-12-18T15:10:42Z","title":"REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T15:34:59.272712Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2512.16636"},"observation_digest":"sha256:ee27e23a2c7fbbea068ba53f1510f14f9c15a7c94c6ab2dbe4bc7fcc1a2c46bd","observation_id":"d9c1e3ad-5dd4-4956-8844-f9f8c7b7c7f7","resolution":{"observed_at":"2026-08-03T15:34:59.272712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2601.21798","last_updated":"2026-05-15T11:47:00Z","snapshot_observed_at":"2026-08-02T04:56:07.337606Z","submitted_at":"2026-01-29T14:42:46Z","title":"CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.787919Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2601.21798"},"observation_digest":"sha256:831d2ba3b3352c94381f3e839b3b8c768f82984a38dcb6d41713785101120748","observation_id":"2c51f95a-e5c3-48c6-850b-70aafb6c13f4","resolution":{"observed_at":"2026-05-21T14:50:14.905925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-03T03:25:00.856914Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction.arXiv preprint arXiv:2404.02905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.08337","last_updated":"2026-07-02T05:59:45Z","snapshot_observed_at":"2026-08-04T01:08:48.151736Z","submitted_at":"2026-02-09T07:22:14Z","title":"Language-Guided Transformer Tokenizer for Human Motion Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:25:00.856914Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2602.08337"},"observation_digest":"sha256:d19ac6faf93737b6bda56fed1ceaec17abe050da11b5c13cc66c4a722a477372","observation_id":"fa7ffe04-5f60-43c7-8e39-b2322a2433d5","resolution":{"observed_at":"2026-08-03T03:25:00.856914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-07-15T13:50:51.666642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06453","last_updated":"2026-06-01T03:19:19Z","snapshot_observed_at":"2026-07-15T13:50:49.552763Z","submitted_at":"2026-03-06T16:43:44Z","title":"Pinterest Canvas: Large-Scale Image Generation at Pinterest","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-15T13:50:51.666642Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2603.06453"},"observation_digest":"sha256:e06bd2857c206feacee6348eab10d13bd719274389c51a3c2b82fc90d0cee506","observation_id":"8599a202-8d46-4591-8938-d4fbc97564a3","resolution":{"observed_at":"2026-07-15T13:50:51.666642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:41:23.057949Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:2a20d0ca30277aaccb35e4f193ff68d55af11e9f09f55a4ae00fd693331ec607","observation_id":"deddcb0a-0fe0-49c6-8f6f-fab0a95d9d8c","resolution":{"observed_at":"2026-05-11T10:01:03.170979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-07-12T21:00:35.123495Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.13030","last_updated":"2026-07-07T13:17:16Z","snapshot_observed_at":"2026-07-12T21:00:28.771955Z","submitted_at":"2026-04-14T17:59:03Z","title":"Generative Refinement Networks for Visual Synthesis","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T21:00:35.123495Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2604.13030"},"observation_digest":"sha256:18b8d983eafa29226fd790f4a455b6487bf99d600dca38fd9253bee30f70861d","observation_id":"46f1a57f-98b3-4157-bcd9-012fd358eb4f","resolution":{"observed_at":"2026-07-12T21:00:35.123495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2604.19330","last_updated":"2026-04-29T12:12:36Z","snapshot_observed_at":"2026-08-03T01:33:20.785741Z","submitted_at":"2026-04-21T10:58:48Z","title":"Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T01:01:06.094276Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2604.19330"},"observation_digest":"sha256:fdef5da9432a5b23823dc9a7e20ac10f2141a7ea053bdf4ed4d3cca382a6e8b9","observation_id":"0469d808-47ad-4bbe-ae39-dfda3f3e0aeb","resolution":{"observed_at":"2026-05-10T01:04:50.133561Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2604.19902","last_updated":"2026-04-21T18:25:25Z","snapshot_observed_at":"2026-08-02T14:48:34.514966Z","submitted_at":"2026-04-21T18:25:25Z","title":"MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T03:27:50.144706Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2604.19902"},"observation_digest":"sha256:ac973548c7e438afed34c958743c46a9153174d71637003a7d3d0c99845e7a5d","observation_id":"af125df3-6c61-462c-946a-bf973da75c54","resolution":{"observed_at":"2026-05-10T03:29:21.706947Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.08078","last_updated":"2026-05-12T22:42:27Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:57:14Z","title":"Normalizing Trajectory Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T01:55:30.852030Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.08078"},"observation_digest":"sha256:fcceccb87680f7213e52e6333d221812ba4876c4761763bc837aeb4c5ec9cf6e","observation_id":"4dd55285-e8f5-4959-be4a-0c54419c273a","resolution":{"observed_at":"2026-05-11T04:10:55.014588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.08078","last_updated":"2026-05-12T22:42:27Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:57:14Z","title":"Normalizing Trajectory Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T21:16:53.641457Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.08078"},"observation_digest":"sha256:5881527d25b6fa38becee81b3314f2b7fd56f2058d338a38f8d559f6795e2240","observation_id":"085bce16-a77c-4529-92ba-498749d3a624","resolution":{"observed_at":"2026-05-14T21:17:58.733808Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.11380","last_updated":"2026-05-12T01:13:16Z","snapshot_observed_at":"2026-08-03T03:48:21.836941Z","submitted_at":"2026-05-12T01:13:16Z","title":"TRACE: Temporal Routing with Autoregressive Cross-channel Experts for EEG Representation Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T02:22:59.247850Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.11380"},"observation_digest":"sha256:899d8bd7d2e7b5ce61afc3a796690c76bddaad7c76718c09a18b540621e82b64","observation_id":"5b4b231a-8f83-4a8d-84d3-6bbda913b35f","resolution":{"observed_at":"2026-05-13T02:27:07.499894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.16384","last_updated":"2026-05-11T10:51:02Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-11T10:51:02Z","title":"Mutual Enhancement Between Global Tokens and Patch Tokens: From Theory to Practice","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-20T22:41:44.510546Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.16384"},"observation_digest":"sha256:ffe8e51c20353f8092bbd8d345fbe7dea16f87af23a82cc1d656b8c1ba708a99","observation_id":"74e2ea72-7abf-4b0b-9e0f-873877f3d55a","resolution":{"observed_at":"2026-05-20T22:43:51.045051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.18267","last_updated":"2026-07-24T06:29:36Z","snapshot_observed_at":"2026-08-02T13:49:17.490757Z","submitted_at":"2026-05-18T12:03:41Z","title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:54.139888Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.18267"},"observation_digest":"sha256:a7ec62a336d22da9df70133f716aa2553b836bd32056a43597dec47b8e1a2adf","observation_id":"6e2dedba-bbfb-49dd-8411-78c31672b540","resolution":{"observed_at":"2026-05-20T12:03:15.386946Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.18267","last_updated":"2026-07-24T06:29:36Z","snapshot_observed_at":"2026-08-02T13:49:17.490757Z","submitted_at":"2026-05-18T12:03:41Z","title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:39:40.667006Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.18267"},"observation_digest":"sha256:ba586dd44f8debdab7b49ca70f2b4bc7d78db8fa8ef112a69523a857c0c7121d","observation_id":"24f58dbd-1847-4812-a2d1-7477efe571c5","resolution":{"observed_at":"2026-06-30T18:55:00.880061Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-02T13:49:19.647602Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.18267","last_updated":"2026-07-24T06:29:36Z","snapshot_observed_at":"2026-08-02T13:49:17.490757Z","submitted_at":"2026-05-18T12:03:41Z","title":"SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T13:49:19.647602Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.18267"},"observation_digest":"sha256:3cf45c9a35b35bd89ee5bdab7c5ed3854313f58b696f0e6e817c18db07ebf3b0","observation_id":"c0e8b435-e4df-4f72-a77b-518e4cab39ef","resolution":{"observed_at":"2026-08-02T13:49:19.647602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.18390","last_updated":"2026-05-18T13:38:43Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T13:38:43Z","title":"Vision Foundation Models as Generalist Tokenizers for Image Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:24.738195Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.18390"},"observation_digest":"sha256:93b74801b994e49e3724f44c68dcd57f1d3d49d0a78a22ca38b5198e8a9adc06","observation_id":"6a3834f3-bfc7-4c5b-bde3-a61da64e68a9","resolution":{"observed_at":"2026-05-20T11:03:13.431357Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.27696","last_updated":"2026-05-28T13:12:21Z","snapshot_observed_at":"2026-07-06T23:37:21.716437Z","submitted_at":"2026-05-26T21:16:04Z","title":"Structure over Pixels: Learning Variable-Length Visual Programs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T18:06:01.684713Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.27696"},"observation_digest":"sha256:85636c6a6a8478b629d72f63b782eec41fd6f30730fbcd792f9a977af1336a24","observation_id":"dd5b4dfa-05d3-4d4a-b4e3-ea7130a7e7f3","resolution":{"observed_at":"2026-06-29T18:13:48.992424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2605.30341","last_updated":"2026-05-28T17:59:26Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:59:26Z","title":"GPIC: A Giant Permissive Image Corpus for Visual Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:21.262064Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2605.30341"},"observation_digest":"sha256:48269b20dd4da4721b1359ae9f608433660bfa31dfe356f7f5bdb0d1fc974461","observation_id":"5f206bdb-b56a-4463-90cf-951d1da76bde","resolution":{"observed_at":"2026-06-29T07:43:14.161443Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2606.07107","last_updated":"2026-06-05T10:01:37Z","snapshot_observed_at":"2026-08-05T08:06:49.561498Z","submitted_at":"2026-06-05T10:01:37Z","title":"Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T21:57:19.195413Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.07107"},"observation_digest":"sha256:2fceba3fa26d50405546bb32bbbc6e72cfd794cf45fcf2a73dcb422ba53ebd2a","observation_id":"7a9eac4a-74fb-4c34-8054-3bb219dba706","resolution":{"observed_at":"2026-07-02T17:37:14.616849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2606.09156","last_updated":"2026-06-08T07:47:53Z","snapshot_observed_at":"2026-08-02T15:02:48.666653Z","submitted_at":"2026-06-08T07:47:53Z","title":"OmniGen-AR: AutoRegressive Any-to-Image Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T17:05:16.883488Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.09156"},"observation_digest":"sha256:43fc7e4730fb3c4b9d000a790b0bbd70c922eb15b49744429ee53869c5872f01","observation_id":"ea1f55ad-4600-458d-be96-a18ba8af89bf","resolution":{"observed_at":"2026-07-03T00:47:29.665114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2606.27088","last_updated":"2026-07-19T08:07:12Z","snapshot_observed_at":"2026-08-02T10:07:01.744484Z","submitted_at":"2026-06-25T14:24:03Z","title":"SubdivAR: Autoregressive Next-Scale Prediction for Neural Mesh Subdivision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T05:01:44.347859Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.27088"},"observation_digest":"sha256:6405644deba224028cf118c6381773711b8f927af10004342e68ba26931aedcd","observation_id":"9c7ac308-bf41-4d0b-8395-357a56231a49","resolution":{"observed_at":"2026-07-04T13:39:51.006842Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-02T10:07:06.115453Z","title":"Visual autoregressive mod- eling: Scalable image generation via next-scale prediction.arXiv preprint arXiv:2404.02905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27088","last_updated":"2026-07-19T08:07:12Z","snapshot_observed_at":"2026-08-02T10:07:01.744484Z","submitted_at":"2026-06-25T14:24:03Z","title":"SubdivAR: Autoregressive Next-Scale Prediction for Neural Mesh Subdivision","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T10:07:06.115453Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.27088"},"observation_digest":"sha256:31907f2bcfb0c1578013b1eec828c061c265f40117095802817a7bdc12f7946b","observation_id":"1c819c78-e0aa-405f-9ed6-28be8e9a3637","resolution":{"observed_at":"2026-08-02T10:07:06.115453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":"2404.02905","doi":"10.48550/arxiv.2404.02905","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2404.02905","venue":"arXiv (Cornell University)","work_id":"62e30831-dbb7-40b8-a862-403c63f4fdbd","year":2024},"citing_paper":{"arxiv_id":"2606.31991","last_updated":"2026-06-30T17:29:04Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:29:04Z","title":"Amplifying Membership Signal Through Chained Regeneration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-01T06:22:08.140403Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2606.31991"},"observation_digest":"sha256:db7c865d1cd356cace76de0b31bb39e58c07e8dce1aa59c247df6ff314d745ee","observation_id":"ba787460-7882-4003-a7cb-b410f43850c5","resolution":{"observed_at":"2026-07-01T09:45:39.297920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2404.02905 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:ab88832d951a162901b74512d0f9846512c8f5093027306d3751b9ef4b154c00","observation_id":"98f86f12-26fd-4466-b869-57bf08f09e9b","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.02905/citation-record","integrity":"/paper/2404.02905/integrity","json":"/paper/2404.02905/citation-record.json","paper":"/paper/2404.02905"},"outbound":[],"paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 48 inbound Pith citation observations for arXiv:2404.02905."}