{"as_of":"2026-08-20T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af1ae3c9064a7d74824fd743f6769e0a0f57656840fb515155c1b67a7ceef816","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:21:04.547305Z","state":"measured"},{"denominator":122,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":122,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:48:03.500362Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.542063Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:cf133b418a28a63d54767f332ad833a844ce79b87760bbb94b4468f93ac7a2ea","observation_id":"ce6f86c3-8ae3-464c-859c-31cbe8c6bfc5","resolution":{"observed_at":"2026-05-24T01:25:54.412504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-08T15:04:29.442501Z","title":"Vargpt: Unified understanding and generation in a visual autoregressive multimodal large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06604","last_updated":"2025-05-16T03:43:21Z","snapshot_observed_at":"2026-08-16T23:48:47.443593Z","submitted_at":"2025-02-10T16:01:55Z","title":"Do we really have to filter out random noise in pre-training data for language models?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:04:29.442501Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2502.06604"},"observation_digest":"sha256:b42db0b359af8c56f8b6b862fbb43ba102edc8b764f0773695953dc36dfed63d","observation_id":"eeeb5c56-95d2-4e74-ba1a-1502d5f79c9d","resolution":{"observed_at":"2026-08-08T15:04:29.442501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-16T11:48:03.500362Z","title":"MLLM-pt” de- notes the pretraining of DDT-LLaMA, “MLLM-ft","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14666","last_updated":"2025-04-20T16:14:28Z","snapshot_observed_at":"2026-08-20T00:13:22.937348Z","submitted_at":"2025-04-20T16:14:28Z","title":"Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-16T11:48:03.500362Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2504.14666"},"observation_digest":"sha256:87c7c6dcb81f955690ab78c553fe7c7b8447a8b16aa493e663be9ef5e73abad4","observation_id":"18734500-4d57-4696-84bd-10f7449a3a0c","resolution":{"observed_at":"2026-08-16T11:48:03.500362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-15T21:01:59.260983Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13507","last_updated":"2025-05-16T12:31:17Z","snapshot_observed_at":"2026-08-20T03:38:07.521889Z","submitted_at":"2025-05-16T12:31:17Z","title":"Open Set Domain Adaptation with Vision-language models via Gradient-aware Separation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:59.260983Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2505.13507"},"observation_digest":"sha256:7d2d5a257080753950729ab9a496f4eec90822fd84c2e3618974ec9d34ad64d4","observation_id":"3678c49c-a694-4464-8743-21f60760af38","resolution":{"observed_at":"2026-08-15T21:01:59.260983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-16T07:03:45.766617Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:c96dca4fae1c1710be709eb6cada0b2d2098750c080670c4b7dfc8433fb7e434","observation_id":"e6b68b22-0eb4-4371-9e7a-5af03bd4b398","resolution":{"observed_at":"2026-05-15T14:50:59.753839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-07T12:18:35.569184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-13T04:32:44.496715Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.569184Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2505.24787"},"observation_digest":"sha256:324cbf234b4e07dbb6ed53789e0177d99bdd8b2dd8740ef0fd0a8fdee49c4802","observation_id":"20f41297-a7fb-4c90-beca-1ca735b99dca","resolution":{"observed_at":"2026-08-07T12:18:35.569184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-07T00:53:26.930717Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12609","last_updated":"2025-08-18T08:18:50Z","snapshot_observed_at":"2026-08-16T00:03:52.874784Z","submitted_at":"2025-06-14T19:10:22Z","title":"Not All Tokens and Heads Are Equally Important: Dual-Level Attention Intervention for Hallucination Mitigation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:53:26.930717Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2506.12609"},"observation_digest":"sha256:ce8c290eb9855ca9ab054f97674df115819d57d8aac6473f192db1eeec392b86","observation_id":"712f8acc-f2d9-4f5e-a1d2-08fc799d6f78","resolution":{"observed_at":"2026-08-07T00:53:26.930717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-07T00:40:22.561926Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12830","last_updated":"2025-06-15T12:22:55Z","snapshot_observed_at":"2026-08-16T20:45:45.867125Z","submitted_at":"2025-06-15T12:22:55Z","title":"ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:22.561926Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2506.12830"},"observation_digest":"sha256:6b142c86d82af775ec1d9d2ea1f0c2f44001582b47647537a8d629727991e6f3","observation_id":"84a7f1c1-7cc2-4716-a4de-cae359319d48","resolution":{"observed_at":"2026-08-07T00:40:22.561926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-06T22:43:04.966173Z","title":"Zhuang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21022","last_updated":"2025-06-26T05:48:36Z","snapshot_observed_at":"2026-08-17T04:53:58.256969Z","submitted_at":"2025-06-26T05:48:36Z","title":"Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:43:04.966173Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2506.21022"},"observation_digest":"sha256:1fc93b9c2552639139ae00a023baa4ea8269e70626481a3cecece5fffcdcc020","observation_id":"cd3cdd43-3777-40cd-aaf1-1e35af05d4e1","resolution":{"observed_at":"2026-08-06T22:43:04.966173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2603.04592","last_updated":"2026-04-19T16:23:58Z","snapshot_observed_at":"2026-08-15T03:59:13.424216Z","submitted_at":"2026-03-04T20:37:30Z","title":"From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T16:16:15.819622Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2603.04592"},"observation_digest":"sha256:7554cfc845a0ac415a791dd264b9a3629cf669dbe56717a6ad1be38fd0d5eb54","observation_id":"226e02d8-a9c5-477b-b69c-0990c34ccad1","resolution":{"observed_at":"2026-05-15T16:20:09.981818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-13T23:27:11.006580Z","title":"arXiv preprint arXiv:2501.12327 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-17T03:37:13.586856Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:11.006580Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:e94cc0eb5188e5d1c9e23a0c3d127d375474b814171d40870421217432e402ac","observation_id":"07a519a3-d3da-46d2-b5f8-00102b18b19a","resolution":{"observed_at":"2026-07-13T23:27:11.006580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-03T02:34:01.603385Z","title":"arXiv preprint arXiv:2501.12327 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-17T03:37:13.586856Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:01.603385Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2603.16870"},"observation_digest":"sha256:2b5b2323cb195053f7470c055273a6adbcae3c575057949853f3628b88412618","observation_id":"e988bc26-b644-4d96-aa89-0e5d9a344453","resolution":{"observed_at":"2026-08-03T02:34:01.603385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2605.18115","last_updated":"2026-05-18T09:24:39Z","snapshot_observed_at":"2026-08-13T17:29:03.398003Z","submitted_at":"2026-05-18T09:24:39Z","title":"WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-20T12:04:19.761430Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2605.18115"},"observation_digest":"sha256:4144dbbcd6fe86b516705cdc3373ff5cc8744722b3b16c2c7483d7fbbf71a269","observation_id":"bf8003dd-c19c-4a18-adff-8a871acc3f23","resolution":{"observed_at":"2026-05-20T12:08:15.816753Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-20T11:32:24.007847Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:02fb434cecdbbb094ad865caaa9ba4b875186660d95f4e6571ce03a91a01d31c","observation_id":"996a1a94-c94d-40c6-8ce7-64ed0331975c","resolution":{"observed_at":"2026-05-20T11:33:14.285652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2605.18714","last_updated":"2026-06-25T13:57:35Z","snapshot_observed_at":"2026-08-15T07:00:36.095755Z","submitted_at":"2026-05-18T17:46:46Z","title":"Semantic Generative Tuning for Unified Multimodal Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-30T18:31:10.578558Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2605.18714"},"observation_digest":"sha256:1ce27c530b7a415ba592693338d2e6da51339bf0f9f79bc8bff496a02521603b","observation_id":"061a9d94-8747-45e3-a2a1-d89cc9b3bf21","resolution":{"observed_at":"2026-06-30T18:35:00.311433Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2606.08302","last_updated":"2026-06-06T18:58:26Z","snapshot_observed_at":"2026-08-06T09:32:24.096311Z","submitted_at":"2026-06-06T18:58:26Z","title":"HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T19:46:43.514413Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2606.08302"},"observation_digest":"sha256:57dc960fc0c74beb0057c295f7789c994ad41bfc5a34f5c7bf05634e71342c10","observation_id":"39ee1ca7-63ea-49ae-acd4-15ccf867488d","resolution":{"observed_at":"2026-07-02T21:27:24.385865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2606.27376","last_updated":"2026-06-25T17:59:57Z","snapshot_observed_at":"2026-08-13T08:13:11.519782Z","submitted_at":"2026-06-25T17:59:57Z","title":"Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T04:58:15.891214Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2606.27376"},"observation_digest":"sha256:293f94252aa29602309c4ac1bea1dff40ff369471b158e9150c068b7529385ca","observation_id":"8263a698-25c9-4f07-839f-f4a8d6190a4d","resolution":{"observed_at":"2026-07-04T13:39:51.492070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2607.00371","last_updated":"2026-07-01T03:11:21Z","snapshot_observed_at":"2026-08-12T20:47:48.531525Z","submitted_at":"2026-07-01T03:11:21Z","title":"MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-02T15:14:36.946247Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2607.00371"},"observation_digest":"sha256:25cf19ae2b1b5dcea662c336854ddfe4b0d56f2003ea0fec82383d63bad52ced","observation_id":"e4e52c5d-0910-439e-b9d3-a27e11303402","resolution":{"observed_at":"2026-07-02T15:17:07.191767Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2501.12327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-08T00:04:22.542063Z","title":"V ARGPT: unified understanding and generation in a visual autoregres- IEEE TRANSACTIONS ON NEURAL NETWORKS AND LEARNING SYSTEMS 21 sive multimodal large language model","venue":"cs.CV","work_id":"89d960ca-7982-4470-8a93-5994cd42f120","year":2025},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:12771c9dfeabcfee4cb651b803c81ac71a06eed73ae762d475ffd52f463c1bc3","observation_id":"158619c6-8924-48c6-82e8-3e8a88ce896a","resolution":{"observed_at":"2026-07-08T00:04:22.543433Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2501.12327 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:880701396089cc497df169741fe6158bb9cebcad9788e9ccadf95e72c883d6d1","observation_id":"c4f225b9-d26d-4fc4-bedc-b1cc4b7b8c79","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-31T22:25:12.526450Z","title":"Segment the second person from the left","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.526450Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:afea645eaef88842d0686c42798f77d9260564044c03fa0b65a4379a7870cdc7","observation_id":"2483e1c5-8177-4b4e-be7f-ee2e17676c4b","resolution":{"observed_at":"2026-07-31T22:25:12.526450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-08-12T00:44:46.078357Z","title":"A blonde ponytail European girl in a white shirt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07948","last_updated":"2026-08-08T06:23:48Z","snapshot_observed_at":"2026-08-15T05:52:24.898852Z","submitted_at":"2026-08-08T06:23:48Z","title":"SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:44:46.078357Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2608.07948"},"observation_digest":"sha256:9450e1bb2cd6f90746a42a88085ff5b24e393534d5483bc6d086576c53168623","observation_id":"e391844b-f528-4ed1-bb93-78e823d1782e","resolution":{"observed_at":"2026-08-12T00:44:46.078357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12327/citation-record","integrity":"/paper/2501.12327/integrity","json":"/paper/2501.12327/citation-record.json","paper":"/paper/2501.12327"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.055182Z","title":"Albergo and Eric Vanden-Eijnden","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.055182Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:1af1513810f1303cfdac95343b65dfbe62ad04a9be58ab7ff5e049906e02e032","observation_id":"02ef5ae7-22ec-402d-8993-4ca00f815ea1","resolution":{"observed_at":"2026-08-10T17:21:04.055182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T17:21:04.060897Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.060897Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:2d768992405b75617f4272d6fa553b3f1ddb58d4de24ab584f6300af79eed1ae","observation_id":"a7091db3-b8a5-4832-b0ac-8719fe9ba569","resolution":{"observed_at":"2026-08-10T17:21:04.060897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.066545Z","title":"messages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.066545Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:f3b7bdf5dcd96724c9f57044b93265fdc3993d0aca50f194017221e6c0224a2d","observation_id":"687c7d63-90b1-4a60-b1ea-791b5c9e0375","resolution":{"observed_at":"2026-08-10T17:21:04.066545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.071756Z","title":"Analytic- dpm: an analytic estimate of the optimal reverse variance in diffusion probabilistic models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.071756Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:87a27a8aed7c5029a3e0e5f1022c211be2dc29a51eac87d2e58539792626f6e9","observation_id":"78110544-edc4-4cf0-a5c4-ebec50a60318","resolution":{"observed_at":"2026-08-10T17:21:04.071756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-10T17:21:04.076616Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.076616Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:83b5d7eb01b4654474949834712849dcabfa323a2cd87174d9117e112fd16ed8","observation_id":"1ec4130f-6976-4b60-ac31-064da350ec4b","resolution":{"observed_at":"2026-08-10T17:21:04.076616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-18T12:56:00.724645Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-10T17:21:04.081816Z","title":"Halc: Object halluci- nation reduction via adaptive focal-contrast decoding.ArXiv, abs/2403.00425, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.081816Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a1dae290a84e02be4a92e70488c89dba57415edb4fabf83650ad9a53998bbd38","observation_id":"c19ee446-7ef1-4332-9b85-34e2226e1571","resolution":{"observed_at":"2026-08-10T17:21:04.081816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.087133Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.087133Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:7ebf64f46ee26bd8e17d8cfa2d44eccc640fc324d1481edbe9336ae21a80fc17","observation_id":"eaf80934-d9d7-4a17-8708-d5024abaf709","resolution":{"observed_at":"2026-08-10T17:21:04.087133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.092153Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.092153Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:f50f0fe4d16a8f2fe6284911a9442989312b6d9787022c7bda48771bd1a6ab3c","observation_id":"e00e5a9b-bcb2-493e-b511-a2ae577baac3","resolution":{"observed_at":"2026-08-10T17:21:04.092153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.097084Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.097084Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:122ccca223842330cacd6d3e4f562addd5fac0184ab9e7678728056feaa2248e","observation_id":"c819938f-f686-4df2-bff3-4272318f25c8","resolution":{"observed_at":"2026-08-10T17:21:04.097084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.107444Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.107444Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:b96111410aa199d58b6371a37ac27bfee6607b755c04079b164ee89aa28b7044","observation_id":"7e567638-7001-4bb0-a5a9-4c0278796200","resolution":{"observed_at":"2026-08-10T17:21:04.107444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.113109Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.113109Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e01e16346a970247ecdd2b2abe16576b08bdaab8f70b3c312c7c66396eca6d91","observation_id":"cc5976e8-5f6c-4489-8476-096b526b951e","resolution":{"observed_at":"2026-08-10T17:21:04.113109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.117969Z","title":"Cogview: Mastering text-to- image generation via transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.117969Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:59eb4ec95dfec2ba4b6f2de647c0f46afabb6db53f78f1663df3ca85417d0917","observation_id":"ccaabffa-b2e6-4969-a60d-0cf3c5f7e961","resolution":{"observed_at":"2026-08-10T17:21:04.117969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.122884Z","title":"Dreamllm: Synergistic multimodal compre- hension and creation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.122884Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e461d5a926b6837efdb890711a5bfe9dc746e681945570ccda0594e952bd29cf","observation_id":"e2ba1748-3173-4c43-9221-9c2e8c359b3c","resolution":{"observed_at":"2026-08-10T17:21:04.122884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.127322Z","title":"Taming transformers for high-resolution image synthesis, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.127322Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:584c3fd5a33dbe27bea1335abe5a89253f037330c61ba512124c88d301b78c51","observation_id":"8187f5d8-4eae-4649-b2f8-30c8dfab353a","resolution":{"observed_at":"2026-08-10T17:21:04.127322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13863","last_updated":"2024-10-17T17:59:59Z","snapshot_observed_at":"2026-08-18T20:25:20.454774Z","submitted_at":"2024-10-17T17:59:59Z","title":"Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13863","snapshot_observed_at":"2026-08-10T17:21:04.132171Z","title":"Fluid: Scaling autoregressive text-to-image generative models with continuous tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.132171Z"},"links":{"cited_paper":"/paper/2410.13863","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:f1e0f06583c78f743aa18902d10aea304cfcbd80d0169f72b541acbb1c4b6505","observation_id":"6b7f01ba-b9f6-4e40-a94a-3baf2bb28b9f","resolution":{"observed_at":"2026-08-10T17:21:04.132171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.137915Z","title":"Mme: A comprehen- sive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.137915Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:54ab4a9c78d1c41cffc221d8e3a2e807e7151006eb1e7a03e02bd87266481032","observation_id":"4b049a85-1fee-4821-b33f-9a53edb8b170","resolution":{"observed_at":"2026-08-10T17:21:04.137915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.142561Z","title":"Making llama see and draw with seed tokenizer, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.142561Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:c437a49eaee410258f4e9980aa7c133505d6f4672124732a537a43368b71f7fa","observation_id":"7db3e256-48c4-40de-8a5e-8aa20d838f68","resolution":{"observed_at":"2026-08-10T17:21:04.142561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-10T17:21:04.147572Z","title":"Seed-x: Multimodal models with unified multi-granularity compre- hension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.147572Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:cc627b1172dffea670399a97ed7919496abf856374fab10d4a4a1c0986b6e90c","observation_id":"c7e95b52-af29-49cd-8716-f2adb530d859","resolution":{"observed_at":"2026-08-10T17:21:04.147572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.152825Z","title":"Making the v in vqa matter: Ele- vating the role of image understanding in visual question answering, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.152825Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:cd358d9ed9b69c939ef43cc0030f5bcb4b98dc656964e4f9cff4cf12c0d7a42f","observation_id":"395f0c5e-97e6-4b70-9bcb-f6804c9c849e","resolution":{"observed_at":"2026-08-10T17:21:04.152825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.157578Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.157578Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:4fc8fffb1973b00f8c67cbb74fd6548c503661efb06b91a9d196e84b71d582ac","observation_id":"ad7bb450-fe95-49f0-bc2c-078aa624bb27","resolution":{"observed_at":"2026-08-10T17:21:04.157578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.162915Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.162915Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:b01dd98a4faaaf96c37561f44d3c687a021ea515e72a0afc61b0785f9d590065","observation_id":"de348b17-ce73-4b05-a90d-647049fd6fb4","resolution":{"observed_at":"2026-08-10T17:21:04.162915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.167558Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.167558Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ebf068d5e1dbeea2cb7af10b34c323021ac415247e3d80f17adc897cf29bb72b","observation_id":"fd96de1b-a8e3-458e-94ae-45c05faaf459","resolution":{"observed_at":"2026-08-10T17:21:04.167558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-10T17:21:04.172479Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.172479Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:519e76b9deda33b5e4190ce5874b728df6a8ad43d388f0d69e27e7d9ffae8f9b","observation_id":"83199dc8-7144-4c07-b62f-6f31345dea6e","resolution":{"observed_at":"2026-08-10T17:21:04.172479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.177268Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.177268Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a38e5d237fed4c49286b698bef4533eaf90a582a423f6d90f4bd46333210a9df","observation_id":"6a913b5d-76b8-4ff4-9ac7-5456d24a75dd","resolution":{"observed_at":"2026-08-10T17:21:04.177268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.181964Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.181964Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ea8e16ac8d7dc496c684f1c0b785a500fe2e914e9cb62eb370857913c1f0cafb","observation_id":"e14c0d7f-ef16-40b3-893b-5cb64c3118df","resolution":{"observed_at":"2026-08-10T17:21:04.181964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.186599Z","title":"Fleet, Mohammad Norouzi, and Tim Salimans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.186599Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:9e01c708831ae887adee69b86f8bb9822da80766e51acb2fd5aa650c1fa63f83","observation_id":"c710cb36-5d00-4c49-99b7-f9ba42f719a9","resolution":{"observed_at":"2026-08-10T17:21:04.186599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.191427Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.191427Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:92fe9729a87f369b637d4af003c53bedb373654b043873146be516292ea00c0b","observation_id":"05c48a21-3f0f-415d-b190-9e083acc0075","resolution":{"observed_at":"2026-08-10T17:21:04.191427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.196480Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.196480Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:c2f1c12812cef1dde38c2201ac68dd0df07155e2a514c817f38aeaf2f09ca0ff","observation_id":"077c2209-9771-4993-9318-d9fca4d48144","resolution":{"observed_at":"2026-08-10T17:21:04.196480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T17:21:04.201224Z","title":"Scaling laws for 20 neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.201224Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:d83a8a50626fce7ec2670696187a189242e0d0393b977d997fba211d5f98d81c","observation_id":"1473683f-a911-4071-a4b0-79ac04e25f79","resolution":{"observed_at":"2026-08-10T17:21:04.201224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.206167Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.206167Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:8809ba60dafe0c5074ee8a2f091fbd93881a3e978839695a4407268c8d5b8fe7","observation_id":"a59168d2-cd0d-417f-a551-f25d6a825290","resolution":{"observed_at":"2026-08-10T17:21:04.206167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.833343Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"64ad641d-61f8-47b8-9b09-9362363a041d","year":2017},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.211116Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:8a1e0082d57c69786a496e53e20f87b6f9b746f4fd1788b99ff015c43b78942f","observation_id":"edafc5d2-ee27-42f5-a95d-57ac40f5108d","resolution":{"observed_at":"2026-08-10T17:21:05.838318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.817558Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"8d1eecc8-2aea-4e9e-a21b-50fde9835509","year":1956},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.216098Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:1cc7f2851f207bd061ee33364a50d6e71a8d673330b8ebc7220bf563c176f6b9","observation_id":"76c23acd-d042-4fa4-92df-e026d85caa07","resolution":{"observed_at":"2026-08-10T17:21:05.823150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.802292Z","title":null,"venue":null,"work_id":"29636a46-ea75-4d4a-94d1-c30c3c3ed7e4","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.220768Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:43009b98270a46a585ec9b733e01189611d4478529a2da2829700698b25ae30b","observation_id":"6b1f51eb-97d4-4ad2-8abc-b868ad943db6","resolution":{"observed_at":"2026-08-10T17:21:05.807189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.787370Z","title":"Datasets: imagenet-1k-vl-enriched","venue":null,"work_id":"9bc2aa95-cb22-4f40-b5d9-1934f29192cb","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.225733Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:dbb3a41687fba685bbfaca33134db5d714aebb190426a25912ccce564018fa09","observation_id":"a2674656-240c-47d0-8726-57db70b158b6","resolution":{"observed_at":"2026-08-10T17:21:05.792194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.772539Z","title":"Deep learning","venue":null,"work_id":"8e6c56e6-d798-41c7-a42a-a5331abfc37c","year":2015},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.230513Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:36293abae50cb9281556fdc6821e97a597c629403fd0aad3b0974e4718adae17","observation_id":"b1af209a-5da4-4f7b-9133-5f254b5b1a4a","resolution":{"observed_at":"2026-08-10T17:21:05.777349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.757135Z","title":"Autoregressive image generation using residual quantization, 2022","venue":null,"work_id":"e85606e7-617c-42e0-b578-aff207e0b4e3","year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.235485Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:491d017d9d83d38757cc98b11907a2dd49fe434c537fbe0ab17c65ad8b5335f4","observation_id":"ebbe9e8b-7c63-4326-914a-90bf4f6025bd","resolution":{"observed_at":"2026-08-10T17:21:05.761859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16922","last_updated":"2023-11-28T16:26:35Z","snapshot_observed_at":"2026-08-18T12:55:28.536184Z","submitted_at":"2023-11-28T16:26:35Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16922","snapshot_observed_at":"2026-08-10T17:21:04.240341Z","title":"Mitigating object hallucinations in large vision-language models through vi- sual contrastive decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.240341Z"},"links":{"cited_paper":"/paper/2311.16922","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:6d43b4d1950c25f3451700eb89b3dc6063266b767bf40f7e1e99f455dd083880","observation_id":"c5d0fb22-0895-45e8-8094-17af05f79de6","resolution":{"observed_at":"2026-08-10T17:21:04.240341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.742083Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension, 2023","venue":null,"work_id":"ef17bd7d-c69f-4f3d-ab41-a3abb4405ded","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.245178Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:9c011577ed562c012e938b0710878f66d057777f5746da829a80e5e06e0d40a6","observation_id":"c690a647-abe8-4335-87f0-ebd032a52f8a","resolution":{"observed_at":"2026-08-10T17:21:05.746758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.726919Z","title":"Llava-next: What else influences visual instruction tuning beyond data?, 2024","venue":null,"work_id":"1ea064c1-37b1-4439-9d94-4fcd1335e8cd","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.250131Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:495a44903537a4327e22c0ac8c180471524f6d4958c4405dc9fbf63531b48709","observation_id":"5840bd26-27e1-476a-acc6-65ef61c90cda","resolution":{"observed_at":"2026-08-10T17:21:05.731951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.712154Z","title":"Llava-next: Stronger llms supercharge multimodal capabilities in the wild, 2024","venue":null,"work_id":"c7b4ee87-d50e-453b-8b4f-9c37692e110f","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.254643Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:55d4641a13fd751fcb97aef9d73a3cdb3db88eb4728c5f7e6866d1e879f75610","observation_id":"a75f6018-7d76-4c07-888b-d6a32297b8e0","resolution":{"observed_at":"2026-08-10T17:21:05.716817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.697403Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":"7ce01d78-735f-43e7-91ec-1fecc49ca30d","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.259415Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:19c13ff9422860d98a84034460da9e6d65dcacd7ab0ca7c6cc6dcb81cfd3fc36","observation_id":"94b0743b-231f-45f1-946c-d4c93240bdb2","resolution":{"observed_at":"2026-08-10T17:21:05.702250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.682549Z","title":"Llava-next: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":"fdada72a-fa45-41f3-86b7-dc3a868fee5a","year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.264372Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:718f646b07fd36a1efac2c437a59f6298cb3b2236528afced61b1f05c40c9144","observation_id":"58bda4e4-2289-47ce-ad53-f14da0f948d4","resolution":{"observed_at":"2026-08-10T17:21:05.687367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.667232Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"362fed1c-b487-4ad4-8db8-176100035538","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.269031Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:fafc7284e053db69c5616441ea940045af64dc27517779a9f0725cd60a4f7429","observation_id":"d0023b5b-6601-469d-a346-fd2e97af8db9","resolution":{"observed_at":"2026-08-10T17:21:05.672425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.651428Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":"a525c6f0-5a63-4bd0-9c85-7c81d6eaf40c","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.273858Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:566e1119e0abb80cab7a6f89e63b7704c366dfc9084ff72ca7dc1d37ce019aa6","observation_id":"53ab4899-7181-43f8-a309-a5e25a2ed6b7","resolution":{"observed_at":"2026-08-10T17:21:05.656693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.636079Z","title":"Evaluating object hallucination in large vision- language models","venue":null,"work_id":"0065a0b4-5fb0-4223-899a-f3f45853693f","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.278654Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ee08cde596602d17b4d5a1be91f769cc503d3bee141d18a56940e4f00f06416d","observation_id":"3b873459-04b5-4fb5-b0f4-0d25d8fa23a4","resolution":{"observed_at":"2026-08-10T17:21:05.640969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.620194Z","title":"Dual diffusion for unified image generation and understanding, 2024","venue":null,"work_id":"169be219-e13c-400e-adf3-c3ad978347a6","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.283580Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:cd744411edf7781ed3176e7d7c431a12af50b369e6f242268e11308d31c8b11f","observation_id":"2c4a206b-008a-4440-ad1f-e8d0e1bc9402","resolution":{"observed_at":"2026-08-10T17:21:05.625246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-10T17:21:04.288423Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.288423Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:c01acfb7f31c92fc9c21c9a2332b620bbd0a136769c85358fd49b2712ad77f86","observation_id":"7f25221c-d942-4d8b-919a-cd855aff610c","resolution":{"observed_at":"2026-08-10T17:21:04.288423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-10T17:21:04.293521Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.293521Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:5e3e3bdf71948eee64331c3c95626f892f50ac1bf6e80b501ef5456b174b27d9","observation_id":"bfdfb097-5980-4de6-83ca-b0cf21c628b3","resolution":{"observed_at":"2026-08-10T17:21:04.293521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.604209Z","title":"Visual instruction tuning","venue":null,"work_id":"b8516f57-c807-47a1-bb62-c773e2229989","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.298785Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:61b2d5493a0c7bc63cc3bedbd7273d4725f7e2192f77e4e8fedf9f5910c730a2","observation_id":"878d5f9d-8086-4274-92d0-89b11770d923","resolution":{"observed_at":"2026-08-10T17:21:05.609283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.588634Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"3bc51c23-0be6-4061-bc0b-e8b0b0594554","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.304374Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:db6320aff84c7a80f64ecf826009515b87ac50325ee8c20ee1b8ced04a28158d","observation_id":"401fee1b-c74a-4080-9fdf-84cc84033a6c","resolution":{"observed_at":"2026-08-10T17:21:05.593616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.573713Z","title":"Improved baselines with visual instruction tuning, 2024","venue":null,"work_id":"c8c6a3c3-451f-4110-bb08-7832811caf4b","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.309619Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:541f6c4501b2cb242804baa373447a3b7bcec90a1bc1324699a9246efdf16bca","observation_id":"1e21cf32-bc91-4ed1-bd31-3ecdcce2692c","resolution":{"observed_at":"2026-08-10T17:21:05.578610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.556927Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"1eaedd87-d4e7-44c3-9d44-062cd0af90e0","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.314855Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:5ef070f11005099be79088cc898a3123a72d47647014764815d9d82b4042738f","observation_id":"821f2ff4-a50b-4d46-86e5-e27b39403060","resolution":{"observed_at":"2026-08-10T17:21:05.562380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.540327Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":"fd1d28e0-a5dd-41ff-abdc-65a1b89dd375","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.319618Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:75df9940e2899b9cf6bcc3dd373933dfd0344693e3fa513d860a61133571659a","observation_id":"367b11ed-4739-47f0-852c-cdacab181abc","resolution":{"observed_at":"2026-08-10T17:21:05.545290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.523630Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":"75c28a17-755b-4726-9c47-7cee5b648806","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.324310Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:437fbcffe335179c47ecef8b9c21756a5935aca0dccc8be5e3dd11841ac6e2b8","observation_id":"ee285e19-6127-4fdf-be4f-100c99da170e","resolution":{"observed_at":"2026-08-10T17:21:05.529584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.506721Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps, 2022","venue":null,"work_id":"03863ac0-307c-454f-980b-645a26a43119","year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.328973Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:4eb30fb0ac2c2d95a36cf2c1c4e39b1494711532f5b3f236992d33cebaa4d5bd","observation_id":"93a6883f-d62b-40bd-b416-7dbb7e0339c3","resolution":{"observed_at":"2026-08-10T17:21:05.511965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.489377Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":"10b8e76b-fefe-4abe-a5f6-ccfcba4073c3","year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.333752Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:cd9d90ac8f9015d7edb2774f702ff9e9e177ca8ff51c0bc527481ed0dd124559","observation_id":"0232c3dd-4465-4a54-a616-ba7197d81649","resolution":{"observed_at":"2026-08-10T17:21:05.495366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.473426Z","title":"Unified multi-modal latent diffusion for joint subject and text conditional image generation, 2023","venue":null,"work_id":"8c86f8d0-04e6-4874-9ac8-af8fd5dd0f3c","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.338929Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:09a9ec8779b3fa0b44be05ab159bb3d42374fcb44bf854d3223180fab7b97f89","observation_id":"84008c93-d13a-40c1-97d6-d1ef4d9b0602","resolution":{"observed_at":"2026-08-10T17:21:05.478887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.343869Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.343869Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:8d964016328911179b5134103b61fa806bac91e3183498cadeda4815fc241fed","observation_id":"4f9e81fe-ab55-47af-8ea5-e797451337d0","resolution":{"observed_at":"2026-08-10T17:21:04.343869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.447243Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":"c609df7f-05c3-4e32-a762-22bedbace6fa","year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.348553Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:41b5f3c905594b3f3fd93beaa0b7329d022d7905e2e17bf579a684601cd3de88","observation_id":"ed88223d-20e4-4c11-bdf6-8c549e1d9350","resolution":{"observed_at":"2026-08-10T17:21:05.452449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.430832Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"8d429a4a-bc40-40e1-9826-0cbbeb4c8436","year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.353053Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:bdfdd43447d9850a1c9eb2c3a8bf3eefe79d9ebe24bc9c0053c619e6c8a9bf3f","observation_id":"5f1c9815-c403-4bae-99fb-b01ac8f9e695","resolution":{"observed_at":"2026-08-10T17:21:05.435954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.357580Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.357580Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e7e4748cf7050ce5d9dafc64a00f9227992a6258fa64d77b1721fbbc43ab589b","observation_id":"d3395c2d-6c74-44b1-aeea-bb2680354427","resolution":{"observed_at":"2026-08-10T17:21:04.357580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.362267Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.362267Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:3ab45aac4ed13d89a9f51e214267ff28b17a05726e6813862023ce30a8be6930","observation_id":"2949aca0-29ff-4e41-ab65-d58979c19940","resolution":{"observed_at":"2026-08-10T17:21:04.362267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.367146Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.367146Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:dc5ea376c138e502ccac9da7821241f05be95c175cd049de3c5cccb59d11ff0d","observation_id":"6adfc238-4cb5-4864-b2ab-f49da80dc63b","resolution":{"observed_at":"2026-08-10T17:21:04.367146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.382682Z","title":"Du, Zehuan Yuan, and Xin- glong Wu","venue":null,"work_id":"d613c7e6-1be5-425d-9c03-2c48ad1f8ecb","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.371864Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:0f6ab89faad823e46b83e0175fce922e1a6efea65125f7d0482ccc84cc54c69a","observation_id":"d4f27e65-f17b-4304-a135-edd8c59b979e","resolution":{"observed_at":"2026-08-10T17:21:05.387857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.376519Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.376519Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:278ca506b854cd792b89c9ebaf8248d0b136b558d77d28fdd500eaefd0e95ac5","observation_id":"3cf0f681-042d-4c4c-9b7a-5ab69a9c262a","resolution":{"observed_at":"2026-08-10T17:21:04.376519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.381413Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.381413Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:9878dffc2c4cc9615e771b6b2dc8ee9f6b9ab0be58ff23472e7fb4ba65e09079","observation_id":"5e957856-07e5-46f2-9882-ad0d28dbbb64","resolution":{"observed_at":"2026-08-10T17:21:04.381413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.386393Z","title":"Zero-shot text-to-image generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.386393Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:fa21219296a558129af7e9f489ad29e08a12e40b6bcbc2d755b1d8606b6abba2","observation_id":"5dedcf49-fcdc-44c6-a8a6-a2a7723e72b1","resolution":{"observed_at":"2026-08-10T17:21:04.386393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.336131Z","title":"Hierarchical text-conditional image genera- tion with clip latents, 2022","venue":null,"work_id":"a3e99538-a901-4d51-a33f-e1c7dfc3d944","year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.391482Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a05c0d345102f5cca42b1f2a231215005ede72fda626bd9c67537fa0159465f6","observation_id":"672f3e67-c3be-4d75-a9e2-eabc8f8a6676","resolution":{"observed_at":"2026-08-10T17:21:05.341071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.319167Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":"0f76e141-1a40-472d-8f7c-f13fd3a88828","year":2021},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.396305Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:d4be61aec95dfc34d3e88eda53e768fd6af3090ffd55e34e0ba2f86e3f1a55da","observation_id":"504fc21f-a55a-4ce4-8205-1b4882b92f90","resolution":{"observed_at":"2026-08-10T17:21:05.324461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.303356Z","title":"A-okvqa: A bench- mark for visual question answering using world knowledge","venue":null,"work_id":"6103ee72-b488-429f-aa17-77c4f855870a","year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.401232Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:d1189560be10b24ce944ccff1ba133891ce1771e5a8034fcb4aa144cf7f81181","observation_id":"64eed9d4-bce1-4264-95ed-7368ce130d2f","resolution":{"observed_at":"2026-08-10T17:21:05.308472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.287371Z","title":"https://sharegpt.com/, 2023","venue":null,"work_id":"ade79f3a-45bc-4ec2-81f9-88dd071dad87","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.406214Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:f9eb802521d1765be2b9ef769e630473c6944dd1ebc82429ac7010862ed11dfd","observation_id":"3b30c682-79a9-4642-8646-a0cc7866efa5","resolution":{"observed_at":"2026-08-10T17:21:05.292565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.270353Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":"2558e46b-fbf4-47d5-831d-7cf76a04a01c","year":2020},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.411103Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:255da053ce48afde42bf99aa2628334522787daeffcd47f9e78da3287f1cc777","observation_id":"4f535246-2cb0-49a0-b2bc-4420abf03743","resolution":{"observed_at":"2026-08-10T17:21:05.276429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.254387Z","title":"Towards vqa models that can read, 2019","venue":null,"work_id":"7074bb77-0d9e-4743-9f46-33f39dd04b3f","year":2019},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.416070Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:551b5ee4dc9e26cfb44048a0a7642176d61b2a1297f982506fb8cf4befb40f79","observation_id":"78a7022f-34f2-440a-af68-a4048fe072ce","resolution":{"observed_at":"2026-08-10T17:21:05.259803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.421214Z","title":"Denois- ing diffusion implicit models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.421214Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:5d5142d30ccdda083025c48ee81334cc8aeda9cc1bb6e6af52f32493c945b35d","observation_id":"c884e091-49c7-49de-bc2f-8a41d6eb0565","resolution":{"observed_at":"2026-08-10T17:21:04.421214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.228497Z","title":"Generative modeling by estimating gradients of the data distribution, 2020","venue":null,"work_id":"11d0274f-7a86-4bd0-9300-e25b6cfbcd8e","year":2020},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.425900Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:d954de7b5d55b25e149c0393ec7376139d834dd10b583f356d3d262ac842210a","observation_id":"f336a288-88b0-4b96-9958-bab1ceaad257","resolution":{"observed_at":"2026-08-10T17:21:05.233418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-10T17:21:04.430791Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.430791Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:adf9731cb0adb200046027915732d255bd0452a1f1d8e41a5fa599a15d87d8b4","observation_id":"f557c42d-75b3-414b-8d52-9bd3628b6b76","resolution":{"observed_at":"2026-08-10T17:21:04.430791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.213003Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation, 2024","venue":null,"work_id":"c3e148bb-b9e7-4b02-9a65-abf1f22a9305","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.435876Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:06139b89eddfea9bff5e8aa9352eee7390622f0acbaa746807ecdc2dd3cf6df2","observation_id":"9534376e-6416-4d9e-a1db-112c70e201eb","resolution":{"observed_at":"2026-08-10T17:21:05.218037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.197174Z","title":"Emu: Generative pretraining in multimodality, 2024","venue":null,"work_id":"331df43e-30e0-4daa-8d89-56a86ef09c27","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.440563Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:dfc1ba8cf21171036c8e81cb0631efb2097ae0186a956b5c01d1b41707ea07cf","observation_id":"f1b697cc-4b73-4fd7-a086-d4ba312325a1","resolution":{"observed_at":"2026-08-10T17:21:05.202213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.180634Z","title":"Hart: Efficient visual generation with hybrid autoregressive transformer","venue":null,"work_id":"3276affe-7411-45d0-8692-fb8561befa22","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.444991Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:71d140a53c0677dbe70d3446b902f13f1665446fcea327fe0478a65d753cab33","observation_id":"4284d52c-fe79-427f-9813-d5d51dfcddac","resolution":{"observed_at":"2026-08-10T17:21:05.185718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.164079Z","title":"Any-to-any generation via composable diffusion, 2023","venue":null,"work_id":"08789a19-1925-4cce-806d-f47e48528840","year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.449643Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:77bf9c5e45373cfadd0482417b02f2a5186b84853c5d90902afa70473b417587","observation_id":"33cd3e92-1192-4ad6-ac2f-e43e1264750d","resolution":{"observed_at":"2026-08-10T17:21:05.169008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-10T17:21:04.454118Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.454118Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:43872af94e4ffffcfd62a706e17513c4eb19be0bf06b9ebd92b8006e94f6c247","observation_id":"b7482b26-fc8c-480e-8e16-18dabf8f7f66","resolution":{"observed_at":"2026-08-10T17:21:04.454118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.148463Z","title":"Chameleon: Mixed-modal early-fusion foundation models, 2024","venue":null,"work_id":"e95a339b-07f0-4bff-861a-43d43bafe7fc","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.459369Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:d28fa6b9168019c344c1b81465ba6643401207a37f15e0366bacc93a99914e3f","observation_id":"b09cea6d-cd21-4e3a-b502-604c4227c340","resolution":{"observed_at":"2026-08-10T17:21:05.153496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.130561Z","title":"Gemini: A family of highly capable multi- modal models, 2024","venue":null,"work_id":"d55ec98b-0897-446f-8886-0e13b60a8d01","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.464229Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:c92da751b88370a9fe795bee8b1ccecf93034374f12d32b430c5a9ca7428597f","observation_id":"0eb9c253-a750-4dfe-8ce0-e714ac4f1155","resolution":{"observed_at":"2026-08-10T17:21:05.136580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.112191Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"c393f9cf-ae2d-4a6e-9235-d694c0aa9de9","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.468923Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:55212a518cb50fe9a0612af56348fa3c2b362538576f8fe3be0f7215fe88a046","observation_id":"c46ec641-224c-4622-a994-0dbfbee052f9","resolution":{"observed_at":"2026-08-10T17:21:05.117973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T17:21:04.473439Z","title":"Lacroix, Baptiste R., Naman Goyal, Eric Hambro, Faisal Azhar, et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.473439Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:5e3f090c088d574e5e82d9ba6caeaadaa8adde4ead9d2972be725f8c35e97025","observation_id":"afa5e832-8fdd-474a-b72b-2ffe528815ed","resolution":{"observed_at":"2026-08-10T17:21:04.473439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T17:21:04.477802Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.477802Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a2ee5df6e30707672b3299804b433063412f2aa1f0d6237869d760b7f0358280","observation_id":"575930a0-480b-4283-8db9-9c67ae203c2f","resolution":{"observed_at":"2026-08-10T17:21:04.477802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-10T17:21:04.482440Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.482440Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:e5b1b11fd9acba48175a2663290d30d3529ec354d55165533ac7402fc8d7f72e","observation_id":"223ddf3d-9771-4eec-aaca-9a5db3eccc20","resolution":{"observed_at":"2026-08-10T17:21:04.482440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.093209Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and genera- tion, 2024","venue":null,"work_id":"fd459f6a-a8d8-408c-bf93-52778a730e8c","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.487152Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:b0a0cc99358c7d21adb758012186b4c532f389052063c1de804d88517f8e840a","observation_id":"ccf4fa23-a0f7-4caf-98be-6f1a4a9cc6b0","resolution":{"observed_at":"2026-08-10T17:21:05.099022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04332","last_updated":"2025-04-10T18:28:11Z","snapshot_observed_at":"2026-08-19T20:11:01.764633Z","submitted_at":"2024-12-05T16:48:16Z","title":"Liquid: Language Models are Scalable and Unified Multi-modal Generators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04332","snapshot_observed_at":"2026-08-10T17:21:04.491869Z","title":"Liq- uid: Language models are scalable multi-modal generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.491869Z"},"links":{"cited_paper":"/paper/2412.04332","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ad4a70d137831574d00c20df28da9e1d4345d843fdd26d897128ba489566723d","observation_id":"07804346-6d60-4570-81a4-816bb00d4b59","resolution":{"observed_at":"2026-08-10T17:21:04.491869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-10T17:21:04.497553Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.497553Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:599d7d1d87fd132c2f92ba62b3be4368f1103e6806a5bf6401cf57a68d31079b","observation_id":"2919fe17-42dd-4e1d-a91c-f17cf84ad08b","resolution":{"observed_at":"2026-08-10T17:21:04.497553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-10T17:21:04.503740Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.503740Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a84c42ba016cb4cdd1f0a6fb046c08f9b83fe7aa5eaceb4ac0683d46c190df90","observation_id":"1b285d06-f445-495c-965d-fcd465fe69d6","resolution":{"observed_at":"2026-08-10T17:21:04.503740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.076423Z","title":"Show-o: One single transformer to unify multimodal understanding and generation, 2024","venue":null,"work_id":"ca0f8fef-a61d-4952-86b0-43a09ca5e681","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.508878Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a98063972a019b667132e416eb22d2004a43b680663b5cd19ddf597ebbb4e15e","observation_id":"4acae73c-0414-4deb-bcfe-5f87fece7fba","resolution":{"observed_at":"2026-08-10T17:21:05.081298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.060445Z","title":"X-vila: Cross-modality align- ment for large language model, 2024","venue":null,"work_id":"5162f09a-fc00-4403-aaa9-77dd3f78fa86","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.513698Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:a1ed882167cddd75ec754a9ccf42e56c93feec0fa8b113eff1591f3cd332983d","observation_id":"3192d077-b9ca-406b-99f0-7d193a3837d9","resolution":{"observed_at":"2026-08-10T17:21:05.065607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-17T11:19:59.774979Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-10T17:21:04.518425Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.518425Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:7c2181971486e199ed6e540cd672058c9d862c8e6de38a3710ed8f382ee7f0c4","observation_id":"7f74507e-3009-4f7d-be6e-dc1309ffbd58","resolution":{"observed_at":"2026-08-10T17:21:04.518425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.043305Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"a3894b35-c74d-4dd4-ab7a-372a63b11496","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.523483Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:f6b0df0a75767c020e86e714f62fae546ef35a515431e13a7ebde60e62f71e45","observation_id":"2c9753cf-45c7-4c39-bbb5-5c5c724de964","resolution":{"observed_at":"2026-08-10T17:21:05.048940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-18T12:54:07.136498Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-10T17:21:04.528220Z","title":"Woodpecker: Hallucination correction for multi- modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.528220Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:b1eecbdcc247d321d326bcabd941e9ea7f03b5edc25ada1216b1294cfb802bd0","observation_id":"a86774a0-f579-4365-b430-b82d493d0519","resolution":{"observed_at":"2026-08-10T17:21:04.528220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.533079Z","title":"Scaling autoregressive models for content-rich text-to-image generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.533079Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:1745dc680a388e0e515f2fd7ccb1ec9d83e923605acd93624554da3be0e56959","observation_id":"b0a5f092-939f-4f8f-904d-ecfc93be4057","resolution":{"observed_at":"2026-08-10T17:21:04.533079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:05.008845Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi, 2024","venue":null,"work_id":"c53221ba-7915-4e5c-a743-739ce18d2209","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.537979Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:6d7770c2760f148f85b3695b17fd8ff27d2bb3997d7646b391dde3b0a93fcd93","observation_id":"8e66f95f-5fb4-4782-b7b8-9f09cc37c952","resolution":{"observed_at":"2026-08-10T17:21:05.016487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.542716Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.542716Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:ae79d54c6344b4652a8ab589d9e82a1c7ddaa66e202fef5a89bbdc3550dcb66e","observation_id":"86b1424d-1762-47fc-8a10-54433d2ceff1","resolution":{"observed_at":"2026-08-10T17:21:04.542716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:21:04.977310Z","title":"Var-clip: Text-to-image generator with visual auto-regressive modeling, 2024","venue":null,"work_id":"32d66299-cb40-435c-afd1-99d7a5493bf3","year":2024},"citing_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T17:21:04.547305Z"},"links":{"citing_paper":"/paper/2501.12327"},"observation_digest":"sha256:21295fac0b42cace4d4d373db2c0304a6053fb88e80b97065891b924f39e8696","observation_id":"016c92f5-1ba3-4d55-b361-2ff766f765d6","resolution":{"observed_at":"2026-08-10T17:21:04.983358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 22 inbound Pith citation observations for arXiv:2501.12327."}