{"as_of":"2026-08-23T14:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d66ef75a4825d9cf23c3a0ff11dad89c77cbe2d6b1a3a33e776025c4332b2af0","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T22:25:12.526450Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24157/citation-record","integrity":"/paper/2607.24157/integrity","json":"/paper/2607.24157/citation-record.json","paper":"/paper/2607.24157"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.289324Z","title":"Estimating and exploiting the aleatoric uncertainty in surface normal estimation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.289324Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:c6297f5f294b02a9402719bbe907894b62efc6ed51983e961481b5e027c79f2e","observation_id":"af6a442e-3ac7-4938-b681-45bd5baa5f8e","resolution":{"observed_at":"2026-07-31T22:25:12.289324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.292882Z","title":"Refereverything: Towards segmenting everything we can speak of in videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.292882Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:dfa10a2037692b849f95faf0976a06beed832c64b5f2bad40b0c26a0cc4a01de","observation_id":"d4712f1a-5733-4ad0-8a33-57c96b920f77","resolution":{"observed_at":"2026-07-31T22:25:12.292882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-31T22:25:12.295664Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.295664Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:2313d496ef4cf778eba856bfec95ea2a931414989d07c5a44b65802473fff43d","observation_id":"aa1cfb72-04ac-47b6-9313-3644dcc5b5b3","resolution":{"observed_at":"2026-07-31T22:25:12.295664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.298661Z","title":"Sequential modeling enables scalable learning for large vision models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.298661Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:4701682f207ad86582bbe5c891b03e51e8a40e7765a85acff1baff218eaa70e7","observation_id":"231f887d-ea4d-4b76-b420-290006245df8","resolution":{"observed_at":"2026-07-31T22:25:12.298661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.301332Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.301332Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:1b25f23665f5a410637e42bb9c25ad615b5f5670b6c00423a3ade6374e43ba5b","observation_id":"5f9c88bc-73a7-490f-9c7d-6116b49c864e","resolution":{"observed_at":"2026-07-31T22:25:12.301332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.304083Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.304083Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:31ff34030ce1ff3d098f1e67dc456c946915162808bed38cedba18c62118b614","observation_id":"f1696e1b-fa18-4130-b051-54a377786d30","resolution":{"observed_at":"2026-07-31T22:25:12.304083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.306751Z","title":"Instructpix2pix: Learning to follow image edit- ing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.306751Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:c365f8a2a5f0162b262b2cb78d85941a252405642f866cf4e50bc578df75bbb6","observation_id":"fa01234a-19f4-43c7-9840-2440f9979359","resolution":{"observed_at":"2026-07-31T22:25:12.306751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15420","last_updated":"2025-08-25T05:05:49Z","snapshot_observed_at":"2026-08-17T21:43:41.819102Z","submitted_at":"2025-01-26T06:48:05Z","title":"Visual Generation Without Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15420","snapshot_observed_at":"2026-07-31T22:25:12.309399Z","title":"Visual generation without guidance.arXiv preprint arXiv:2501.15420, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.309399Z"},"links":{"cited_paper":"/paper/2501.15420","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:daee14182b0ccbf6957719da5dbf95f05a8b6d5576a3ec6e16733fbb76f2d4c5","observation_id":"015c49d0-cd99-46cb-898a-1bd6b42af204","resolution":{"observed_at":"2026-07-31T22:25:12.309399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.312082Z","title":"Scaling instruction-finetuned language models.JMLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.312082Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:f2cc0c27e253051f99e179ca3328ef62dc0134a29ef1f586bb53ffb9d8f4652e","observation_id":"9b1224f5-4a29-4782-b763-177aa1593be7","resolution":{"observed_at":"2026-07-31T22:25:12.312082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-31T22:25:12.314474Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.314474Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:5ffce580e5380f225cc97e024fd1e69eb5e2d35d6be82841b2c80c5070bc2a50","observation_id":"a1cf275e-9ccd-4201-bbdb-cfdc42b442eb","resolution":{"observed_at":"2026-07-31T22:25:12.314474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.317195Z","title":"Instructir: High-quality image restoration following human instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.317195Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:99fea7cd0bafa6ac970604d589f2d437c3906894d032f6898c9bc138e96393d9","observation_id":"8016f4a0-d2f6-498a-9543-872c29950ca5","resolution":{"observed_at":"2026-07-31T22:25:12.317195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-31T22:25:12.319632Z","title":"Emerging proper- ties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.319632Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:c0a6ce940dec32d3b759b2f72dd8cd870bbda4e76d3b7186735f695f83672a4c","observation_id":"5d5419ae-b72f-4812-b0cc-0c6dee8845c9","resolution":{"observed_at":"2026-07-31T22:25:12.319632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.322484Z","title":"Imagenet: A large-scale hierarchi- cal image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.322484Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:aa064f6dcabb59a4abfc0c64be67a21271593ee9834f28f2f52fd338b1cfbe4a","observation_id":"f4554b91-259c-49da-9dee-0fa50156f916","resolution":{"observed_at":"2026-07-31T22:25:12.322484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.324729Z","title":"Vision-language transformer and query genera- tion for referring segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.324729Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:729a8b91d0a80a763f374966c8b25cd978d809f251299c387c0ead1b5606b0b4","observation_id":"b9e07590-96c7-4353-b3ad-40763a4dd129","resolution":{"observed_at":"2026-07-31T22:25:12.324729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.326933Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.326933Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:f1fbbcefadc8ad8f26461cd57a0bf6cb1d10b5065956d65b924a12ea5e05b721","observation_id":"0785f655-fca9-4d4b-969d-4e1140330e06","resolution":{"observed_at":"2026-07-31T22:25:12.326933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12652","last_updated":"2025-04-22T18:52:05Z","snapshot_observed_at":"2026-08-16T12:49:33.426960Z","submitted_at":"2025-03-16T21:11:25Z","title":"UniVG: A Generalist Diffusion Model for Unified Image Generation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12652","snapshot_observed_at":"2026-07-31T22:25:12.329315Z","title":"Univg: A generalist diffusion model for unified image generation and editing.arXiv preprint arXiv:2503.12652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.329315Z"},"links":{"cited_paper":"/paper/2503.12652","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:de3bdc96353a48e97345937c8d1a360ff78144c16d13e76b0b24035c7a787182","observation_id":"aab1004c-f626-46f1-9719-b9d5c357aab3","resolution":{"observed_at":"2026-07-31T22:25:12.329315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.332068Z","title":"Removing rain from single images via a deep detail network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.332068Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:bd19093b9389a8581c91d1d598d5864f8269d0a83d0b52577a270c7e30f99225","observation_id":"8fa65489-5027-477a-84dd-cacb73309439","resolution":{"observed_at":"2026-07-31T22:25:12.332068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00390","last_updated":"2024-03-16T07:21:34Z","snapshot_observed_at":"2026-08-20T05:44:19.951575Z","submitted_at":"2023-09-30T14:26:43Z","title":"InstructCV: Instruction-Tuned Text-to-Image Diffusion Models as Vision Generalists","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00390","snapshot_observed_at":"2026-07-31T22:25:12.334777Z","title":"Instructcv: Instruction-tuned text-to-image diffusion models as vision generalists.arXiv preprint arXiv:2310.00390,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.334777Z"},"links":{"cited_paper":"/paper/2310.00390","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:dfa3e2de15004871405709c57b1befe3662edfa449c6d9904f7f7de29dfe2a5b","observation_id":"2c0ddf29-a741-4b48-8d3a-a142485c3966","resolution":{"observed_at":"2026-07-31T22:25:12.334777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-07-31T22:25:12.337657Z","title":"Seed-x: Multimodal models with unified multi- granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.337657Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:8dd5761f7c04dba6d671cc58a4962db4b5926a012cd085a652d8cee02412c1cf","observation_id":"9b80db01-0f0d-4eed-bf1a-25d6355ad7d3","resolution":{"observed_at":"2026-07-31T22:25:12.337657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.340188Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.340188Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:9ba1c47f93c2c745c7b82e487d831f8da312caaf2b3950a166feb260ab606cb4","observation_id":"15d8c122-4f41-4c45-a7a4-069feb3eed6c","resolution":{"observed_at":"2026-07-31T22:25:12.340188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.342513Z","title":"Vector quantized diffusion model for text-to- image synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.342513Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:ed8ac4dee5c49d00c8fca8b8e85c348604beca283ff844d75d6fb47ed9de2360","observation_id":"0aec3c25-ec3c-4859-9471-d528c50cf1f7","resolution":{"observed_at":"2026-07-31T22:25:12.342513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.344755Z","title":"Infin- ity: Scaling bitwise autoregressive modeling for high- resolution image synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.344755Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:fafdb32342cd4ee9a31a949675f9264a2d0cf105294672a969281ffaf2476243","observation_id":"e31f1a5e-c7fa-47ba-a508-fcb96e784532","resolution":{"observed_at":"2026-07-31T22:25:12.344755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00086","last_updated":"2024-11-05T12:25:32Z","snapshot_observed_at":"2026-08-18T10:32:50.281654Z","submitted_at":"2024-09-30T17:56:27Z","title":"ACE: All-round Creator and Editor Following Instructions via Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00086","snapshot_observed_at":"2026-07-31T22:25:12.347110Z","title":"Ace: All-round creator and editor following instructions via diffusion transformer.arXiv preprint arXiv:2410.00086, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.347110Z"},"links":{"cited_paper":"/paper/2410.00086","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:bf43054f559053870c1c07c3cdcdfcfb6dc4ec54fe5934b513e08494f7f85f85","observation_id":"84552ca4-33e6-4d78-803e-f9611a4dda57","resolution":{"observed_at":"2026-07-31T22:25:12.347110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.349570Z","title":"Stylebooth: Image style editing with multimodal instruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.349570Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:f50e0d07c88bc9c460a931cacedfa939d8e25683662376de878a9fcb7ce52b71","observation_id":"c8cabaf5-c8cd-4b7d-a5d7-c3478d797d06","resolution":{"observed_at":"2026-07-31T22:25:12.349570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.351865Z","title":"Gans trained by a two time-scale up- date rule converge to a nash equilibrium","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.351865Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:53f5ff7d4b92534aa7622267a57789bf35a7f405539680711b69e7844941cbc8","observation_id":"51781b98-6bc3-4c3d-916c-1cd05424d698","resolution":{"observed_at":"2026-07-31T22:25:12.351865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.354597Z","title":"Denoising diffusion probabilistic models.NeurIPS, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.354597Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:6eeed2d50e24ca939d2c1b6bfcb5a4a6d75ca0b74da00449c5ca233425a3ea9e","observation_id":"ca2dad9f-bba5-429f-a210-beec63a12208","resolution":{"observed_at":"2026-07-31T22:25:12.354597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.356906Z","title":"We- gen: A unified model for interactive multimodal gen- eration as we chat","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.356906Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:a2f53005a5c8453586e3dabfcad3abd6e3153a9f018ef9d9fd92ef3d93c86850","observation_id":"c4c1a126-225a-4c49-9d64-ec8723b51693","resolution":{"observed_at":"2026-07-31T22:25:12.356906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-31T22:25:12.359100Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.359100Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:ea5dd0bef48862b393d06a1aa564dee795a74a50833e99ab1bad5170c3fe093c","observation_id":"b414056c-e019-47b3-8885-34734ac17bad","resolution":{"observed_at":"2026-07-31T22:25:12.359100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.361555Z","title":"Unified language-vision pretrain- ing in llm with dynamic discrete visual tokenization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.361555Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:16a53c84a6f3a9bcb839fb984d118030c67482bb4cef5c0075a04ce9572c2290","observation_id":"c2cdd910-9f0b-4106-99cc-4e7822d3b419","resolution":{"observed_at":"2026-07-31T22:25:12.361555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.363879Z","title":"Video-lavit: Unified video- language pre-training with decoupled visual-motional tokenization.arXiv preprint arXiv:2402.03161, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.363879Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:499d3acf15cc67a49f29366b31f458d85ec16cf96580c741642d2b8d0b8d2270","observation_id":"d32d2bcd-5a3b-4122-bc22-253d4543b9e1","resolution":{"observed_at":"2026-07-31T22:25:12.363879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.366167Z","title":"Repurposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.366167Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:6129fe44169cc2092d23db2e6ae31940358b26b8fe3d92efc817aadfe5346d91","observation_id":"2a1c3dcd-356a-4de8-b3c6-d174d86e22e2","resolution":{"observed_at":"2026-07-31T22:25:12.366167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-07-31T22:25:12.368393Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.368393Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:23e49ecb35f10c06e0d439eb5f8633dcd0e84b39026341ce2f5584a7febb72fb","observation_id":"c1ce9ff2-7ba4-44d1-bf5a-b655501feca7","resolution":{"observed_at":"2026-07-31T22:25:12.368393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.371129Z","title":"Generating images with multimodal language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.371129Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:455ee7c72307df29ddf36cf2a879f02e0b418a8ab033f70c321fa29eb74e01b2","observation_id":"d8f05da1-551a-402f-a76a-3bd1ceb7b857","resolution":{"observed_at":"2026-07-31T22:25:12.371129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.373484Z","title":"Unleashing in- context learning of autoregressive models for few-shot image manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.373484Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:be00788b8f70c08ec1b5fb5fab695845a46da5098ba277916e117d4c8da4bd11","observation_id":"85878a66-cb0b-4f8f-b517-239758e8d597","resolution":{"observed_at":"2026-07-31T22:25:12.373484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.375860Z","title":"Lisa: Reason- ing segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.375860Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:3f60d219a6ebc28c3e08cbc75b54c01ce03f5b4199abe93ff098b5c5beac7bc9","observation_id":"3e0e1a7d-f80f-44d2-9b65-b62adb5a1881","resolution":{"observed_at":"2026-07-31T22:25:12.375860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.378498Z","title":"All-in-one image restora- tion for unknown corruption","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.378498Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:f342295912822b37c55ba027cc378ef9e4c5c457bae4a2a306f2c663cf786eb4","observation_id":"cccb1f47-df3d-458f-9c0b-7d06d736ae4e","resolution":{"observed_at":"2026-07-31T22:25:12.378498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-08-16T13:13:16.202764Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-07-31T22:25:12.380740Z","title":"Imagefolder: Autore- gressive image generation with folded tokens.arXiv preprint arXiv:2410.01756, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.380740Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:7377d5dac96a87cc5ef3226ce7924fe6721aa2570f31ee049126524d0ad8ab3d","observation_id":"cd358879-c884-476a-978b-545f7e2af462","resolution":{"observed_at":"2026-07-31T22:25:12.380740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10316","last_updated":"2025-05-05T16:31:12Z","snapshot_observed_at":"2026-08-17T08:50:55.801352Z","submitted_at":"2024-12-13T17:58:06Z","title":"BrushEdit: All-In-One Image Inpainting and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10316","snapshot_observed_at":"2026-07-31T22:25:12.383425Z","title":"Brushedit: All-in-one image inpainting and edit- ing.arXiv preprint arXiv:2412.10316, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.383425Z"},"links":{"cited_paper":"/paper/2412.10316","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:ab81430bc700b5b5acea8b49edfd3bf3066e28ddb43ff147812af1663ebe2bbc","observation_id":"a97e0a8b-e8fd-4119-9a1a-2a8bf26844e0","resolution":{"observed_at":"2026-07-31T22:25:12.383425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.385898Z","title":"Visualcloze: A universal image generation framework via visual in-context learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.385898Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:bd61197af8cdd4c9d8e807c855e11d81e84910e7fc396f01b42fc719cb3dd44c","observation_id":"a5c59884-995f-4e48-bf5e-1b1ffe0925a8","resolution":{"observed_at":"2026-07-31T22:25:12.385898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10406","last_updated":"2025-07-20T08:44:35Z","snapshot_observed_at":"2026-08-18T05:49:59.336266Z","submitted_at":"2025-03-13T14:31:52Z","title":"RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10406","snapshot_observed_at":"2026-07-31T22:25:12.388284Z","title":"Realgeneral: Unifying visual genera- tion via temporal in-context learning with video mod- els.arXiv preprint arXiv:2503.10406, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.388284Z"},"links":{"cited_paper":"/paper/2503.10406","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:149d7c07290d997b39c1734435937c5591102b76979c8f9daa928d719fd77761","observation_id":"f279ba0b-f1ff-424b-9ae6-0ce9dea986ed","resolution":{"observed_at":"2026-07-31T22:25:12.388284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.390820Z","title":"Visual instruction tuning.NeurIPS,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.390820Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:db5d367b85b3094ae65acfd7f70d3dd087559e4db38d7d50f369df399975e26f","observation_id":"80fc214a-9bbf-4e59-9eda-5eece282cbcf","resolution":{"observed_at":"2026-07-31T22:25:12.390820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.393698Z","title":"Improved baselines with visual instruction tun- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.393698Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:10da7c44543a5e8645c5fa1a4326a5808ed4a34038d13dda100767f3e606db9f","observation_id":"8326ca7a-5ede-443b-b5e0-eab0d85b20b8","resolution":{"observed_at":"2026-07-31T22:25:12.393698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-08-15T10:26:22.896514Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-31T22:25:12.396212Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.396212Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:6003b6d1f40a9155f755f146d7b42fda5ae76b3280cf9bac0c582987f8f0e9b2","observation_id":"11be3b96-43da-414c-a9db-57236ecc69a7","resolution":{"observed_at":"2026-07-31T22:25:12.396212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-31T22:25:12.398767Z","title":"Decou- pled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.398767Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:d62a35371b18d97ae114ab959934cd05af4a190bc777163a60142701d139456b","observation_id":"2b091bdb-d3a7-4937-92e7-22247fdeacb8","resolution":{"observed_at":"2026-07-31T22:25:12.398767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08916","last_updated":"2022-10-04T22:37:32Z","snapshot_observed_at":"2026-08-20T10:02:52.933360Z","submitted_at":"2022-06-17T17:53:47Z","title":"Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08916","snapshot_observed_at":"2026-07-31T22:25:12.401226Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks.arXiv preprint arXiv:2206.08916,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.401226Z"},"links":{"cited_paper":"/paper/2206.08916","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:bfb806223d9b6a3b2d3dd9aa46880ccb8153259af0df2db6a925e5bbf5b2c84b","observation_id":"5792015c-7b09-4844-ad46-4aa3ae0fcff8","resolution":{"observed_at":"2026-07-31T22:25:12.401226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.403742Z","title":"Unified-io 2: Scaling au- toregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.403742Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:b70518f84b028cdac09bfb4dea7b80135161524fe1bc48b940ad3d0d084c283a","observation_id":"045ad8d9-9239-4c51-b723-7ba249263b4e","resolution":{"observed_at":"2026-07-31T22:25:12.403742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.406020Z","title":"Multi- task collaborative network for joint referring expres- sion comprehension and segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.406020Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:abb2a8aff850ca86336577efd111ecfde3a9d05884da365a304806a706dbd424","observation_id":"16d6dea3-7374-493d-a76d-54b5d27291ca","resolution":{"observed_at":"2026-07-31T22:25:12.406020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-07-31T22:25:12.408624Z","title":"Open- magvit2: An open-source project toward democratiz- ing auto-regressive visual generation.arXiv preprint arXiv:2409.04410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.408624Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:744d1711f89a1082bb9d19f0f0c3667b36348e1ea02a5174ca697482e266f4e2","observation_id":"4617ca67-b4a3-4d52-b1cd-c31c7c0dec31","resolution":{"observed_at":"2026-07-31T22:25:12.408624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.411066Z","title":"Visual autoregressive modeling for instruction-guided image editing.arXiv preprint arXiv:2508.15772,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.411066Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:c481349a3685146aad3862c2e4e3fe8f3bb73ca6c973ccc74ce0d8a71f5d4964","observation_id":"59adc718-84bd-4d2f-b457-e55dd94f22a7","resolution":{"observed_at":"2026-07-31T22:25:12.411066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.413428Z","title":"Deep multi-scale convolutional neural network for dy- namic scene deblurring","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.413428Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:029a3d03d60ce6e90daa6bb30f909189d897106e5c59cdaff3aa769dafc05f3d","observation_id":"08225278-32bc-43ec-96d5-c6fcf3c042c1","resolution":{"observed_at":"2026-07-31T22:25:12.413428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-08-16T14:55:02.836558Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-07-31T22:25:12.415671Z","title":"Kosmos-g: Generat- ing images in context with multimodal large language models.arXiv preprint arXiv:2310.02992, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.415671Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:73c4a6e4f79de0c8f5819ca39d6fa486e2514f7533f328cf0c9816b47e77fe79","observation_id":"c3140dda-cb53-4d50-a7b9-a704c8732e78","resolution":{"observed_at":"2026-07-31T22:25:12.415671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-21T17:21:24.620300Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-31T22:25:12.418124Z","title":"Transfer between modalities with metaque- ries.arXiv preprint arXiv:2504.06256, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.418124Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:0e0e45ea1e3c47c4657145b3d83655d35309aec8879ee869f59407ef009a6b33","observation_id":"f1bf9407-fd57-46bd-b584-83f971ba7cd5","resolution":{"observed_at":"2026-07-31T22:25:12.418124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-31T22:25:12.420562Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.420562Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:7dfd399197e363262c74fa68618d181b318504b21471f815858e86f5214cf377","observation_id":"7098bfb0-794a-450f-abfe-77f6251ff240","resolution":{"observed_at":"2026-07-31T22:25:12.420562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18993","last_updated":"2025-01-31T09:53:47Z","snapshot_observed_at":"2026-08-11T15:19:34.535546Z","submitted_at":"2025-01-31T09:53:47Z","title":"Visual Autoregressive Modeling for Image Super-Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18993","snapshot_observed_at":"2026-07-31T22:25:12.423003Z","title":"Visual autoregressive modeling for image super-resolution.arXiv preprint arXiv:2501.18993, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.423003Z"},"links":{"cited_paper":"/paper/2501.18993","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:b62045abb09e0e6bab17030502370ef9fe032021dadf5f0d3869f514dc7f0879","observation_id":"7b8afe61-7b65-4fdd-9800-37704d6abed0","resolution":{"observed_at":"2026-07-31T22:25:12.423003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-07-31T22:25:12.425457Z","title":"Hierarchical text- conditional image generation with clip latents.arXiv preprint arXiv:2204.06125, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.425457Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:274fef0d3d1ae4b2961f166e0d7c5558f99a9481849c5233f992e979b149cf06","observation_id":"72e668ae-8e79-4956-a90b-fe29cd1fa75b","resolution":{"observed_at":"2026-07-31T22:25:12.425457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.428168Z","title":"High- resolution image synthesis with latent diffusion mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.428168Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:20f2535e80e899e5d5510624fba17b0b053c898d204f7fac8e25691b520232a3","observation_id":"0c3b323e-fea5-4775-a814-0c3b8438ebd1","resolution":{"observed_at":"2026-07-31T22:25:12.428168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02797","last_updated":"2025-06-12T03:04:07Z","snapshot_observed_at":"2026-08-10T12:12:06.267872Z","submitted_at":"2025-02-05T00:49:59Z","title":"Upweighting Easy Samples in Fine-Tuning Mitigates Forgetting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02797","snapshot_observed_at":"2026-07-31T22:25:12.430501Z","title":"Upweighting easy sam- ples in fine-tuning mitigates forgetting.arXiv preprint arXiv:2502.02797, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.430501Z"},"links":{"cited_paper":"/paper/2502.02797","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:079f7296137dabe370f5d076563cc44416dac127a69e5c21b66bfbcaac864b01","observation_id":"8e65ae95-452e-483c-bc48-f69654095d5b","resolution":{"observed_at":"2026-07-31T22:25:12.430501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-07-31T22:25:12.433199Z","title":"Laion-400m: Open dataset of clip- filtered 400 million image-text pairs.arXiv preprint arXiv:2111.02114, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.433199Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:32cc0cc636e55d584540f12171cd605336486116e88cdc57fe9c5f1b965643af","observation_id":"ac802f96-d384-4060-af78-f3a105e4494e","resolution":{"observed_at":"2026-07-31T22:25:12.433199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07812","last_updated":"2025-05-12T17:58:14Z","snapshot_observed_at":"2026-08-15T22:05:26.444507Z","submitted_at":"2025-05-12T17:58:14Z","title":"Continuous Visual Autoregressive Generation via Score Maximization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07812","snapshot_observed_at":"2026-07-31T22:25:12.435621Z","title":"Contin- uous visual autoregressive generation via score maxi- mization.arXiv preprint arXiv:2505.07812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.435621Z"},"links":{"cited_paper":"/paper/2505.07812","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:b98d978f4abee97fa386ac151c3f627cc836d8ffa06d96271386e2023057b4a1","observation_id":"701ec53c-3d93-48cb-9a7f-485e88bdf4b3","resolution":{"observed_at":"2026-07-31T22:25:12.435621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.438228Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.438228Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:2069e3257832c2de530ea55869c5cac0c36b4b1f7dc8efa45789efb20d5883e0","observation_id":"7a101895-df3e-4ee7-8d4b-2ae0bef2de74","resolution":{"observed_at":"2026-07-31T22:25:12.438228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.440553Z","title":"Indoor segmentation and support in- ference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.440553Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:8b5582780d3243191d374ea0070873c7374453c4d150dc82fcc865188865b194","observation_id":"3a549291-141d-4032-aca1-1b683144ca29","resolution":{"observed_at":"2026-07-31T22:25:12.440553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-07-31T22:25:12.442880Z","title":"Autore- gressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.442880Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:aa02d3707a7a4a09ac18daeaaab149c6f17e8206221a5595ede8d2bdefa57960","observation_id":"48c112d3-be58-48d4-a921-0d29d61becea","resolution":{"observed_at":"2026-07-31T22:25:12.442880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-07-31T22:25:12.445503Z","title":"Emu: Generative pretraining in multimodality.arXiv preprint arXiv:2307.05222, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.445503Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:453f164630be271375bd062d093600f27c3293782386a101f0e475f9d138afe1","observation_id":"1b0d6cda-314d-421c-8fa9-a22aff396974","resolution":{"observed_at":"2026-07-31T22:25:12.445503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.448289Z","title":"Generative multi- modal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.448289Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:f449c2032b965c64094664013ee12c811e340a749e7e5f4c5deee11e03f2b96e","observation_id":"312004ea-31bf-4222-8084-c1a26a8e25ed","resolution":{"observed_at":"2026-07-31T22:25:12.448289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01824","snapshot_observed_at":"2026-07-31T22:25:12.450878Z","title":"X-prompt: Towards universal in-context image generation in auto-regressive vision language foundation models.arXiv preprint arXiv:2412.01824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.450878Z"},"links":{"cited_paper":"/paper/2412.01824","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:3418a40d51dcc1ec36a9e7ac5ee842ab468f319bf9409fd404358159108acd1a","observation_id":"1dbba8e2-49a4-4769-8392-bf3f0ab74947","resolution":{"observed_at":"2026-07-31T22:25:12.450878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21193","last_updated":"2025-03-27T06:19:29Z","snapshot_observed_at":"2026-08-16T12:46:24.596358Z","submitted_at":"2025-03-27T06:19:29Z","title":"UGen: Unified Autoregressive Multimodal Model with Progressive Vocabulary Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21193","snapshot_observed_at":"2026-07-31T22:25:12.453642Z","title":"Ugen: Unified autoregressive multimodal model with progressive vocabulary learning.arXiv preprint arXiv:2503.21193, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.453642Z"},"links":{"cited_paper":"/paper/2503.21193","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:10be6ebe376c8ce5be12cdbb16072927a6a27f3d1ca20146e354685fb2477419","observation_id":"d0407919-c8d0-4e6b-880e-3121c98e042b","resolution":{"observed_at":"2026-07-31T22:25:12.453642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.456043Z","title":"Codi-2: In- context interleaved and interactive any-to-any genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.456043Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:955e06557a6f9da4d27abdfc73f2111a1451c94ce9772794cb3770d6c9b25bbe","observation_id":"77353f5f-9b4f-4b24-b5cd-3601d8c98cbc","resolution":{"observed_at":"2026-07-31T22:25:12.456043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-31T22:25:12.458309Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.458309Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:9d3b35c7f15b29e405957bc65da03d405ac91f47cc8d975c0eb959d4f317e32e","observation_id":"e1090e1a-92fe-436c-9f70-b4e87b4038a7","resolution":{"observed_at":"2026-07-31T22:25:12.458309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.460861Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.460861Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:c589c5b5c131ee2f3d24eed2c903cc1ab3f3e3baea7a57d1916c563d4e49458f","observation_id":"19852e8e-6ed6-4c12-b54d-43e0a6b18275","resolution":{"observed_at":"2026-07-31T22:25:12.460861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.463090Z","title":"Neural discrete representation learning.NeurIPS, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.463090Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:6bfa9a832c9e158872bc344fbd68e51bf305834b82230e46f9fe4512cf35e877","observation_id":"99ca34ec-d16b-44c0-b099-e2cc64d90db1","resolution":{"observed_at":"2026-07-31T22:25:12.463090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01819","last_updated":"2025-03-20T12:59:49Z","snapshot_observed_at":"2026-08-15T08:33:35.667211Z","submitted_at":"2024-12-02T18:57:41Z","title":"Switti: Designing Scale-Wise Transformers for Text-to-Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01819","snapshot_observed_at":"2026-07-31T22:25:12.465355Z","title":"Switti: Designing scale-wise trans- formers for text-to-image synthesis.arXiv preprint arXiv:2412.01819, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.465355Z"},"links":{"cited_paper":"/paper/2412.01819","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:d070eced721cd2b41f4ead7c512c23f703d1c3f78a5da5842ccae9a93bc554b2","observation_id":"19b39dc7-af7f-44bb-9f8c-ec145acd1cf1","resolution":{"observed_at":"2026-07-31T22:25:12.465355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.467766Z","title":"Editinfinity: Image editing with binary-quantized generative models.arXiv preprint arXiv:2510.20217, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.467766Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:5db191e5100bbf23bb80fd60fc0492acf5fab187f696fb785e851db675ec0aa5","observation_id":"f0abb4fa-9b33-47db-a2da-bc053033cc98","resolution":{"observed_at":"2026-07-31T22:25:12.467766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.469974Z","title":"Scalable autoregressive monocular depth estima- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.469974Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:a5f49e3ec06d7cbcb53a7e8ab0f1d1d2f9ec1d01d86f825f97d8142d7f7e1938","observation_id":"220bab46-f057-415f-9b21-8ff782c56faf","resolution":{"observed_at":"2026-07-31T22:25:12.469974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.472377Z","title":"Images speak in images: A gener- alist painter for in-context visual learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.472377Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:56323c624a06491ce332ad0ed23299750889cb0d7ffdca23d1f356e5f34620fb","observation_id":"85d40c92-a852-491b-92fd-2dd9161dbd56","resolution":{"observed_at":"2026-07-31T22:25:12.472377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-31T22:25:12.474539Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.474539Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:717a9ead7f9c4e1c30d25136abf762d8c2c9cb5348560c7e77876d47912666a4","observation_id":"91948141-7432-4cb5-aec4-002c784e95f8","resolution":{"observed_at":"2026-07-31T22:25:12.474539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23897","last_updated":"2025-03-31T09:46:56Z","snapshot_observed_at":"2026-08-17T05:00:14.785949Z","submitted_at":"2025-03-31T09:46:56Z","title":"Training-Free Text-Guided Image Editing with Visual Autoregressive Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23897","snapshot_observed_at":"2026-07-31T22:25:12.477030Z","title":"Training- free text-guided image editing with visual autoregres- sive model.arXiv preprint arXiv:2503.23897, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.477030Z"},"links":{"cited_paper":"/paper/2503.23897","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:0f20129d48ce14dce5f467dc4c81be9617e4c43a63779c86dc1333bdfb28d470","observation_id":"f1ce38e8-0954-4784-9e13-85bab18b492f","resolution":{"observed_at":"2026-07-31T22:25:12.477030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04560","last_updated":"2018-08-14T07:20:55Z","snapshot_observed_at":"2026-08-20T07:55:13.763100Z","submitted_at":"2018-08-14T07:20:55Z","title":"Deep Retinex Decomposition for Low-Light Enhancement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04560","snapshot_observed_at":"2026-07-31T22:25:12.479601Z","title":"Deep retinex decomposition for low-light en- hancement.arXiv preprint arXiv:1808.04560, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.479601Z"},"links":{"cited_paper":"/paper/1808.04560","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:ec5c57c2d995b9f2e007e56af5727b1481053957b2c1abbfdd29cc826648a2e3","observation_id":"1c3cc9e5-3ac9-4cf4-a2f7-39d8c51aea3b","resolution":{"observed_at":"2026-07-31T22:25:12.479601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.482026Z","title":"Omniedit: Building im- age editing generalist models through specialist super- vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.482026Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:ce215a450b59befbbe40b76634d4da8ef425e93a0744e731be0dba788edefd02","observation_id":"7cd61ee7-babe-4d5a-8ef3-f71f8bcb8240","resolution":{"observed_at":"2026-07-31T22:25:12.482026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.484287Z","title":"Janus: Decou- pling visual encoding for unified multimodal under- standing and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.484287Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:c1e0bc777ac9fe9a5cdf47789f6793c94c4f36708ca58007b946dfded41b3fb8","observation_id":"eef9ed57-eb0b-4bfe-83d1-bbe358b31708","resolution":{"observed_at":"2026-07-31T22:25:12.484287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-07-31T22:25:12.486685Z","title":"Qwen-image technical re- port.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.486685Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:9e8dcf9e5e4ebf1ead88152752d2844dfdb9c56a90356320125325bb0a53c704","observation_id":"b2d64675-c013-4a37-875c-afaf0af2e205","resolution":{"observed_at":"2026-07-31T22:25:12.486685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-08-18T21:48:45.801096Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-31T22:25:12.489096Z","title":"Omnigen2: Exploration to advanced multimodal generation.arXiv preprint arXiv:2506.18871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.489096Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:ab1341360b9698af828afb99ca5eacf6036ae98c0a9e506fcaf808f71efe6a19","observation_id":"fcd7a9f5-f02e-402f-9e0f-e0202e5281ab","resolution":{"observed_at":"2026-07-31T22:25:12.489096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-07-31T22:25:12.491727Z","title":"Vila-u: a uni- fied foundation model integrating visual understand- ing and generation.arXiv preprint arXiv:2409.04429,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.491727Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:cd4bfcfaf2af1e95230fd2c28e4aa53fb4c33511bcb1f1306b666814e126f168","observation_id":"f8275d40-b326-4ff3-8d6c-c81e75be37b7","resolution":{"observed_at":"2026-07-31T22:25:12.491727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.494341Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.494341Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:4b004d29d49564d8de47062c82e6c88dfade77f20095e507e49e85fc95611307","observation_id":"56998093-8e60-433b-a06c-b5342919fc38","resolution":{"observed_at":"2026-07-31T22:25:12.494341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-08-20T10:31:24.549119Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-07-31T22:25:12.496632Z","title":"Sana: Efficient high- resolution image synthesis with linear diffusion trans- formers.arXiv preprint arXiv:2410.10629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.496632Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:63215b93fcea59f8cc336cb85ab9c86d80c2571091665a15f8a107a678aa59b1","observation_id":"eb20b369-23ab-46c5-98fa-cdd2d7780366","resolution":{"observed_at":"2026-07-31T22:25:12.496632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.499090Z","title":"Universal instance perception as object discovery and retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.499090Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:709be2b883c9619d83773498348cf972a6aeb505e0855ea18331f66aacd1092a","observation_id":"d8d5dac1-99f0-4cd4-a6d4-73df69eb32d6","resolution":{"observed_at":"2026-07-31T22:25:12.499090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.501402Z","title":"Depth any- thing: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.501402Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:97231363b47455a8b0ad236f33d4f36063609bad038d11ae23382453562aa41f","observation_id":"b3d5856c-0454-46d2-a589-a40d4e97d264","resolution":{"observed_at":"2026-07-31T22:25:12.501402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.503588Z","title":"Lavt: Language-aware vision transformer for referring im- age segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.503588Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:e67cbd4c4a5219abbb0d3c1459c33e8cd0b4104571fa90139c5637e93beca5b2","observation_id":"3c76708c-7e80-47ff-a767-2da251d8f7e6","resolution":{"observed_at":"2026-07-31T22:25:12.503588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.505867Z","title":"Inverted pyramid multi-task transformer for dense scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.505867Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:f1ba1038bdf5aba6dbc83f5fbe4638d437b81c1691c95bacaef61323aa407717","observation_id":"1d31e769-3505-4918-999e-f24200b72bf9","resolution":{"observed_at":"2026-07-31T22:25:12.505867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.508251Z","title":"Modeling context in refer- ring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.508251Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:b2ab924b24dfb8cdf41f5c7ac0f87aa618d42bd7153dab6a3e298553767964e3","observation_id":"370fde71-d183-4bb3-9a12-583fc1e3fb91","resolution":{"observed_at":"2026-07-31T22:25:12.508251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21356","last_updated":"2025-07-15T09:23:42Z","snapshot_observed_at":"2026-08-16T11:46:59.313125Z","submitted_at":"2025-04-30T06:30:48Z","title":"Nexus-Gen: Unified Image Understanding, Generation, and Editing via Prefilled Autoregression in Shared Embedding Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21356","snapshot_observed_at":"2026-07-31T22:25:12.510892Z","title":"Nexus-gen: A unified model for image understanding, generation, and editing.arXiv preprint arXiv:2504.21356, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.510892Z"},"links":{"cited_paper":"/paper/2504.21356","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:6c7477ad3d11074a29c032b171a05d8689b3b3c601744339d8c1eb4a2a2e2648","observation_id":"da0e89d6-0140-48f0-9ed0-06b7cebddaeb","resolution":{"observed_at":"2026-07-31T22:25:12.510892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.513292Z","title":"Nextflow: Unified se- quential modeling activates multimodal understand- ing and generation.arXiv preprint arXiv:2601.02204,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.513292Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:abb9a277720e32dbc57a36b243f5b1b788ccf81ac8d50bc65cab5e6dfaab51e5","observation_id":"bb849754-410d-496e-ba3a-fdbd3ce91a82","resolution":{"observed_at":"2026-07-31T22:25:12.513292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.516022Z","title":"Uni-controlnet: All-in-one control to text-to- image diffusion models.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.516022Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:2940d4f72e39164d103fbd582add54b38bdee43e5811b5911fd381126a352658","observation_id":"8f8f0cc7-e32f-4d70-bc8c-3d19ae5305ee","resolution":{"observed_at":"2026-07-31T22:25:12.516022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.518490Z","title":"Diff-2-in-1: Bridging generation and dense perception with diffusion mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.518490Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:ec7116c74ef082460a412a587feeec33e7fbd646123ebab1bcbc22658b974ca9","observation_id":"40a518ba-3033-4f42-84c3-030078036fd8","resolution":{"observed_at":"2026-07-31T22:25:12.518490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12048","last_updated":"2024-02-19T11:02:05Z","snapshot_observed_at":"2026-08-16T14:17:22.875988Z","submitted_at":"2024-02-19T11:02:05Z","title":"Model Tailor: Mitigating Catastrophic Forgetting in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12048","snapshot_observed_at":"2026-07-31T22:25:12.520952Z","title":"Model tailor: Mitigating catastrophic forgetting in multi-modal large language models.arXiv preprint arXiv:2402.12048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.520952Z"},"links":{"cited_paper":"/paper/2402.12048","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:313808eb976fa69a7565ed2f7660dc419fce2d8f8555c56f703eb61cfa895418","observation_id":"dda4bdf1-3d3d-475f-8349-e056ac653c28","resolution":{"observed_at":"2026-07-31T22:25:12.520952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T22:25:12.523939Z","title":"Training-free geometric image editing on diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.523939Z"},"links":{"citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:3be421d73793e09f58723eac4390919d89a0da7d1e12d595c8a299090e9fc975","observation_id":"859dc7c9-0f5e-4c63-8d98-26e7d0516f98","resolution":{"observed_at":"2026-07-31T22:25:12.523939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12327","last_updated":"2025-01-21T17:50:43Z","snapshot_observed_at":"2026-08-19T05:52:15.731419Z","submitted_at":"2025-01-21T17:50:43Z","title":"VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12327","snapshot_observed_at":"2026-07-31T22:25:12.526450Z","title":"Segment the second person from the left","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.526450Z"},"links":{"cited_paper":"/paper/2501.12327","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:afea645eaef88842d0686c42798f77d9260564044c03fa0b65a4379a7870cdc7","observation_id":"2483e1c5-8177-4b4e-be7f-ee2e17676c4b","resolution":{"observed_at":"2026-07-31T22:25:12.526450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2607.24157."}