{"as_of":"2026-08-21T09:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a39f5e70bf34b66a0e8f759ccb14debb01582197d6310567b95efe082fb67695","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:56:59.808319Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:30:21.554689Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T15:19:51.779596Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01824","snapshot_observed_at":"2026-08-15T18:30:21.554689Z","title":"X-prompt: Towards universal in-context image generation in auto-regressive vision language foundation models.arXiv preprint arXiv:2412.01824, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19848","last_updated":"2025-06-24T17:59:55Z","snapshot_observed_at":"2026-08-20T06:25:49.912409Z","submitted_at":"2025-06-24T17:59:55Z","title":"ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T18:30:21.554689Z"},"links":{"cited_paper":"/paper/2412.01824","citing_paper":"/paper/2506.19848"},"observation_digest":"sha256:11c165634f3fea3062f35ceceeaa2eef7ed22e3bf3a8fa027599ce93aff5c974","observation_id":"03e39ec1-c5dc-4dcb-a655-5aad110f1693","resolution":{"observed_at":"2026-08-15T18:30:21.554689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"cited_work":{"arxiv_id":"2412.01824","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01824","snapshot_observed_at":"2026-08-05T15:19:51.779596Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","venue":"cs.CV","work_id":"6658310d-ba13-4a00-b1a1-ec9402587da5","year":2024},"citing_paper":{"arxiv_id":"2508.20096","last_updated":"2025-08-27T17:59:50Z","snapshot_observed_at":"2026-08-18T23:41:08.495825Z","submitted_at":"2025-08-27T17:59:50Z","title":"CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:50.820124Z"},"links":{"cited_paper":"/paper/2412.01824","citing_paper":"/paper/2508.20096"},"observation_digest":"sha256:e21b95234c11577366212107c76acdf4fbe96211a89b9d3b7746e1e7ac0e189b","observation_id":"84696db2-b6ed-48cf-9186-844744fabb5a","resolution":{"observed_at":"2026-08-05T15:19:51.797076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01824","snapshot_observed_at":"2026-08-03T21:15:46.208071Z","title":"X-prompt: Towards universal in-context image generation in auto-regressive vision language foundation models.CoRR, abs/2412.01824, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16107","last_updated":"2026-07-21T01:49:54Z","snapshot_observed_at":"2026-08-14T12:48:11.274679Z","submitted_at":"2025-11-20T07:02:06Z","title":"T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T21:15:46.208071Z"},"links":{"cited_paper":"/paper/2412.01824","citing_paper":"/paper/2511.16107"},"observation_digest":"sha256:c9fcbb41964d3da688b15c6eecbb1127c1e8255b5d7d8faa7e99fb5ce1512bae","observation_id":"bf4091d7-c1f8-4a74-b56b-357c74f87fa0","resolution":{"observed_at":"2026-08-03T21:15:46.208071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01824","snapshot_observed_at":"2026-07-31T22:25:12.450878Z","title":"X-prompt: Towards universal in-context image generation in auto-regressive vision language foundation models.arXiv preprint arXiv:2412.01824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24157","last_updated":"2026-07-27T08:35:09Z","snapshot_observed_at":"2026-08-19T08:34:58.925945Z","submitted_at":"2026-07-27T08:35:09Z","title":"UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T22:25:12.450878Z"},"links":{"cited_paper":"/paper/2412.01824","citing_paper":"/paper/2607.24157"},"observation_digest":"sha256:3418a40d51dcc1ec36a9e7ac5ee842ab468f319bf9409fd404358159108acd1a","observation_id":"1dbba8e2-49a4-4769-8392-bf3f0ab74947","resolution":{"observed_at":"2026-07-31T22:25:12.450878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01824/citation-record","integrity":"/paper/2412.01824/integrity","json":"/paper/2412.01824/citation-record.json","paper":"/paper/2412.01824"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-12T00:56:59.511711Z","title":"Dai, Orhan Firat, Melvin John- son, Dmitry Lepikhin, Alexandre Tachard Passos, Sia- mak Shakeri, Emanuel Taropa, Paige Bailey, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.511711Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:27d590b8d9063d72ca21d6eef0af40f66a3b196b441b6a1d4eb74b68f5f32fcd","observation_id":"5bfa5040-9f0b-4ece-bcaa-65e0cd1f737a","resolution":{"observed_at":"2026-08-12T00:56:59.511711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-12T00:56:59.516791Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.516791Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:48a61aa4ee55acd06144e93b69c91b890b3865177fceae7c6e73362bd586ff74","observation_id":"29acbec3-e92a-49f9-b0cc-fa34529d2034","resolution":{"observed_at":"2026-08-12T00:56:59.516791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.520501Z","title":"Es- timating and exploiting the aleatoric uncertainty in surface normal estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.520501Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:310f3786fbe1e4b89767848e10b7b35440e914b1c2b2d5b750cbccad2cff18db","observation_id":"c6312d3f-0ed7-427b-b6ab-345fe88efaa6","resolution":{"observed_at":"2026-08-12T00:56:59.520501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.523819Z","title":"Sequential modeling enables scalable learn- ing for large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.523819Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:d97cd1edbcbf38c54a3297da996c0c11aac95ac7b6173516c3203d30ea7934c9","observation_id":"9911dee2-13bb-4aae-bc9c-2aa0d6548acf","resolution":{"observed_at":"2026-08-12T00:56:59.523819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.527244Z","title":"Visual prompting via image inpaint- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.527244Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:7222c6c06a8092ce751545b6c3b474a6b48f25f00480c41417439bf83dc4e9a7","observation_id":"b4546b04-90ea-46b6-9bb2-ef7a93e0f190","resolution":{"observed_at":"2026-08-12T00:56:59.527244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.530640Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.530640Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:5c187e30d80f4932ce7637a48f2ba2bd091f3af9c4d4919d9ad37df25226ccc1","observation_id":"b7977445-e071-441d-9a4b-87c27b80b4d4","resolution":{"observed_at":"2026-08-12T00:56:59.530640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.533835Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.533835Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:4c5784ad562082fe684d60c78f695fa683fb8e9eaf303a2e1814d615fbe1dc4d","observation_id":"255aa901-836c-4acc-a5bb-1f5093ac596b","resolution":{"observed_at":"2026-08-12T00:56:59.533835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06241","last_updated":"2025-02-27T07:05:30Z","snapshot_observed_at":"2026-08-16T13:11:24.702254Z","submitted_at":"2024-10-08T17:56:33Z","title":"ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06241","snapshot_observed_at":"2026-08-12T00:56:59.543418Z","title":"Broadway: Boost your text-to-video gen- eration model in a training-free way","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.543418Z"},"links":{"cited_paper":"/paper/2410.06241","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:eb6083a0c17b179d3871493c1a81797e818b9e9b6387ccfe2f281d7a05ded512","observation_id":"554dec18-e5ac-483d-a105-35f235895d7e","resolution":{"observed_at":"2026-08-12T00:56:59.543418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.546965Z","title":"Learning photographic global tonal adjustment with a database of input / output image pairs","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.546965Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:c0077639bda9d3a2f9ea23b955e0ad8e8028fd1d746fce960a3bd54cbba7ca71","observation_id":"8204d8d1-e1bd-460a-9f34-aeecde2685fd","resolution":{"observed_at":"2026-08-12T00:56:59.546965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.549903Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.549903Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:5014883468425422f4f541a9f51517133fe12e9b1ce3929d324866c75785c0e8","observation_id":"9eaec335-1ec1-4f0c-8bd6-1c0d0a55ee68","resolution":{"observed_at":"2026-08-12T00:56:59.549903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.552932Z","title":"Masked-attention mask 9 transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.552932Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:902470b2e7ee5836ffc149ad74db9fa7fbd5e439ec798d812c006df01b52b184","observation_id":"2138bdf9-57e4-4c73-a5cc-b739ccfd801a","resolution":{"observed_at":"2026-08-12T00:56:59.552932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.555902Z","title":"Shazeer, Vinodkumar Prab- hakaran, Emily Reif, Nan Du, Benton C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.555902Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:014aefce55bf5bb44adad4b3fc6cc3e8771f6801bb2825a34487ed5dd71b9790","observation_id":"95668963-d6b0-426b-a6e4-f0e74ed8ca31","resolution":{"observed_at":"2026-08-12T00:56:59.555902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.558459Z","title":"Instruc- tir: High-quality image restoration following human instruc- tions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.558459Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:f34b20e31a1b0dc7dd127754623f96f80481adc66fa711b9c49b56c09160493c","observation_id":"4b10193d-ce38-4e8b-bc29-bc3a35456da4","resolution":{"observed_at":"2026-08-12T00:56:59.558459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-20T05:11:46.926766Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-12T00:56:59.560793Z","title":"Dreamllm: Synergistic multimodal com- prehension and creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.560793Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:5fc347b7fe2034ad07c29d4a5eac942e88a65d8d9720db3f40deb7ff8888a1be","observation_id":"af2b56f9-ff1f-4a6a-9cd2-5d273410e54b","resolution":{"observed_at":"2026-08-12T00:56:59.560793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.564386Z","title":"Internlm-xcomposer2: Mastering free-form text- image composition and comprehension in vision-language large model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.564386Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:70b13e802bf2d4b590dc83e2fd72a5bfd0bbee081fafccfbd6e844ab0fbdf1b8","observation_id":"047321ff-fb17-471c-b628-6501bf540668","resolution":{"observed_at":"2026-08-12T00:56:59.564386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T00:56:59.567054Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.567054Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:fc19769df52d540cde5d6f9ba9fe866bca647e778f551f7088f9eac72d6bb460","observation_id":"fb85be1a-ee18-42be-b289-08f4d43408ad","resolution":{"observed_at":"2026-08-12T00:56:59.567054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.570056Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.570056Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:e7d5c85d8f703ae905aaf8eb31c7d6232928df4be2c2b8ce110fb30a3b781337","observation_id":"55972e13-63d9-49c8-8a72-2fc5aebd8ef9","resolution":{"observed_at":"2026-08-12T00:56:59.570056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.572607Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.572607Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:ae63f66441f7e8e5723284537b6d5853a4bba2e465a5e519500102531d1220bf","observation_id":"3c4beb1c-4411-43cb-82ef-13fa678862bb","resolution":{"observed_at":"2026-08-12T00:56:59.572607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.552361Z","title":"Removing rain from single images via a deep detail network","venue":null,"work_id":"8d358ee2-e6d9-4085-aaec-dcbb18111988","year":2017},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.575359Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:1055dcd70fd12401052543777226c5a4318955a8e0baffbc816ecaca024737c5","observation_id":"9ccd74bd-8563-46fa-abff-8de2b8706926","resolution":{"observed_at":"2026-08-12T00:57:00.556021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00390","last_updated":"2024-03-16T07:21:34Z","snapshot_observed_at":"2026-08-20T05:44:19.951575Z","submitted_at":"2023-09-30T14:26:43Z","title":"InstructCV: Instruction-Tuned Text-to-Image Diffusion Models as Vision Generalists","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00390","snapshot_observed_at":"2026-08-12T00:56:59.577864Z","title":"Instructcv: Instruction- tuned text-to-image diffusion models as vision generalists","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.577864Z"},"links":{"cited_paper":"/paper/2310.00390","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:ec31c6019d9e5487f5944eb982ebc3d2d37b02dc888485883193b1445fc33254","observation_id":"f241de02-5408-4dac-8cb2-69f89fa3e553","resolution":{"observed_at":"2026-08-12T00:56:59.577864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-16T14:55:51.246316Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-12T00:56:59.580658Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.580658Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:bd194b0e78e0c2bb74afafc2e6fd7e403382aa9bc59cdd325f79de6c05b955d4","observation_id":"2a352133-5948-4b17-8b7c-4bd3dd3493a4","resolution":{"observed_at":"2026-08-12T00:56:59.580658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-12T00:56:59.583467Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.583467Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:37828204e87e85fb2cbf1d4af714c4af33e9ead2c2d01665c82750f948ade9ec","observation_id":"e58e58aa-8a1c-4340-80b9-ebb31f09af18","resolution":{"observed_at":"2026-08-12T00:56:59.583467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.542822Z","title":"Instructdiffusion: A generalist modeling inter- face for vision tasks","venue":null,"work_id":"fda3d53f-a6f2-445b-a7ac-4c13ecd18cfe","year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.586454Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:6617ce92fb1e051e581d901a2954dcb5b56d7ab679a46f4c0f03b8b37b00216d","observation_id":"b37ea80f-5399-499b-af47-4730d32667f6","resolution":{"observed_at":"2026-08-12T00:57:00.546585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.533394Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment","venue":null,"work_id":"965d868b-35b5-40ae-b7c7-d60a483b6585","year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.589163Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:a645995bd3c60844c4a934d82b6d2bfeef42583439da11d9d8e1bd6f82978610","observation_id":"1a13b393-9199-4a9e-9339-b6194817a20d","resolution":{"observed_at":"2026-08-12T00:57:00.536879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18071","last_updated":"2024-09-26T17:18:39Z","snapshot_observed_at":"2026-08-18T20:50:32.513503Z","submitted_at":"2024-09-26T17:18:39Z","title":"FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18071","snapshot_observed_at":"2026-08-12T00:56:59.592304Z","title":"Freeedit: Mask-free reference-based image editing with multi-modal instruction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.592304Z"},"links":{"cited_paper":"/paper/2409.18071","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:02ce39f33723fb173985de9ac83b0a057d8ddb855ea6d6b787c46c85b99ea1a6","observation_id":"15daa145-782f-4ccc-912b-ce5b9d7e1597","resolution":{"observed_at":"2026-08-12T00:56:59.592304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.596018Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.596018Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:e48cb8c8710b5bdf7c68cba041ce9ef5d7a7529de4758460bbfc17957cb437c3","observation_id":"c23aa687-ef92-47a1-a152-162285a5093a","resolution":{"observed_at":"2026-08-12T00:56:59.596018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-12T00:56:59.599391Z","title":"Rae, Oriol Vinyals, and L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.599391Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:c1b95c89e2e7e41e884550ebaf7313b523b094638936439f04df4ffdc3bdad9a","observation_id":"bedcf773-588e-41fa-9e76-dad461967606","resolution":{"observed_at":"2026-08-12T00:56:59.599391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-16T13:10:59.354278Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-12T00:56:59.603097Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate.arXiv preprint arXiv:2410.07167, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.603097Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:bfb5ff53f13a1b422e8f5c67f0d550445a0dbb93deb0ede6edc21641cbb20635","observation_id":"874e5f9d-2eff-4ffd-9b1c-7bc2eaa1a9ea","resolution":{"observed_at":"2026-08-12T00:56:59.603097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.517603Z","title":"Smartedit: Exploring complex instruction-based image editing with multimodal large lan- guage models","venue":null,"work_id":"cbab28d0-35d5-481b-ab8e-0efe9dce87a5","year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.606976Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:fb93ba254bf6ebdb5b5ad3190af26dc5169dde9854d712dd79f49ca54265b2d1","observation_id":"199e7cce-eab5-458b-8b02-b0795708f5bb","resolution":{"observed_at":"2026-08-12T00:57:00.521225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.509073Z","title":"Repurpos- 10 ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"796e0d46-2557-434a-b274-1d1792997d48","year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.610236Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:f7fe526ea5de652f9ef7551fe8911d0313b792d50072c1378c605221c141a26d","observation_id":"f26e6c39-a4f8-450d-bcb3-123e9c2a254c","resolution":{"observed_at":"2026-08-12T00:57:00.512163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-12T00:56:59.613812Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.613812Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:df51b20f34b9ebb41438a0967ee46fcb448f841af52f24d936af5353209d2bc1","observation_id":"c22d2bdd-3c91-45be-94e4-0ff28e766f5b","resolution":{"observed_at":"2026-08-12T00:56:59.613812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.500359Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"12c1f7d5-515f-4447-a21c-6f66654bfecd","year":2020},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.617027Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:7a26a6601d6aacba3fde23ed9fda07e3b3a6d9eb3c89bebc22d603bf35858847","observation_id":"3ecaca46-4ca0-44d1-926d-f17e32371c2f","resolution":{"observed_at":"2026-08-12T00:57:00.503713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.491014Z","title":"All-in-one image restoration for unknown corruption","venue":null,"work_id":"8b711c6f-50b0-45ad-be70-49a700ad3473","year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.620124Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:4139b3ed9b6230f4a0ba12229ff3688b78287c1dd4c5e6ef398a6d03abc61397","observation_id":"0aa70367-b215-4d66-907c-a89e72fe9042","resolution":{"observed_at":"2026-08-12T00:57:00.493925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.482614Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":"cb216a8d-434e-4264-8df5-5eea76a58bc0","year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.623258Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:93ebe40b8351c724350349cd9c3a73aa8bfff8b51dcec5002860e59ccce2de4e","observation_id":"85f473ed-78fd-4ebd-89e7-ef3849560b0b","resolution":{"observed_at":"2026-08-12T00:57:00.485722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-12T00:56:59.626403Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.626403Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:8c35fb89957ce1de57745784bca93deabdfe185423f5b8970fef21d27f67f307","observation_id":"9e2cacb5-52b9-4fd8-8c1e-3c07c138f222","resolution":{"observed_at":"2026-08-12T00:56:59.626403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-08-16T13:13:16.202764Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-08-12T00:56:59.629870Z","title":"Imagefolder: Autoregres- sive image generation with folded tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.629870Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:97e716c09cba4ce9d70b3df32414a722bfe061510a6c49b02d9f2e0b324b39a8","observation_id":"832c8996-a5a4-4d51-954e-2590435a78e5","resolution":{"observed_at":"2026-08-12T00:56:59.629870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05338","last_updated":"2024-10-22T04:22:16Z","snapshot_observed_at":"2026-08-16T13:44:59.124353Z","submitted_at":"2024-06-08T03:44:25Z","title":"MotionClone: Training-Free Motion Cloning for Controllable Video Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05338","snapshot_observed_at":"2026-08-12T00:56:59.633268Z","title":"Motionclone: Training-free motion cloning for controllable video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.633268Z"},"links":{"cited_paper":"/paper/2406.05338","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:141419ebeee8397a648fad557980205a1d378b2660e3b2a4e5cae2b660b9e692","observation_id":"68ace587-682e-44a5-a454-747b1d399901","resolution":{"observed_at":"2026-08-12T00:56:59.633268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-21T06:07:33.885436Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-12T00:56:59.636337Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.636337Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:6feed43f234ad9afd00a1fb5ba000c4a75090d330346d3475b1fea06721f3156","observation_id":"142d523d-929d-47ef-826e-9084208b1384","resolution":{"observed_at":"2026-08-12T00:56:59.636337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-20T06:14:05.136628Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-12T00:56:59.639527Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.639527Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:c3137a786710f93a190e6e06fbbcbe22a971356d25f65f11d52ef504cbb4ad0f","observation_id":"31cde6aa-6ae1-4f83-842c-bddaf0fc6804","resolution":{"observed_at":"2026-08-12T00:56:59.639527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17637","last_updated":"2024-10-23T07:56:48Z","snapshot_observed_at":"2026-08-18T04:41:50.261605Z","submitted_at":"2024-10-23T07:56:48Z","title":"MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17637","snapshot_observed_at":"2026-08-12T00:56:59.642476Z","title":"Mia-dpo: Multi-image augmented di- rect preference optimization for large vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.642476Z"},"links":{"cited_paper":"/paper/2410.17637","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:5e7dcae848d8aea364c204d4f186b484f92145b989d35481f159837f637bc4c4","observation_id":"27cab28d-099d-4893-b962-9a205a7dd291","resolution":{"observed_at":"2026-08-12T00:56:59.642476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.473695Z","title":"Unified-io: A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":"46f8ce87-f40e-4927-b1e1-7b686078a405","year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.645445Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:39fe7eef70e56e7f841f5443b54aa82d948f491f0767cc049ed12701d93683f4","observation_id":"9cae051f-4df6-42f4-9088-051fc050bfbc","resolution":{"observed_at":"2026-08-12T00:57:00.476994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-12T00:56:59.648332Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.648332Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:34a6759baf2f6b71176f42065c668f245a1d5d6bbc3fe2e5c8079c86e19118db","observation_id":"74a0d82e-affe-4917-bb1d-b664d0bb0b0d","resolution":{"observed_at":"2026-08-12T00:56:59.648332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10797","last_updated":"2025-02-19T06:00:55Z","snapshot_observed_at":"2026-08-18T11:01:01.238927Z","submitted_at":"2024-06-16T03:45:45Z","title":"STAR: Scale-wise Text-conditioned AutoRegressive image generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10797","snapshot_observed_at":"2026-08-12T00:56:59.651679Z","title":"Star: Scale-wise text-to- image generation via auto-regressive representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.651679Z"},"links":{"cited_paper":"/paper/2406.10797","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:75cd0f54d69d794b2652b7f24089866c6f16ad4f8aa200aaeaf11fd50a66b7e5","observation_id":"72ccaa16-a94b-40fc-bba6-6c2f5feba1b0","resolution":{"observed_at":"2026-08-12T00:56:59.651679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T00:56:59.655257Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.655257Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:8e4aad2a636b0bb89aa2cc16610bd477d1ce301e10474d71b2452cdb764cb2df","observation_id":"9a93f306-e501-44c1-b6e1-5fa294a51bc7","resolution":{"observed_at":"2026-08-12T00:56:59.655257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.658407Z","title":"Deep multi-scale convolutional neural network for dynamic scene deblurring","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.658407Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:a87a483e0f00145357dd8239d3036091f0fbf23d926aa6507fc0046f5d9ae48e","observation_id":"0e111547-fa6e-4197-9f10-66514e4e1ca3","resolution":{"observed_at":"2026-08-12T00:56:59.658407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.459289Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"cd0c9381-da4e-4ce4-ae3a-1e6d70a27994","year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.661720Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:4541d386b769f085f43d47367b9d81b1f7c6846df974454b05d57b18ffbd8f8c","observation_id":"863c6666-5de0-4b5f-877f-0322900e14f9","resolution":{"observed_at":"2026-08-12T00:57:00.462746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.450030Z","title":"Gpt-4 technical report","venue":null,"work_id":"25481b74-b5b1-409f-b0ae-8020f14f6774","year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.665029Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:c34d08e2c49a612bf21af01323e92748f85a02952d61b9844c1c482767abd69d","observation_id":"bb949fb4-704a-4199-8623-9cc2676b8c11","resolution":{"observed_at":"2026-08-12T00:57:00.453288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-12T00:56:59.668213Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.668213Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:5754b7bdb5eaff23906d91c30ca32f6d1faeb72e9469a03ee6173286efb38a43","observation_id":"84848d12-4ae2-42a0-a72b-bee436e31a94","resolution":{"observed_at":"2026-08-12T00:56:59.668213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02980","last_updated":"2025-05-30T13:51:09Z","snapshot_observed_at":"2026-08-16T14:37:23.328470Z","submitted_at":"2023-12-05T18:59:55Z","title":"GPT4Point: A Unified Framework for Point-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02980","snapshot_observed_at":"2026-08-12T00:56:59.671729Z","title":"Gpt4point: A unified framework for point-language understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.671729Z"},"links":{"cited_paper":"/paper/2312.02980","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:ad34f8814e958b4979648a21b2ef0549f81ad3b6d924cc2269191b912dec6b0f","observation_id":"b136387b-655e-491b-aef8-a7ef27d2d88a","resolution":{"observed_at":"2026-08-12T00:56:59.671729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.440597Z","title":"Gpt4point: A unified framework for point-language understanding and generation","venue":null,"work_id":"863383ca-f947-4930-92c4-c9739dda8f49","year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.674793Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:7484ac2aa6109ec8f300e0d8bb86d9c7ee0afd43ae5ca6544e01fa1aa235f2dc","observation_id":"e900c64a-1e02-4a64-bb5f-e2161ff8546b","resolution":{"observed_at":"2026-08-12T00:57:00.444084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06191","last_updated":"2024-07-08T17:59:55Z","snapshot_observed_at":"2026-08-17T14:02:42.927599Z","submitted_at":"2024-07-08T17:59:55Z","title":"Tailor3D: Customized 3D Assets Editing and Generation with Dual-Side Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06191","snapshot_observed_at":"2026-08-12T00:56:59.678101Z","title":"Tailor3d: Customized 3d assets edit- ing and generation with dual-side images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.678101Z"},"links":{"cited_paper":"/paper/2407.06191","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:73ae77f55c8a0a09a25c18553156ed6f05204f8b8210232f284223e6c0a4305d","observation_id":"825ef939-0a58-405d-a155-b340ced7a3f6","resolution":{"observed_at":"2026-08-12T00:56:59.678101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.430980Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"b5605a25-68ac-44d6-8d1b-2ad0915bae6e","year":2021},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.681555Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:72befda1f48e231dc4468a8cf9ef9543a6b68080f2e7195f7b779df139e27a5f","observation_id":"b7085699-5954-413c-8325-55e90c03c51a","resolution":{"observed_at":"2026-08-12T00:57:00.434621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.684841Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.684841Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:f7a9b853f5d8f0259d48e2e7e02c4a5614d289ce14224304f74a0f4d03257ae9","observation_id":"ed437bf1-73e5-430a-8284-32d7eb7f78fd","resolution":{"observed_at":"2026-08-12T00:56:59.684841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-12T00:56:59.688002Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.688002Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:f999873b2152ce4b88bf3fae2fd390798a2ba2a187d03175c419add7bcb872e4","observation_id":"ec5a1d25-08c5-48fb-983e-22c7894a4cf3","resolution":{"observed_at":"2026-08-12T00:56:59.688002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.415566Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"014432b1-b294-4da1-b366-2bc7df2debb8","year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.691537Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:e9df8586f9b089b8909a00035d97b13bc25c392a4391a7952123bb75bc7ad052","observation_id":"c68f39c7-933f-4d12-9f9b-769b79b13b48","resolution":{"observed_at":"2026-08-12T00:57:00.419092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17401","last_updated":"2024-05-27T17:51:08Z","snapshot_observed_at":"2026-08-19T14:07:21.921372Z","submitted_at":"2024-05-27T17:51:08Z","title":"RB-Modulation: Training-Free Personalization of Diffusion Models using Stochastic Optimal Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17401","snapshot_observed_at":"2026-08-12T00:56:59.694280Z","title":"Rb-modulation: Training-free personalization of diffu- sion models using stochastic optimal control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.694280Z"},"links":{"cited_paper":"/paper/2405.17401","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:1b36420c6a84b7a0a22c1d45d6d2000c8e814513da23738844bef4479af689d9","observation_id":"439ee319-2672-4f02-b6b5-4b13a4cc4248","resolution":{"observed_at":"2026-08-12T00:56:59.694280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.404315Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"b97da738-7f12-44f1-9d8c-b37954677664","year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.697253Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:2cbb6158e6deb2b4ad9d732d1b1029a3647a90f31ec28adb23de78384af5a272","observation_id":"23fd0597-9589-4072-b0e0-1ef186d965e6","resolution":{"observed_at":"2026-08-12T00:57:00.408917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.394834Z","title":"Emu edit: Precise image editing via recognition and gen- eration tasks","venue":null,"work_id":"66033ef0-fb8e-4948-9397-0dce7e8fbbaa","year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.700144Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:9dbdea6c31b927ebaf03526c00678d4ad2ecff6a0fe45dbfd9cf8985caa6e37f","observation_id":"64de6525-48f6-41dc-9372-75aad7c53018","resolution":{"observed_at":"2026-08-12T00:57:00.398101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.386099Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"98bc3dd2-434a-49ee-b0bf-0283905f9314","year":2012},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.702738Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:4846957006c7403def33a33e74465cc679a993d6d841451948b69cbc0cd5671e","observation_id":"41b9e1fd-bb7d-4783-9013-699820ed19c1","resolution":{"observed_at":"2026-08-12T00:57:00.389297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-12T00:56:59.705352Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.705352Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:8523a633af2fc0305509206012ad1c5230d55df7234edf5cf8583c019dc9ff7a","observation_id":"e5966f0a-97fd-4a77-8b17-6ce0b66c6bf6","resolution":{"observed_at":"2026-08-12T00:56:59.705352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-08-13T22:05:34.844117Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-12T00:56:59.708401Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.708401Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:8470755aaefbfa053ec9fb99f22ba6f7117f96e7089c6fc0475ce8318eeebb45","observation_id":"679f3e18-3360-425a-9b0a-40f73e19dc24","resolution":{"observed_at":"2026-08-12T00:56:59.708401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.711162Z","title":"Emu: Generative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.711162Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:cf1675eee316977c02012b51aaea67a62bc27d6ad2ca47ab2bd5baa4cd4d3d18","observation_id":"a4ffc111-bdf7-48c4-a07d-c2be88e849c3","resolution":{"observed_at":"2026-08-12T00:56:59.711162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.713917Z","title":"Generative multimodal mod- els are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.713917Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:46788cc56ed14e702dfcc0bc7f9d63f379be85976faddce4854a40705b7a49a7","observation_id":"2b766934-8a3b-40db-89c4-4453644f1d31","resolution":{"observed_at":"2026-08-12T00:56:59.713917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.367045Z","title":"Alpha- clip: A clip model focusing on wherever you want, 2023","venue":null,"work_id":"13c0e132-7fe0-4f4f-9e56-f4fd004db31f","year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.716602Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:4255305e50ea62d6f638003017b38ac3e48e90d016b1e9255a683d38d49d2d66","observation_id":"6133a99f-cd74-409a-b854-bfeed499aab6","resolution":{"observed_at":"2026-08-12T00:57:00.370352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10812","last_updated":"2024-10-14T17:59:42Z","snapshot_observed_at":"2026-08-16T13:09:29.086289Z","submitted_at":"2024-10-14T17:59:42Z","title":"HART: Efficient Visual Generation with Hybrid Autoregressive Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10812","snapshot_observed_at":"2026-08-12T00:56:59.719288Z","title":"Hart: Efficient visual generation with hybrid au- toregressive transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.719288Z"},"links":{"cited_paper":"/paper/2410.10812","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:dd6ef1f819d47a0743ab9fdccc3797354859f8cec11c943edae057b11a6999f1","observation_id":"af1355ad-b7f9-47f8-87dd-2d990dd38077","resolution":{"observed_at":"2026-08-12T00:56:59.719288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-12T00:56:59.722132Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.722132Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:2a6ea23ea73093439177ab760f56ca3e6c1c7b877b0fc88049123f477182ca19","observation_id":"46b6ba75-12ef-4c79-820a-e2486ba25db7","resolution":{"observed_at":"2026-08-12T00:56:59.722132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-08-16T14:03:52.109479Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-12T00:56:59.725425Z","title":"Visual autoregressive modeling: Scalable im- age generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.725425Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:386e55af1609d2ca8d5106096098def5a675364802f4001c19e9b6cf47f88c28","observation_id":"fb423553-6403-4e51-b4e3-d974705d62cf","resolution":{"observed_at":"2026-08-12T00:56:59.725425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T00:56:59.728864Z","title":"Llama: Open and efficient foundation lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.728864Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:e0421cf0b2ec9be0343ed944aa7c4667eb9e545146710a83b608568b503fba9b","observation_id":"c6bd74ac-59e0-45c6-8a01-ff96dcad33fb","resolution":{"observed_at":"2026-08-12T00:56:59.728864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.732778Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.732778Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:ab7b9465aa0c6241f307e12de8404dae981b880756e0c727f5ae0654f7acda93","observation_id":"e233f119-89dc-4dd4-a4f2-78ee6f39916a","resolution":{"observed_at":"2026-08-12T00:56:59.732778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T00:56:59.736081Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.736081Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:1e5eb941511bc8d738c09dc0f1c24eaea52b6cfa41493cdeb54d5dca3229e31a","observation_id":"bcedd024-df6f-4a0c-aa2b-fa7f9767d2e6","resolution":{"observed_at":"2026-08-12T00:56:59.736081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.353127Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":"8644c0e9-6764-47d6-ba88-0cb843f00498","year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.739715Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:348111f3adf56fa6c7295074dceb352e7bbd4ec89a74717df7a3d3e4aaae2b15","observation_id":"c4b1cc3b-203c-4213-8471-e3764113e26d","resolution":{"observed_at":"2026-08-12T00:57:00.356301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-16T15:42:11.267112Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-12T00:56:59.742838Z","title":"Seggpt: Segmenting ev- erything in context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.742838Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:1f69ba46f2d4527973f1ed71dd641f6a337ee19a2d6f7d0b2d359b1739d0dad4","observation_id":"3b5255e3-d242-4e42-ac82-a20abc71799d","resolution":{"observed_at":"2026-08-12T00:56:59.742838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-12T00:56:59.746232Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.746232Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:1fd01da7c7a5ce3a11c5890a8ee07c17b2b4ad45b9abf96adfbedd8f3af9fef8","observation_id":"9558197c-75cd-41c3-a606-b08d4cdbee71","resolution":{"observed_at":"2026-08-12T00:56:59.746232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04560","last_updated":"2018-08-14T07:20:55Z","snapshot_observed_at":"2026-08-20T07:55:13.763100Z","submitted_at":"2018-08-14T07:20:55Z","title":"Deep Retinex Decomposition for Low-Light Enhancement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04560","snapshot_observed_at":"2026-08-12T00:56:59.750151Z","title":"Deep retinex decomposition for low-light enhancement","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.750151Z"},"links":{"cited_paper":"/paper/1808.04560","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:9e4ee330fd006071a46691f79916956d1d5adf3432e2d61879925da5f0797775","observation_id":"75b4d6ec-fd1c-442b-95de-ce81cc6197ba","resolution":{"observed_at":"2026-08-12T00:56:59.750151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-12T00:56:59.753498Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.753498Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:a37073eb54511545035ff9e9ddf08d6da384c4df41965c9900236bf5887aeb35","observation_id":"34c5a393-e22f-4037-ac96-b40136512a9a","resolution":{"observed_at":"2026-08-12T00:56:59.753498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-12T00:56:59.756955Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.756955Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:0bb8daa49ae42e2419d9a5a5880935364ca5ed6b0c7f5c02bb65f8114513c4c9","observation_id":"70807277-4dcf-418b-af70-11f113fbdd21","resolution":{"observed_at":"2026-08-12T00:56:59.756955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-12T00:56:59.760360Z","title":"Vila-u: a unified foundation model inte- grating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.760360Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:611ef4ff372fd4ca79c68447cf8f1d1098eea01105663c69139a3c9bd33eb1d4","observation_id":"52c3278d-7f0a-419e-8630-568d51058738","resolution":{"observed_at":"2026-08-12T00:56:59.760360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-20T07:26:30.722636Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-12T00:56:59.763167Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.763167Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:11892122645b8ad5ca76e4a037296ebac4c55bfb3205776b75059e66cbd378fb","observation_id":"8f71053a-6c9e-4994-bd71-8f1cd7587618","resolution":{"observed_at":"2026-08-12T00:56:59.763167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-12T00:56:59.766390Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.766390Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:f1d30ca5b89a4184621f9738958109af326c0af917c16eb6dcd61f571026e179","observation_id":"1fb8cc4e-b2e6-4657-bb56-9a2b6144c798","resolution":{"observed_at":"2026-08-12T00:56:59.766390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-12T00:56:59.769394Z","title":"Pyramiddrop: Accelerating your large 12 vision-language models via pyramid visual redundancy re- duction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.769394Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:bd877ecd7c135ce127be6c47bc668195ef8a82dc5faf1cf4c72002766c6ce8b9","observation_id":"f0f3ddc0-aaab-4290-9511-f751322438fa","resolution":{"observed_at":"2026-08-12T00:56:59.769394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.772416Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.772416Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:533431887218ac002f0a0c21be28fc334e6e194d6a2c9a67a23ca8743dc541ca","observation_id":"79a5fc81-a78f-4cd0-919a-e74d5ae98d2c","resolution":{"observed_at":"2026-08-12T00:56:59.772416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13252","last_updated":"2025-02-21T16:06:37Z","snapshot_observed_at":"2026-08-16T13:24:15.777384Z","submitted_at":"2024-08-23T17:50:23Z","title":"LayerPano3D: Layered 3D Panorama for Hyper-Immersive Scene Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13252","snapshot_observed_at":"2026-08-12T00:56:59.774838Z","title":"Layer- pano3d: Layered 3d panorama for hyper-immersive scene generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.774838Z"},"links":{"cited_paper":"/paper/2408.13252","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:6e1ba2dc883558e81a4b19791c4f3e05c0e69cf10d7e24b7987c292ae5e34a01","observation_id":"c03bbacd-17d7-4f0b-a5a7-023eb186eb85","resolution":{"observed_at":"2026-08-12T00:56:59.774838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.338801Z","title":"Deep joint rain detection and removal from a single image","venue":null,"work_id":"77812bbd-6f5e-4505-ae92-50f16c9d9533","year":2017},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.777790Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:d78641d70ffb46f170f2a494a03bbb51dd59e2d4e7d030e95f074e90f4d68397","observation_id":"8b5763c5-0701-45f2-b971-f0d2af69017a","resolution":{"observed_at":"2026-08-12T00:57:00.341899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.329743Z","title":"Inverted pyramid multi-task trans- former for dense scene understanding","venue":null,"work_id":"364a68cf-ef50-4042-ba15-1aea563f6c66","year":2022},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.780553Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:aee61c13744db7ddfd2da8b9539af5889e2a74565705211939c9a47c680b6e27","observation_id":"46906c86-bcfd-4deb-b086-409d8db8df58","resolution":{"observed_at":"2026-08-12T00:57:00.332943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-12T00:56:59.783126Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.783126Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:77b00932bc16cf81371c20571ca10e6e7b468244e3776ff01622df721aca22cb","observation_id":"0d4f2d3c-152a-4334-83b2-7a10cbbabb39","resolution":{"observed_at":"2026-08-12T00:56:59.783126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-16T15:03:02.519968Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-12T00:56:59.785833Z","title":"Scaling autoregressive multi- modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.785833Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:7c527e141de8fdb1718cf52aec37434ef96f31e474e8def20c1ee8d35c81a07e","observation_id":"dbc6f3a2-9a93-4714-9cd9-11aeb2765524","resolution":{"observed_at":"2026-08-12T00:56:59.785833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.319806Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"c709bc7b-e47b-497a-a5cd-afdaa471fd1b","year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.789002Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:012c2ebfc0fe65f7b543b30dfa75ed8ea73eb81956ea5a3cc7dcd59340f50ede","observation_id":"1d50d04c-4829-421e-a1f5-fbfcd7359f6d","resolution":{"observed_at":"2026-08-12T00:57:00.323390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.792082Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.792082Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:5be6cd0fa10f4be7b7d0146ff90baf916d7001e1fcf5ce1bfe22360e124d1bd1","observation_id":"4052ce3d-8bad-4811-9379-49d31fa50f94","resolution":{"observed_at":"2026-08-12T00:56:59.792082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:57:00.301583Z","title":"Internlm-xcomposer: A vision-language large model for ad- vanced text-image comprehension and composition, 2023","venue":null,"work_id":"fc6cec4e-1822-4518-9cca-6250387979b2","year":2023},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.795238Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:bd21b848f3f7494ec2df81ba76d869b55d5c0bba62ef1eb21fb1146681bea609","observation_id":"d91d5ab1-9ccd-4d7d-9f55-7832c2d40ba3","resolution":{"observed_at":"2026-08-12T00:57:00.307195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01181","last_updated":"2024-08-02T11:03:22Z","snapshot_observed_at":"2026-08-19T11:52:53.748852Z","submitted_at":"2024-08-02T11:03:22Z","title":"VAR-CLIP: Text-to-Image Generator with Visual Auto-Regressive Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01181","snapshot_observed_at":"2026-08-12T00:56:59.798606Z","title":"Var-clip: Text-to-image gen- erator with visual auto-regressive modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.798606Z"},"links":{"cited_paper":"/paper/2408.01181","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:e40a454d798465adc3cda488a573be188b5edc01b1e3b3f7b4bd385e8b39ef7c","observation_id":"032a2303-6d34-4de3-9c41-6cd1f5d933b1","resolution":{"observed_at":"2026-08-12T00:56:59.798606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05282","last_updated":"2024-12-19T04:42:41Z","snapshot_observed_at":"2026-08-20T07:25:44.448673Z","submitted_at":"2024-07-07T06:50:22Z","title":"UltraEdit: Instruction-based Fine-Grained Image Editing at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05282","snapshot_observed_at":"2026-08-12T00:56:59.801968Z","title":"Ultraedit: Instruction-based fine-grained im- age editing at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.801968Z"},"links":{"cited_paper":"/paper/2407.05282","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:d2fa125136e1c202b1ed16a63e3468c92ae2fe737de70d30131e36e762591b3b","observation_id":"4d3d874a-6126-4c04-859a-4692e5ef9177","resolution":{"observed_at":"2026-08-12T00:56:59.801968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:56:59.805205Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.805205Z"},"links":{"citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:a96ea175e176139a4688daf0829ca3f43c4da7301bdb2df1b7834f0c2156bcb2","observation_id":"8b51fed7-f510-4b7d-afc0-9beec1bd5c25","resolution":{"observed_at":"2026-08-12T00:56:59.805205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-12T00:56:59.808319Z","title":"Do you think the two image shares the same semantics and basic layout [Yes/No]? Provide your reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.808319Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:d0f30a731157cc5c3eb69499060a51725df441f6bc424bbd6e5a9033d3c59cca","observation_id":"11cc75af-ed41-433b-b5bb-1077f47aa075","resolution":{"observed_at":"2026-08-12T00:56:59.808319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T17:10:47.562227Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 4 inbound Pith citation observations for arXiv:2412.01824."}