{"as_of":"2026-08-08T08:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:083f742b04712c154a34ca958add48a18c288ade6ed3c1f6ae8c107a049de04f","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:50:00.171859Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T15:30:23.485228Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:08:50.357414Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"cited_work":{"arxiv_id":"2506.06962","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06962","snapshot_observed_at":"2026-07-03T19:08:50.357414Z","title":null,"venue":null,"work_id":"1a276b07-4baf-4b72-8e0b-42a0537a37ae","year":2025},"citing_paper":{"arxiv_id":"2606.17619","last_updated":"2026-06-16T07:25:08Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:25:08Z","title":"RAVA: Retrieval-Augmented Viewpoint Alignment for Subject-Driven Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T02:02:32.008630Z"},"links":{"cited_paper":"/paper/2506.06962","citing_paper":"/paper/2606.17619"},"observation_digest":"sha256:f8feb66f7c3911ffb6d66b0286ec36f7db911ddf9c934c772338559ce53601b4","observation_id":"35aaae44-7d4c-4e64-9b36-1725aad98f1b","resolution":{"observed_at":"2026-07-03T19:08:50.358851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06962","snapshot_observed_at":"2026-07-14T15:30:23.485228Z","title":"arXiv , author =:2506.06962v3 , primaryclass =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09803","last_updated":"2026-07-09T17:52:16Z","snapshot_observed_at":"2026-08-06T03:03:16.058770Z","submitted_at":"2026-07-09T17:52:16Z","title":"Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T15:30:23.485228Z"},"links":{"cited_paper":"/paper/2506.06962","citing_paper":"/paper/2607.09803"},"observation_digest":"sha256:9260d467fa1bcb945a25231c6599ed1d10ae6fba1a610e345f80d4c04426bf2c","observation_id":"2571aa8b-e431-40b6-a160-2ce29f98cc57","resolution":{"observed_at":"2026-07-14T15:30:23.485228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06962/citation-record","integrity":"/paper/2506.06962/integrity","json":"/paper/2506.06962/citation-record.json","paper":"/paper/2506.06962"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.625025Z","title":"Towards effective long conversation generation with dynamic topic tracking and recommendation","venue":null,"work_id":"41de8707-fd71-46bb-b9b0-9c4f34126165","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.961345Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:7b918fc5afe56e0668f34fa662bb0ae395fa5f9b4ae159db966e50c874de7931","observation_id":"307a66ff-295c-46cb-bb6f-ec99d41db689","resolution":{"observed_at":"2026-08-07T05:50:00.628400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T05:49:59.965544Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.965544Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:15d51e35082a1790ba616af0ec9d44c1d0971edcb7411f7e2f7dc49fb0014106","observation_id":"64d2be91-7b55-4ca0-9f5e-a21372a01e21","resolution":{"observed_at":"2026-08-07T05:49:59.965544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.615368Z","title":"Semi- parametric neural image synthesis","venue":null,"work_id":"d0e85105-2871-4dca-88ca-2c52156255d9","year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.969799Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:88d61bd292237ac99bcc158444dc473597a9f15e3df71321ee0604e77be98612","observation_id":"b7133e25-9690-4eb0-9f8f-b9fed9bc8a5a","resolution":{"observed_at":"2026-08-07T05:50:00.618793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.605982Z","title":"Improving language models by retrieving from trillions of tokens","venue":null,"work_id":"724c4d1e-b9a6-4464-819e-0b3851d7f16a","year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.973438Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:1d48ca0f55b435948e18da8910f799a206e7442275a0f0e5536b39311649d722","observation_id":"853e6cb8-e911-4077-bd24-f8122edc0d23","resolution":{"observed_at":"2026-08-07T05:50:00.609366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08981","last_updated":"2021-03-30T08:20:34Z","snapshot_observed_at":"2026-07-06T10:42:19.278531Z","submitted_at":"2021-02-17T19:15:53Z","title":"Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08981","snapshot_observed_at":"2026-08-07T05:49:59.977186Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts.CoRR, abs/2102.08981, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.977186Z"},"links":{"cited_paper":"/paper/2102.08981","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:b7f81fb4ca5c9d3da650e6bd6c67a0fbc179c5d7dd041fe4b2c692016181adb5","observation_id":"8dc5c7c3-b4f4-4086-9b32-c5b43d10ab15","resolution":{"observed_at":"2026-08-07T05:49:59.977186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.596596Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset, 2025","venue":null,"work_id":"e9314f32-1a88-4472-8db1-f2e0a81fa995","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.981218Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:0f94eff720803483d132e05c7d6c39ec8ce8e14284c3ee2fa5fe8ce600353ff8","observation_id":"6fbb9673-30f8-4505-bdf4-16b290fd4bd1","resolution":{"observed_at":"2026-08-07T05:50:00.600119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T05:49:59.985139Z","title":"Kwok, Ping Luo, Huchuan Lu, and Zhenguo Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.985139Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:26298ea22fa464d0c5ce0173ec9961789e62eb9a647c5b06b400004d38810016","observation_id":"edc6de30-0e8c-4e32-9f24-4fc7fecabb7f","resolution":{"observed_at":"2026-08-07T05:49:59.985139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.587290Z","title":null,"venue":null,"work_id":"95fef598-e837-4467-87a7-19be9f7769d4","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.988929Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:3f12567a6efcdd62e53aae0901564bb951999e78a15601c9f22eb1346c4a270d","observation_id":"61b5f847-b241-42e2-95f0-87370469fcc7","resolution":{"observed_at":"2026-08-07T05:50:00.590447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T05:49:59.992508Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.992508Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:6f187bc40f166148a36da2e336ebd3b63f7e9ba1a6ff6cec64884300eef6e604","observation_id":"bc8cf03a-588d-4227-b39a-0cc1377e3a2b","resolution":{"observed_at":"2026-08-07T05:49:59.992508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:59.996279Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.996279Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:d2ea0d3f6590b11fcee77b4f6b5ee723aa6ca057c3885becada22029a97b7532","observation_id":"9fd6a6ae-f5f2-4cec-b0ff-ef2f1e7a0748","resolution":{"observed_at":"2026-08-07T05:49:59.996279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.13753","last_updated":"2022-12-01T06:29:07Z","snapshot_observed_at":"2026-07-06T13:46:33.740204Z","submitted_at":"2022-08-29T17:37:29Z","title":"Frido: Feature Pyramid Diffusion for Complex Scene Image Synthesis","version":2},"cited_work":{"arxiv_id":"2208.13753","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.13753","snapshot_observed_at":"2026-08-07T05:50:00.333041Z","title":"Frido: Feature Pyramid Diffusion for Complex Scene Image Synthesis","venue":"cs.CV","work_id":"734b6ad3-ce16-48a1-a942-fed3436050ee","year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:59.999949Z"},"links":{"cited_paper":"/paper/2208.13753","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:7e0b5e40e078eef4e4c089551139e955ecbd3eef6c2f6d398b2009dabdbd8392","observation_id":"712fa45b-7698-41e3-9489-b55fb1d5ff61","resolution":{"observed_at":"2026-08-07T05:50:00.336946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.571354Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"0ef44724-9b5a-4807-8c16-1bf56a4ec663","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.005484Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:2c2865876fd995a1accfac529bbfa70568119bfdc1515f3e77b159c9edf37e18","observation_id":"9bfc47b3-12fd-4b45-8bf0-6cf8b4d85b49","resolution":{"observed_at":"2026-08-07T05:50:00.575249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T05:50:00.010895Z","title":"Retrieval-augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.010895Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:a94b3a378bcc061490f8ab4257dd3e477f15369036bd32b596bd40789ea8fb28","observation_id":"a5881580-67cb-47b6-b134-e35e02448a99","resolution":{"observed_at":"2026-08-07T05:50:00.010895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-07-06T16:34:42.650324Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-07T05:50:00.027350Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.027350Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:9514e35bfa2fa9066b84b35553f1375178a6eeb73c55b3c2ff646d538305a934","observation_id":"91435f76-e0a6-45e5-9e40-fbd69a2b279f","resolution":{"observed_at":"2026-08-07T05:50:00.027350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-08-07T05:50:00.032601Z","title":"Kat: A knowledge augmented transformer for vision-and-language","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.032601Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:308faa8cbc55366b0247a53d539979d5aba747c2e109a2f994fe73aebadab62d","observation_id":"976b4ea1-7398-408c-a3d0-a5c54e7311f6","resolution":{"observed_at":"2026-08-07T05:50:00.032601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.561310Z","title":"Retrieval augmented language model pre-training","venue":null,"work_id":"efaba877-1636-429e-b235-644321104433","year":2020},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.037991Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:b1133500b96171f3d8c47e3b077a8774fa60c251f738a6fd98dc5c22094c0e6e","observation_id":"438992b0-6d5d-445b-a6ca-e037a5afacd0","resolution":{"observed_at":"2026-08-07T05:50:00.564800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.551397Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"05db4842-6a06-4cdc-afd4-84b601c513ce","year":2017},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.043443Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:5de5694cd1735ac89eaf62ba68082ee52cfd7913a9a224ab9ab5c18a1aaf85b7","observation_id":"a2241fd9-aea4-4d72-ae9f-64a2c82d567c","resolution":{"observed_at":"2026-08-07T05:50:00.555078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.050319Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.050319Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:646935d36be1b15850b08791d5d840f5d0ad7ce4022b2d86d97a2d69b0316268","observation_id":"07593543-70da-4052-a4e0-17c4bf3870a1","resolution":{"observed_at":"2026-08-07T05:50:00.050319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.536277Z","title":"Leveraging passage retrieval with generative models for open domain question answering","venue":null,"work_id":"9323923d-0b15-49f7-8503-0c20babc6554","year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.056179Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:e6ab91a188984922d0cb0b4a139ba2ade103d00b8b4533ef0852cc907e19fed3","observation_id":"4511be7b-e668-486c-88e3-0cf1da95883e","resolution":{"observed_at":"2026-08-07T05:50:00.539575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.526949Z","title":"Rethinking fid: Towards a better evaluation metric for image generation","venue":null,"work_id":"aec73b88-ff39-46ea-b12e-b0daebd77631","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.061164Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:1c2f76439aa732df7ba59df9e86cfd794bad7115b8377677a71a0af0908ff82b","observation_id":"35a7268c-9765-4e22-a072-b5984384abc1","resolution":{"observed_at":"2026-08-07T05:50:00.530349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.065535Z","title":"Billion-scale similarity search with GPUs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.065535Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:807836adc21776f6a50f157d1e4593784184cfe9e3e458a1ac48d2d2e3c22d09","observation_id":"613a8570-b4cd-44e3-bb7e-2010c1fb22d9","resolution":{"observed_at":"2026-08-07T05:50:00.065535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04269","last_updated":"2023-04-09T16:21:43Z","snapshot_observed_at":"2026-07-31T00:56:36.756307Z","submitted_at":"2023-04-09T16:21:43Z","title":"HumanSD: A Native Skeleton-Guided Diffusion Model for Human Image Generation","version":1},"cited_work":{"arxiv_id":"2304.04269","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.04269","snapshot_observed_at":"2026-08-07T05:50:00.293306Z","title":"HumanSD: A Native Skeleton-Guided Diffusion Model for Human Image Generation","venue":"cs.CV","work_id":"7d7649ce-d118-4fb2-adb8-926092dbc274","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.069883Z"},"links":{"cited_paper":"/paper/2304.04269","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:a7a96573b8dbaa5e821269ef3c936cf942cec0c827f2b7b446153ae7e3819293","observation_id":"105f5d2e-a632-486f-802d-554abaf6fd0a","resolution":{"observed_at":"2026-08-07T05:50:00.298942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.512220Z","title":null,"venue":null,"work_id":"1f3f3879-6e14-4b97-82d7-645f16116805","year":2020},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.074692Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:381b04d0a815343126dded8440f4ab1f71077ee78989876e9510aa0df92c37ed","observation_id":"7b799476-c683-4fc6-9162-6f9411fa5bb3","resolution":{"observed_at":"2026-08-07T05:50:00.515449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.502547Z","title":"Fine-grained late- interaction multi-modal retrieval for retrieval augmented visual question answering","venue":null,"work_id":"4ae42e34-8601-445a-b0bd-b1a5f6f8ffcf","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.078718Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:0d5ef319f7e9acebcf708e6590cfe50b21a0688524378908008ee62ff1fc0c01","observation_id":"796e6423-b89f-45dc-b61b-3d7d88a0203b","resolution":{"observed_at":"2026-08-07T05:50:00.506190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08327","last_updated":"2024-06-05T11:46:23Z","snapshot_observed_at":"2026-08-01T04:05:40.608560Z","submitted_at":"2024-02-13T09:47:07Z","title":"PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08327","snapshot_observed_at":"2026-08-07T05:50:00.082375Z","title":"Preflmr: Scaling up fine-grained late-interaction multi-modal retrievers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.082375Z"},"links":{"cited_paper":"/paper/2402.08327","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:1ad1f02931a691452ce5e9552333db5b0dfca8267706f75f98b51098e28c281f","observation_id":"c464a96e-1961-4421-b45a-f4968b352ff9","resolution":{"observed_at":"2026-08-07T05:50:00.082375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.493598Z","title":"Handrefiner: Refining malformed hands in generated images by diffusion-based conditional inpainting","venue":null,"work_id":"0f271709-133a-49e2-9e80-b08553c1d9ee","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.088312Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:77533746d47bc790c436011f93042ce851d68aac1f96b2964bc7a2facaf11ac4","observation_id":"c548ac04-56a0-4d0a-9609-c43cfc848c4c","resolution":{"observed_at":"2026-08-07T05:50:00.497001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-07T05:50:00.091963Z","title":"Transfer between modalities with metaqueries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.091963Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:9932808d127ad0a029cbd93e16345ef643aa16192d58193862537b8f227964f5","observation_id":"f599aad6-3a1c-4ec6-9208-6ab1ee0e5be6","resolution":{"observed_at":"2026-08-07T05:50:00.091963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.484380Z","title":"SDXL: improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"95cabd3a-49cc-4112-9a35-a2c7f79ca2e6","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.095712Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:91be6b720ae6a265558175c3fd6d3985f44530776465c1eee2515c3b35255a50","observation_id":"1d275fd9-84df-49a8-b25c-931f1e9e1cef","resolution":{"observed_at":"2026-08-07T05:50:00.487925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.099287Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.099287Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:384138f1bc45f53674e4b0df15c55d1f6233768ed1f07e346082343d5fa31010","observation_id":"bde39ec9-4a4e-4c71-b61c-8e7345a212d5","resolution":{"observed_at":"2026-08-07T05:50:00.099287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T05:50:00.102884Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.102884Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:cb343d09b362a81ca0acd96daade99f492fcd9800ec98954ac7b0773de490d7c","observation_id":"21854800-ab86-42d8-9e42-5c217ec6d5c3","resolution":{"observed_at":"2026-08-07T05:50:00.102884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-07T05:50:00.106158Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.106158Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:e1dbc54e7b3b4c6268c1e195727e307acb8c03e9e235b0217dccb51d2a6bdb48","observation_id":"54aaef81-83e8-417f-ab70-8dcdbe9c0d2e","resolution":{"observed_at":"2026-08-07T05:50:00.106158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.110226Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.110226Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:d7ceb60bb99c8fcc2f144c16499b76646a45c61aa21f36ce88ffe347cb728504","observation_id":"2cb12436-21e9-4b54-9e7f-b9a803d5fc5b","resolution":{"observed_at":"2026-08-07T05:50:00.110226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.463868Z","title":"Bermano, and Ohad Fried","venue":null,"work_id":"f6dbe33e-3801-4d0e-b71e-25200e936109","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.113894Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:b59797c364e53ea85cfa0bc0fc1d2c534ce49396fe0a3e00839cbaaafc392eee","observation_id":"fce48b6d-dc98-4f77-ad0b-53a0d0366910","resolution":{"observed_at":"2026-08-07T05:50:00.467251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.454599Z","title":"kNN-diffusion: Image generation via large-scale retrieval","venue":null,"work_id":"e57771c4-c208-46ff-9bcf-38e63fd0cc5d","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.117309Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:eab23a0f2dc5c75f3b2bbbd3d8fb6a33b244c6f0e71a47ec3ee2fb1359ace9f9","observation_id":"40c4ba51-a8a1-4628-98bf-eb50ed8c167c","resolution":{"observed_at":"2026-08-07T05:50:00.458012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.444688Z","title":"Retrieval aug- mentation reduces hallucination in conversation","venue":null,"work_id":"7e1473a2-3bbd-4b6b-be47-4918cc350b7c","year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.121229Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:a08f6b11b61a4ccdd8d42c7f7ba8d079c2276585ee59f497825b9b47349217bc","observation_id":"fba33c5d-0c58-4b5d-88bc-dbc4ec0af2a1","resolution":{"observed_at":"2026-08-07T05:50:00.448267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.128960Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.128960Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:476e7f51a391741b28fe2d369f0e681253cc63bd5e76d17204225c85dc3afc4e","observation_id":"6d144aad-f07e-4b3d-b96d-a83eb90bc233","resolution":{"observed_at":"2026-08-07T05:50:00.128960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T05:50:00.132362Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.132362Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:37cd6c50eb6873de159af2593902569b8bf53857a763d93d16b157b78eaaea6d","observation_id":"356e327c-0f9e-4360-9050-d4672b653c1c","resolution":{"observed_at":"2026-08-07T05:50:00.132362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.423835Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"821c868d-6b91-4e59-a180-ddd1faa3f9f6","year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.135645Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:deab2eeb83df734c216fe74e14fb3ffdb2df4c1094175987e8c6075133ee67f1","observation_id":"22f32b96-6336-40f9-b306-adbf8f046317","resolution":{"observed_at":"2026-08-07T05:50:00.427595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.413829Z","title":"Fréchet wavelet distance: A domain-agnostic metric for image generation","venue":null,"work_id":"6b3ae466-43f1-4d0f-a084-2bb80c9dbce9","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.138862Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:5cba0473f51ff37a3877efd6d69df9981dacae248e7f2cef4fc473ad98229e89","observation_id":"2e993fd4-2f90-4c5b-bafb-d649bd3d1a3b","resolution":{"observed_at":"2026-08-07T05:50:00.417416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.404726Z","title":"Midjourney prompts dataset","venue":null,"work_id":"cf7c5149-838e-4c40-9f9a-499944695f6a","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.141871Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:0252cf9ec58aceca8489f72350478eee6de25c11a3515e55d7bfba035b5faf35","observation_id":"698dfdd7-8bd2-49a2-b9cd-17664632897f","resolution":{"observed_at":"2026-08-07T05:50:00.407893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-07T05:50:00.145033Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.145033Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:8a75c241ba05ebe38668733503ac6e0c934e19f20b3363215eba17d2f11457d7","observation_id":"2c17aadf-bb35-4f89-ad79-acc49bda02c2","resolution":{"observed_at":"2026-08-07T05:50:00.145033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-07T05:50:00.148561Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.148561Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:addcecbb39606f642ba7a9317b76422483e047004ec0a904b86936dea05e4e53","observation_id":"7eab1213-4d83-4397-8543-039fc4d01fd5","resolution":{"observed_at":"2026-08-07T05:50:00.148561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-07T05:50:00.151862Z","title":"SANA: efficient high-resolution image synthesis with linear diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.151862Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:a1547ed2111ebdd1ca003fe1868f8a94488327183847025d8fd1b9555809a8d6","observation_id":"e4ed34e5-436b-4779-ac92-5997192ed361","resolution":{"observed_at":"2026-08-07T05:50:00.151862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T05:50:00.155401Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.155401Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:76ef8ffd41e420c52a52d001294ea5b98664ba9c9c1e6a6105db81613dd058c5","observation_id":"390cbf13-88a6-4503-b756-56a11954b064","resolution":{"observed_at":"2026-08-07T05:50:00.155401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.395370Z","title":"Modality-specialized synergizers for interleaved vision-language generalists","venue":null,"work_id":"8d0eb7f2-be9e-44e1-84d2-e5a07727db5e","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.158685Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:cf458019c7223d6cb62ef9407e705bd1bee4b74bcd82987f9bc4d55f02c62709","observation_id":"8d701f30-1c00-4b86-97b9-2ded6edda6db","resolution":{"observed_at":"2026-08-07T05:50:00.398761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.385390Z","title":"Retrieval-augmented multimodal language modeling","venue":null,"work_id":"406429a1-17fd-47ff-8bc8-daa8419d791e","year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.161798Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:2ea96426eda70cf6e8e390e6f5bc98ecd1d88cb4c906fde1fbc839dd85b7e108","observation_id":"f070860d-feba-4a60-8bd1-a631a2b63525","resolution":{"observed_at":"2026-08-07T05:50:00.388852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01558","last_updated":"2024-05-05T15:58:24Z","snapshot_observed_at":"2026-08-04T12:45:28.903998Z","submitted_at":"2023-10-02T18:52:35Z","title":"Making Retrieval-Augmented Language Models Robust to Irrelevant Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01558","snapshot_observed_at":"2026-08-07T05:50:00.164958Z","title":"Making retrieval-augmented language models robust to irrelevant context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.164958Z"},"links":{"cited_paper":"/paper/2310.01558","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:cbc9bf005decb35e891aff98ac6280ed9dbaff48c0200577697b3d0deff9bdc0","observation_id":"df11e4ee-8b63-40a0-88eb-f62b69f90fbb","resolution":{"observed_at":"2026-08-07T05:50:00.164958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-06T19:04:26.186950Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-07T05:50:00.168507Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.168507Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:497f2c9c822b73b06db75886b0e8b748e6450ff31431ea34e80f3fabbb457ea5","observation_id":"0349970a-a02d-4bfb-b826-ce4611bc89f9","resolution":{"observed_at":"2026-08-07T05:50:00.168507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.375644Z","title":"FineRAG: Fine-grained retrieval-augmented text-to-image generation","venue":null,"work_id":"c9d90979-72c8-4d66-aefd-ad709dc6a2a2","year":2025},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.171859Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:f658d3fba1be5fb385f7c1e8ab17a9d84976af3203d23819cd2a437580635cd0","observation_id":"5b92c257-4a93-4205-bb4d-3f3c6961c622","resolution":{"observed_at":"2026-08-07T05:50:00.379520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:00.125527Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.125527Z"},"links":{"citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:7ba54db529c441d41827188c75be288e74e27cd9c17da1e1028993183afec96c","observation_id":"bc811eb1-6b8e-42cd-966a-c3b113381080","resolution":{"observed_at":"2026-08-07T05:50:00.125527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:42:57.544392Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 2 inbound Pith citation observations for arXiv:2506.06962."}