{"as_of":"2026-08-08T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9de6584913dd2eea83a6f10e63644163e14c12c5676cc809139ee723bd967eb","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:17:28.123920Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T02:02:32.008630Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:08:50.359914Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.15779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15779","snapshot_observed_at":"2026-07-03T19:08:50.359914Z","title":"Ia-t2i: Internet-augmented text-to-image generation","venue":null,"work_id":"c0444512-3f3f-4b71-9836-7ebe9391bf63","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T21:18:10.087258Z"},"links":{"cited_paper":"/paper/2505.15779","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:9a3eccd5416a1bafc22611258f7ff30c1d3b3fe2186f10d18fa4390f86e9e03f","observation_id":"248898b0-b4f2-4258-ad5c-5b1e335adacc","resolution":{"observed_at":"2026-05-14T21:19:28.110664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.15779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15779","snapshot_observed_at":"2026-07-03T19:08:50.359914Z","title":"Ia-t2i: Internet-augmented text-to-image generation","venue":null,"work_id":"c0444512-3f3f-4b71-9836-7ebe9391bf63","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T06:31:13.232880Z"},"links":{"cited_paper":"/paper/2505.15779","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:32681e62ecfaba7e8a7cf231bf8c65675c8059f469f1e67f8c62be59adf998ac","observation_id":"e7d4cbce-fc52-4392-9581-c3248356f2c9","resolution":{"observed_at":"2026-05-25T06:35:25.161207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.15779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15779","snapshot_observed_at":"2026-07-03T19:08:50.359914Z","title":"Ia-t2i: Internet-augmented text-to-image generation","venue":null,"work_id":"c0444512-3f3f-4b71-9836-7ebe9391bf63","year":2025},"citing_paper":{"arxiv_id":"2605.08043","last_updated":"2026-05-08T17:32:30Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:32:30Z","title":"SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-11T02:27:36.104714Z"},"links":{"cited_paper":"/paper/2505.15779","citing_paper":"/paper/2605.08043"},"observation_digest":"sha256:0eeb77ea9ee4203670ea67ffc5900df0cdc2cd6a9382740aaf969a36d748026e","observation_id":"4d641562-55c1-49a2-91b8-bacf3132ee2d","resolution":{"observed_at":"2026-05-11T03:30:57.663442Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2505.15779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15779","snapshot_observed_at":"2026-07-03T19:08:50.359914Z","title":"Ia-t2i: Internet-augmented text-to-image generation","venue":null,"work_id":"c0444512-3f3f-4b71-9836-7ebe9391bf63","year":2025},"citing_paper":{"arxiv_id":"2606.17619","last_updated":"2026-06-16T07:25:08Z","snapshot_observed_at":"2026-07-06T23:53:11.869569Z","submitted_at":"2026-06-16T07:25:08Z","title":"RAVA: Retrieval-Augmented Viewpoint Alignment for Subject-Driven Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T02:02:32.008630Z"},"links":{"cited_paper":"/paper/2505.15779","citing_paper":"/paper/2606.17619"},"observation_digest":"sha256:fca25ff64e29a01fc3a48b1a20fba37d9591adee491eac11e8d20e67c6acf460","observation_id":"ee8a0ae2-6757-4afb-896b-dbace2a2d295","resolution":{"observed_at":"2026-07-03T19:08:50.361415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15779/citation-record","integrity":"/paper/2505.15779/integrity","json":"/paper/2505.15779/citation-record.json","paper":"/paper/2505.15779"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:25.265991Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:25.265991Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:c80f605ce5f4433cc5c427237769734c238d95636197f7d94e820630156171c2","observation_id":"254fda25-a6cc-43bc-827d-b090ec73c186","resolution":{"observed_at":"2026-08-07T15:17:25.265991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:25.360148Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:25.360148Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:dc5a992de003d90134ee543b0c9296bc7beb992abba38d9e4a28540c980c77a7","observation_id":"bc69e4c3-6a44-4796-8293-c400c5b6f001","resolution":{"observed_at":"2026-08-07T15:17:25.360148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:25.457301Z","title":"Flux.https://github.com/black-forest-labs/flux, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:25.457301Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:0595f9aa204a2bcec3a136943521136ea88078924cc528744da0245b4eaea461","observation_id":"7f817c21-4b68-4251-a926-e715d038889f","resolution":{"observed_at":"2026-08-07T15:17:25.457301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T15:17:25.613298Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:25.613298Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:ef71bcd915cf77952e6298564c497edf40849b6c0a93b36970a15ab9db578008","observation_id":"d6148fed-efaa-4d70-8fd9-7162fd4b1914","resolution":{"observed_at":"2026-08-07T15:17:25.613298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:25.735205Z","title":"Generative adversarial networks.Communications of the ACM, 63(11):139– 144, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:25.735205Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:958b2f1505b64fc006d2923c6edab6ca0f5f3b569743dd99e06eab234d634f9a","observation_id":"596ec329-ff35-4c46-bb4e-3fea4d34c4d3","resolution":{"observed_at":"2026-08-07T15:17:25.735205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:25.808654Z","title":"Attngan: Fine-grained text to image generation with attentional generative adversarial networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:25.808654Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:2a655663d489c1613e66ba7e37b79a2c9f4d880b8a7ab831d5ced4a17fd080b1","observation_id":"55cb4e1e-8a87-448a-b9b7-7b008499835b","resolution":{"observed_at":"2026-08-07T15:17:25.808654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T15:17:25.869605Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:25.869605Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:a3639ea39876aab9c92ae942aaab23dcdd355788a9a4a21878c5e8527aafb42a","observation_id":"140c2203-557d-4ca5-acc2-41a9fe8e9af7","resolution":{"observed_at":"2026-08-07T15:17:25.869605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:25.927775Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:25.927775Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:0d561829f79960aafaeee078d76797ca0181b71b8d2f219b26ac5541938d13f6","observation_id":"d072a1b2-7f38-44d1-8924-3d8fe07db9c7","resolution":{"observed_at":"2026-08-07T15:17:25.927775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T15:17:25.994288Z","title":"Autore- gressive model beats diffusion: Llama for scalable image generation.arXiv preprint arXiv:2406.06525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:25.994288Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:995cc881e57aab1bf555ae8947245e0b34d48825db1a7f2aed22a01a92f9d807","observation_id":"361478c6-d7e3-42cc-8a2e-38b885778450","resolution":{"observed_at":"2026-08-07T15:17:25.994288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:26.051028Z","title":"Controlnet++: Improving conditional controls with efficient consistency feedback: Project page: liming-ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.051028Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:0704d7ce34049601e778278dc86bfbea2dcb8d59439bd29ae1239c5e5d3170d9","observation_id":"f0e0a6db-f50a-4313-9f1d-c7d6284cf2e2","resolution":{"observed_at":"2026-08-07T15:17:26.051028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T15:17:26.115967Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining.arXiv preprint arXiv:2408.02657, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.115967Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:eec5cc3d4fdbfd9a89e1932839ef54c4465d44f33a4938f6605b6b07481ed748","observation_id":"26bc7693-c9e1-4dce-ab19-04882e189e26","resolution":{"observed_at":"2026-08-07T15:17:26.115967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T15:17:26.179156Z","title":"Show-o: One single transformer to unify multimodal understanding and generation.arXiv preprint arXiv:2408.12528, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.179156Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:e2968e9cc339fca3847b07317ff8dba3a9680759f4b5e96e22ed8a98ef5a7543","observation_id":"2af546c9-fe79-4c9c-b098-615c25c800d7","resolution":{"observed_at":"2026-08-07T15:17:26.179156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T15:17:26.234981Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.234981Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:20603ee551357a59c4f4dd5617f8df8cd1dac2343e8ead5824ea9ad8f047bed0","observation_id":"c1e9ef26-c87e-49e8-80bc-2b3570f2c7cc","resolution":{"observed_at":"2026-08-07T15:17:26.234981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:26.310616Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.310616Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:691c8b5a9014692172241876a180f26be0e4d739f0089c107ece6e02acc7460d","observation_id":"9c27115a-365f-4255-97ec-b3f514d9920b","resolution":{"observed_at":"2026-08-07T15:17:26.310616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-07T15:17:26.379840Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation.arXiv preprint arXiv:2404.14396, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.379840Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:b281b5b6b5d03f68c91b129d92f8440dfd3ee21c9ef4e5febdafe739a0223740","observation_id":"d7134827-a707-4ceb-890a-adfe77e31ddb","resolution":{"observed_at":"2026-08-07T15:17:26.379840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06542","last_updated":"2025-06-06T15:03:44Z","snapshot_observed_at":"2026-08-07T17:19:09.862301Z","submitted_at":"2025-03-09T10:15:39Z","title":"ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability","version":2},"cited_work":{"arxiv_id":"2503.06542","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06542","snapshot_observed_at":"2026-08-07T15:17:28.844030Z","title":"ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability","venue":"cs.CV","work_id":"d6158b9c-730d-42e8-8114-7274f4dbd57a","year":2025},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.441051Z"},"links":{"cited_paper":"/paper/2503.06542","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:92d4e9f909b56b7e4f4c61d7c0fe201bde8c491c308e3cdd5cb46924872bcd57","observation_id":"4c9bda6b-eef7-4d07-84df-ab159f0553c7","resolution":{"observed_at":"2026-08-07T15:17:28.915599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12571","last_updated":"2024-12-17T06:03:05Z","snapshot_observed_at":"2026-07-06T20:08:20.905061Z","submitted_at":"2024-12-17T06:03:05Z","title":"ChatDiT: A Training-Free Baseline for Task-Agnostic Free-Form Chatting with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12571","snapshot_observed_at":"2026-08-07T15:17:26.477465Z","title":"Chatdit: A training-free baseline for task-agnostic free-form chatting with diffusion transformers.arXiv preprint arXiv:2412.12571, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.477465Z"},"links":{"cited_paper":"/paper/2412.12571","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:2c5a21a535710f83011c1c2a500d2fc572690bc26414dd338d3cd9e1e684c398","observation_id":"924ccdb7-a76b-4da7-ac5a-19d3b4368e2d","resolution":{"observed_at":"2026-08-07T15:17:26.477465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:30.437243Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":"c7e07be6-7eb1-4b2d-9c8d-19e4f9dedf97","year":2023},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.532718Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:257e9b888b45418128b67757f4f72b90f897acb81c7a3cbe8369e2b4fcc02ed3","observation_id":"0ed2c20c-8fe4-42b7-a67f-46f38694b170","resolution":{"observed_at":"2026-08-07T15:17:30.522900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:30.177178Z","title":"Seggpt: Towards segmenting everything in context","venue":null,"work_id":"d8ae3152-2993-479a-8553-97ec8e6dad31","year":2023},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.578282Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:e6be01e74dd0d86a34ee4162aabbfcdd344466daeda0c946f92a31407ea838b6","observation_id":"bc93ad50-5cfd-4212-a3ec-bac14547bfd6","resolution":{"observed_at":"2026-08-07T15:17:30.333069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:26.646475Z","title":"In-context learning unlocked for diffusion models.Advances in Neural Information Processing Systems, 36:8542–8562, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.646475Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:d00f4cccc609f7009bada050f4e476097714a1767bdc2bcc8605bf2c2d7edf4d","observation_id":"3a03a13e-9017-4040-8d65-8825e146d93d","resolution":{"observed_at":"2026-08-07T15:17:26.646475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:26.706379Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.706379Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:39a5194657d49bbb1fd2047fd0d5260ae12c61a56c822cc5b12da5ffefd92e1a","observation_id":"8b33aca5-0c10-4f4b-96be-3e877e8e139e","resolution":{"observed_at":"2026-08-07T15:17:26.706379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:26.773430Z","title":"Context diffusion: In-context aware image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.773430Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:1e00b04487c67323f06496c8e39553ee34c868b1b50609fa41d1e4370c3fffe1","observation_id":"b0153b89-5ea3-4c94-861f-0db169ff68e4","resolution":{"observed_at":"2026-08-07T15:17:26.773430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-07-06T19:42:47.238254Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-08-07T15:17:26.822515Z","title":"In-context lora for diffusion transformers.arXiv preprint arXiv:2410.23775, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.822515Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:56bd8fc254fffd9f919ae5160834dc06b9b3bcfa48cc5233fdf47c03b44b775c","observation_id":"e8868588-5d28-46b4-8b31-cb16a8906996","resolution":{"observed_at":"2026-08-07T15:17:26.822515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:26.880964Z","title":"Retrieval-augmented diffusion models.Advances in Neural Information Processing Systems, 35:15309–15324, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.880964Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:532cb30819b033c299d3f493fc4a5a68be9587faba1fe91761b886c33abde40e","observation_id":"48cddbb7-ec6c-4aca-ad97-8eba96bef0f6","resolution":{"observed_at":"2026-08-07T15:17:26.880964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02849","last_updated":"2022-10-02T11:55:59Z","snapshot_observed_at":"2026-08-06T04:16:14.037579Z","submitted_at":"2022-04-06T14:13:35Z","title":"KNN-Diffusion: Image Generation via Large-Scale Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02849","snapshot_observed_at":"2026-08-07T15:17:26.936866Z","title":"Knn-diffusion: Image generation via large-scale retrieval.arXiv preprint arXiv:2204.02849, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.936866Z"},"links":{"cited_paper":"/paper/2204.02849","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:6ca2a11caad51175bbd9429b2615484be4ef63747384ac27a07b8485405765b9","observation_id":"1fcf6e40-c569-46e2-9840-f60bd8a82cbf","resolution":{"observed_at":"2026-08-07T15:17:26.936866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14491","last_updated":"2022-11-22T02:09:38Z","snapshot_observed_at":"2026-08-03T22:24:49.500281Z","submitted_at":"2022-09-29T00:57:28Z","title":"Re-Imagen: Retrieval-Augmented Text-to-Image Generator","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14491","snapshot_observed_at":"2026-08-07T15:17:27.011626Z","title":"Re-imagen: Retrieval-augmented text-to-image generator.arXiv preprint arXiv:2209.14491, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.011626Z"},"links":{"cited_paper":"/paper/2209.14491","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:7534de91c597439bd8a2095f5ba1d7fd0c690c000b463b07d62e42891a83f92e","observation_id":"d4047fe1-8917-48ff-b2f0-2c9b4b5a101e","resolution":{"observed_at":"2026-08-07T15:17:27.011626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:29.811763Z","title":"Fin- erag: Fine-grained retrieval-augmented text-to-image generation","venue":null,"work_id":"1431ac3e-772d-4f29-b93e-e04011086de5","year":2025},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.072281Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:35531056fe945aa7dec9b68a694761931d8f0fb2b95f8c89a03607cfbba2795f","observation_id":"5227812e-d3bd-4c45-8c47-dc563630ff03","resolution":{"observed_at":"2026-08-07T15:17:29.970376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:27.129684Z","title":"Realrag: Retrieval-augmented realistic image generation via self-reflective contrastive learning.arXiv preprint arXiv:2502.00848, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.129684Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:9998cba66d3b0229e6c3382111b2549da2a6e4577c746bcd51541e1f7e14296a","observation_id":"2180d177-dc3b-47b0-983f-b7e2780ea3a0","resolution":{"observed_at":"2026-08-07T15:17:27.129684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07566","last_updated":"2021-07-15T19:00:35Z","snapshot_observed_at":"2026-07-06T11:29:34.579530Z","submitted_at":"2021-07-15T19:00:35Z","title":"Internet-Augmented Dialogue Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07566","snapshot_observed_at":"2026-08-07T15:17:27.198968Z","title":"Internet-augmented dialogue generation.arXiv preprint arXiv:2107.07566, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.198968Z"},"links":{"cited_paper":"/paper/2107.07566","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:46b20cbdb2090e3447b98afb533a125835a272a9d979df6b10771d8e1de42205","observation_id":"aff18438-0f94-461e-828a-9d8e343692de","resolution":{"observed_at":"2026-08-07T15:17:27.198968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05115","last_updated":"2022-05-23T16:41:08Z","snapshot_observed_at":"2026-08-07T01:30:18.016560Z","submitted_at":"2022-03-10T02:24:14Z","title":"Internet-augmented language models through few-shot prompting for open-domain question answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05115","snapshot_observed_at":"2026-08-07T15:17:27.299485Z","title":"Internet-augmented language models through few-shot prompting for open-domain question answering.arXiv preprint arXiv:2203.05115, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.299485Z"},"links":{"cited_paper":"/paper/2203.05115","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:a5edace13984426f9b2849a9f33516095697de13877317087ea02882f169b91b","observation_id":"21b1a432-20d4-4dee-986e-403b4b5517f2","resolution":{"observed_at":"2026-08-07T15:17:27.299485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07849","last_updated":"2023-05-15T16:17:15Z","snapshot_observed_at":"2026-07-06T15:16:13.658255Z","submitted_at":"2023-04-16T18:16:35Z","title":"ChatPLUG: Open-Domain Generative Dialogue System with Internet-Augmented Instruction Tuning for Digital Human","version":3},"cited_work":{"arxiv_id":"2304.07849","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.07849","snapshot_observed_at":"2026-08-07T15:17:28.361428Z","title":"ChatPLUG: Open-Domain Generative Dialogue System with Internet-Augmented Instruction Tuning for Digital Human","venue":"cs.CL","work_id":"b380faf8-9cb5-4a00-be12-544990c6c13b","year":2023},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.367758Z"},"links":{"cited_paper":"/paper/2304.07849","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:4396275dbef504b32c76a80db3cffcce20b549a44266441a6cb9dd7b7a6984a0","observation_id":"895d08a5-75d8-4ef9-8baa-c8cea7942798","resolution":{"observed_at":"2026-08-07T15:17:28.431235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:29.506971Z","title":"Searchlvlms: A plug-and-play framework for augmenting large vision-language models by searching up-to-date internet knowledge","venue":null,"work_id":"67ee824e-ff8b-42ca-b104-3c6c1c0dca6e","year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.431960Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:a945c1aa278d17a4f49d03a1e22a14b416129fdf33ff834aa666980514abbb16","observation_id":"126ef546-5f21-46ba-b7cc-b7ef5ba81304","resolution":{"observed_at":"2026-08-07T15:17:29.605490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12959","last_updated":"2024-11-27T08:49:12Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:45Z","title":"MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12959","snapshot_observed_at":"2026-08-07T15:17:27.472421Z","title":"Mmsearch: Benchmarking the potential of large models as multi-modal search engines.arXiv preprint arXiv:2409.12959, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.472421Z"},"links":{"cited_paper":"/paper/2409.12959","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:7abc365a2729959a62c5d474214ddc356de17f6cf340a10c6a741d96aab25dca","observation_id":"70f40c06-c8ea-4fa9-90aa-12f4ee19e486","resolution":{"observed_at":"2026-08-07T15:17:27.472421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T15:17:27.533743Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.533743Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:cd9c134b6c78ff619731641ab840e1d95b3de36f693ff0094053beee6d4b7bae","observation_id":"a435072d-962f-4eaa-b963-f8e07cc4b287","resolution":{"observed_at":"2026-08-07T15:17:27.533743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:29.358999Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"31eda7d2-07b1-49dc-b13b-7db3026a3fc5","year":2021},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.614019Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:90b10b0be1930b39598b4309ec11a91fa57c0c3eeba0a8bbfc25c103448669d9","observation_id":"52e1f768-f81b-45fe-9e0f-535527e4138f","resolution":{"observed_at":"2026-08-07T15:17:29.442673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:27.719823Z","title":"Prentice-Hall, Inc., 1988","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.719823Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:755d9bf0440ffabd3753d970dae744b8955b20485883e17aa7af2b03ae1beffd","observation_id":"59f02db0-7ed7-4969-b98a-3ea691d565be","resolution":{"observed_at":"2026-08-07T15:17:27.719823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:29.261375Z","title":"An edit friendly ddpm noise space: Inversion and manipulations","venue":null,"work_id":"1b47ce5d-4d60-4eeb-9b3d-8768fa013716","year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.842022Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:ee33af152f6b9f9cb12abfbdf5893baff3c6497ae0c18a570721ac771902625f","observation_id":"cb37720b-32c6-4106-9b4b-67966187d66b","resolution":{"observed_at":"2026-08-07T15:17:29.293033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-08-07T15:17:27.943678Z","title":"Step1x-edit: A practical framework for general image editing.arXiv preprint arXiv:2504.17761, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:27.943678Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:a1e2037881f53b97197083c5cab7c24448c42f8206acdb5a1208711d9f5b0261","observation_id":"b5e416a9-ebd6-4517-b0cd-424964debf96","resolution":{"observed_at":"2026-08-07T15:17:27.943678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:17:29.151685Z","title":"True\", otherwise you output","venue":null,"work_id":"40dde3cc-20e9-4b91-a011-353310bc7be2","year":2025},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:28.123920Z"},"links":{"citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:c4ebd72609a4cdb40dd225a0b016b10a119a42acfd2173f0b14061d133eb4183","observation_id":"f09b1cd1-d665-4901-bf67-75255107ba84","resolution":{"observed_at":"2026-08-07T15:17:29.188186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 4 inbound Pith citation observations for arXiv:2505.15779."}