{"as_of":"2026-08-08T03:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f0e5e30ffef63ed7ce7177e312ecd74fd8602f07f8c5ef39ae9c81456a0adc4","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:06:54.293800Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:52:01.773382Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:16:44.587845Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"cited_work":{"arxiv_id":"2505.20053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20053","snapshot_observed_at":"2026-07-02T07:16:44.587845Z","title":"Multimodal llm-guided semantic cor- rection in text-to-image diffusion.ArXiv, abs/2505.20053,","venue":null,"work_id":"1dfbca54-e60e-4a24-aed1-4c0ec9cc6a60","year":null},"citing_paper":{"arxiv_id":"2606.04479","last_updated":"2026-06-03T05:53:58Z","snapshot_observed_at":"2026-08-03T21:43:54.545392Z","submitted_at":"2026-06-03T05:53:58Z","title":"Evaluating Reasoning Fidelity in Visual Text Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T07:03:38.967856Z"},"links":{"cited_paper":"/paper/2505.20053","citing_paper":"/paper/2606.04479"},"observation_digest":"sha256:ff40c259428ec91fc9e7a0468f8e9c755ffdc4cc7d64663cd9da395332148cc4","observation_id":"9baf39b9-98f5-4453-b4fe-7d4d6105034a","resolution":{"observed_at":"2026-07-02T07:16:44.590852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20053","snapshot_observed_at":"2026-08-02T09:52:01.773382Z","title":"Multimodal llm-guided semantic correction in text- to-image diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22655","last_updated":"2026-06-26T17:29:32Z","snapshot_observed_at":"2026-08-07T03:00:52.298676Z","submitted_at":"2026-06-26T17:29:32Z","title":"EventOD: Event-Aware OD Flow Generation via LLM-Guided Semantic Modulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T09:52:01.773382Z"},"links":{"cited_paper":"/paper/2505.20053","citing_paper":"/paper/2607.22655"},"observation_digest":"sha256:324089c8bba94fca0b8276b264ba7a72431c62a5076f72714bf8b0758ca7e8be","observation_id":"1fb06972-df6a-42e2-ba65-76813b6d0c0a","resolution":{"observed_at":"2026-08-02T09:52:01.773382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20053/citation-record","integrity":"/paper/2505.20053/integrity","json":"/paper/2505.20053/citation-record.json","paper":"/paper/2505.20053"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:47.716477Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:47.716477Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:3d8a4a22923ba75ba8e809505fe1c8adfc7011049d205bd574318898cf7a9642","observation_id":"c06619fa-9623-4a5f-ae7b-52d9b53670fb","resolution":{"observed_at":"2026-08-07T14:06:47.716477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:06:47.759834Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:47.759834Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:6041af94c9ce64275a9bd3421d108906a95dc6090e3f39c24832abf0d379a4b3","observation_id":"ea5670b8-5329-4dd2-873e-efea9da8a204","resolution":{"observed_at":"2026-08-07T14:06:47.759834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08748","last_updated":"2024-05-14T16:33:25Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:33:25Z","title":"Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08748","snapshot_observed_at":"2026-08-07T14:06:47.850143Z","title":"Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:47.850143Z"},"links":{"cited_paper":"/paper/2405.08748","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:576c1d6dc56293738b1ccbf74df42d5347f511799165a32a29fa65bad3dd0db0","observation_id":"a4c39549-f37a-4bdc-b515-ceb6be0a7050","resolution":{"observed_at":"2026-08-07T14:06:47.850143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:47.908260Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:47.908260Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:80faaf55b33811d9b4aba20cdf4958d92430f052e7a54d9f8c5024931683904d","observation_id":"82fbe835-84d6-42cd-b205-46448a2e69de","resolution":{"observed_at":"2026-08-07T14:06:47.908260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:07:00.071385Z","title":"Glide: Towards pho- torealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":"5ebe9a89-67b8-4c3a-96d6-4d48c96e6d5e","year":2022},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:47.967440Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:3fe5285573544beba84e71f99db02797d9a4261a90d292c865691b0c692d359c","observation_id":"ca4bca66-6924-4fec-9c8a-c7ab9994c99a","resolution":{"observed_at":"2026-08-07T14:07:00.229685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:59.807846Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"5468f04d-c988-4d8e-aa57-551b7429a6dd","year":2022},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.033052Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:46f1e9b6359d65bfb6ccb44488c4a34eec6490abeff9cdf39d039ce175dffd77","observation_id":"516980c7-ff1f-4bc7-bdeb-0e440de27559","resolution":{"observed_at":"2026-08-07T14:06:59.928402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12908","last_updated":"2023-11-21T15:24:05Z","snapshot_observed_at":"2026-07-06T16:50:46.608196Z","submitted_at":"2023-11-21T15:24:05Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12908","snapshot_observed_at":"2026-08-07T14:06:48.103834Z","title":"Bowman, Jack W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.103834Z"},"links":{"cited_paper":"/paper/2311.12908","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:8d9d686ad7bed4f06e6a0602da03ee91d70b3dfdfcf064cd6597723fd0d1ce60","observation_id":"fae598c4-1250-4417-9dca-ad311a928cd5","resolution":{"observed_at":"2026-08-07T14:06:48.103834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:59.576372Z","title":"Reflected diffusion models for text-to-image generation","venue":null,"work_id":"94d40d40-6c33-4167-9940-e7d4c7fcbd97","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.184902Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:8d6ae5907b472200110256e057d7787065defb77be38a969864f189fdb9cc78c","observation_id":"7d8ce54f-ea13-4e07-b26e-8cb25d398790","resolution":{"observed_at":"2026-08-07T14:06:59.658957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:48.239095Z","title":"Zigzag diffusion sampling: Diffusion models can self-improve via self-reflection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.239095Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:58dfd4f8260cce25857495e04c87c02d5f1198c26a2cfe52897ea434f6b59275","observation_id":"10ad2305-3411-41e1-992c-3b249212fc2f","resolution":{"observed_at":"2026-08-07T14:06:48.239095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T14:06:48.321896Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.321896Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:f1dcbb7ae1634c2ed8b2c6a1fa6c0632cf51e6a439a71450d26c9d4ebea79e7f","observation_id":"a4b9019f-129b-4818-8f7d-a5c4ea30eb39","resolution":{"observed_at":"2026-08-07T14:06:48.321896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T14:06:48.434294Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.434294Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:5afe727fac42522f3d09a40c26561250ea048abbffa4d5970e863ec941804895","observation_id":"f69bfa58-c945-4c6f-98e1-15914aa25905","resolution":{"observed_at":"2026-08-07T14:06:48.434294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T14:06:48.599291Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.599291Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:52ced0efbf6e629dbb1422ae70f0614caf7dca20470a6f44ea1daefc9d1adb95","observation_id":"fd0a1b04-1430-4840-a719-c88703dc6216","resolution":{"observed_at":"2026-08-07T14:06:48.599291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:48.685967Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.685967Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:3c96f4a1d484a5a4f611cf87077df5862a2c9e475e6f759514202f065e862464","observation_id":"ea24c6c6-0162-4ff9-96f8-00de82811965","resolution":{"observed_at":"2026-08-07T14:06:48.685967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:48.763435Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.763435Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:33fb4172899e7a79b45a00ffffa82304ce5ea441800d931a3e5435f783656e46","observation_id":"c08b10a6-45de-4872-9748-4f015951ff6b","resolution":{"observed_at":"2026-08-07T14:06:48.763435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-07T14:06:48.826863Z","title":"Internlm-xcomposer: A vision-language large model for advanced text-image comprehension and composition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.826863Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:8f39aa93224aad8e8ffd632384b73bf9c59a2e9ec3fe72c3b88e0ea6527fcc4c","observation_id":"8e219843-5cf5-4465-a564-1712dca7ca49","resolution":{"observed_at":"2026-08-07T14:06:48.826863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:48.905495Z","title":"Gpt-4v(ision) system card, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.905495Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:9b8d1007c139ae88543350b2168a3c791f1935f9620d4a6d7ac432f98a1b56b1","observation_id":"e50bf329-a9fe-459d-a036-13a62c91e7f9","resolution":{"observed_at":"2026-08-07T14:06:48.905495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:06:48.981966Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:48.981966Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:bb280a84e2ec1b618003d580632081440915113b775ba640fc7fb2cd9fe0dc16","observation_id":"ea40dd3e-078d-4a32-806f-ee9f5d2867fe","resolution":{"observed_at":"2026-08-07T14:06:48.981966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:59.177192Z","title":"The claude 3 model family: Opus, sonnet, haiku., 2024","venue":null,"work_id":"6858ea8f-a5de-4f67-8b9c-d5622c032e98","year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.066634Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:fdb28f63a40b18e87454bc9b7833c5ae0b2e97aa2837c500cdf40d2c684f2c3d","observation_id":"ab32b750-5c39-4104-bad3-bc2629e92b08","resolution":{"observed_at":"2026-08-07T14:06:59.339147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-07T14:06:49.131004Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.131004Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:df99a66afd092f397cefda79d0cc743bf6d5d7a6932e9725fbb57bd5f083f438","observation_id":"301aff66-ce55-45c8-91de-c03f5c645ec0","resolution":{"observed_at":"2026-08-07T14:06:49.131004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:58.878502Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","venue":null,"work_id":"ba472f01-ce58-40ef-b055-cbaa47fe6a67","year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.204546Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:df38caf15fb64971d54a9d9dfe5c68b95c0b791e4a0882f4bf3d4c0203b68416","observation_id":"473e7b59-2b52-4a8b-a714-8d517271f1a8","resolution":{"observed_at":"2026-08-07T14:06:59.008380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T14:06:49.319344Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.319344Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:641c3545773a9a482f8d4135305049b6a4576c841f15d6c9ac1ea2d867494be7","observation_id":"ca8069a4-8084-40fd-b260-cd8a3a3f04f4","resolution":{"observed_at":"2026-08-07T14:06:49.319344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-07T14:06:49.423903Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.423903Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:d5e09c84d6c3f0fcdbb3a245c7513c83a023f39e80a02492e41a8742047d97ac","observation_id":"fc00e381-7b25-419d-911a-94e666446bf5","resolution":{"observed_at":"2026-08-07T14:06:49.423903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T14:06:49.514356Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.514356Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:f94659bd47cd2786a39bd343c23da3fded069f9f8f225407ee1ed5a6ebbdf0a1","observation_id":"c37bb812-1d23-4f05-a0ba-81645fefeb15","resolution":{"observed_at":"2026-08-07T14:06:49.514356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:58.646196Z","title":"Visual instruction tuning","venue":null,"work_id":"29e61b1b-d685-49fd-8791-b3e913030170","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.614935Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:b5f078090ca6b56da546ffaa3278c356ed4ee1379e8100f4e38b0afddc326b1b","observation_id":"0bfddfa8-bcb5-48b3-81ca-e67109e115cf","resolution":{"observed_at":"2026-08-07T14:06:58.756151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:49.701785Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.701785Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:7ff01dfefc28859adf3c6cca123bdc4009551452b00b74df2151910652111d1b","observation_id":"1d778432-d4a7-4989-967c-683703e71c7c","resolution":{"observed_at":"2026-08-07T14:06:49.701785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-07T14:06:49.812070Z","title":"video-salmonn: Speech-enhanced audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.812070Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:8ca26465ccddbd87afd44e04f76916cfaea7058301a0b09e97c9d8f0aeda6ef5","observation_id":"abae598a-bd1a-4bf1-b652-9477b1db0b36","resolution":{"observed_at":"2026-08-07T14:06:49.812070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-07T14:06:49.900006Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.900006Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:55a7e5a58e8c796b335a184f77805ad5535acddf356341fd65b8ac05afea4ad4","observation_id":"5f486cbc-df12-485f-8dc2-8c4e544ab8ae","resolution":{"observed_at":"2026-08-07T14:06:49.900006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T14:06:49.990929Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:49.990929Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:4949f09dc8581e8f80968cdacce8d200981ae0e4c8246f1b0eeebe02e676583e","observation_id":"f9832be2-b9f5-4fdd-aeac-e089fbae9e01","resolution":{"observed_at":"2026-08-07T14:06:49.990929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-07-29T15:30:39.490502Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-07T14:06:50.101431Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.101431Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:91eeaffab8f599489c112596ea624d0b9648bbab5fd75fa994ff7c4047daba3c","observation_id":"158b09e0-b90c-4054-9de1-0ec7c148dae2","resolution":{"observed_at":"2026-08-07T14:06:50.101431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:50.177732Z","title":"Gem: Empowering mllm for grounded ecg understanding with time series and images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.177732Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:1adc7ea193dac9922759025964f63062aac181b773a5809460629fb1589c70a0","observation_id":"609b4299-45d5-421d-9257-8c03625df872","resolution":{"observed_at":"2026-08-07T14:06:50.177732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-07T14:06:50.252890Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.252890Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:9fc456c228677ad48bd59221c8382f67de79d5917c4a4494dd272107db98e973","observation_id":"924717a1-24cd-45db-99c1-8602fcd9fe8b","resolution":{"observed_at":"2026-08-07T14:06:50.252890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:58.377744Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"75490c8c-5143-4214-ac5b-afd746e4ccf9","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.348109Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:136f854e3dcacda7c1aa3603ae59d6f36192a3d2123793a2c6006af35fca823a","observation_id":"ee156c4d-6fdf-467e-be13-d763710906db","resolution":{"observed_at":"2026-08-07T14:06:58.503692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:50.465526Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.465526Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:b76af2033b68e95e729dfcd74b6df0f5e1588d2508b39d63bd301082c3bb56bf","observation_id":"fe97c230-cacd-4740-b9b9-67ccfdc43bc5","resolution":{"observed_at":"2026-08-07T14:06:50.465526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:50.571133Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.571133Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:f6c1b6bd827ce080ed77e2241a0114266edbe62220bf494386b52d694e187393","observation_id":"effea327-ff42-4398-8134-c0a3d82fabb8","resolution":{"observed_at":"2026-08-07T14:06:50.571133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T14:06:50.670211Z","title":"Kingma, Abhishek Kumar, Stefano Ermon, and Ben Poole","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.670211Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:8c6ba1f3f5985c8eac3fa94444bb3967631aaac2f52e3440bc8d7932d4b5fb18","observation_id":"642ddab9-115c-4701-b043-540e0ae28fcb","resolution":{"observed_at":"2026-08-07T14:06:50.670211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:50.787590Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.787590Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:a23175d49bb0b1914a5bb39f35ce6182e1f1ebbf12d8f65e36a1ece7a71a8bf3","observation_id":"2df6ad0c-f992-4801-a5b2-60d4b5b6a25c","resolution":{"observed_at":"2026-08-07T14:06:50.787590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00630","last_updated":"2023-04-14T00:20:30Z","snapshot_observed_at":"2026-08-03T22:15:47.891015Z","submitted_at":"2021-07-01T17:43:20Z","title":"Variational Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00630","snapshot_observed_at":"2026-08-07T14:06:50.897243Z","title":"Kingma, Tim Salimans, Ben Poole, and Jonathan Ho","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.897243Z"},"links":{"cited_paper":"/paper/2107.00630","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:51d82d078dadddc843bc6c0b1890c1ff2d86e35854235da060c124a780c65782","observation_id":"60078f2f-56e9-4a43-849f-07f80ff1ba27","resolution":{"observed_at":"2026-08-07T14:06:50.897243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:58.147861Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"290ff692-2a26-456f-9a73-a574f97955c9","year":2021},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:50.980896Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:c328d304ca58997f535bcb8cb35da5ae80a16185ef730147c4e42392c853bbb4","observation_id":"76e04cf0-65aa-4a61-b6ea-3ba52601ff6a","resolution":{"observed_at":"2026-08-07T14:06:58.185767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T14:06:51.093720Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:51.093720Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:f0aebaa5fe3c9a584b35ecc2d7213fe47e3443a91f2ee8815e31dcb21887e63f","observation_id":"d43efcaa-0729-4ffe-a8fb-5c40c94dee3a","resolution":{"observed_at":"2026-08-07T14:06:51.093720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:51.187989Z","title":"On fast sampling of diffusion probabilistic models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:51.187989Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:78916029db70f3743761f3b0b6bce24236d951a5d42642b6b621615241c94248","observation_id":"d0e00451-32fd-4ecc-a9df-06ff70552686","resolution":{"observed_at":"2026-08-07T14:06:51.187989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:51.289011Z","title":"Progressive distillation for fast sampling of diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:51.289011Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:b6f0663e6bb54e1cb24ca75a79cba501681acbe71ad696dfa283b75d14d9c7bc","observation_id":"b6ca835f-bac8-4b5f-b7ae-61564d957ac3","resolution":{"observed_at":"2026-08-07T14:06:51.289011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-07T14:06:51.407405Z","title":"Sara Mahdavi, Raphael Gontijo Lopes, Tim Salimans, Jonathan Ho, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:51.407405Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:d9ff30cde14d0ece77fca941f876f7a7d74ea8ed1580c1c3ad40da7c23f85cf0","observation_id":"0fc98851-47c4-44a9-a0f7-12ba55f5e3b4","resolution":{"observed_at":"2026-08-07T14:06:51.407405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:58.082413Z","title":"A morphology focused diffusion probabilistic model for synthesis of histopathology images","venue":null,"work_id":"171d09b4-836d-4589-b020-9e6e813b611c","year":2000},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:51.520453Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:e8048e66b9f8ee487751a6d3c7074cb8f70ee4d9a51c913a33981e8cea441079","observation_id":"e2a5553f-4d25-4df0-91bb-6ba334d54caa","resolution":{"observed_at":"2026-08-07T14:06:58.099911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01053","last_updated":"2023-04-03T15:00:06Z","snapshot_observed_at":"2026-08-07T07:17:10.188043Z","submitted_at":"2023-04-03T15:00:06Z","title":"ViT-DAE: Transformer-driven Diffusion Autoencoder for Histopathology Image Analysis","version":1},"cited_work":{"arxiv_id":"2304.01053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.01053","snapshot_observed_at":"2026-08-07T14:06:54.927638Z","title":"ViT-DAE: Transformer-driven Diffusion Autoencoder for Histopathology Image Analysis","venue":"cs.CV","work_id":"16b66657-1a23-4cc5-af96-1079ad938bb4","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:51.617993Z"},"links":{"cited_paper":"/paper/2304.01053","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:3937069e481cccc4466a0e8a00d1b6032bd9c4451d6e77548642b76fcde7a8ec","observation_id":"42c2468a-1653-4443-8c81-46d292bea758","resolution":{"observed_at":"2026-08-07T14:06:54.980320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:58.044439Z","title":"A multimodal comparison of latent denoising diffusion probabilistic models and generative adversarial networks for medical image synthesis","venue":null,"work_id":"69bab5e3-0dd5-4deb-b1a7-50f87323adb5","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:51.732216Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:200b91ecf8370825148bee47bc478b20cd0c8ec415392196e8c219d42274cd96","observation_id":"3fa73ae7-5566-407a-ac17-46718afa9a6b","resolution":{"observed_at":"2026-08-07T14:06:58.052520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00748","last_updated":"2023-11-30T20:20:23Z","snapshot_observed_at":"2026-07-06T16:13:27.304874Z","submitted_at":"2023-09-01T22:08:32Z","title":"PathLDM: Text conditioned Latent Diffusion Model for Histopathology","version":2},"cited_work":{"arxiv_id":"2309.00748","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.00748","snapshot_observed_at":"2026-08-07T14:06:54.817364Z","title":"PathLDM: Text conditioned Latent Diffusion Model for Histopathology","venue":"cs.CV","work_id":"3543bbb1-2204-4fb0-b2ae-2b71460d3927","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:51.847044Z"},"links":{"cited_paper":"/paper/2309.00748","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:06af06df3d10f87174516fe91f6541257d261919934225270c946dd688753377","observation_id":"7bc475f4-c260-4ee1-8ef0-fb19c053fbaf","resolution":{"observed_at":"2026-08-07T14:06:54.857114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16648","last_updated":"2023-08-31T11:44:40Z","snapshot_observed_at":"2026-07-06T16:12:42.589161Z","submitted_at":"2023-08-31T11:44:40Z","title":"Generate Your Own Scotland: Satellite Image Generation Conditioned on Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16648","snapshot_observed_at":"2026-08-07T14:06:51.959575Z","title":"Generate your own scotland: Satellite image generation conditioned on maps","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:51.959575Z"},"links":{"cited_paper":"/paper/2308.16648","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:ec5235bda3f11c62ea2e55cdbd9ff55446cdefb126035f4e0199793cf036a946","observation_id":"a9ffe029-eaad-4e40-ae29-8cc014e4afa2","resolution":{"observed_at":"2026-08-07T14:06:51.959575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02455","last_updated":"2024-10-05T08:42:15Z","snapshot_observed_at":"2026-07-06T16:14:53.027414Z","submitted_at":"2023-09-03T09:34:49Z","title":"RSDiff: Remote Sensing Image Generation from Text Using Diffusion Model","version":2},"cited_work":{"arxiv_id":"2309.02455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.02455","snapshot_observed_at":"2026-08-07T14:06:54.700705Z","title":"RSDiff: Remote Sensing Image Generation from Text Using Diffusion Model","venue":"cs.CV","work_id":"82063485-bb05-444a-b08d-de791afe7a19","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.085869Z"},"links":{"cited_paper":"/paper/2309.02455","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:96ff7b78015908a0799710f9048bb3c9633a364778aa9faf6ee4632e2c948765","observation_id":"835f4c14-42e8-4a81-b790-b0dfe214c2cf","resolution":{"observed_at":"2026-08-07T14:06:54.740550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:57.914138Z","title":"Diffinfinite: Large mask-image synthesis via parallel random patch diffusion in histopathology","venue":null,"work_id":"e313c4b9-ddea-46ba-83e9-a680bcc821f8","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.206481Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:ecf0e38d717e3b4887b7fbf846d2e9a8393a5f44e16d7a5075d01811b93f333f","observation_id":"38a8099b-876f-4083-9b15-fd5f310778fb","resolution":{"observed_at":"2026-08-07T14:06:57.990956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:57.806478Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"8f3eb870-6e0f-4a18-9691-843db692c391","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.380003Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:c5eb765beb7d609ebe7a892a9829934bf8397ddc163d7dd718f16eb07466f6a4","observation_id":"a6588839-6739-4c54-a6b4-2b9d52746045","resolution":{"observed_at":"2026-08-07T14:06:57.849838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T14:06:52.551359Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.551359Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:2f40346754f2bbc2e039b54bbd9b607bbdd4abf07ade7263d5c8905b7fb81ebb","observation_id":"8b5878c5-cde4-430d-8d15-44266ed48e53","resolution":{"observed_at":"2026-08-07T14:06:52.551359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T14:06:52.660020Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.660020Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:8db71eb64dac1a7ce900afc8ea9c9dc27bf6a09e0499f1f6d8b1fea03b45190b","observation_id":"ea94fad3-b85e-411e-9b82-40c19f678f2c","resolution":{"observed_at":"2026-08-07T14:06:52.660020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T14:06:52.743919Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.743919Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:7f59e88a83b3deb8a169828515f0a18d5e42d3e87c2733a27df59b35d2b81596","observation_id":"e6c5ff1e-165e-4788-a6c9-b6fe757af986","resolution":{"observed_at":"2026-08-07T14:06:52.743919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05977","last_updated":"2023-12-28T14:13:35Z","snapshot_observed_at":"2026-07-06T15:14:55.628493Z","submitted_at":"2023-04-12T16:58:13Z","title":"ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05977","snapshot_observed_at":"2026-08-07T14:06:52.820142Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.820142Z"},"links":{"cited_paper":"/paper/2304.05977","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:16e0447b244da280872949891dc60155c1e45ff8d52878d7c460d050504d8efe","observation_id":"ac61415e-7d8c-4bbf-82ff-03c186bd7891","resolution":{"observed_at":"2026-08-07T14:06:52.820142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05788","last_updated":"2023-09-11T19:47:27Z","snapshot_observed_at":"2026-07-06T16:17:07.927369Z","submitted_at":"2023-09-11T19:47:27Z","title":"Proceedings Combined 30th International Workshop on Expressiveness in Concurrency and 20th Workshop on Structural Operational Semantics","version":1},"cited_work":{"arxiv_id":"2309.05788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05788","snapshot_observed_at":"2026-08-07T14:06:54.462582Z","title":"Proceedings Combined 30th International Workshop on Expressiveness in Concurrency and 20th Workshop on Structural Operational Semantics","venue":"cs.LO","work_id":"0aaa984f-2d49-4735-9598-2688eaf3b92a","year":2023},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.870085Z"},"links":{"cited_paper":"/paper/2309.05788","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:d08cb82d5a0ea456d15f0765e25b9a6837a9cfb34e459e4250f97f2173474acd","observation_id":"0e115430-fe59-4210-8c0d-54f64c306505","resolution":{"observed_at":"2026-08-07T14:06:54.489092Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11708","last_updated":"2024-05-05T04:50:54Z","snapshot_observed_at":"2026-08-06T07:45:20.379717Z","submitted_at":"2024-01-22T06:16:29Z","title":"Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11708","snapshot_observed_at":"2026-08-07T14:06:52.960237Z","title":"Master- ing text-to-image diffusion: Recaptioning, planning, and generating with multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:52.960237Z"},"links":{"cited_paper":"/paper/2401.11708","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:d12e9ef088a3f3cfb3c2003cbfb273aa8f4ed6e94a716b324450a081efe988b4","observation_id":"b3b398bc-8821-45dd-bc29-fee3c6833b06","resolution":{"observed_at":"2026-08-07T14:06:52.960237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:53.066333Z","title":"Pixart- σ: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.066333Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:a51856435e98cf8667683808aa663e704384f0a15743545f20c02ee0f7907749","observation_id":"9fd60d17-982f-4d9c-8cba-f4daaa680f76","resolution":{"observed_at":"2026-08-07T14:06:53.066333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:53.135444Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.135444Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:da89867c26b7ef7e8da22707db280f3371535cfc4c8a107a4f38a16a19e1098a","observation_id":"00d7166c-da29-472b-910f-19f7d6158fc3","resolution":{"observed_at":"2026-08-07T14:06:53.135444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:06:53.216987Z","title":"\"\" Analyze m i s m a t c h e s between the image and the original prompt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.216987Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:42f48e7659985414da309ff88dd90b79c2231fde1e5687abebb4ebcf042f5d94","observation_id":"1e3bcc20-d7d9-46e8-9144-f7e9d13468b4","resolution":{"observed_at":"2026-08-07T14:06:53.216987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:57.695277Z","title":null,"venue":null,"work_id":"6faf964f-2cb3-4157-94ae-5796d477972a","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.272418Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:aac723a0bda687e2d4248bd37fffde724fc6e3554425ae9996c260034a49c99b","observation_id":"5849a7b6-c064-4c6b-b828-6a0e448de70e","resolution":{"observed_at":"2026-08-07T14:06:57.748867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:57.563010Z","title":null,"venue":null,"work_id":"5b2d83c7-c6ec-42bd-ac08-c9bc56cc60c3","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.356610Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:dedc4ed14e6aa889da49e8a0fc10700ca35bdeeeecccdc05dabb3832ac66ef56","observation_id":"b9ea0a37-f9b8-4b22-b3d2-a4fcb87725f0","resolution":{"observed_at":"2026-08-07T14:06:57.630453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:57.403621Z","title":"\"\" Generate an refined prompt to better match the original intent","venue":null,"work_id":"3978ea55-bb66-4bd4-9971-553a2c3132eb","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.483957Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:412ed86ab0e047732a8157c21c076f7e0c42f50553ef364c2ce323b3b00171c9","observation_id":"1d8ea50b-2b65-464c-bc35-36390c751286","resolution":{"observed_at":"2026-08-07T14:06:57.499882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:57.098839Z","title":null,"venue":null,"work_id":"cb3f7cdf-4de5-490f-ac0e-3ba0409374f1","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.605526Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:62de29fff1d126611c1c8a3b9fc3c95acf68ccd39e443b0cdce447c5d18917cb","observation_id":"3aed37fd-81df-490e-8b7b-e62f8595a9e2","resolution":{"observed_at":"2026-08-07T14:06:57.227179Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:56.835915Z","title":null,"venue":null,"work_id":"ffcc01db-fb41-4cad-a3c7-4268437280a7","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.738677Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:bd15734ddcdc426ecbcfd71006fd4f576b9b4216b61355a57622603adf26dce0","observation_id":"5dc84d7c-c437-4cf6-a6bf-81ff2e2ebcd1","resolution":{"observed_at":"2026-08-07T14:06:56.973480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:56.515628Z","title":null,"venue":null,"work_id":"2ff48113-9e7f-411f-8089-bb976b6ba787","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.801951Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:fda9952e2c20e7f7b492322ab6e50c425a3c046a082b6ad4c67d29faca1642cd","observation_id":"a612da21-ff5b-440a-8550-9912a649a6af","resolution":{"observed_at":"2026-08-07T14:06:56.682655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:56.227517Z","title":null,"venue":null,"work_id":"f2e3021b-b36f-48a4-abc3-6e8bb7151acb","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:53.914719Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:9534d87838c00c6fc2316f7e648a720c5396eb3fc8fb25f86f51de74c8e772f0","observation_id":"edb1aa06-00e2-4db7-819c-5e0df1c42cfc","resolution":{"observed_at":"2026-08-07T14:06:56.342548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:55.953681Z","title":"\"\" Generate a omission h ig hl igh t to e li mi na te unwanted elements","venue":null,"work_id":"57abdf8c-8a86-4a81-ad33-0ab4d827d5a6","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:54.032865Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:e01d35baf60a7a339923c7655cde5b9c4f69e133b5114285feee239ead103c75","observation_id":"fe3c1149-e799-43e8-931e-5db7bb1af3d6","resolution":{"observed_at":"2026-08-07T14:06:56.077454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:55.699971Z","title":null,"venue":null,"work_id":"e466acfa-6a41-4bbf-af29-70268c9cca57","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:54.168411Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:80a1b7b661d6379ee8831e5ae637f51baf2755bef895d49455fa918aea2c3b30","observation_id":"332eaefd-0085-4fa2-86c3-ec6e302ecb70","resolution":{"observed_at":"2026-08-07T14:06:55.814594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:06:55.360849Z","title":"OLLL”, “ZALL","venue":null,"work_id":"782f6f51-5cac-40d0-9a0d-6df44bb64095","year":null},"citing_paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:06:54.293800Z"},"links":{"citing_paper":"/paper/2505.20053"},"observation_digest":"sha256:e4dbc3051f695e3eb547204dcc6a92f911e73bcb70d66bdfa13e7608be58a4e7","observation_id":"b50e467b-8dcf-4084-85a6-d29d84eb4f9c","resolution":{"observed_at":"2026-08-07T14:06:55.537446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20053","last_updated":"2025-05-26T14:42:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:58:02.236530Z","submitted_at":"2025-05-26T14:42:35Z","title":"Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":50,"verified_exact":3,"verified_fuzzy":15},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 2 inbound Pith citation observations for arXiv:2505.20053."}