{"as_of":"2026-08-08T21:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f99520bfc19ed6eb31d0ada874fc14104b39b1df57b3764bc6fd69aa2c7f7ad","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:24:41.613546Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:30:41.848847Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:16:44.528778Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10458","snapshot_observed_at":"2026-08-07T00:30:41.848847Z","title":"I think, therefore i diffuse: Enabling multimodal in-context reasoning in diffusion models.arXiv preprint arXiv:2502.10458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13846","last_updated":"2025-06-26T16:39:32Z","snapshot_observed_at":"2026-08-08T01:12:51.911821Z","submitted_at":"2025-06-16T17:59:40Z","title":"Fake it till You Make it: Reward Modeling as Discriminative Prediction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:41.848847Z"},"links":{"cited_paper":"/paper/2502.10458","citing_paper":"/paper/2506.13846"},"observation_digest":"sha256:65ec521c6fe7a8c52a52b0cc9676e770dd823e0f4a2a716b1f8c056d65ecc2a6","observation_id":"6b9f5c38-17bd-4f58-bd65-fb5155828610","resolution":{"observed_at":"2026-08-07T00:30:41.848847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10458","snapshot_observed_at":"2026-08-05T22:23:09.762650Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07135","last_updated":"2025-08-10T01:15:37Z","snapshot_observed_at":"2026-08-05T22:23:08.270280Z","submitted_at":"2025-08-10T01:15:37Z","title":"Canvas3D: Empowering Precise Spatial Control for Image Generation with Constraints from a 3D Virtual Canvas","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T22:23:09.762650Z"},"links":{"cited_paper":"/paper/2502.10458","citing_paper":"/paper/2508.07135"},"observation_digest":"sha256:763c5f280b856b7884beba2cc01cccd954135e4bfd52470af3d8467d33019655","observation_id":"bdf387b8-c76b-48f7-bc82-8ba6fb216934","resolution":{"observed_at":"2026-08-05T22:23:09.762650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10458","snapshot_observed_at":"2026-08-03T05:23:34.601925Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-08T05:57:49.430723Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:34.601925Z"},"links":{"cited_paper":"/paper/2502.10458","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:1ca83b064843d443bdc9778f73bcbc456b195b1bd56e562e0e50b77d73b5e943","observation_id":"78e3f980-ffb4-4779-8a20-f93842855331","resolution":{"observed_at":"2026-08-03T05:23:34.601925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"cited_work":{"arxiv_id":"2502.10458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10458","snapshot_observed_at":"2026-07-02T07:16:44.528778Z","title":"I think, therefore i diffuse: Enabling multimodal in-context reasoning in diffusion models.ArXiv, abs/2502.10458, 2025","venue":null,"work_id":"25163ddc-dc62-4134-8ffb-603e045a92d7","year":2025},"citing_paper":{"arxiv_id":"2606.04479","last_updated":"2026-06-03T05:53:58Z","snapshot_observed_at":"2026-08-03T21:43:54.545392Z","submitted_at":"2026-06-03T05:53:58Z","title":"Evaluating Reasoning Fidelity in Visual Text Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T07:03:38.967856Z"},"links":{"cited_paper":"/paper/2502.10458","citing_paper":"/paper/2606.04479"},"observation_digest":"sha256:aad61fd0dc9aa6e06f21caf5702681022733fb4b110de8f4e71e5db57a36a8da","observation_id":"7caac5a9-9141-425b-8b35-17869fbb82d9","resolution":{"observed_at":"2026-07-02T07:16:44.531073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10458/citation-record","integrity":"/paper/2502.10458/integrity","json":"/paper/2502.10458/citation-record.json","paper":"/paper/2502.10458"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T10:24:41.549136Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.549136Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:9cf053258080b8968b01b307a54ebade6358886afcda00f0b8cb6b07d23911e2","observation_id":"22f885db-7021-4c7d-b4d2-f2e02da7de95","resolution":{"observed_at":"2026-08-08T10:24:41.549136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-07-06T19:16:23.103921Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-08T10:24:41.559300Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.559300Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:feb8d141080d65f5b3965113bdf257f69ec1646e8ba119e5af6bd06b7f1ddeb3","observation_id":"4ed10bf5-00e1-4e10-b85f-b2740dd74a1c","resolution":{"observed_at":"2026-08-08T10:24:41.559300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-08T10:24:41.577917Z","title":"Gen- erative pretraining in multimodality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.577917Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:e87658a0932de1cf0c7949bf192dcf221bce3d374643acc70199577f3fd25067","observation_id":"d4894015-2a6d-478c-a88c-cf596569162e","resolution":{"observed_at":"2026-08-08T10:24:41.577917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-08T10:24:41.582650Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.582650Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:31a5de9bf25bdbb5676280f2d99218c3576a047fa175405a220d8982c134bd9d","observation_id":"5f3c019a-4926-4b07-9d9f-7d2714d09cc2","resolution":{"observed_at":"2026-08-08T10:24:41.582650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T10:24:41.587655Z","title":"Moa: Mixture-of-attention for subject-context disentanglement in personalized image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.587655Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:9d743d9e8dda42c109c1360d9259cbea4689ff0c11a5d9b484e7bfee746222a6","observation_id":"083c57dd-e15a-4e01-b9b9-032256d952e3","resolution":{"observed_at":"2026-08-08T10:24:41.587655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-08T10:24:41.592218Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.592218Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:6ad6c0e790a7ea5a1889567fdaecbf14aa964b37e47a5be770cc019454262524","observation_id":"58444dd7-0d96-4e22-af4f-c55c151bc7b2","resolution":{"observed_at":"2026-08-08T10:24:41.592218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10629","snapshot_observed_at":"2026-08-08T10:24:41.596545Z","title":"Yang, A., Yang, B., Zhang, B., Hui, B., Zheng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.596545Z"},"links":{"cited_paper":"/paper/2410.10629","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:ef28d457745e1e7194e635ded0fda52986e3278f21a3470c3e52ed8c93b836e8","observation_id":"89300a6a-ce86-42d5-9296-ee9b39e789eb","resolution":{"observed_at":"2026-08-08T10:24:41.596545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19335","last_updated":"2024-05-29T17:59:58Z","snapshot_observed_at":"2026-08-01T16:34:38.923197Z","submitted_at":"2024-05-29T17:59:58Z","title":"X-VILA: Cross-Modality Alignment for Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19335","snapshot_observed_at":"2026-08-08T10:24:41.600967Z","title":"X- vila: Cross-modality alignment for large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.600967Z"},"links":{"cited_paper":"/paper/2405.19335","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:37f65130a81e42543c09fa681c24923a9585f1c3c0e069e63d8267ed988c05b2","observation_id":"33892029-21d1-4f12-b64c-54f9cd3d0a5e","resolution":{"observed_at":"2026-08-08T10:24:41.600967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-08T10:24:41.605239Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.605239Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:6a7be8808b973b4a849a36ec7892ad8cf3fc8ebc7b497674932b5064c023595e","observation_id":"66aca6c8-bbd4-4ea9-99fd-bb9ff985fd77","resolution":{"observed_at":"2026-08-08T10:24:41.605239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:24:41.854732Z","title":"Limitation Despite ThinkDiff’s strong performance in reasoning generation tasks, several limitations remain for future work","venue":null,"work_id":"16cf22f8-5ac9-4f9b-8d95-b294fbc0bec7","year":2018},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.609473Z"},"links":{"citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:26a83634128227e27e2b0107e7577599f32add5d2040c8897a099f5d179f69e0","observation_id":"cb751775-0dc6-4f23-9fda-ee7c7109f809","resolution":{"observed_at":"2026-08-08T10:24:41.859449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:24:41.838261Z","title":"These images are preprocessed using Qwen2-VL, which generates detailed descriptions based on randomly selected text prompts from a predefined set","venue":null,"work_id":"a69ccad1-875e-4a77-9b0f-0e37458ce17f","year":2023},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.613546Z"},"links":{"citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:d4e6372d607e437fdf0ee3cf7c1248a8ff3343b7fc5b3c2ab4ed81a3cddcd12b","observation_id":"7f35c36b-0d8d-4518-b496-4576e66c666d","resolution":{"observed_at":"2026-08-08T10:24:41.843637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-08T10:24:41.564014Z","title":"Kosmos-g: Generating images in context with multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.564014Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:0cbd1a33158547b157aadebcadc62a74270a512f13e08ffbabe68fc64fd93359","observation_id":"2d81f8f4-bbf6-47d5-8c78-f11dd0ff8683","resolution":{"observed_at":"2026-08-08T10:24:41.564014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15188","last_updated":"2025-02-05T02:26:38Z","snapshot_observed_at":"2026-08-02T19:18:33.010410Z","submitted_at":"2024-12-19T18:56:24Z","title":"LMFusion: Adapting Pretrained Language Models for Multimodal Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15188","snapshot_observed_at":"2026-08-08T10:24:41.573614Z","title":"V ., Zettle- moyer, L., and Yu, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.573614Z"},"links":{"cited_paper":"/paper/2412.15188","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:0420e6716eb012bbebb818870a6fca599f8a162ffd46d4071863ddd282aaf1ee","observation_id":"82064ae3-1537-41f5-954b-ed80812f159e","resolution":{"observed_at":"2026-08-08T10:24:41.573614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-07T22:08:49.929764Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-08-08T10:24:41.568747Z","title":"Dreambench++: A human-aligned benchmark for personalized image gener- ation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.568747Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:2b31dab09afb98afaf2bdabd0eab8ebd2cf411da47a0e7076a7fab55c859722e","observation_id":"774753ec-f91e-4c9c-a525-2acc165eaf77","resolution":{"observed_at":"2026-08-08T10:24:41.568747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18790","last_updated":"2024-09-11T21:56:02Z","snapshot_observed_at":"2026-07-06T18:37:39.282367Z","submitted_at":"2024-06-26T23:21:42Z","title":"MUMU: Bootstrapping Multimodal Image Generation from Text-to-Image Data","version":2},"cited_work":{"arxiv_id":"2406.18790","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.18790","snapshot_observed_at":"2026-08-08T10:24:41.806313Z","title":"MUMU: Bootstrapping Multimodal Image Generation from Text-to-Image Data","venue":"cs.CV","work_id":"49ed143d-4724-4f75-b9f1-1f2fd0249513","year":2024},"citing_paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T10:24:41.554662Z"},"links":{"cited_paper":"/paper/2406.18790","citing_paper":"/paper/2502.10458"},"observation_digest":"sha256:1807b0ed8b9b42f6f63f538612df74a77434e7e99c1bacd0680ff15a27244da0","observation_id":"45ddc80c-8930-4c48-b240-0512dee2b3da","resolution":{"observed_at":"2026-08-08T10:24:41.812464Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.10458","last_updated":"2025-02-12T05:30:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T10:16:55.365971Z","submitted_at":"2025-02-12T05:30:08Z","title":"I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 4 inbound Pith citation observations for arXiv:2502.10458."}