{"as_of":"2026-08-08T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bfc0a7e5ef2f8026e6dfb38db6e93ba5561459c787c5212d5329ab5d1970a1b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:26:57.014104Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.608389Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-08T05:26:57.014104Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08364","last_updated":"2025-08-15T00:20:58Z","snapshot_observed_at":"2026-08-08T05:20:32.191564Z","submitted_at":"2025-02-12T12:50:24Z","title":"A Survey on Pre-Trained Diffusion Model Distillations","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T05:26:57.014104Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2502.08364"},"observation_digest":"sha256:1032190e3940b8981f660afc1103c2ef94732e3f1715d117104e7e0e9552d523","observation_id":"0e345701-4149-431f-a655-25e323bdb32e","resolution":{"observed_at":"2026-08-08T05:26:57.014104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-07T15:02:18.230361Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16707","last_updated":"2025-05-22T14:08:59Z","snapshot_observed_at":"2026-08-07T22:16:46.041806Z","submitted_at":"2025-05-22T14:08:59Z","title":"KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:18.230361Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2505.16707"},"observation_digest":"sha256:0d60107ccb7bc477d2fba6238431da0e3e933272149c5849ce1d5ad809adffdd","observation_id":"878b40ac-f11b-43b7-a642-64d481dac74d","resolution":{"observed_at":"2026-08-07T15:02:18.230361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-07T12:27:34.712223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24423","last_updated":"2025-05-30T10:02:15Z","snapshot_observed_at":"2026-08-07T12:20:03.288235Z","submitted_at":"2025-05-30T10:02:15Z","title":"MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:34.712223Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2505.24423"},"observation_digest":"sha256:4a75404f7629aee040daae7d7ab94d33f83a1326208d0d4b50659b1917302008","observation_id":"6c2fbbb3-ed15-49b7-9928-5a3138001b26","resolution":{"observed_at":"2026-08-07T12:27:34.712223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-06T20:25:27.267209Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-08T10:07:54.393945Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.267209Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:7be3eba77bcedf8af7c67d5ac93c812eb552c83ef163060501c800b01465cd58","observation_id":"40b743f7-bc70-444f-8b57-053c8fc6fc83","resolution":{"observed_at":"2026-08-06T20:25:27.267209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-06T19:34:25.575695Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05426","last_updated":"2025-07-07T19:15:43Z","snapshot_observed_at":"2026-08-07T05:29:05.779275Z","submitted_at":"2025-07-07T19:15:43Z","title":"Mastering Regional 3DGS: Locating, Initializing, and Editing with Diverse 2D Priors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:34:25.575695Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2507.05426"},"observation_digest":"sha256:e1951502db4ebd53a3a06c880f0b46e23761f15436dd1a2d4c62f8a9f98e6c81","observation_id":"ba30208d-2536-458a-92f1-067bd37636db","resolution":{"observed_at":"2026-08-06T19:34:25.575695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-06T17:10:56.151197Z","title":"A survey of multimodal-guided image editing with text-to-image diffu- sion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11533","last_updated":"2025-07-15T17:58:08Z","snapshot_observed_at":"2026-08-06T17:04:19.137456Z","submitted_at":"2025-07-15T17:58:08Z","title":"CharaConsist: Fine-Grained Consistent Character Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:10:56.151197Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2507.11533"},"observation_digest":"sha256:933cb0c11a387e19311abe996dcd7617217edca99975c7371f1fe489c6d1cb69","observation_id":"8165f4f7-8e44-44bb-922b-a229563d7772","resolution":{"observed_at":"2026-08-06T17:10:56.151197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2604.26031","last_updated":"2026-04-28T18:14:18Z","snapshot_observed_at":"2026-07-06T23:11:48.524898Z","submitted_at":"2026-04-28T18:14:18Z","title":"Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T16:52:26.262129Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2604.26031"},"observation_digest":"sha256:8cdbe66806b732eaccbd2fb4000b20e70cf4900d1069acdb7b88b0ea19b86447","observation_id":"e6af47d5-4af3-440e-8548-3eb7ebda4aa4","resolution":{"observed_at":"2026-05-11T23:31:15.614068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2605.10204","last_updated":"2026-05-11T08:51:28Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:51:28Z","title":"3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T04:10:35.320940Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2605.10204"},"observation_digest":"sha256:50c8232b5396261be4c31a57fef8b77e518134c293f4f2177224e6606c988d0a","observation_id":"59122a93-fd2f-47a9-9bbf-ac778dbaa19e","resolution":{"observed_at":"2026-05-12T06:31:29.034804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2605.19750","last_updated":"2026-05-19T12:18:15Z","snapshot_observed_at":"2026-07-06T23:30:25.609722Z","submitted_at":"2026-05-19T12:18:15Z","title":"CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T07:01:01.427273Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2605.19750"},"observation_digest":"sha256:f34fafa2fe8c265ee6429c14a7809cc2146d529491a8be180436b20f127b05e8","observation_id":"892abf8a-cee7-46cd-9aea-c74da73112c2","resolution":{"observed_at":"2026-05-20T07:03:06.239593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2605.25568","last_updated":"2026-05-25T08:20:23Z","snapshot_observed_at":"2026-08-07T13:41:58.020131Z","submitted_at":"2026-05-25T08:20:23Z","title":"Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T23:06:29.200541Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2605.25568"},"observation_digest":"sha256:39e307193289dd753a6083adb992b0340960590375fe620124777e07c70e25d1","observation_id":"4396eee7-f712-44f0-95e4-134bbbd06b38","resolution":{"observed_at":"2026-06-29T23:14:02.005615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2406.14555","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-07-03T14:48:32.608389Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":"a7574e01-1b4b-4ac4-9334-79a174e2c07d","year":2024},"citing_paper":{"arxiv_id":"2607.02497","last_updated":"2026-07-02T17:56:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-07-02T17:56:49Z","title":"Seek to Segment: Active Perception for Panoramic Referring Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-03T14:39:22.617747Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2607.02497"},"observation_digest":"sha256:ec10af1b0259c5027331c11e3d97a579d5032b45ad36b355f826e6c4687ab291","observation_id":"0b2d1af0-f569-4eb2-8d1a-0abb21da0e73","resolution":{"observed_at":"2026-07-03T14:48:32.609856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-01T12:45:18.568969Z","title":"arXiv preprint arXiv:2406.14555 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19344","last_updated":"2026-07-21T17:59:12Z","snapshot_observed_at":"2026-08-07T03:53:37.076179Z","submitted_at":"2026-07-21T17:59:12Z","title":"Appearance Pointers -- Multimodal Region Control of Diffusion Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T12:45:18.568969Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2607.19344"},"observation_digest":"sha256:fe4f380572c8c3674167aba16f8128b1a697a15b1de32c250a0da9b1c43da710","observation_id":"434f46b2-f6e4-45c2-bbba-52c4b15aa7ec","resolution":{"observed_at":"2026-08-01T12:45:18.568969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.14555/citation-record","integrity":"/paper/2406.14555/integrity","json":"/paper/2406.14555/citation-record.json","paper":"/paper/2406.14555"},"outbound":[],"paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T18:59:34.400882Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2406.14555."}