{"as_of":"2026-08-18T23:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40663328db5858cd2bca164450f399817ba181c2129372c039c9555f898f444c","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:48:34.038440Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13401/citation-record","integrity":"/paper/2507.13401/integrity","json":"/paper/2507.13401/citation-record.json","paper":"/paper/2507.13401"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:29.723374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:29.723374Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:48bd93b15bad9e2ef5a435b57ba19e4b3c4770079c46cf6a1cfbddada1e44ae7","observation_id":"40aa7432-0898-4b1f-b3ec-b7918a3ee569","resolution":{"observed_at":"2026-08-06T16:48:29.723374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-16T16:04:52.013149Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T16:48:29.960911Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:29.960911Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:bf96ddd47602a474bc455a927cae2d291e2b47026f9b90f56045bb61df705207","observation_id":"07764351-64d3-4d07-9710-39ec82cf5df2","resolution":{"observed_at":"2026-08-06T16:48:29.960911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:36.387454Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":"415d537d-addd-40c1-b524-24b0c4c75f55","year":2022},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:30.075783Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:d6ed25f9f241b6926e741443b01ee7922bb5fa87332a82641b231d15b5e448ad","observation_id":"4f0d0e10-8936-4265-8514-462f8edd60b0","resolution":{"observed_at":"2026-08-06T16:48:36.487936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:30.199603Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:30.199603Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:2963ed6ec9434732ce554c1d07545b486459f779656a78048ebcecf9bf33d5a1","observation_id":"1f70df94-920b-4d6f-ba6d-ad9e89f71182","resolution":{"observed_at":"2026-08-06T16:48:30.199603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:36.145781Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing, 2025","venue":null,"work_id":"9594d1cc-27db-48b1-a5f8-e5d253ba7910","year":2025},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:30.337360Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:8c2c1e2978231721f75ec84ad7a4979e741e71a75bddab6cde82bb428255dab7","observation_id":"3bc04cb4-535b-4f8b-bc66-7c3d66b9c0df","resolution":{"observed_at":"2026-08-06T16:48:36.261778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:30.466238Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:30.466238Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:d9dbd9e7087fd6b047656669ccadb6c740862b85410532f0684e8a0427a5e037","observation_id":"3f997ebe-b0a6-493b-bacd-890a5167ea63","resolution":{"observed_at":"2026-08-06T16:48:30.466238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02226","last_updated":"2024-04-21T03:39:21Z","snapshot_observed_at":"2026-08-18T21:09:48.830937Z","submitted_at":"2023-10-03T17:32:41Z","title":"Think before you speak: Training Language Models With Pause Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02226","snapshot_observed_at":"2026-08-06T16:48:30.625805Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:30.625805Z"},"links":{"cited_paper":"/paper/2310.02226","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:7cbd6fb00bc91ce1b1035e23cbd02826feaee64b5939623a2cdb9dfe0ba8e717","observation_id":"a06ac850-4280-4fab-9f07-12874da7d55f","resolution":{"observed_at":"2026-08-06T16:48:30.625805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:30.762790Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:30.762790Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:d816dfc1110b8f628241cccbb83988a5e248a238901234f23a523dc22919256c","observation_id":"2ea94b04-339f-4b24-b1a7-8745c2666fef","resolution":{"observed_at":"2026-08-06T16:48:30.762790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:30.895115Z","title":"Denoising diffusion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:30.895115Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:7e959433cbca28c2dbfc3be4652dad2b4e9f3e6d3f4cf14f38073c9e1191730a","observation_id":"b6b3c055-c2ef-4540-89f1-a02462553536","resolution":{"observed_at":"2026-08-06T16:48:30.895115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06787","last_updated":"2024-12-10T14:09:22Z","snapshot_observed_at":"2026-08-17T18:24:47.063800Z","submitted_at":"2024-12-09T18:59:56Z","title":"[MASK] is All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06787","snapshot_observed_at":"2026-08-06T16:48:31.037163Z","title":"[mask] is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:31.037163Z"},"links":{"cited_paper":"/paper/2412.06787","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:0762a496c18b07ccd581bfe46898292b4bd71fd006d74f90d4d33325e4b87ca2","observation_id":"d48de95d-3f88-46fe-9146-6531635ffd86","resolution":{"observed_at":"2026-08-06T16:48:31.037163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:35.822083Z","title":"Learning action and reasoning-centric image editing from videos and simulations, 2024","venue":null,"work_id":"04cd0eb4-4be9-4d71-995b-61ced6442128","year":2024},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:31.317425Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:6f07018d4022d8d68599c0e1d835dc43a4291be48a13a4f1cccd4373c57490ec","observation_id":"79961ac2-5dae-4ca5-a46b-1789267e4633","resolution":{"observed_at":"2026-08-06T16:48:35.946212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11767","last_updated":"2024-12-16T13:39:32Z","snapshot_observed_at":"2026-08-18T22:47:43.208620Z","submitted_at":"2024-12-16T13:39:32Z","title":"IDEA-Bench: How Far are Generative Models from Professional Designing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11767","snapshot_observed_at":"2026-08-06T16:48:31.473458Z","title":"Idea-bench: How far are generative models from professional designing? arXiv preprint arXiv:2412.11767, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:31.473458Z"},"links":{"cited_paper":"/paper/2412.11767","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:d2705af77e054b11c7c557fc0b9a0e3df0538333a67d5de0fc8d5df6739a4bd3","observation_id":"a4587575-9a8b-40b7-8d54-b84b02fe8bb1","resolution":{"observed_at":"2026-08-06T16:48:31.473458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:31.622705Z","title":"Show your work: Scratchpads for intermediate computation with language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:31.622705Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:1dd1e9c4eefdf80f6d8a656c848752f68c29f934b45f78b7849ffaab78493b17","observation_id":"1ef9e1ca-9511-49b7-9078-440483fe6ff7","resolution":{"observed_at":"2026-08-06T16:48:31.622705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T16:48:31.785039Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:31.785039Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:17509597c68631c261f8321bf334518c4df7faccba1b68ac8c07e1f337b1b037","observation_id":"16ce3eac-24a5-4948-8e64-b59f1362e2f1","resolution":{"observed_at":"2026-08-06T16:48:31.785039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:31.920475Z","title":"Cogcom: A visual language model with chain-of-manipulations reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:31.920475Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:ea552553cfb59d83ab56fdba3b38dacf0eb4ce3bb6bf736863d20af14b57d08c","observation_id":"bfb6dff6-9d3d-4afe-9f2a-69bc43bf3ab6","resolution":{"observed_at":"2026-08-06T16:48:31.920475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:32.050994Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:32.050994Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:d300d0f674173c0eb84160ae081eb6eac0436a6fc619fe284e546fdc0fe1c866","observation_id":"d1757b3d-0c9a-4f5d-89e7-9679c5766510","resolution":{"observed_at":"2026-08-06T16:48:32.050994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:32.208981Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:32.208981Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:c76e9a91e24b682cd58530dc1b5938116b8d4140f7a1f39badc95be1c5017c73","observation_id":"7e4e583e-a1c9-46e0-ad27-16f7a2b88cde","resolution":{"observed_at":"2026-08-06T16:48:32.208981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:35.444533Z","title":"Seededit: Align image re-generation to image editing, 2024","venue":null,"work_id":"260ca290-e899-485f-996e-9e2fd90fac38","year":2024},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:32.376334Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:5a3d5139f770660ae3cad2a4b156334c318833cd8c73cc2fb79b9df3fd2b77a7","observation_id":"1f67c3cd-25fd-407c-824d-030d14b09bf6","resolution":{"observed_at":"2026-08-06T16:48:35.606020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:35.168067Z","title":"Kingma, Abhishek Kumar, Stefano Ermon, and Ben Poole","venue":null,"work_id":"74f20911-89f9-473b-a6e1-631a99acbc67","year":2020},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:32.531370Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:b870cf64887d33dd65aa686011e0424c295a92a45940e0f351c139a41da1540c","observation_id":"f0b5e86f-e786-4a8e-b815-749978105f92","resolution":{"observed_at":"2026-08-06T16:48:35.283366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:34.867631Z","title":null,"venue":null,"work_id":"1c7f3e34-040d-4237-8e5d-a3c2bd0f0429","year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:32.709600Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:52bc2cb7cf47a13e85bdec5d8db86984f32e5b9a1a7189baae7c73e9a0926898","observation_id":"17aed3b1-0717-4500-9363-f91343110c5d","resolution":{"observed_at":"2026-08-06T16:48:34.948628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:32.860648Z","title":"Omniedit: Building image editing generalist models through specialist supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:32.860648Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:15205e65f8022464839b21bf4d1d1e1ffd0a5223503dd42758d9d305473a8f55","observation_id":"420c2d08-bc12-487c-b64b-2a1f0898d681","resolution":{"observed_at":"2026-08-06T16:48:32.860648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:33.014953Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:33.014953Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:c2005818741948a6fb4a4f3dc53f4cd82b778cbeea6d5ca3e5a7b696b8f4298e","observation_id":"69d05fb5-b143-487f-b40b-12e909dcec6d","resolution":{"observed_at":"2026-08-06T16:48:33.014953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11340","last_updated":"2024-11-21T14:09:12Z","snapshot_observed_at":"2026-08-16T13:17:46.268142Z","submitted_at":"2024-09-17T16:42:46Z","title":"OmniGen: Unified Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11340","snapshot_observed_at":"2026-08-06T16:48:33.123960Z","title":"Omnigen: Unified image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:33.123960Z"},"links":{"cited_paper":"/paper/2409.11340","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:a57748451b7e9dd247038b7ad541237573ed35d6c26b9bd2d11ae1c52d4c80b9","observation_id":"6955a465-4660-4db5-a29b-62daf9ac3edc","resolution":{"observed_at":"2026-08-06T16:48:33.123960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-08-18T17:34:44.890427Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T16:48:33.253084Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:33.253084Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:a144c3d467324aa52d2151a82708d0b63ab04572b2cd358eb616e5ccbe9fa0d7","observation_id":"2a0b67ba-be06-4d2a-8a44-7e5bda064be9","resolution":{"observed_at":"2026-08-06T16:48:33.253084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:34.560048Z","title":"Llava-cot: Let vision language models reason step-by-step, 2025","venue":null,"work_id":"e6074261-f67f-48eb-b67e-9a7425c3a827","year":2025},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:33.380627Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:0a2135d0141ede5946092148aeb58660be30ff83f17f7091c0347db676361a19","observation_id":"88691822-0144-4c17-bedb-9eba35c6cf76","resolution":{"observed_at":"2026-08-06T16:48:34.671198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:34.329012Z","title":"Complex-Edit: Cot-like instruction generation for complexity-controllable image editing benchmark, 2025","venue":null,"work_id":"3bbccea8-229c-4f4b-a282-c6ff9674cf4b","year":2025},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:33.548602Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:64296b1fc7a2484bc4b43bbfc6b78bbabd2437d24fe9477788b24e1df7ef0c34","observation_id":"483ca2e6-6335-4900-9e6c-adaba0f497af","resolution":{"observed_at":"2026-08-06T16:48:34.416256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:33.661386Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:33.661386Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:1e63d456325eac4b1e370a3c2c965d3714b48fe3ae645ea4c0641e0cb82e621a","observation_id":"cfe9c930-2380-48b4-8efe-c962a317a2b0","resolution":{"observed_at":"2026-08-06T16:48:33.661386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:33.801958Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:33.801958Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:1e3f95da006e2302bc9fe4d81ecc8f46d0e13f70fce9a1272474fa8c2fc5fe72","observation_id":"d6782d8f-6fa3-448d-9f95-a07b0a0c41b0","resolution":{"observed_at":"2026-08-06T16:48:33.801958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:33.923207Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:33.923207Z"},"links":{"citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:a0cdba2d704479ae90743d38085218c31211b2413c2cdad6c7124dddaa42cf09","observation_id":"a49bcbc2-53c8-4629-abe3-83e89f15f9a0","resolution":{"observed_at":"2026-08-06T16:48:33.923207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09305","last_updated":"2024-03-05T01:10:18Z","snapshot_observed_at":"2026-08-16T15:23:34.823593Z","submitted_at":"2023-06-15T17:38:48Z","title":"Fast Training of Diffusion Models with Masked Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09305","snapshot_observed_at":"2026-08-06T16:48:34.038440Z","title":"pause tokens,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:34.038440Z"},"links":{"cited_paper":"/paper/2306.09305","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:c5da9b6b6855bfb2f3ee37def41109be3d06b36fbe8ae631678de2e86416b441","observation_id":"54f2b4ff-c8c9-4a47-9964-0a21b2e591d9","resolution":{"observed_at":"2026-08-06T16:48:34.038440Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T23:50:55.894948Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2507.13401."}