{"as_of":"2026-08-07T19:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e40a201827c4c6449cad262fc74a66f5e82199c882303a6521b49d3e9c95dc5b","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:44:35.062271Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23482/citation-record","integrity":"/paper/2506.23482/integrity","json":"/paper/2506.23482/citation-record.json","paper":"/paper/2506.23482"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T21:44:31.315697Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:31.315697Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:b1a14b8ff44e2a1e560224e1932e325ac356637bf0b664bd2813cc0684e7da86","observation_id":"dfba4dbe-fe03-4af2-80c1-2d278ba06c6e","resolution":{"observed_at":"2026-08-06T21:44:31.315697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:37.884216Z","title":"Blended latent diffusion","venue":null,"work_id":"1b23cd20-dea4-4b44-8600-cd25ef27b0a5","year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:31.373510Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:b68c015649f3b2b3a24f34e5af37c65541a6b8a4b87f5ed19a13651a5d738739","observation_id":"76ef8b62-a6fb-423f-bc2e-b44a7db2f237","resolution":{"observed_at":"2026-08-06T21:44:37.963711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:37.763021Z","title":"Improving text-guided object inpainting with semantic pre-inpainting","venue":null,"work_id":"991b99b8-ece5-4f98-a67e-f2e7eb0faf3c","year":2025},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:31.462780Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:6574ad611392dca39e0a323affe2821f5c985a3b2640f0e5a7d8485557a88427","observation_id":"86f77fc9-22b5-4859-93f1-92b5062bc25f","resolution":{"observed_at":"2026-08-06T21:44:37.815462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-01T15:07:11.635426Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-06T21:44:31.592924Z","title":"Diffedit: Diffusion-based seman- tic image editing with mask guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:31.592924Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:44ae06cc1287454e45044f463de94f5533f22edb34552936214af18d1cf0cf87","observation_id":"aedc1592-037e-4636-9e0d-67ca8d1105e1","resolution":{"observed_at":"2026-08-06T21:44:31.592924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:31.678111Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:31.678111Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:fce6b761c246a844d9cc44a90b6d5faf8594b2d34ae613ba8d1f2356e765bec5","observation_id":"5d9579db-dec8-481d-b5ae-843a0cf8faa5","resolution":{"observed_at":"2026-08-06T21:44:31.678111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T21:44:31.767307Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:31.767307Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:53b28de19c9c182c917fbefc2b709ae0467b49018e15a0780fed890d8c0d19c5","observation_id":"ee3d785e-1010-4d68-bac4-978a365313d6","resolution":{"observed_at":"2026-08-06T21:44:31.767307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:31.844765Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:31.844765Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:2ed541356f0e76ce426c4c0d40f367827d6051dced6e3d81fac98ae0774b73e6","observation_id":"65a465a8-5e63-4c7d-a6a2-a446422550ee","resolution":{"observed_at":"2026-08-06T21:44:31.844765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:31.902694Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:31.902694Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:eeae5032ef5b7a69e0ccb8fd16d7ebdc964401ffc3db6e3488e8546fa4a84138","observation_id":"be1b7989-f77f-4780-9397-8870f926f066","resolution":{"observed_at":"2026-08-06T21:44:31.902694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06976","last_updated":"2024-03-11T17:59:31Z","snapshot_observed_at":"2026-07-06T17:42:49.471518Z","submitted_at":"2024-03-11T17:59:31Z","title":"BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06976","snapshot_observed_at":"2026-08-06T21:44:31.990782Z","title":"Brushnet: A plug-and-play image inpaint- ing model with decomposed dual-branch diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:31.990782Z"},"links":{"cited_paper":"/paper/2403.06976","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:c2ef1e1b7bf467c4568b6be727ba30757da01f10c73dfbf888428c43d351ef66","observation_id":"6ceca655-ac5f-42e5-8ba1-a1a8c090944f","resolution":{"observed_at":"2026-08-06T21:44:31.990782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T21:44:32.112058Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.112058Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:f73a20e1ce6f44426f384ee454742101148bafbb53d3541f2e509c4820867ce5","observation_id":"07a1fd02-6678-4be5-bdde-1f329773b585","resolution":{"observed_at":"2026-08-06T21:44:32.112058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T21:44:32.178531Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.178531Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:4aab6f0016deb3fef94efa67b492f764148593ae2dccbb9d82428c95ec25cff4","observation_id":"59fb3945-2482-4b55-bf87-3f6d9b674507","resolution":{"observed_at":"2026-08-06T21:44:32.178531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:32.238435Z","title":"Openimages: A public dataset for large-scale multi-label and multi-class image classification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.238435Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:3f4a30689e1eef83c3ab144d14047b1189d178bf74704e126629cc3484f67298","observation_id":"93513296-9f27-4ac9-ab37-17933ed1e2df","resolution":{"observed_at":"2026-08-06T21:44:32.238435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:32.306406Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.306406Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:143fb235a7b80c6db7ac6c618eed10d7a4de511c485a9cb9d7fdf5a681552804","observation_id":"338ac064-ecf6-4a04-8d8b-b49fb7a4d69b","resolution":{"observed_at":"2026-08-06T21:44:32.306406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:37.531778Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":"9af5376c-9cbe-4eae-9d56-be7412beb665","year":2024},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.396347Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:9277309901c214aa17696bd3a0e34bea20b74eb3103d7f2b09717b5c8df5aa26","observation_id":"83aaeaef-9b05-4f20-8a8c-903da4f955a5","resolution":{"observed_at":"2026-08-06T21:44:37.623181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:37.333786Z","title":"Visual instruction tuning","venue":null,"work_id":"92a71686-af29-4a8c-8b13-c94788b06bb4","year":2024},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.472710Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:f6c56681493e1e7f71ca33fe1ba472ca51093e7f5b71d018a1df2214ce09342e","observation_id":"0cbc1f01-05f9-4dfa-a9df-c6ba2f9daa39","resolution":{"observed_at":"2026-08-06T21:44:37.415119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T21:44:32.529119Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.529119Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:11c939c3984f5e7480738b62a5a41da3c0e92eda39365ce0d3975a1cb0ff536e","observation_id":"b513da9e-eaea-4042-a083-ff67ccb4376a","resolution":{"observed_at":"2026-08-06T21:44:32.529119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:37.176894Z","title":"Painterly image harmonization using diffusion model","venue":null,"work_id":"a11fe992-75db-4581-ab94-424293179d06","year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.580426Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:b69b38cc6bbd8ed801126145ffc0e2a9d5e8f7bf02f23f23cc0dc92b758cf3a3","observation_id":"12826b62-1358-47a8-8383-a6827ab1acb1","resolution":{"observed_at":"2026-08-06T21:44:37.244061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:32.627275Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.627275Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:ed676ddbd841a065dee40c701545afb1a1ae156b2c250a484f8d73a0c9c710b1","observation_id":"1fd03217-ed05-439d-b3ab-bf6a2ab1d34b","resolution":{"observed_at":"2026-08-06T21:44:32.627275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:32.697248Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.697248Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:c8b74ff917fa71124d27336c15220aaeb00864820bc5bb811a76217886bcc62f","observation_id":"3d2074cb-8c15-44b8-80a1-c29e525c26e4","resolution":{"observed_at":"2026-08-06T21:44:32.697248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T21:44:32.769913Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.769913Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:48b35897b221dc92618e7ea9936c566a5e8c5ae7f8274161b0e8991ae9440ae1","observation_id":"55332f8b-7bd3-4dae-ad72-3bc87f3ffc8d","resolution":{"observed_at":"2026-08-06T21:44:32.769913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:32.862190Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.862190Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:d98d3011e43b6fde5506ad1e43e1a1ac96559ef8471f02887566d20fcb747a09","observation_id":"0eee0116-9a44-4d8b-b6c5-559a07ccc566","resolution":{"observed_at":"2026-08-06T21:44:32.862190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:32.995644Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:32.995644Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:68f4731e3d0dc37adc35303cd2bf275592d85361fcd7004784ac0b927f028497","observation_id":"dd17796d-10e2-403b-bb24-9a977f4cca8c","resolution":{"observed_at":"2026-08-06T21:44:32.995644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T21:44:33.089246Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.089246Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:e38c1e3d523522ae5f2497f234771cff8a8c59edcde95ef42f034595a9852f40","observation_id":"d936efd2-d870-4a01-859c-e8055db9cb35","resolution":{"observed_at":"2026-08-06T21:44:33.089246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:33.180974Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.180974Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:748bdbd21e0bc26d454b06b5aea239399c0ceb5cb7fc2c156c60012d27b51a12","observation_id":"220a25bb-c6e8-4f93-94bc-c745f3a7b0d5","resolution":{"observed_at":"2026-08-06T21:44:33.180974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:36.959545Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"c4ad3a11-a069-445c-9358-380d5a7ac8d5","year":2022},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.308076Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:3ce5d71c06ff3ae38c8a8b4d12653b3c3845e1419d3439c0ff481d67e312967a","observation_id":"a4593b8d-a898-48e5-ae36-1106adcc444a","resolution":{"observed_at":"2026-08-06T21:44:37.041117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:33.460635Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.460635Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:308ba67840275813cdc6ff5b63a749e5c19698fabf6c35e43cbe0773d88e9b51","observation_id":"af4feec8-a447-4250-8726-5f2557690626","resolution":{"observed_at":"2026-08-06T21:44:33.460635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:33.584428Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.584428Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:008b1abda0eb1018f20af04d28eb6acf399f991d4057742727f932037f87f57f","observation_id":"d50df278-8d55-4525-8dd7-760c55fddf6b","resolution":{"observed_at":"2026-08-06T21:44:33.584428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:36.786499Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"c708a2d0-45ef-40d8-b862-158bc45fa000","year":2022},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.650381Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:69b28e6b0fe35a3c5741e43d8a3c5f592257938a951c9db0cf2fda2b80b80936","observation_id":"021b044c-be0b-4d31-bb12-186bb536ce76","resolution":{"observed_at":"2026-08-06T21:44:36.857911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T21:44:33.721984Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.721984Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:620d9faeb027ff254f10139b25fce2d326124de69be94dd914a57db21c1f7b8a","observation_id":"1d7a29ca-e4b4-475a-89ed-dc5199b7a6ab","resolution":{"observed_at":"2026-08-06T21:44:33.721984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:33.812592Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.812592Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:f18b81c6853c6d53816bb42458fcefd72e663a7f30790efc0c7ef9380163d165","observation_id":"3dac835f-1ca7-4c4f-baa7-5fcfdfc66acb","resolution":{"observed_at":"2026-08-06T21:44:33.812592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01292","last_updated":"2024-04-01T17:58:30Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:30Z","title":"Measuring Style Similarity in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01292","snapshot_observed_at":"2026-08-06T21:44:33.912238Z","title":"Measuring style similarity in diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.912238Z"},"links":{"cited_paper":"/paper/2404.01292","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:1e5488bae67a251a15d7c621e6f87c93b8ee3794719487d2c1121a64c27d94cf","observation_id":"0ff357ea-02dd-495b-a5c6-a5aba7f68d00","resolution":{"observed_at":"2026-08-06T21:44:33.912238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T21:44:33.990028Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:33.990028Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:18c31cf7dc095b7904423a5fe2d5e67c437f7c9155ce2a3dde6e060454869cdf","observation_id":"f5edcb00-cd82-476d-a6a4-a18f06a92d70","resolution":{"observed_at":"2026-08-06T21:44:33.990028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:34.087414Z","title":"Generative modeling by esti- mating gradients of the data distribution","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.087414Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:40ee9edb0a48d0d18ec73e1cad142ad61ea6f8ab6da6420d814bdadac513d1e2","observation_id":"1a950043-6e13-4496-a8f4-d2594b8618b4","resolution":{"observed_at":"2026-08-06T21:44:34.087414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:36.620351Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided im- age inpainting","venue":null,"work_id":"6e5c8cfd-6c26-487a-8cb1-1e0fd03cad2c","year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.165948Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:578a252e4a6f4fcb0a79937cd3bb915061db3b238a1b8eb021e9a210ce736d31","observation_id":"5f10836f-00ae-42d3-a7df-870a670f7c85","resolution":{"observed_at":"2026-08-06T21:44:36.702271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:36.441205Z","title":"Stylediffusion: Controllable disentangled style transfer via diffusion models","venue":null,"work_id":"0d1a47f9-adcd-4173-8dcf-4223a9a809ef","year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.242925Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:32229c1b043ed19dbd4e89d8e60ffa95caa96d90304abc09d4568eac71013e4a","observation_id":"d612582c-892e-4adf-bd4c-6c3e7ff27221","resolution":{"observed_at":"2026-08-06T21:44:36.549017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-07-06T11:05:04.853545Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-06T21:44:34.295676Z","title":"Godiva: Gen- erating open-domain videos from natural descriptions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.295676Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:485d5944ae5e1693213391057c1f6b460be9922a87cac16797075de4f0846e19","observation_id":"3b2d9b4f-115f-41d5-8090-5b94ea438653","resolution":{"observed_at":"2026-08-06T21:44:34.295676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:36.250855Z","title":"Not only generative art: Stable diffusion for content-style disentangle- ment in art analysis","venue":null,"work_id":"1bc92a04-c511-4e73-ab03-3b4972d594be","year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.350977Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:1c68faca27f4d977dad6f5f2318b3577b20cee4164eb81d044cd015ca7655f95","observation_id":"97f8aa24-70c7-4206-b447-d9f081659ff9","resolution":{"observed_at":"2026-08-06T21:44:36.318720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:36.141613Z","title":"Smartbrush: Text and shape guided object inpainting with diffusion model","venue":null,"work_id":"cc5a1f4f-1b69-4d48-8a5c-a1bd47b57dc5","year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.413277Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:f6c22c9c780fcc5b2160d247ee3faed6e7052e9b7a9e37f5437169c3014aedbb","observation_id":"6062c201-6ca5-41be-8fbd-2e33c0887e4a","resolution":{"observed_at":"2026-08-06T21:44:36.202135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:35.970314Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"752ab79e-bcef-41a4-bbef-c99d7595fb99","year":2024},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.535001Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:ca3af1840170b8e0b4b82c6022759017307d1f7bd36c351ecf67ec85af1a2a87","observation_id":"b9e534fe-24de-4147-ac78-819fc66ffa18","resolution":{"observed_at":"2026-08-06T21:44:36.038709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:35.792605Z","title":"Uni-paint: A unified framework for multimodal image inpainting with pretrained diffusion model","venue":null,"work_id":"fd5af0fc-019f-4a63-8326-0c10838faab4","year":null},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.654426Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:e0086ac8d277ac4165c5643cb4c28f65a0edd941b0f10e3d9510c3eb813739b0","observation_id":"fb483cac-cc05-4eb1-8e34-344d78e1b77a","resolution":{"observed_at":"2026-08-06T21:44:35.855125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:35.634970Z","title":"Zero-shot contrastive loss for text-guided diffusion image style transfer","venue":null,"work_id":"023f6f45-6117-4547-9b34-0716f471f53d","year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.728761Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:2e1dd2d3e73cf9978a5437a87f2b05c295c36e1a259b288e0fd33ead91a2c4a2","observation_id":"2a873fc0-fa0d-4890-a428-c9f375998813","resolution":{"observed_at":"2026-08-06T21:44:35.719301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:34.828463Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.828463Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:fe5eab5e37244137026d25e618844af518747232bc4107fe407c686cf207ac3b","observation_id":"131db759-cc02-4be6-8096-0a0de12ae9d2","resolution":{"observed_at":"2026-08-06T21:44:34.828463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:34.882407Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.882407Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:5cf92a73699c82e924ed84aa09803f3e8cd5ff976450d9726ca8b51e027042ae","observation_id":"6c98a1a0-ed4c-4732-b2d3-eff992633a92","resolution":{"observed_at":"2026-08-06T21:44:34.882407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:44:35.405819Z","title":"Inversion-based style transfer with diffusion models","venue":null,"work_id":"3da440e7-4313-4ba2-9c5c-5ecd3c5f2921","year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:34.980913Z"},"links":{"citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:06b0b866b77a5cc9ff7fe8bce0ce56b1e225f11cc78b03384d1687c5faf08100","observation_id":"dd9494ce-6dff-4f59-9a7d-81873b8e2efa","resolution":{"observed_at":"2026-08-06T21:44:35.492420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03594","last_updated":"2024-07-23T11:48:57Z","snapshot_observed_at":"2026-07-06T16:57:46.724781Z","submitted_at":"2023-12-06T16:34:46Z","title":"A Task is Worth One Word: Learning with Task Prompts for High-Quality Versatile Image Inpainting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03594","snapshot_observed_at":"2026-08-06T21:44:35.062271Z","title":"A task is worth one word: Learning with task prompts for high-quality versatile image inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:35.062271Z"},"links":{"cited_paper":"/paper/2312.03594","citing_paper":"/paper/2506.23482"},"observation_digest":"sha256:214414309f51a5acb9d9dea083ad964f12ef40ac1a11a0ea5c6462a32bc4cc94","observation_id":"ae7027e2-80bd-47e8-b929-1189aee84eaf","resolution":{"observed_at":"2026-08-06T21:44:35.062271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23482","last_updated":"2025-06-30T03:06:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:38:45.609977Z","submitted_at":"2025-06-30T03:06:54Z","title":"MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2506.23482."}