{"as_of":"2026-08-13T13:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:453891a9fa2b1b2999e76ac7f3e3fc9882b19f23b5bc4dbb247bb50ed5f79c64","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:19:22.592578Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T16:07:53.054355Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T16:07:53.165809Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"cited_work":{"arxiv_id":"2411.17323","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17323","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Insightedit: Towards better instruction following for image editing","venue":null,"work_id":"70e94418-30e7-48cb-8c20-8f01278ca1db","year":2024},"citing_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-13T04:37:50.242337Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T16:07:53.054355Z"},"links":{"cited_paper":"/paper/2411.17323","citing_paper":"/paper/2504.20690"},"observation_digest":"sha256:4e6842089501076a0be5d9d95ebb97f7488615d87e66402a333e772ab771f142","observation_id":"17882952-f7a9-410d-b29f-8dd72fff0933","resolution":{"observed_at":"2026-05-16T16:07:53.167573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17323/citation-record","integrity":"/paper/2411.17323/integrity","json":"/paper/2411.17323/citation-record.json","paper":"/paper/2411.17323"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.331750Z","title":"Blended latent diffusion","venue":null,"work_id":"35252250-eac3-48a3-bdff-5241dd5d1594","year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.358642Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:8793987b09580f9293821967ff0cd3e518798d624e955da39fa0e942cfee918c","observation_id":"760af4c4-abb5-40fd-949b-68587d0a0794","resolution":{"observed_at":"2026-08-12T12:19:23.336623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.311956Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"c9454524-c6f7-4db2-a558-27f1a096888b","year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.364636Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:8893a0f9e9455143bb05d1ea3495966637cb9f8b88dd555b867480fcddc59240","observation_id":"5667b81a-71fb-4832-9207-d985f4552312","resolution":{"observed_at":"2026-08-12T12:19:23.317771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.370164Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.370164Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:195208b8347d05e12a6414e8da22f35492dcffd9b7a5be630b18c736dd34c237","observation_id":"1200f067-85c1-4936-b5c0-b6728a3f9478","resolution":{"observed_at":"2026-08-12T12:19:22.370164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.376187Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.376187Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:9878f119a608979fa7d8ea1ac4bdd4d9b3ec3ef6d27fd1ccda82a14ac8011244","observation_id":"03de9598-47b0-4693-b29c-66309b4f3ff9","resolution":{"observed_at":"2026-08-12T12:19:22.376187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.383137Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.383137Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:f8578d14c33028ef824894e7593ccd4db49d84db7cefd985ddec4d2340cf33c6","observation_id":"2c38f988-f88e-420d-910a-9b79d30b4127","resolution":{"observed_at":"2026-08-12T12:19:22.383137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19145","last_updated":"2023-10-29T20:39:11Z","snapshot_observed_at":"2026-08-13T05:38:01.229605Z","submitted_at":"2023-10-29T20:39:11Z","title":"Learning to Follow Object-Centric Image Editing Instructions Faithfully","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19145","snapshot_observed_at":"2026-08-12T12:19:22.391172Z","title":"Learning to follow object-centric image editing instructions faithfully","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.391172Z"},"links":{"cited_paper":"/paper/2310.19145","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b561965daa2334bed79e7cdae6cde6f43f528174dc9ae33ac0110a5413b50428","observation_id":"19b28b7c-5657-45e1-a1cd-e182da48246c","resolution":{"observed_at":"2026-08-12T12:19:22.391172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.397476Z","title":"Conceptual 12m: Pushing web-scale image-text pre- training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.397476Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:d8812095a38afb8b6fb8993b33d19eec98e65f227461ade12046f6da1ca2c96f","observation_id":"882868f8-e7e3-4a11-9b74-55ee7ab7ecd5","resolution":{"observed_at":"2026-08-12T12:19:22.397476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17102","last_updated":"2024-02-05T05:04:53Z","snapshot_observed_at":"2026-08-13T10:02:26.882506Z","submitted_at":"2023-09-29T10:01:50Z","title":"Guiding Instruction-based Image Editing via Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17102","snapshot_observed_at":"2026-08-12T12:19:22.402699Z","title":"Guiding instruction-based im- age editing via multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.402699Z"},"links":{"cited_paper":"/paper/2309.17102","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b288376265c359a5258c069e2a8843a53a75b627597b316b46dfdff4420f4431","observation_id":"b6fd0b5c-dc44-48d3-9e4e-2c0151863f78","resolution":{"observed_at":"2026-08-12T12:19:22.402699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.247819Z","title":"Instructdiffusion: A generalist modeling inter- face for vision tasks","venue":null,"work_id":"c16ee28a-68cd-40a7-be6d-28b7047677a4","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.411977Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:527dea63b7df1e630bf33e2f3eeffa8199b1d77ea86d1cd84245a7fa483dea8b","observation_id":"bb97db91-9e4c-4659-a3ff-27323f5ddce0","resolution":{"observed_at":"2026-08-12T12:19:23.253477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-12T12:19:22.417571Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.417571Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:3549bbe0d1ec28cee77833f9b65029e1e8cca4ebdce1415ed4f9d4d3e856c662","observation_id":"d7007744-1940-4c6d-ace5-9b3b6649b8a3","resolution":{"observed_at":"2026-08-12T12:19:22.417571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.422518Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.422518Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:7658ccf4a353d6b8d4b5785c8e9b57eb04f9aedf1cbe803d7335747df72ee82a","observation_id":"a66cee22-bf40-44ed-b424-ba9352f5317f","resolution":{"observed_at":"2026-08-12T12:19:22.422518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T12:19:22.427569Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.427569Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:bc6ec154a8019362a790f38033a3855abaf8de6f05c7d8500da2c8bc23b5e02b","observation_id":"de62810b-1005-42e4-a081-900ba0658e5e","resolution":{"observed_at":"2026-08-12T12:19:22.427569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17525","last_updated":"2025-03-11T02:16:29Z","snapshot_observed_at":"2026-08-13T04:09:07.293129Z","submitted_at":"2024-02-27T14:07:09Z","title":"Diffusion Model-Based Image Editing: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17525","snapshot_observed_at":"2026-08-12T12:19:22.433319Z","title":"Diffusion model-based image editing: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.433319Z"},"links":{"cited_paper":"/paper/2402.17525","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:ddc632a28afc601dcf87ef86764679b0cd61b791c0336feeda60917ab7281946","observation_id":"6f051b66-ec4c-4448-bd43-30e5e500137a","resolution":{"observed_at":"2026-08-12T12:19:22.433319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.214664Z","title":"Smartedit: Exploring complex instruction-based image editing with multimodal large lan- guage models","venue":null,"work_id":"9c3bb4ed-3e51-44cd-add2-ceaad0ab2998","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.438521Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b8c7b31e2f3bed6d816529d457fb9397f4fca78c2c2e71f542258bc7ac81fbf3","observation_id":"de0a4650-16b1-486c-a064-2d003056840a","resolution":{"observed_at":"2026-08-12T12:19:23.219965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-08-13T00:29:40.423105Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-12T12:19:22.444615Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.444615Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:688afc7b7de08ac09ed6bb42c467e9f63749f2fceaf3b96c67030745e47cc445","observation_id":"fe37e4f9-7969-402c-b9a2-e67348baf9a0","resolution":{"observed_at":"2026-08-12T12:19:22.444615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06976","last_updated":"2024-03-11T17:59:31Z","snapshot_observed_at":"2026-08-13T00:57:21.525577Z","submitted_at":"2024-03-11T17:59:31Z","title":"BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06976","snapshot_observed_at":"2026-08-12T12:19:22.448901Z","title":"Brushnet: A plug-and-play image inpaint- ing model with decomposed dual-branch diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.448901Z"},"links":{"cited_paper":"/paper/2403.06976","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:8fdd0bd3e33afb0df04c0b8b5cdcf30ca5af0a8cbc5322fac937cfa4c469fd5d","observation_id":"61fb3233-c4ad-4751-9c00-c3c0b97c250d","resolution":{"observed_at":"2026-08-12T12:19:22.448901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.453180Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.453180Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:bbfca2f797037cd6f0720a3233ce284d4ae7db385e5869e0075e4d17222821bb","observation_id":"ca56dd4b-0d50-43bd-945d-05172560eff7","resolution":{"observed_at":"2026-08-12T12:19:22.453180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T12:19:22.457748Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.457748Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:a5d896b58b6018b8b061bd11b460b95437accd395dc5001a12b8f1b6659f6605","observation_id":"1f1a3217-d4b8-461e-8caa-767ac1591bf3","resolution":{"observed_at":"2026-08-12T12:19:22.457748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.187357Z","title":"Gen- erating images with multimodal language models","venue":null,"work_id":"5b152589-c73c-4c19-a6ad-1fa7ef7d91c2","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.462634Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:fadc904fbb12eb14320fff8d3a502a9a1d933778318acd29cf15b0d36a694390","observation_id":"cb616302-0503-4f2d-86d8-46387ef6a077","resolution":{"observed_at":"2026-08-12T12:19:23.193354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-08-13T04:55:05.773072Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-08-12T12:19:22.467898Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.467898Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b6069a9d115bc718902f2b826f832c32342b08088e9363b9097762600e172c73","observation_id":"8da70949-c9f3-4256-9c3e-a6a79f2ac986","resolution":{"observed_at":"2026-08-12T12:19:22.467898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T12:19:22.472727Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.472727Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:5bf8fc7f68d5179890e1074c506cf575a07e9eb5727269593bfbd90fa4a6b1e8","observation_id":"2f37db29-59a6-42d9-bc99-caed9a1506e3","resolution":{"observed_at":"2026-08-12T12:19:22.472727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.478124Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.478124Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:f65237f0e5f50361e179446cd1d36699c57ac1694c006bbb776de25d091dcc19","observation_id":"0f4ef9b0-c56e-4ca3-80ab-7b70d7955d68","resolution":{"observed_at":"2026-08-12T12:19:22.478124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.482309Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.482309Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:83ef23d9526b505f417c1a5cbde42cbb03be188e183cbb55405c74871a3855a6","observation_id":"c1e1e345-5fde-4f4a-8013-4cd084f15ac4","resolution":{"observed_at":"2026-08-12T12:19:22.482309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.487643Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.487643Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:7b1f9d38d8add7c693bbde7a1f0a026a5f690798573c67b8487348d481f790a7","observation_id":"7733db1f-c23f-44dc-97a9-151a93ffcf1c","resolution":{"observed_at":"2026-08-12T12:19:22.487643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T12:19:22.492943Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.492943Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b8e50feaee3d701d0e2f8b6ed3856bba71e41dd09aa8107fcfcc48a44bf0abed","observation_id":"cfcc8c28-9204-46af-a22e-70b99b42fe9d","resolution":{"observed_at":"2026-08-12T12:19:22.492943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.497473Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.497473Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b909860e68abda9eec5fd71dde8d2c994c7b0684661965a69b591ccc3bd957a1","observation_id":"fdf02c19-15fd-49ec-acfe-6e52678a7234","resolution":{"observed_at":"2026-08-12T12:19:22.497473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.501781Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.501781Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:86a7d607da4e75fcce61d6d457649d2a50089408908c98d3802764f06bfe3884","observation_id":"d6c01bc4-8e7d-469c-ae3a-cfdc09c86c80","resolution":{"observed_at":"2026-08-12T12:19:22.501781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.512037Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.512037Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:c4dad46e8395f5d8e41830df1b5caee39448a7a6e83e901be023f60ff072ae50","observation_id":"d628a74b-b5be-4599-840f-ade024b74f16","resolution":{"observed_at":"2026-08-12T12:19:22.512037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.516863Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.516863Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:ca348551bb745641779c3f89557aaab8284d4abe34d07fe614e0b935d278675b","observation_id":"5a35c3bd-5b08-45d0-ab1c-4a4b750fa8ea","resolution":{"observed_at":"2026-08-12T12:19:22.516863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T12:19:22.521176Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.521176Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:914a5dd3ded30606f5779276349ccbdf90ae74e521942eeeb5d4f176c200435c","observation_id":"cf115904-528c-4411-8cb5-77acd804dc56","resolution":{"observed_at":"2026-08-12T12:19:22.521176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.087704Z","title":"Imagen editor and editbench: Advancing and evaluating text-guided im- age inpainting","venue":null,"work_id":"7bce4dbf-84a5-4713-b3bf-ee81298b15ee","year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.525213Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:2f0453752e6948fc85718fed0a6881a972e1ad811b92b3d3e75f3cd9fc5938c0","observation_id":"32efd130-9350-476c-a03e-facd9d1d5c7a","resolution":{"observed_at":"2026-08-12T12:19:23.097887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.064181Z","title":"Smartbrush: Text and shape guided object inpainting with diffusion model","venue":null,"work_id":"7cf58d74-7bba-4895-a1a8-d95941a3e0d8","year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.529202Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:09cfe5927022c9589316475e54a40d97465cd0823b8c19c2d1dee36b2fc87234","observation_id":"3d182635-52bc-4e1e-9513-7d3cad92a339","resolution":{"observed_at":"2026-08-12T12:19:23.069036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03771","last_updated":"2023-12-05T22:23:19Z","snapshot_observed_at":"2026-08-13T05:09:09.098874Z","submitted_at":"2023-12-05T22:23:19Z","title":"DreamInpainter: Text-Guided Subject-Driven Image Inpainting with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03771","snapshot_observed_at":"2026-08-12T12:19:22.533203Z","title":"Dreaminpainter: Text-guided subject-driven image inpaint- ing with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.533203Z"},"links":{"cited_paper":"/paper/2312.03771","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:07d2dff12048aff83f39dc6e0eccbe7fff348382eddcd5f6d3f8a218931e88d2","observation_id":"f447d16f-197e-454e-8e7a-a1533ad4324d","resolution":{"observed_at":"2026-08-12T12:19:22.533203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T12:19:22.538501Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.538501Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:944a411070a10baa96a15c98934523efe2adc3eb197de2ece7fa9ebd09f014c9","observation_id":"86b2cd0f-58d6-44a1-8edb-27a4cda6c50f","resolution":{"observed_at":"2026-08-12T12:19:22.538501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14785","last_updated":"2024-05-23T16:54:17Z","snapshot_observed_at":"2026-08-12T23:59:37.360807Z","submitted_at":"2024-05-23T16:54:17Z","title":"EditWorld: Simulating World Dynamics for Instruction-Following Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14785","snapshot_observed_at":"2026-08-12T12:19:22.543846Z","title":"Editworld: Simulat- ing world dynamics for instruction-following image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.543846Z"},"links":{"cited_paper":"/paper/2405.14785","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:0b5544a959ee6f88dae93fee7668c99d883018e9cf0d413158a559d72e7a1687","observation_id":"34aaf49b-0adb-4be0-87b3-f493d10e4670","resolution":{"observed_at":"2026-08-12T12:19:22.543846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-13T04:52:37.935795Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-12T12:19:22.549062Z","title":"An improved baseline for reasoning segmentation with large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.549062Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:311aeacd65b1b5e774b5f744a511a0a653f482da5157ec1d4048ee8ae03ef002","observation_id":"d00bebc9-12d3-4492-97cd-ffaa4de39556","resolution":{"observed_at":"2026-08-12T12:19:22.549062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-12T12:19:22.555889Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.555889Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:6e41e58a09d8ddb4bdc8d7a33ed10d0d0bf92661644f9c1d6e28e9f5be976af9","observation_id":"3ccb8b6a-4558-49b4-9845-1b0de044f3f3","resolution":{"observed_at":"2026-08-12T12:19:22.555889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.560892Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.560892Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:7ebb4f3e6c34d517d22c5064e69dc89c034176f4b94ef95a11b9ce4f7104a005","observation_id":"224856ad-fe9b-461a-a225-04d0c5c05e68","resolution":{"observed_at":"2026-08-12T12:19:22.560892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:23.039953Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"8a493031-f177-4c27-908b-bffddd0cdf5d","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.565590Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:e9f8f7215558f1e5814b41e48a88a59eda03961559a2a9f2857d4b265374984c","observation_id":"1c677321-181c-41d1-9f1e-0cfacc1aa4e2","resolution":{"observed_at":"2026-08-12T12:19:23.044724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.570581Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.570581Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:7f9f466f816f39ed1aa74280c210a75a60cc972c42042c23d86e2c8523741109","observation_id":"a4dde6b5-45de-46ff-98b7-1eea7f7d18fc","resolution":{"observed_at":"2026-08-12T12:19:22.570581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.574739Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.574739Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:d3779ea7f498efb3e66a9f48ae59c0f5afd46a192777b42cb3218d021980a001","observation_id":"da9bea9e-ba98-4c84-87c3-b640a70532c4","resolution":{"observed_at":"2026-08-12T12:19:22.574739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:19:22.998768Z","title":"Hive: Harnessing human feedback for instructional visual editing","venue":null,"work_id":"6a971f99-8282-4354-8ae2-a86ee1352cb0","year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.580148Z"},"links":{"citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:f21d4ecbf2457d2f9e63538b3cbe659f7f301875036fb6056403bd98ecf11d9e","observation_id":"a95793dc-a990-4046-84a9-7c30c9ca6501","resolution":{"observed_at":"2026-08-12T12:19:23.006566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05282","last_updated":"2024-12-19T04:42:41Z","snapshot_observed_at":"2026-08-12T23:27:27.091360Z","submitted_at":"2024-07-07T06:50:22Z","title":"UltraEdit: Instruction-based Fine-Grained Image Editing at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05282","snapshot_observed_at":"2026-08-12T12:19:22.587711Z","title":"Ultraedit: Instruction-based fine-grained im- age editing at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.587711Z"},"links":{"cited_paper":"/paper/2407.05282","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:b89374cf35c473c027897b8f5af23db26b1c486a7776a872091b5d5530e32b78","observation_id":"4ed2c6d5-5dfa-4d7e-865f-9236dc97d98c","resolution":{"observed_at":"2026-08-12T12:19:22.587711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03594","last_updated":"2024-07-23T11:48:57Z","snapshot_observed_at":"2026-08-13T05:08:38.821368Z","submitted_at":"2023-12-06T16:34:46Z","title":"A Task is Worth One Word: Learning with Task Prompts for High-Quality Versatile Image Inpainting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03594","snapshot_observed_at":"2026-08-12T12:19:22.592578Z","title":"A task is worth one word: Learning with task prompts for high-quality versatile image inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.592578Z"},"links":{"cited_paper":"/paper/2312.03594","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:11617e2c0b60aa8f00eb7cc9d3a6c9e8ba73832a192dcd1c6d37cdf6cc29e60f","observation_id":"c5f2084e-7948-4f04-a07f-57d1120e7dcc","resolution":{"observed_at":"2026-08-12T12:19:22.592578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2411.17323."}