{"as_of":"2026-08-21T23:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc4037e9dd708c89ae9e41231c6160470b3e3ab938fbb3ee12287f944d78d43a","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:10:03.330319Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08489/citation-record","integrity":"/paper/2509.08489/integrity","json":"/paper/2509.08489/citation-record.json","paper":"/paper/2509.08489"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-15T16:10:03.136745Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.136745Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:e79f05515ba2b71f0ff4e4cee56e4f49799b5b177142882ab939b02f168a5497","observation_id":"99864e71-c6ed-44f7-a624-0e071973ebbd","resolution":{"observed_at":"2026-08-15T16:10:03.136745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-15T16:10:03.142060Z","title":"Segment anything.arXiv preprint arXiv:2304.02643, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.142060Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:d53b538e312411b88a620734c06be4d413ec640ba19ec902f5cb49efc7cdf9d5","observation_id":"c283907f-0296-44da-ad4e-e36d570143ac","resolution":{"observed_at":"2026-08-15T16:10:03.142060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.146167Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.146167Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:c65a4dd34800b41d4817ed3563108c1170c9a18e7ff384ba42374d7fca5cad90","observation_id":"bf1cc640-0144-4552-8e10-6563f06cc157","resolution":{"observed_at":"2026-08-15T16:10:03.146167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-15T16:10:03.150969Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.150969Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:4cd69191c9570980487149ad285aaf09634bddcbe705ce90ad83cdc5a998eddd","observation_id":"4f53e3cd-6ea3-4de4-b000-4fcfac365079","resolution":{"observed_at":"2026-08-15T16:10:03.150969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:04.043930Z","title":"Hidden technical debt in machine learning systems","venue":null,"work_id":"4b19d5b1-6fc5-48fa-9194-56fa008ec4d3","year":2015},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.154606Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:6aec42dab8b680bfb6cd7fa9219394f1a5c433c5f81e34d4b52b81e735ff05dd","observation_id":"9bfb1a87-3b0d-4080-81c1-1a95a6291582","resolution":{"observed_at":"2026-08-15T16:10:04.047999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-15T16:10:03.159053Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks.arXiv preprint arXiv:2401.14159, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.159053Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:a07da0afc58a7f4bb751bd30fc8b89d93155788b6a46be5fff5cdf629cd33dad","observation_id":"6b9ce203-d56b-4fa3-9468-b97343147a24","resolution":{"observed_at":"2026-08-15T16:10:03.159053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:04.032730Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"f8081df6-8441-43e1-96c6-1b5033a3e3b2","year":2021},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.163960Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:1c4780e3c412459e079b35048890afc31790c58507e5b059110cc734e4a3e533","observation_id":"b9ee630f-c160-49c1-b052-ad3017c938fd","resolution":{"observed_at":"2026-08-15T16:10:04.036484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:04.022484Z","title":null,"venue":null,"work_id":"4f7b5f7a-a392-4151-8163-57721938edc8","year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.167830Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:0450386b3d696bc93331c306cbb21dd9877f9b596ff7a773516366c9024b43b3","observation_id":"918cda8d-2c36-4369-8c68-8ae51e7ca394","resolution":{"observed_at":"2026-08-15T16:10:04.025731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T16:10:03.172108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.172108Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:731d73ce470b0ce3f2883f20ba5b54a446fc3a5c7bcb7aef560381be9f8e05d9","observation_id":"97cdc948-6fa1-4397-bf2a-6a86f9e19398","resolution":{"observed_at":"2026-08-15T16:10:03.172108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:04.010977Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"5adc937e-f665-431a-9cbe-b113c8297813","year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.175521Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:3860e77c290b70572076946332563cbc7b5a411b5cd13b433bf53d887f8bff60","observation_id":"8faab3d4-f2d4-4169-aa0d-9c22aab2b6b6","resolution":{"observed_at":"2026-08-15T16:10:04.014554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.994412Z","title":"X-decoder: Generalized decoding for pixel, image, and language","venue":null,"work_id":"50d6d4c8-5d99-417a-8ef4-33d38a6ed65c","year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.180093Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:fd9ba8b056b7b2e1d73f48f8e22034d23d3bba08dd9da44b07669b1629f1ea3f","observation_id":"177dd66a-647f-4b55-905a-407fe8ab7227","resolution":{"observed_at":"2026-08-15T16:10:03.999795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.980634Z","title":"Cris: Clip-driven referring image segmentation","venue":null,"work_id":"cf30214b-4df9-4815-986d-c73d08df10cb","year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.185059Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:2d8205abfc1e7f00fc69f99955c5986bdfcb872de24582d55b7423864fc23671","observation_id":"1e318b8c-6259-4c17-831a-0d1f8f0bce96","resolution":{"observed_at":"2026-08-15T16:10:03.984879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.966595Z","title":"Language-aware vision transformer for referring image segmentation","venue":null,"work_id":"123017a0-e48c-45da-bb16-b8a0c6656951","year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.189842Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:efd51b2bd16986c4a68ca196747331a4d566365470cdead341c6047dc2521ca7","observation_id":"09592f85-a74a-46e8-b7e5-37e743b98075","resolution":{"observed_at":"2026-08-15T16:10:03.972242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.952782Z","title":"Restr: Convolution-free referring image segmentation with transformers","venue":null,"work_id":"11c0c4c3-e2a3-49f5-8e77-e7e24c7e080b","year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.194124Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:c996c166e09a39966448abba734296e8a3b09cc1e10e2f2f1bc86cca8faeb204","observation_id":"f677c759-bc0b-43b2-83ac-f9c1038554fd","resolution":{"observed_at":"2026-08-15T16:10:03.957241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-20T15:29:48.660284Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-15T16:10:03.198326Z","title":"Clip-adapter: Better vision-language models with feature adapters.arXiv preprint arXiv:2110.04544, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.198326Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:5a7ded4c39139e76d5fa858b18ee85b7547cd7c910d8f1bc886941ca1db6ee2b","observation_id":"e378cc42-12b6-4bfa-a86d-d24af82a1435","resolution":{"observed_at":"2026-08-15T16:10:03.198326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.938269Z","title":"Tip-adapter: Training- free clip-adapter for better vision-language modeling","venue":null,"work_id":"6c9bb2c5-2551-4133-8381-c646e011fb89","year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.203244Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:2d25c02644ddc791b354535b87e2beb3be9efe080c27e110f137e44b943269ad","observation_id":"835b3a85-6a95-4d73-82ad-44761a6f7d44","resolution":{"observed_at":"2026-08-15T16:10:03.942786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.923244Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models","venue":null,"work_id":"2d66246a-6897-4eff-92d2-63451ec972b4","year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.207381Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:5fcf0a7d4bc341fc49a1312dd75a74721b027fa05410c6e6555d07c8bada341f","observation_id":"e42ddafb-121d-4e8d-86f6-dabe1b8c7beb","resolution":{"observed_at":"2026-08-15T16:10:03.927859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-20T14:05:04.144690Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-15T16:10:03.211971Z","title":"Sdedit: Image synthesis and editing with stochastic differential equations.arXiv preprint arXiv:2108.01073, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.211971Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:bda26ed3ad27a0d220edacc2ec5449275af947a700804b0421514c518d57ca64","observation_id":"9baa733f-15eb-4442-b82e-13c902f3b47e","resolution":{"observed_at":"2026-08-15T16:10:03.211971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-08-17T00:44:11.103098Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-15T16:10:03.216059Z","title":"Prompt-to-prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.216059Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:990a878b211ce602caad3594345d1a1e923825448f031ab5a652449e7987eac7","observation_id":"4343308b-5f6b-433f-bbbf-388315187ffe","resolution":{"observed_at":"2026-08-15T16:10:03.216059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.221040Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.221040Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:5a19b8a92c8e4591dfdab037c5784645b76f52d55a9c4b869e87ca59891e2a7f","observation_id":"6622998c-5dd1-43ac-9354-4bc3d63ed086","resolution":{"observed_at":"2026-08-15T16:10:03.221040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-14T19:07:37.876970Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-15T16:10:03.225288Z","title":"Adding conditional control to text-to-image diffusion models.arXiv preprint arXiv:2302.05543, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.225288Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:349bc7a8710f9616286cea913fc9ef652f7b1f2d2eccc97768665e42f927df32","observation_id":"a426cfe4-3ffd-4a6a-9756-60e7c226d3dd","resolution":{"observed_at":"2026-08-15T16:10:03.225288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13227","last_updated":"2022-11-23T18:59:52Z","snapshot_observed_at":"2026-08-20T04:57:31.788040Z","submitted_at":"2022-11-23T18:59:52Z","title":"Paint by Example: Exemplar-based Image Editing with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13227","snapshot_observed_at":"2026-08-15T16:10:03.230216Z","title":"Paint by example: Exemplar-based image editing with diffusion models.arXiv preprint arXiv:2211.13227, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.230216Z"},"links":{"cited_paper":"/paper/2211.13227","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:f057f7d8a5d09c55845fe45f4bae1e4df0e2ad382f25e73d33b87f029208c80e","observation_id":"7fd1a34c-067b-4144-9c12-a07b8335dddb","resolution":{"observed_at":"2026-08-15T16:10:03.230216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02779","last_updated":"2023-04-30T17:43:11Z","snapshot_observed_at":"2026-08-16T16:54:58.377348Z","submitted_at":"2022-06-06T17:58:04Z","title":"Blended Latent Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02779","snapshot_observed_at":"2026-08-15T16:10:03.233728Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.233728Z"},"links":{"cited_paper":"/paper/2206.02779","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:aae6240d61aafd49efa3b4ee004099635ae7d9ab3430566314c20aa1f02bd979","observation_id":"73366b5b-fb63-4169-aa8b-c63fc5aa291e","resolution":{"observed_at":"2026-08-15T16:10:03.233728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.896760Z","title":"Palette: Image-to-image diffusion models.ACM Transactions on Graphics, 2022","venue":null,"work_id":"dd6e25ad-52cf-4402-b2c8-42b33901dac6","year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.238407Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:da6bad8c10928fcfc6e2ac5b016cddac67733e905c058e2577998e1e11153d93","observation_id":"04307d61-3400-44b6-975b-32d8921ee3ff","resolution":{"observed_at":"2026-08-15T16:10:03.905011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.244505Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.244505Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:9a367f77c93f1ee54047a1de966d19afe5517a5d349b6469fb46ba88dfec1b3e","observation_id":"92a630ab-81d1-47e4-ae4b-00bd3574ef65","resolution":{"observed_at":"2026-08-15T16:10:03.244505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-20T10:39:03.872570Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-15T16:10:03.251426Z","title":"Bermano, Gal Chechik, and Daniel Cohen-Or","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.251426Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:83258b5512e58339f2782bcc92be8cf8b31e7cca88b74f89269ce1d58f0612ae","observation_id":"c9625d18-fab9-4d7b-9397-fe7322f8766a","resolution":{"observed_at":"2026-08-15T16:10:03.251426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.862421Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"a75a4bf2-e9ba-4105-8a08-e6e4d8c0d0b3","year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.257540Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:cacddecc5a0fdf9067987598cfbe784600e5973c6548361d1e962ebcff0e233d","observation_id":"2893d110-5c75-4e1d-ac5d-a7ae9f0b40e8","resolution":{"observed_at":"2026-08-15T16:10:03.867993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13826","last_updated":"2023-05-31T15:42:00Z","snapshot_observed_at":"2026-08-17T15:09:55.528271Z","submitted_at":"2023-01-31T18:10:38Z","title":"Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13826","snapshot_observed_at":"2026-08-15T16:10:03.262156Z","title":"Attend-and-excite: Attention-based guidance for text-to-image diffusion models.arXiv preprint arXiv:2301.13826, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.262156Z"},"links":{"cited_paper":"/paper/2301.13826","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:890158a530a29f7331e65bcb00ab5bee6df0fe5ef39320fc309cf97a3352ccf0","observation_id":"8232bbc2-2d12-4fb5-bf1f-1629e407cea4","resolution":{"observed_at":"2026-08-15T16:10:03.262156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-15T16:10:03.267347Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.267347Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:d8671c83f8121a45e6f64c8e15106891a7fe21e96be1db9102b39bf9abaa5acd","observation_id":"eb06a419-8b52-45bb-95e2-2dad71b0f2a2","resolution":{"observed_at":"2026-08-15T16:10:03.267347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14156","last_updated":"2022-04-29T15:21:52Z","snapshot_observed_at":"2026-08-21T12:33:41.637045Z","submitted_at":"2022-04-29T15:21:52Z","title":"Redefining Populations of Inference for Generalizations from Small Studies","version":1},"cited_work":{"arxiv_id":"2204.14156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.14156","snapshot_observed_at":"2026-08-15T16:10:03.389644Z","title":"Redefining Populations of Inference for Generalizations from Small Studies","venue":"stat.ME","work_id":"8f953fd8-ed3b-4dca-9382-b8c5a37d262b","year":2022},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.274143Z"},"links":{"cited_paper":"/paper/2204.14156","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:f9c7912e0e5636d4bf51d394fe15457822b184f6f1742730d48b6d6c7990733e","observation_id":"cc44ee16-3d84-4c7e-a879-139fbb72a662","resolution":{"observed_at":"2026-08-15T16:10:03.396807Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.844277Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"8dfff1de-f33c-49f0-b24d-a28ff88abb2b","year":2021},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.279035Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:2fbea0b73615396482e0c12a8c4ac4b23d825847a2ab50573fef0d28fb327c6c","observation_id":"8e712756-ae3f-4176-87cd-fa9295d5b110","resolution":{"observed_at":"2026-08-15T16:10:03.849897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.828805Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"acfb39dc-7b81-49ee-8d35-c6c6c79db63d","year":2018},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.283353Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:ce0e305b24eaf129d88ae6225950fb92da2fea006a3e9eeade20b5e7ec2ee534","observation_id":"1748739a-8e33-4c4e-8a80-6aae34ced163","resolution":{"observed_at":"2026-08-15T16:10:03.834715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.287901Z","title":"Image quality assessment: From error visibility to structural similarity.IEEE Transactions on Image Processing, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.287901Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:2b5e1c2ae678b37053ca6e8454f0a86bcd4a85761f964b03647c4e10ab3e9295","observation_id":"e702653d-10e7-495a-92aa-e6bb06c408c2","resolution":{"observed_at":"2026-08-15T16:10:03.287901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.796246Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":"ff65cbed-6016-4040-9abe-09f28d7e78d8","year":2017},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.291824Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:835fd985df3e26e9651841bbdf11faccccee69d68760ddb3024b1aec9736fbc4","observation_id":"2f6a44ba-c6bf-4946-be81-ac2a9018b6d7","resolution":{"observed_at":"2026-08-15T16:10:03.803197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.784025Z","title":"Sutherland, Michael Arbel, and Arthur Gretton","venue":null,"work_id":"d133fc70-bf2e-448b-a146-17babeadfb01","year":2018},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.296040Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:0ac0a806e2a2ffde7b462c6084ecb94e949b469b1bdc9725fa9393b41a7177e2","observation_id":"b4ade179-a5e8-4177-a137-6668b86c8413","resolution":{"observed_at":"2026-08-15T16:10:03.787600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12206","last_updated":"2020-12-30T21:32:34Z","snapshot_observed_at":"2026-08-19T19:54:57.424740Z","submitted_at":"2020-03-27T02:16:25Z","title":"Improving Reproducibility in Machine Learning Research (A Report from the NeurIPS 2019 Reproducibility Program)","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12206","snapshot_observed_at":"2026-08-15T16:10:03.300493Z","title":"Improving reproducibility in ma- chine learning research: A report from the neurips 2019 reproducibility program.arXiv preprint arXiv:2003.12206, 2020","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.300493Z"},"links":{"cited_paper":"/paper/2003.12206","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:65dc05e38a5e7a609e464ea3bcd5de623ba01e49d072b8d2ff47e375024d11a2","observation_id":"b34e78ec-a59f-43fb-acd1-da85eb301154","resolution":{"observed_at":"2026-08-15T16:10:03.300493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.763781Z","title":"Model cards for model reporting","venue":null,"work_id":"5c524eb0-fe4d-4fcd-b4b9-74d9511c0a6f","year":2019},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.306674Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:e732b8e04afd288f9ac327732fff4cfd1179252f16d9dc98ff707170ed3b3b8f","observation_id":"79395a14-b85e-4d6f-aa42-1f431a155d14","resolution":{"observed_at":"2026-08-15T16:10:03.774317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09010","last_updated":"2021-12-01T20:29:42Z","snapshot_observed_at":"2026-08-15T04:24:26.471843Z","submitted_at":"2018-03-23T23:22:18Z","title":"Datasheets for Datasets","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.09010","snapshot_observed_at":"2026-08-15T16:10:03.310132Z","title":"Datasheets for datasets.arXiv preprint arXiv:1803.09010, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.310132Z"},"links":{"cited_paper":"/paper/1803.09010","citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:2aef4d4ad24b40523911c0cf05af5b578f88a51959741388117e9f30d03660cf","observation_id":"3b7bf3b5-4e90-46b3-8e02-80af5c8750f8","resolution":{"observed_at":"2026-08-15T16:10:03.310132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.741279Z","title":"The ml test score: A rubric for ml production readiness and technical debt reduction","venue":null,"work_id":"8bc9bf94-7185-4c8f-bdad-bcb155f88695","year":2017},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.314629Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:d4a8bd77f0aa222b5eadeba6b32bc37b980d8174ebd7d79258acf23dd3729951","observation_id":"a6b59914-ca0a-496e-928c-570f116d91d7","resolution":{"observed_at":"2026-08-15T16:10:03.751562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.725892Z","title":"Everyone wants to do the model work, not the data work: Data cascades in high-stakes ai","venue":null,"work_id":"b8adb32d-dbbf-4251-b35f-b2fc758ec7ba","year":2021},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.317987Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:67f9a84dce943c63f1ca1dade39617044598184e055d213ff4902f48bb8986ec","observation_id":"69ef1ee2-521d-40f9-bd0c-6e993d91c208","resolution":{"observed_at":"2026-08-15T16:10:03.729827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.712452Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"95f58ce5-b761-4560-9f37-9fe2ac334f02","year":2021},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.322136Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:655da612e417c4457a80663509a7d784e94885df641675b7a997788efa1d3615","observation_id":"96855232-663a-419e-b3c2-3ee66c084a61","resolution":{"observed_at":"2026-08-15T16:10:03.717300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.326750Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.326750Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:ada9e535e5bd18d8095ab564e2c9e28b4ad2e4888b3b982651cd75181d784517","observation_id":"a4d6191c-6965-459e-8fbf-ea9bf7addac2","resolution":{"observed_at":"2026-08-15T16:10:03.326750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:10:03.609228Z","title":"Improved precision and recall metric for assessing generative models","venue":null,"work_id":"9ab69069-8b36-4686-b879-1a1ac28f346b","year":2019},"citing_paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:10:03.330319Z"},"links":{"citing_paper":"/paper/2509.08489"},"observation_digest":"sha256:f926c52a261a53e79592dd31ca469d44220a778d756455d136484500cca630eb","observation_id":"5971bb27-253b-4251-8e9c-8f10dd764d7d","resolution":{"observed_at":"2026-08-15T16:10:03.694552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08489","last_updated":"2025-09-10T11:00:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-21T22:35:22.500894Z","submitted_at":"2025-09-10T11:00:12Z","title":"Prompt-Driven Image Analysis with Multimodal Generative AI: Detection, Segmentation, Inpainting, and Interpretation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2509.08489."}