{"as_of":"2026-08-06T03:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be502e4a2cf90d3de733e6e884d9cb34f3f2deb689a66a7d5c22d977e09b64c2","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:03:37.152137Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.14534/citation-record","integrity":"/paper/2605.14534/integrity","json":"/paper/2605.14534/citation-record.json","paper":"/paper/2605.14534"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:33.285831Z","title":"Assessing image inpainting via re-inpainting self-consistency evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.285831Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:ffd073b13a90062f812b84b0115c4246515414ca081f24d538cb2b61671af623","observation_id":"b107f4ea-300c-48bb-9c10-bf9b51216a84","resolution":{"observed_at":"2026-08-02T14:03:33.285831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:33.386929Z","title":"Image quality metrics: Psnr vs. ssim,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.386929Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:ed0638beb7ddccc6150e8b3b1c262b009ba7727a99b9e5e62213908bcbbf65f2","observation_id":"d2f1b8c7-2c24-4295-aad1-6b9e59c69ff5","resolution":{"observed_at":"2026-08-02T14:03:33.386929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:33.471949Z","title":"Image quality assessment: from error visibility to structural similarity,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.471949Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:925c8c7df85bc0105e33c588a687122eea69545d534ec2a24cd9a3b1b25d2254","observation_id":"194cd076-ec38-461a-b82e-8b2e1d0924d0","resolution":{"observed_at":"2026-08-02T14:03:33.471949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:33.537756Z","title":"The unreasonable effectiveness of deep features as a perceptual metric,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.537756Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:c787734dbb9ac1aae90bb7c66a4195dc63bc1045e3ed52e4ac086a5e7a05c0e7","observation_id":"2656db3f-9046-4ddb-b0f0-fbc82f5bc23b","resolution":{"observed_at":"2026-08-02T14:03:33.537756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:33.592599Z","title":"Resolution-robust large mask inpainting with fourier convolutions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.592599Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:e8b538936858f73dd8fb5681dfa948dd542994c68b7c93789e072482bc4a1577","observation_id":"6cb751cb-cc5d-49bc-b865-013646d32cad","resolution":{"observed_at":"2026-08-02T14:03:33.592599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:33.671968Z","title":"Precise object and effect removal with adaptive target-aware attention,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.671968Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:20c2a75564e63ae5fb157d35fd7659a815a53d7f860b5156d829310620fc1964","observation_id":"1d3de603-10a9-49d2-9838-8782879512cd","resolution":{"observed_at":"2026-08-02T14:03:33.671968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18633","last_updated":"2025-08-26T03:18:31Z","snapshot_observed_at":"2026-08-05T16:23:35.382635Z","submitted_at":"2025-08-26T03:18:31Z","title":"ROSE: Remove Objects with Side Effects in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18633","snapshot_observed_at":"2026-08-02T14:03:33.758497Z","title":"Rose: Remove objects with side effects in videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.758497Z"},"links":{"cited_paper":"/paper/2508.18633","citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:667ca32eecb083aa3e5aa345aebebf7de4a4ce5ee32ca5b0ba4496c6c3b3b623","observation_id":"a229face-a3db-4acc-a3a2-6829731f974d","resolution":{"observed_at":"2026-08-02T14:03:33.758497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:33.824659Z","title":"Flow-guided transformer for video inpainting,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.824659Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:55c76c522c2b044b3a169e2718bd685071e946ef14132cfbcbc571d505380b26","observation_id":"7cd4c43b-8a2c-45d6-a1ff-bb642fb0fc53","resolution":{"observed_at":"2026-08-02T14:03:33.824659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:33.882124Z","title":"Remove: A reference-free metric for object erasure,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.882124Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:93e130c0f2626de60e19fcf1a0a92b7bf7be7b63bd009f49575ce27dae44dbb8","observation_id":"05757a96-8fda-431c-bf3c-24ef9bd0afd4","resolution":{"observed_at":"2026-08-02T14:03:33.882124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:33.938216Z","title":"Omnipaint: Mastering object-oriented editing via disentangled insertion-removal inpainting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:33.938216Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:a7603d04ef95207ac72b2894fc7d7e12501a9c8f5b0155a4eec52072e4fa3444","observation_id":"26a71f91-290f-47f7-87a9-5b2e1f7f93ef","resolution":{"observed_at":"2026-08-02T14:03:33.938216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:34.047504Z","title":"Avid: Any-length video inpainting with diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:34.047504Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:3b9ec34963bb8c95ff80ca40da6e35b5c5e787a1756a4b1ae879c1dc44cc953c","observation_id":"332f5783-16a1-40ec-9d0f-927c332b80bb","resolution":{"observed_at":"2026-08-02T14:03:34.047504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:34.167335Z","title":"Vbench: Comprehensive benchmark suite for video generative models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:34.167335Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:b273456a5f307343295e073862d2c8c70927ab6bbd52d581c973eb2cc5164b6d","observation_id":"052e5a4a-d372-474f-b320-a6aeb66ede2d","resolution":{"observed_at":"2026-08-02T14:03:34.167335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:34.276765Z","title":"Omnimatterf: Robust omnimatte with 3d background modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:34.276765Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:5169db00b78e9179e3f1255ffaa722ae493547c946a213cf743ae38a97b263f4","observation_id":"a88edfe8-bd9e-409a-949e-80a96741aa33","resolution":{"observed_at":"2026-08-02T14:03:34.276765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-02T14:03:34.382964Z","title":"The 2017 davis challenge on video object segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:34.382964Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:e952f7f63b010eff7d4295f47d93a360d8b73dbccc792843f83f3546baff8db8","observation_id":"557f6af3-4ad3-481a-8329-cec8b626a61c","resolution":{"observed_at":"2026-08-02T14:03:34.382964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:34.486544Z","title":"A kernel two-sample test,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:34.486544Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:15d00f4f7193d9bc74e55f0d0d23393a8ca3499c224e15d5c9aa28d98dd35a83","observation_id":"ec626914-1317-4fab-9bc5-1079ca67e8ac","resolution":{"observed_at":"2026-08-02T14:03:34.486544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:34.605978Z","title":"Propainter: Improvingpropagationandtransformer for video inpainting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:34.605978Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:ae3f661d7faae1bf440631c2877a3faeb0e250e35b68fa86a436d4e1cd2dcfd3","observation_id":"8199ff46-8870-434b-a0a6-d3c5fa33998a","resolution":{"observed_at":"2026-08-02T14:03:34.605978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:34.722342Z","title":"Diverse inpainting and editing with gan inversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:34.722342Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:f1bb11d01dd325ab09c9cdad937f7228660d516d2e557109b2768c85537911d3","observation_id":"44e9e5d6-0b2b-489b-8fa3-631c1106e762","resolution":{"observed_at":"2026-08-02T14:03:34.722342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10018","last_updated":"2025-01-17T08:03:02Z","snapshot_observed_at":"2026-08-04T08:08:54.687000Z","submitted_at":"2025-01-17T08:03:02Z","title":"DiffuEraser: A Diffusion Model for Video Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10018","snapshot_observed_at":"2026-08-02T14:03:34.833732Z","title":"Diffueraser: A diffusion model for video inpainting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:34.833732Z"},"links":{"cited_paper":"/paper/2501.10018","citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:f1b287b57f36a6bc5c0167b16b7502c05fe3b39bb5099bb678c9a7536ba1cac4","observation_id":"c02dc8c7-c000-48b2-9ff3-d18b32f3381b","resolution":{"observed_at":"2026-08-02T14:03:34.833732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24873","last_updated":"2025-05-30T17:59:45Z","snapshot_observed_at":"2026-07-06T21:33:50.814913Z","submitted_at":"2025-05-30T17:59:45Z","title":"MiniMax-Remover: Taming Bad Noise Helps Video Object Removal","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24873","snapshot_observed_at":"2026-08-02T14:03:34.947377Z","title":"Minimax-remover: Taming bad noise helps video object removal,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:34.947377Z"},"links":{"cited_paper":"/paper/2505.24873","citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:9f49455f4ac25b82d0b2a1eb59ef9efe4e21963cb45e486662c4f5af79e13dfa","observation_id":"aecca054-906b-4ca2-9d4e-3b7bab3970b3","resolution":{"observed_at":"2026-08-02T14:03:34.947377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:35.016246Z","title":"Vace: All-in-one video creation and editing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.016246Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:a95eda5957e7db8ddcee16681d67b59287592dd70e2fc8a7fda9d62388b54264","observation_id":"a6f81e79-6076-43c1-8d42-77675ad93cab","resolution":{"observed_at":"2026-08-02T14:03:35.016246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:35.127475Z","title":"Generative omnimatte: Learning to decompose video into layers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.127475Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:e66ca87b0e19e70998296a7f9d251abe8c623902c240fa374168009813866e78","observation_id":"9878ea5d-0451-41a3-94b6-ca360554daee","resolution":{"observed_at":"2026-08-02T14:03:35.127475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07397","last_updated":"2025-03-11T14:04:38Z","snapshot_observed_at":"2026-08-02T08:10:02.416676Z","submitted_at":"2025-01-13T15:12:40Z","title":"OmniEraser: Remove Objects and Their Effects in Images with Paired Video-Frame Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07397","snapshot_observed_at":"2026-08-02T14:03:35.192871Z","title":"Omnieraser: Remove objects and their effects in images with paired video-frame data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.192871Z"},"links":{"cited_paper":"/paper/2501.07397","citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:63f2ad3841e5662c7fa632eef74b2a3367b5bcad9a5c49c93209753d065076aa","observation_id":"fe6de6d9-3927-4d65-95bb-0f9e69fea349","resolution":{"observed_at":"2026-08-02T14:03:35.192871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:35.311390Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.311390Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:301210fc12003da9812191a77024fdb3b946815e70c7edbe24fe327f47c782a4","observation_id":"36dd8767-d3f3-4042-af97-2a848a7108ae","resolution":{"observed_at":"2026-08-02T14:03:35.311390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:35.383364Z","title":"Rethinking fid: Towards a better evaluation metric for image generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.383364Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:04a3b875e7c9b26e35ac9e3777344c0e3e8331cce32ad3be183ee7b95e161cfe","observation_id":"c00416b8-9ba2-4ebc-8cb0-9c833c527982","resolution":{"observed_at":"2026-08-02T14:03:35.383364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:35.489172Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.489172Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:c2f961ab7d8be0044c61b946545ec941b0d01572fd85572bfcc902f18595416b","observation_id":"b5f622aa-3d13-4ba9-b57b-c668bbb9bb62","resolution":{"observed_at":"2026-08-02T14:03:35.489172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:35.610748Z","title":"Object-wiper: Training-free object and associated effect removal in videos,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.610748Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:045e7a91da09a1d9fc82b1efa6d2b8052b13da6138d2583dfdd3cba88ccc94ec","observation_id":"b4e09783-95f0-4a3c-b675-b5aabd51c6b6","resolution":{"observed_at":"2026-08-02T14:03:35.610748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:35.728825Z","title":"Dˆ 2nerf: Self-supervised decou- pling of dynamic and static objects from a monocular video,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.728825Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:417c549273653dcc3dee9c96d1570e49cc92275b268b91bc038217240ab2d49b","observation_id":"419ef0e6-b633-4a7e-aceb-06cb9343a91c","resolution":{"observed_at":"2026-08-02T14:03:35.728825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:35.852400Z","title":"Privacy assessment on reconstructed images: are existing evaluation metrics faithful to human perception?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.852400Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:d0739095030d532b1fc0be31b947f0f62e5d68c2de01e5f1e4266feff31f6905","observation_id":"6d35c954-5772-4261-a213-38a5c3489700","resolution":{"observed_at":"2026-08-02T14:03:35.852400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08840","last_updated":"2023-05-15T17:55:04Z","snapshot_observed_at":"2026-07-06T15:27:25.253387Z","submitted_at":"2023-05-15T17:55:04Z","title":"Attacking Perceptual Similarity Metrics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08840","snapshot_observed_at":"2026-08-02T14:03:35.972033Z","title":"Attacking perceptual similarity metrics,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:35.972033Z"},"links":{"cited_paper":"/paper/2305.08840","citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:c135e5032b210f2fd91ca88744e3d4990a06eac7f3c22f152acf50222f05c590","observation_id":"55935dde-615f-471f-9e32-e74492635053","resolution":{"observed_at":"2026-08-02T14:03:35.972033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.087271Z","title":"Regression to the mean: what it is and how to deal with it,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.087271Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:96587bfeba8c6cb6b423c4c552283580aa910c3ad2f96ca6689315969f9b6f06","observation_id":"e5bdcd2d-6f49-452d-aaa7-f816053129a1","resolution":{"observed_at":"2026-08-02T14:03:36.087271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.158699Z","title":"The perception-distortion tradeoff,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.158699Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:2675465ccd10d12b631f5278a01218ee6ab9267c7ea88ab313d43b0e4c3904f0","observation_id":"e4ceb22c-bf4d-418a-a190-5a2862ff643a","resolution":{"observed_at":"2026-08-02T14:03:36.158699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.217942Z","title":"Enhancenet: Single image super-resolution through automated texture synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.217942Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:f3b68c1ab4f2d3ac6873b4c188ed9bfb6de0a717de98de7ab7dc97cfd250f857","observation_id":"79e7abc3-67a7-4aa2-a52b-790279650730","resolution":{"observed_at":"2026-08-02T14:03:36.217942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.312966Z","title":"Deblurring via stochastic refinement,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.312966Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:2a5fe620629fb08ec2c1b70aac1bb59009a041787eaf12568ecb84472f3ae73c","observation_id":"d739a232-3e85-4e5a-8f28-bf5add43a707","resolution":{"observed_at":"2026-08-02T14:03:36.312966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.434882Z","title":"Traversing distortion-perception tradeoff using a single score-based generative model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.434882Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:9c9a001ebfed5ce21a2d46fad876f1f15a9f332c4675993860ff3c0ab9327d90","observation_id":"fd5e5540-20f0-4bf8-81a1-b2c23e6dd0f6","resolution":{"observed_at":"2026-08-02T14:03:36.434882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.492925Z","title":"Shift-tolerant perceptual similarity metric,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.492925Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:de3286b18dc392f8bee590ac13b816f732962cd5fbb0ac6a1b09e59ba22e7fae","observation_id":"1b7c81e0-967a-42fd-9e2b-82d7d9a4fc17","resolution":{"observed_at":"2026-08-02T14:03:36.492925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.548388Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.548388Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:4436e88044af6050ad2849474714bf5e3bbacb6cd3776682398442ba09aafd9c","observation_id":"79bc74aa-6077-48df-94d4-89e730a0b8eb","resolution":{"observed_at":"2026-08-02T14:03:36.548388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-02T14:03:36.610269Z","title":"Sam 3: Segment anything with concepts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.610269Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:9d7e13188dfa42d921ce63a257e7089c5d25ffdcd0da2943a76190b312cfc9f8","observation_id":"00326da2-51e4-4256-8043-5e2db70d1f56","resolution":{"observed_at":"2026-08-02T14:03:36.610269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.725220Z","title":"Generative video propagation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.725220Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:bc13fe926406621f15a5c0c024182a332a01c85b2091d53a0c6e37e7aa2a0334","observation_id":"56b4dc28-7532-46dd-ad36-47a12fff33f8","resolution":{"observed_at":"2026-08-02T14:03:36.725220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.787550Z","title":"Rord: A real-world object removal dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.787550Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:6f035064a4a7def372a0f3d9c4d35eb3e83feebc2c77c8387aaf7712eb6048ed","observation_id":"de3e1598-2244-43c8-a4ec-7fc56f0096d7","resolution":{"observed_at":"2026-08-02T14:03:36.787550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.878088Z","title":"Smarteraser: Remove anything from images using masked-region guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.878088Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:d979ace9fe0fc2c51b7b188574bb247240c4b9ef6df05b137f85b43f0495900d","observation_id":"e87b4039-eca2-4f7c-9166-fcf92c9584c1","resolution":{"observed_at":"2026-08-02T14:03:36.878088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:36.977049Z","title":"The original borda count and partial voting,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:36.977049Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:4bf08c658939ac49b7357c207ca71d3f2f5605fc1d92ebaa367fb598d116819f","observation_id":"32ad3eb7-74da-4c7f-8b75-31274f736a6f","resolution":{"observed_at":"2026-08-02T14:03:36.977049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:03:37.076889Z","title":"Do computer vision foundation models learn the low-level characteristics of the human visual system?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:37.076889Z"},"links":{"citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:fcae46f7015040dd53b861eee0cc643ff5791a023249ccd2dc419640e9245588","observation_id":"c2dd95a6-a1c4-4e33-bf89-13667b07be27","resolution":{"observed_at":"2026-08-02T14:03:37.076889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-02T14:03:37.152137Z","title":"Blur is Clean","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T14:03:37.152137Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2605.14534"},"observation_digest":"sha256:8e8658adf2e69a0241ba253c838bf31ae9b8ea6441f29534b3e864e8f01deb42","observation_id":"a09f2032-6cc2-407f-b8ed-55126a0d7661","resolution":{"observed_at":"2026-08-02T14:03:37.152137Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.14534","last_updated":"2026-07-30T05:14:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T23:16:58.574779Z","submitted_at":"2026-05-14T08:16:51Z","title":"PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2605.14534."}