{"as_of":"2026-08-22T20:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14eafd100ca1e789686d0abeb99ae919b0f984be2907630b8db3313972efdd7b","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:07:19.139826Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:44:21.142769Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T16:44:21.225823Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"cited_work":{"arxiv_id":"2505.02075","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02075","snapshot_observed_at":"2026-08-15T16:44:21.225823Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","venue":"cs.CV","work_id":"135b4589-5895-42af-b288-f67fb6826e47","year":2025},"citing_paper":{"arxiv_id":"2508.21529","last_updated":"2025-08-29T11:37:43Z","snapshot_observed_at":"2026-08-19T08:32:08.521746Z","submitted_at":"2025-08-29T11:37:43Z","title":"Maybe you don't need a U-Net: convolutional feature upsampling for materials micrograph segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T16:44:21.142769Z"},"links":{"cited_paper":"/paper/2505.02075","citing_paper":"/paper/2508.21529"},"observation_digest":"sha256:7c54cf160d2d1ee7a27641211a6f4557963c5bc78fb457f62605c8d6f80dec98","observation_id":"f8737f15-daf1-4c69-95c4-d278f4caf19b","resolution":{"observed_at":"2026-08-15T16:44:21.229535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02075/citation-record","integrity":"/paper/2505.02075/integrity","json":"/paper/2505.02075/citation-record.json","paper":"/paper/2505.02075"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-08-09T22:50:03.459615Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-16T01:07:18.870889Z","title":"Understanding in- termediate layers using linear classifier probes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.870889Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:278d2c383a6a180fb66decd41ad1ae0d896075474f9779fda89922e83c6a952d","observation_id":"a18391a9-f22c-473a-a2b8-6b730dc2e87a","resolution":{"observed_at":"2026-08-16T01:07:18.870889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:20.021959Z","title":null,"venue":null,"work_id":"490d05cb-e32c-43d8-9b11-81bb4c3a55ff","year":2019},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.875655Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:e3d774e2d078122b12b04d6627749d544a88e0853dd9b6ae9a2bd859437be3a1","observation_id":"33e52fdb-b99d-4cec-b2ca-95ba93262914","resolution":{"observed_at":"2026-08-16T01:07:20.025830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13575","last_updated":"2024-08-24T12:58:08Z","snapshot_observed_at":"2026-08-20T11:39:37.153392Z","submitted_at":"2024-08-24T12:58:08Z","title":"Can Visual Foundation Models Achieve Long-term Point Tracking?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13575","snapshot_observed_at":"2026-08-16T01:07:18.879278Z","title":"Can visual foundation models achieve long-term point tracking? ArXiv, abs/2408.13575, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.879278Z"},"links":{"cited_paper":"/paper/2408.13575","citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:b2aa91dbfa60a7aad1309fae23f865d1895a601e19a105982f5b06a23d988d42","observation_id":"167278ec-c250-4ce2-aa64-0d2bcba7f776","resolution":{"observed_at":"2026-08-16T01:07:18.879278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:20.011853Z","title":"Guibas, Justin Johnson, and Varun Jampani","venue":null,"work_id":"a058f86c-6938-4941-8aa1-3001a628f4f1","year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.883671Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:a4e80d98d7e56b06a9e4173f8ed9e1aebd85d7e10fc7d3de2bcf5f7a0d911f4c","observation_id":"a9f04764-6b6d-433a-95a4-98ded1f4bae7","resolution":{"observed_at":"2026-08-16T01:07:20.015414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:20.001415Z","title":"Large- scale interactive object segmentation with human annotators","venue":null,"work_id":"e50136cb-a9be-435c-a878-6432fedd4826","year":2019},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.888344Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:7abbf67873ce0ddd3eb799cced1d6b9a0b463a9a0223490c31d143f598ad8c84","observation_id":"e687de0c-b841-4631-9b1b-6404eb984e15","resolution":{"observed_at":"2026-08-16T01:07:20.005168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01580","last_updated":"2022-05-03T15:54:44Z","snapshot_observed_at":"2026-08-20T00:07:04.160092Z","submitted_at":"2022-05-03T15:54:44Z","title":"Better plain ViT baselines for ImageNet-1k","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01580","snapshot_observed_at":"2026-08-16T01:07:18.892369Z","title":"Better plain vit baselines for imagenet-1k","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.892369Z"},"links":{"cited_paper":"/paper/2205.01580","citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:c3e46357e0e64520fa9412b54f1154a10fc9fdf43cec21d8d452951521c08972","observation_id":"692d1212-32d6-436f-8b01-af085d2643c7","resolution":{"observed_at":"2026-08-16T01:07:18.892369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.990689Z","title":"Interactive graph cuts for optimal boundary and region segmentation of objects in N-D images","venue":null,"work_id":"aad968aa-2f4f-4a35-923b-df2e32ce78a2","year":2001},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.896259Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:eab946ba697c0b3f557d39837cddae5e6563cc26ac86b47d6ba0e1b2946fe894","observation_id":"8fab37f9-27e9-4c6b-badd-fc26b1f93b03","resolution":{"observed_at":"2026-08-16T01:07:19.994821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.970931Z","title":"An experimental comparison of min-cut/max-flow algorithms for energy min- imization in vision","venue":null,"work_id":"eface1e8-aa57-4273-9b57-f7f87dbf1ccd","year":2001},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.904284Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:d0bcad7ada215b4324144bf6a4eea61273342292c3f93efd56ccbcf647db7c19","observation_id":"c28742e9-a442-4ad6-92a3-ef8afe9763a3","resolution":{"observed_at":"2026-08-16T01:07:19.974470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.960091Z","title":"Ledits++: Limitless image editing us- ing text-to-image models","venue":null,"work_id":"93e48275-b8d5-4c99-97de-36095ba9bc94","year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.908917Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:fcf8d0bf25e997c8e0be9a2fe933bf0d6184bb8e871750e73cd66d34aa620dbe","observation_id":"076272ef-98b9-49a0-ab2f-176372a933bf","resolution":{"observed_at":"2026-08-16T01:07:19.963966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.950179Z","title":null,"venue":null,"work_id":"8072b200-cae5-4abd-9c1d-d3da34b0c15e","year":2023},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.913730Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:e3ca3aef39ab988abacc37b4f0e701fa067fd7de52933dafe165d6b20bd1be92","observation_id":"dcea4419-e5eb-47f5-8e77-3169fdbe466b","resolution":{"observed_at":"2026-08-16T01:07:19.953740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.939298Z","title":"Focalclick: Towards practical interactive image segmentation","venue":null,"work_id":"90f04933-97ea-4960-9d84-63bcc31ddb52","year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.917463Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:136ca68538c5bf3115603fb6e3f19f7e764f7cb9cbc019a2018eb917db65ba0b","observation_id":"b5c697d1-1ac9-4d83-a5d3-5bc8e6a157d4","resolution":{"observed_at":"2026-08-16T01:07:19.943480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:18.921205Z","title":"Feat2gs: Probing visual foundation models with gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.921205Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:6d12ee1f98f8998e556791d3268afb28c58692b80442394e7f936e4d103a748f","observation_id":"f38a78c7-abfc-4caf-ae7e-0d8b95b49b9b","resolution":{"observed_at":"2026-08-16T01:07:18.921205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.928527Z","title":"Diffedit: Diffusion-based semantic image editing with mask guidance","venue":null,"work_id":"7b13fc3d-8492-487b-94e8-b290c12c3628","year":2023},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.924720Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:871ad1f78f587de0159958aff25529b3b18e1fbfff7a0564e0913a5fcc127bb6","observation_id":"9bc044f0-7ea8-42df-8381-ef3d531ec272","resolution":{"observed_at":"2026-08-16T01:07:19.932525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.916664Z","title":"Surgical-dino: adapter learning of foundation models for depth estimation in endoscopic surgery.International Journal of Computer Assisted Radiology and Surgery, 19:1013 – 1020,","venue":null,"work_id":"1a294e4d-88ef-4523-9f23-a3b1dfdc3a4d","year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.928136Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:2ce20ed810b0fda41b598ab055a37451af30650711fa1576a721d96055750e2a","observation_id":"7a4dca7e-e283-4196-b80c-5ff2abf63a76","resolution":{"observed_at":"2026-08-16T01:07:19.921639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.905491Z","title":"Learning affinity- aware upsampling for deep image matting","venue":null,"work_id":"8934674b-1aa9-4c2a-9a9a-4ee444c192e7","year":2021},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.931698Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:74115e9dc403633388f7b78f94636faf495da73b80144e641960b487f1571f29","observation_id":"a19ae8fa-938a-4ba5-8f80-a5fc1d9cb0dd","resolution":{"observed_at":"2026-08-16T01:07:19.909168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.894332Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"8f2790d1-4008-4dc8-8a5c-47e96e07943c","year":2021},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.935102Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:938cc0481d06cefbb346d4909d78d73ac5901727ea24bbe7a60c4505fbe79a87","observation_id":"54af8306-9e4c-40fb-acd0-c77708a7e311","resolution":{"observed_at":"2026-08-16T01:07:19.898499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07285","last_updated":"2018-01-11T18:54:25Z","snapshot_observed_at":"2026-08-19T20:41:01.429763Z","submitted_at":"2016-03-23T17:52:21Z","title":"A guide to convolution arithmetic for deep learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.07285","snapshot_observed_at":"2026-08-16T01:07:18.938845Z","title":"A guide to convo- lution arithmetic for deep learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.938845Z"},"links":{"cited_paper":"/paper/1603.07285","citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:a72efe9256e3af489a70149978adfeb58573de506c7ccd065cb856e9762cd701","observation_id":"3fcc8e40-05cd-4f83-bb63-ffc4c43168c1","resolution":{"observed_at":"2026-08-16T01:07:18.938845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.884356Z","title":"Brandt, Axel Feld- mann, Zhoutong Zhang, and William T","venue":null,"work_id":"6358e766-6db9-4620-8550-8a140ddab668","year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.942961Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:77a9c03fc2ff41bf5697943de64a2da6a804cf2d0efe6bbaab396374585962b6","observation_id":"0a555be5-92fa-45fb-a289-36a1b4e9e530","resolution":{"observed_at":"2026-08-16T01:07:19.887898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.874123Z","title":"Bros- tow","venue":null,"work_id":"9a929316-5441-452c-b170-b00d3cc0f841","year":2017},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.946131Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:ca8ddad4ebaa485b623f03bd1f83a4eb06be7ca26bf2c78cc1bd9a5b28675096","observation_id":"10a0c1ff-5bbf-42cc-9543-570a0edaab4b","resolution":{"observed_at":"2026-08-16T01:07:19.877671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.864141Z","title":null,"venue":null,"work_id":"db21242e-7a50-4c4d-b260-133f7da34b16","year":2006},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.949574Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:08a06341bb7e16215d0764f796135be05ef8ae278e26ec8e64b98de6d5d53197","observation_id":"e9fa9e24-8d83-43d4-ac99-915622fab366","resolution":{"observed_at":"2026-08-16T01:07:19.867643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.852659Z","title":"Geodesic star convexity for interactive image segmentation","venue":null,"work_id":"0101d148-6712-4ab9-9314-e0606e0f17a2","year":2010},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.952797Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:f9e429bfbefbde83067f3b8ecd094fcb2c177516f1cf36e4ac804713b0d334bb","observation_id":"5f5f93ac-dfab-47a7-a700-8fa135f4e339","resolution":{"observed_at":"2026-08-16T01:07:19.857585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.842976Z","title":"Bourdev, Subhransu Maji, and Jitendra Malik","venue":null,"work_id":"afcf0964-c2b4-4750-9041-ac2baf47c4b0","year":2011},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.956836Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:34e11a7503fa3af83f8fb5f1ea28bb504e911b2c8db4c7d219827964a6e8b078","observation_id":"940cacf9-a669-4fdb-82b8-071f399969c7","resolution":{"observed_at":"2026-08-16T01:07:19.846466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.832699Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"474adaad-f4fa-4ede-9521-4f132a018823","year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.960135Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:dceaa2aed35939b0850773383366cb0cc4795424d718c80ca75e78b80fa6cd32","observation_id":"5dc572b6-966d-48be-a9c5-fb1295a2a329","resolution":{"observed_at":"2026-08-16T01:07:19.836144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.820743Z","title":"Learning implicit feature alignment function for semantic segmentation","venue":null,"work_id":"25bc8b95-7317-4ecd-a078-412ccdc4d422","year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.963655Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:1b479f24075531836fcbb9488fb7d451e03055948687851dcc58a2e2134c59a4","observation_id":"3c817995-585a-4925-930d-8aaa267e50e3","resolution":{"observed_at":"2026-08-16T01:07:19.825506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.810276Z","title":"Renovating names in open-vocabulary segmentation benchmarks","venue":null,"work_id":"a4de372a-66cd-4481-adef-8881ed3db316","year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.967359Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:70a4ee1b83fd340a1b8b9c4b09f31d587ad5bd98ed700d36f85a03a8c953d02f","observation_id":"f08c9010-b78b-487b-9075-696b78123b92","resolution":{"observed_at":"2026-08-16T01:07:19.813910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.799469Z","title":"Loftup: Learning a coordinate-based feature upsampler for vision foundation models, 2025","venue":null,"work_id":"e24574f3-ba31-41ad-aaf2-b653fa46cf62","year":2025},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.970775Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:1fc189564b1daab44704f5f89a055eb1761916c2003aec3b9819c2f86aa4bff7","observation_id":"cfa5cf0e-18d7-469a-aaa3-773b4970e33e","resolution":{"observed_at":"2026-08-16T01:07:19.803268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.788115Z","title":"Gir- shick","venue":null,"work_id":"ca1db240-a74f-4b64-ac94-0511f66127e7","year":2020},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.974494Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:c9cfc4eceb250ffd54cf639dcbc9fb6b8e87078ee4008b35dd0c9f01e5c9175a","observation_id":"c64e7e78-9741-404f-b5d3-5bf4646b0678","resolution":{"observed_at":"2026-08-16T01:07:19.791996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-16T01:07:18.977990Z","title":"Berg, Wan-Yen Lo, Piotr Doll´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.977990Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:6310177e33728f0913af40bda2a03538529fdfa396b54302c34d4b58497d32ea","observation_id":"103cd756-d751-4cae-a0c3-56e026e4c948","resolution":{"observed_at":"2026-08-16T01:07:18.977990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.777170Z","title":"User-centric learning and evaluation of interactive segmentation systems","venue":null,"work_id":"a946e2af-30ac-4a4b-97dc-374a339b5d08","year":2012},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.981750Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:5f5700c94c66e1fc8a2674992640c8731279d196f71091dbd284f584a1bbd18e","observation_id":"47d3c7ad-100c-4879-8e2f-e657b140d8d0","resolution":{"observed_at":"2026-08-16T01:07:19.780810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.766630Z","title":"Cohen, Dani Lischinski, and Matthew Uyttendaele","venue":null,"work_id":"f958d742-5736-4ed7-9d62-8d29078de92a","year":2007},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.985183Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:e1bdbd7a5b37a82e8b7c6cb5a803c986d370483485ca75a2888ff46994257111","observation_id":"f1ebb31b-383a-451a-8cc7-cb1879de049e","resolution":{"observed_at":"2026-08-16T01:07:19.770417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.756294Z","title":"Controlnet++: Improv- ing conditional controls with efficient consistency feedback","venue":null,"work_id":"04a491c3-8521-469c-9f71-9b807b10d06d","year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.988697Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:52616bde33e5bef6b1cdf33f3a8d7cb618bd75c3bb623d7c1e1d52c85afc9117","observation_id":"434c3578-f694-40f4-bc12-102c5d1fa0f1","resolution":{"observed_at":"2026-08-16T01:07:19.760105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.744361Z","title":"Girshick, and Kaiming He","venue":null,"work_id":"f19130cc-642c-4e58-a1f2-c546c810f8c8","year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.992081Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:1da347ccf76bdefe7ccce9a6a8c52eb6c7d9bc840a02ececd9844705939b8f7e","observation_id":"2393db46-a72f-4664-adc0-85c43b41c5b9","resolution":{"observed_at":"2026-08-16T01:07:19.748844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.732587Z","title":"Interactive image segmentation with latent diversity","venue":null,"work_id":"2c19454e-5d69-4e12-8f03-6c6b9ca631b6","year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.995658Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:b231c60b59896b390a68170ef39cee64d2a66f939829fb81dccfdddcfe484403","observation_id":"670b03a9-67bb-4b90-80b1-3dec6203057c","resolution":{"observed_at":"2026-08-16T01:07:19.736366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.713755Z","title":"Interactive image segmentation with first click attention","venue":null,"work_id":"6a62e4f2-4935-4835-8a34-b482cd99073e","year":2020},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.002982Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:037681379acfb9255c0566df90ff8e62b81de30710a626767874f2dd2304b2c3","observation_id":"058d9042-a810-4b7b-a640-df8dc0424106","resolution":{"observed_at":"2026-08-16T01:07:19.717697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.701772Z","title":"Focuscut: Diving into a focus view in interactive segmentation","venue":null,"work_id":"ffaa96cc-1c7d-4bf5-967c-5232653da968","year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.006372Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:dccf6285b6291d531c3bb88fb904b918e2aa2a87ea6a81e0b1ec25654306e873","observation_id":"0e3e42d2-3332-49de-a7e5-55a9e6ccd7bf","resolution":{"observed_at":"2026-08-16T01:07:19.705745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11325","last_updated":"2022-07-17T13:20:09Z","snapshot_observed_at":"2026-08-19T06:46:44.422015Z","submitted_at":"2021-12-21T16:16:30Z","title":"iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images","version":6},"cited_work":{"arxiv_id":"2112.11325","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.11325","snapshot_observed_at":"2026-08-16T01:07:19.209511Z","title":"iSegFormer: Interactive Segmentation via Transformers with Application to 3D Knee MR Images","venue":"cs.CV","work_id":"6099ae52-bdc1-48e3-8098-29a3d899c624","year":2021},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.010239Z"},"links":{"cited_paper":"/paper/2112.11325","citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:80aff16678d8b275fbda72c7a52c3dfb044c05a3e325c1a45e18eea623bda216","observation_id":"b2bd5fe9-f0be-4377-922b-6668682b2ea8","resolution":{"observed_at":"2026-08-16T01:07:19.213331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.689599Z","title":"Simpleclick: Interactive image segmentation with simple vi- sion transformers","venue":null,"work_id":"a4840af0-f2a2-48fb-8262-973702beeee7","year":2023},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.014044Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:c36c4d5fbd973db2702e1bde0717d03e0604fe751913a3b8b16b689fd0993c61","observation_id":"63c7c3a9-82a0-4c25-a27b-a3797d7fdcad","resolution":{"observed_at":"2026-08-16T01:07:19.693553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.677684Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"684a7b69-04ef-48db-88d4-c411d1b87e9b","year":2021},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.017419Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:fa82df3ca5c851d04b820ff6fabb4f5c83d0f923d1b96a50fd529f9e5e055f20","observation_id":"436f5306-9ede-4955-ab1a-9ce9aee0f6ff","resolution":{"observed_at":"2026-08-16T01:07:19.681778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.666077Z","title":"Index networks","venue":null,"work_id":"b89756d0-bcf3-4017-9797-7a09e6b722d7","year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.020863Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:9f564bd5753f426c10db0146ebdeb99cc842061bc95620bde377e90ee5307c8b","observation_id":"161afe87-ae58-4f27-8f63-caf28c807352","resolution":{"observed_at":"2026-08-16T01:07:19.669888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.653617Z","title":"FADE: fusing the assets of decoder and encoder for task-agnostic upsampling","venue":null,"work_id":"338a8d8e-c777-4a05-b2ec-2cd43b6b9e33","year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.024745Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:cda2da64ad93d6b4eeec787c56587b56b0aca2445be77870624f1eb65b1aa336","observation_id":"367d3cdc-f0d7-4741-98ff-3ae612565677","resolution":{"observed_at":"2026-08-16T01:07:19.658324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.641064Z","title":"SAPA: similarity-aware point affiliation for feature upsampling","venue":null,"work_id":"3ac4989c-226e-41d8-9bb3-6e5bdb7101f6","year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.028351Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:cdf888bbda31f247d89144cb831ddbea2fe7fde0a6132bc42a897e26228ce0d8","observation_id":"ca3fc26c-f9cc-4d5d-b08c-4aaf563c3dad","resolution":{"observed_at":"2026-08-16T01:07:19.645825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.031883Z","title":"Deep interactive segmentation of medical images: A systematic review and taxonomy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.031883Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:dc6a1b2127c45878944ce686924461cde45d11187598fed36d5d5fc6f4896e7d","observation_id":"0e6201fc-0903-4205-bac2-c0c4e83aee29","resolution":{"observed_at":"2026-08-16T01:07:19.031883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.623119Z","title":"Martin, Charless C","venue":null,"work_id":"00b1297e-3888-4e8f-90b5-9703c589fd78","year":2001},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.035561Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:42d643d092d54753f92fb7e258fa62230bd4416a7281dd1500b179951512996f","observation_id":"24834962-75a0-41d6-86bf-e27fc079b9c3","resolution":{"observed_at":"2026-08-16T01:07:19.626798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.611911Z","title":"Learn- ing deconvolution network for semantic segmentation","venue":null,"work_id":"4d608537-4daf-493a-b29a-d67f4c132dfe","year":2015},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.039334Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:a5e9e618bf60036c9bdc5fed106b14afd72ddedffa359e6cf907f3fe8b1ee3f0","observation_id":"35fde2f9-3380-4930-83d4-0b625246f67f","resolution":{"observed_at":"2026-08-16T01:07:19.616041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.600732Z","title":"Decon- volution and checkerboard artifacts","venue":null,"work_id":"1e99be22-dc47-4342-8824-9a9f9b7b858a","year":2016},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.042773Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:7aeb110092ee5951540345b9453573f316bd1d3c3d2e8e961cc354fb19ad5093","observation_id":"95d068de-dd91-4d82-a9e4-38e7d536e8ed","resolution":{"observed_at":"2026-08-16T01:07:19.604548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.590363Z","title":null,"venue":null,"work_id":"cf9ef45e-f7dd-4296-95a2-3de46f41f11f","year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.046127Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:2c5b84b0d50cc53df05e7aa3d1eaa04743bc581f2040baf815821a2028b05e3a","observation_id":"0b0e52a4-17f9-4def-ad4d-e60a2d03939d","resolution":{"observed_at":"2026-08-16T01:07:19.594182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.578953Z","title":"Taglab: Ai-assisted annotation for the fast and accurate semantic segmentation of coral reef 9 orthoimages","venue":null,"work_id":"5c31dff4-d8ff-4528-926e-f0ec2c40709d","year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.049711Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:8462ef7e52064213c92209e926777bb917a4a1b12d432e3e9bf1c8abbb5cc8c4","observation_id":"64ef1e89-b7b5-4608-b3e7-ab1dcba3926f","resolution":{"observed_at":"2026-08-16T01:07:19.582890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.568190Z","title":"Gross, and Alexander Sorkine- Hornung","venue":null,"work_id":"ee0ea687-4ca6-4b24-9f29-b8b6f852558a","year":2016},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.053543Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:6768a54f4ad3efe35e7b634e04fbae47b4cfdf968d73d89583429f6bb507ba55","observation_id":"a7f667b8-7f95-401f-98df-4b231e3118ab","resolution":{"observed_at":"2026-08-16T01:07:19.571864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.556538Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"20da8530-e88e-4d4e-b597-9b06bf142e52","year":2021},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.057115Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:4c7a7217bda1416a22b6074af440b160d75ceb13e63c72e4391662f529990cf4","observation_id":"64e1145f-2b9e-41cf-bfe9-1f26471ffe4e","resolution":{"observed_at":"2026-08-16T01:07:19.560401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.544835Z","title":"Using goms and nasa-tlx to evaluate human–computer inter- action process in interactive segmentation","venue":null,"work_id":"bf8ca680-2034-4c57-b742-3f194a8e81a5","year":2017},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.060821Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:720ccd6659308ccb7c6225a0017b72d5d356da7f97c8c939616ff78c24b2e377","observation_id":"3c25fe50-3140-41eb-b392-5f937a67567e","resolution":{"observed_at":"2026-08-16T01:07:19.549615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.533385Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"1e396f78-1b2d-4d3e-a981-ed2436caea70","year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.064371Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:52e3b641c18869ba692d077daef3ef6ae1de93d2404092dced7a4536fbae8a91","observation_id":"5548f322-4d6d-43ee-bc56-afe3a16e1710","resolution":{"observed_at":"2026-08-16T01:07:19.537249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-16T01:07:19.068846Z","title":"Girshick, Piotr Doll´ar, and Christoph Feichtenhofer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.068846Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:58a9b6f89650af47d780aa3da5fa6025f75da19c4446f1c4e57364796a8efa00","observation_id":"f10efcb2-8004-45e6-bcc2-496f92c5582c","resolution":{"observed_at":"2026-08-16T01:07:19.068846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.520816Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"5e567f00-a59f-4d1c-8ece-288aa9c37474","year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.072612Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:c44ba7ce8ce59ed6921efbec45dfcea71c8bc032650f7d8b04d5879e0ed39059","observation_id":"a6b0af8c-0cb0-4493-a366-2abc27c2ee25","resolution":{"observed_at":"2026-08-16T01:07:19.524882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.509668Z","title":"”grabcut”: interactive foreground extraction using iterated graph cuts","venue":null,"work_id":"0adbe412-cced-439d-88c7-0f7585397f79","year":2004},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.076127Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:26cbd5b697ddbd91f469a51e7ef8f9e2c350538f38532769c1b63b1be88eba85","observation_id":"f0735e4b-caa6-4e5b-9d5d-94ee756f73d5","resolution":{"observed_at":"2026-08-16T01:07:19.513495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07009","last_updated":"2016-09-22T15:11:11Z","snapshot_observed_at":"2026-08-16T13:47:58.773241Z","submitted_at":"2016-09-22T15:11:11Z","title":"Is the deconvolution layer the same as a convolutional layer?","version":1},"cited_work":{"arxiv_id":"1609.07009","doi":null,"metadata_source":"pith","pith_arxiv_id":"1609.07009","snapshot_observed_at":"2026-08-16T01:07:19.182035Z","title":"Is the deconvolution layer the same as a convolutional layer?","venue":"cs.CV","work_id":"8f9abc63-0cb6-4442-8dae-9237f20383b7","year":2016},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.079573Z"},"links":{"cited_paper":"/paper/1609.07009","citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:6f45a845aee3c7b97be80dfb41b2bbf72baef35cbe8ed8bc4f3f2ae3f613065d","observation_id":"ab82b50a-88b8-431e-9d70-f125c50cf7aa","resolution":{"observed_at":"2026-08-16T01:07:19.187810Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.497388Z","title":"Petrov, and Anton Konushin","venue":null,"work_id":"86e8fcff-2e56-46ec-b20b-84dce58846e8","year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.083708Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:af0b193554ae1bfac25e8d4f06c21e5cabaf82f6dcece69e9dbee338fcee95ab","observation_id":"03edf2f3-e52e-43d2-bd48-efae7939f5c6","resolution":{"observed_at":"2026-08-16T01:07:19.501903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.484985Z","title":"Lift: A surprisingly simple lightweight feature transform for dense vit descriptors","venue":null,"work_id":"c0ed66b9-1140-4240-8d29-30e7fc6e5044","year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.086925Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:5f698e3b64376b9f7fa375475c07bb14009618458de36d207f67095e13071173","observation_id":"dd1154a8-9df4-4842-816e-06ccaa67dee9","resolution":{"observed_at":"2026-08-16T01:07:19.489003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.094431Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.094431Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:1ddbc656dfc087f91c25be264285c2dc8f5d073613d8931373a98e7b65aee9cb","observation_id":"0f882ab3-8fc9-420d-906f-15e52740acd8","resolution":{"observed_at":"2026-08-16T01:07:19.094431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-16T01:07:19.098065Z","title":"Gritsenko, Xiao Wang, Muhammad Ferjad Naeem, Ibrahim Alabdulmohsin, Nikhil Parthasarathy, Talfan Evans, Lucas Beyer, Ye Xia, Basil Mustafa, Olivier J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.098065Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:30492cc2e25b9ebcd464e13b1a48c7d1d19e3a768463556ba51ee3984e9b22d6","observation_id":"46b98148-3b30-4038-b979-d9227c2ba13e","resolution":{"observed_at":"2026-08-16T01:07:19.098065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.453149Z","title":"Stewart, Zhitong Xiong, Xiao Xiang Zhu, Stefan Bauer, and John Chuang","venue":null,"work_id":"b4976411-989b-4cda-8d60-80b491e444a5","year":2025},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.101631Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:a6442a21193d939c62ce8454fa724de6605d051d3991250209f2bfe1c0893a50","observation_id":"8eff323b-2c71-4a5b-9777-dd9704846038","resolution":{"observed_at":"2026-08-16T01:07:19.457486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.441247Z","title":"CARAFE: content-aware reassembly of features","venue":null,"work_id":"483bce90-c911-45bc-929e-7caa9ff03c9c","year":2019},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.105138Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:5ace4e1f148298b0c3e5e7cddac14053c7b0a0e46a5528690f57f46e6f6daa32","observation_id":"557e4afb-476b-4b58-8c9e-d4c2625afac1","resolution":{"observed_at":"2026-08-16T01:07:19.445027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.429980Z","title":"Fouhey, and Abhinav Gupta","venue":null,"work_id":"1c6e4d3f-9148-493c-81a3-52475a104388","year":2015},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.108916Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:d5ccfa63fe018db36da27e45907771d075e1034aa7d267f9deb0c8c8027222ee","observation_id":"7e38b290-f07c-421b-bd56-0152bc9a04e7","resolution":{"observed_at":"2026-08-16T01:07:19.433712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.417655Z","title":"´Alvarez, and Ping Luo","venue":null,"work_id":"601611d7-9495-4b60-89a9-382d963a19fe","year":2021},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.113053Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:4705419c99f74051396970c5b52c432167443be4de48583e44b4d505cce871c6","observation_id":"6e7b4e1f-f503-4ecb-ae71-32e3be75deaa","resolution":{"observed_at":"2026-08-16T01:07:19.421317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.406384Z","title":"Price, Scott Cohen, Jimei Yang, and Thomas S","venue":null,"work_id":"d0c33129-6044-4619-8740-7c51e1bc778b","year":2016},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.117181Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:9e253f9fe7287f25c40642f9afe6d802b9c5f2f7b764f2ddd12c5072bd66076e","observation_id":"1c25b2a4-1497-4a78-88bc-f587a8d837b7","resolution":{"observed_at":"2026-08-16T01:07:19.410434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.394804Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional CLIP","venue":null,"work_id":"4255ccce-0cfa-47f3-bf85-4940bc68af1d","year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.121117Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:de8661df58a25fcb1bc355ba8e1ca59e9965d93b979821e8c79664555e86c2cb","observation_id":"2baa1592-7182-4b77-9804-55cded988563","resolution":{"observed_at":"2026-08-16T01:07:19.399076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.125148Z","title":"Open-vocabulary sam: Segment and recognize twenty-thousand classes interactively","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.125148Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:0b46b9a76dfb9fd2d9115c9f569ce5cc9d58a0e6bdbdbb11490b721b69cc7b27","observation_id":"97db39c8-9fc8-4a62-9859-503ee6bcfe2f","resolution":{"observed_at":"2026-08-16T01:07:19.125148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.128696Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.128696Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:1bb34765bdaa0b300b0185c6b17feeeb76f8d7f3c76016de30083dcc0ec39c70","observation_id":"0c9700f5-daf5-4768-ba99-f17345f13dbc","resolution":{"observed_at":"2026-08-16T01:07:19.128696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.369653Z","title":"Graco: Granularity-controllable interactive segmentation","venue":null,"work_id":"25a50475-b430-4991-bcf8-feb4a7999f1d","year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.132371Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:87eb27199831e1b1f82ed13a028e5681f89651aa2562207edbe1447219fa4672","observation_id":"169ae5c8-54a2-4c68-ad4f-71a59dc0c3ca","resolution":{"observed_at":"2026-08-16T01:07:19.373410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.358573Z","title":"The 1 14 resolution is derived directly through a convolutional layer, while the 1 28 resolution is obtained by applying a 2× 2 max pooling operation prior to convolution","venue":null,"work_id":"2a509384-a6fe-48ed-aae6-c310584ac4cc","year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.136332Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:1d31a7fe07620641c6468acfbba901ccb69117ea2f7ba4fdbf3913071c45679d","observation_id":"10ea6ed7-0cc5-4721-8b6a-1292f41ea5ad","resolution":{"observed_at":"2026-08-16T01:07:19.362771Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.980948Z","title":null,"venue":null,"work_id":"58ec6d0f-e52c-4236-abbb-bc3342bc9d6b","year":2001},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.900510Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:34675cffa076c5e34e0a7ba640a4c3fcff39d0b57ddd8ff407dcd6d025537d73","observation_id":"174fe7de-4292-49db-9a03-7840d06c8881","resolution":{"observed_at":"2026-08-16T01:07:19.984251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.473430Z","title":"1, 3, 4, 5","venue":null,"work_id":"3e179b29-e5c4-4cfb-9f45-4af7be3b1011","year":2024},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.090883Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:f0ea73f2d369bc3e95aa592a9a0bce0edff983ad8333b3401e6ebbc4dfc6133d","observation_id":"94d77904-e524-4371-bd4d-55dc999caa99","resolution":{"observed_at":"2026-08-16T01:07:19.477469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:19.347542Z","title":"Finally, a classifi- cation layer is applied","venue":null,"work_id":"4a57567f-530e-42cb-8a96-a5470295f991","year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:19.139826Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:618fb9d0964f6398942b48595d3786c079c7424dde41c07a397637e28ab96deb","observation_id":"4d88be2f-af29-4042-bdd9-ca103f38d3f5","resolution":{"observed_at":"2026-08-16T01:07:19.351427Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:18.999050Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation","version":1},"reference_index":585,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:18.999050Z"},"links":{"citing_paper":"/paper/2505.02075"},"observation_digest":"sha256:c3f8bb6e995668604f45d5d37dec0720e9b96ec6d69980aec88648d6b5be8b7a","observation_id":"f46cce8d-e1a4-4b95-9386-cfb67e044f47","resolution":{"observed_at":"2026-08-16T01:07:18.999050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02075","last_updated":"2025-05-04T11:59:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T19:33:27.400696Z","submitted_at":"2025-05-04T11:59:26Z","title":"Benchmarking Feature Upsampling Methods for Vision Foundation Models using Interactive Segmentation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":51},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2505.02075."}