{"as_of":"2026-08-03T21:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f33e90557917faba7a009139108eb5dbd6a6f36c518d6d4e56f602fbc8fc3ec5","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T07:30:42.555053Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05253/citation-record","integrity":"/paper/2607.05253/integrity","json":"/paper/2607.05253/citation-record.json","paper":"/paper/2607.05253"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:d9ea513abf55cf0d36cc23bacad767ad55dad095c7438ea52f10e4d4ad0e9b98","observation_id":"14718327-0b98-423e-a3b2-c086f7aa3291","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Exploiting efficientsam and temporal coher- ence for audio-visual segmentation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:b693825e72e2a83994f83cd7d253995bbde9b3897ab735d8674920d8a14faca1","observation_id":"9b5793b1-cb30-45da-95d6-8c9754649999","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:5c4a10f3feebaea663bfc2338f2d2f83eea0b8c3cd0af416c18b701317f7d931","observation_id":"2efe077a-0bb5-44e0-a15c-68dc9aac671c","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Visual and textual prior guided mask assemble for few-shot segmentation and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:0e1b307d0668e427f0bb3beb9effe97b342578f8dd5fb4cf2c84703dd41c06ee","observation_id":"b033ea74-40d8-4948-9f2a-1d4bbb3ea9cb","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13310","last_updated":"2024-01-19T13:03:04Z","snapshot_observed_at":"2026-07-06T15:30:53.706005Z","submitted_at":"2023-05-22T17:59:43Z","title":"Matcher: Segment Anything with One Shot Using All-Purpose Feature Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13310","snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Matcher: Segment anything with one shot using all-purpose feature matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"cited_paper":"/paper/2305.13310","citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:3ae1837db0f92b4f52e7c379fa96220eb959b752c8d31ea11f89b4e7aa0de72b","observation_id":"5f5e2f1c-e0a4-4efe-8f2c-bdd43a75dd3d","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03048","last_updated":"2023-10-04T01:15:21Z","snapshot_observed_at":"2026-07-06T15:23:25.493171Z","submitted_at":"2023-05-04T17:59:36Z","title":"Personalize Segment Anything Model with One Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03048","snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Personalize segment anything model with one shot,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"cited_paper":"/paper/2305.03048","citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:3a637f101a5df33423c176b79062772d431c0715e3cf329f3278fc2d419ec495","observation_id":"8d9a1320-a603-4264-a3f1-944b4855c0a1","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Vrp-sam: Sam with visual reference prompt,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:770d4383e6dce54ed5375a0a4e94d8cdf2ca06d431d5b8988b56628b83edaee8","observation_id":"28b69c20-24cf-4658-87be-b2466cfabf23","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Denseclip: Language-guided dense prediction with context-aware prompting,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:92564a1e7d49f8da3651f8afbec205712a29e68cf9ca8d4e2194657c4aff4f12","observation_id":"eae2f266-84f5-40e4-93cf-81c5d1861e02","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06488","last_updated":"2025-05-21T05:31:33Z","snapshot_observed_at":"2026-07-30T23:41:29.920130Z","submitted_at":"2023-10-10T09:57:17Z","title":"SpikeCLIP: A Contrastive Language-Image Pretrained Spiking Neural Network","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06488","snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Spikeclip: A contrastive language-image pretrained spiking neural network,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"cited_paper":"/paper/2310.06488","citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:23697fbc2158055225e0ff47620bb7311b1881e9801baa8d53fc1d29b046177b","observation_id":"57744544-306e-441b-bfc5-6e7f784ccb1d","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Spklip: Aligning spike video streams with natural language,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:f52c8b66e331abc991a4329a7f005c83198488c1a204e32ba916112f0ce4214e","observation_id":"42344664-6dd5-4e2c-ae7f-df960cdcc86e","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Self-supervised high-order information bottleneck learning of spiking neural network for robust event-based optical flow estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:6b17e8872730d0d3db5a6e73ea4a9d810dd2871b91562ee66d94cfafb3111785","observation_id":"55f1498e-0be9-45bc-bd69-053cf0f031e1","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03546","last_updated":"2022-04-03T03:33:43Z","snapshot_observed_at":"2026-08-01T06:14:31.660540Z","submitted_at":"2022-01-10T18:59:10Z","title":"Language-driven Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03546","snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Language-driven semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"cited_paper":"/paper/2201.03546","citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:b0d6e14ce44797a40c5ab53cfbb3a0fc6eead5ababa3edeb8b097de071ba7596","observation_id":"86682367-75ab-4b96-8c2f-8b78fe57dd3b","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Delving into shape-aware zero-shot semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:67ad1af35f3455281ab18c2bc69b075661fbbcbf97b1e75031b2e72a1bc178eb","observation_id":"8f5065c8-df6d-4a8f-8841-f5de3d60bb08","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Decoupling zero-shot semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:436fdc815d3e4a479db7fbd5cef82a10d0de444c8045b8dcf3b8f333e282a8cb","observation_id":"31e9f569-da6c-4c6d-bd49-637d346b8c8b","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:698ecda6f68485ac099e9665dbbd04b76ff2348ad119429947f9c823b35ad2b4","observation_id":"c8d8f5a9-341f-4389-8189-1e9363931378","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Vqgan-clip: Open domain image generation and editing with natural language guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:65fc277da0aab849188ca0e11aff695c3941e35eab39952bdc7f5a9c4db5eb79","observation_id":"59512194-b341-43c1-9a1d-9083d34749eb","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Clip-forge: Towards zero-shot text-to-shape generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:343da07dbade409b4f0f77f76a24860fbcd5951d6583ae3b7449fdb73802c23d","observation_id":"84a7dd8b-d1ce-46e9-969c-e39209e44795","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Clip-driven semantic discovery network for visible-infrared person re-identification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:9d5bf7c3ef3ad0035494073627cb46b83770376e4300813a7c139a66bc64eac5","observation_id":"f8cc38ae-43b6-4e17-8eaf-008fdc32a794","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Clip-based modality compensation for visible-infrared image re-identification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:ccf10648682004b0d71111c89fcc0d26492a1c80fffca4921899ba8b5742623b","observation_id":"166668c0-3673-486a-a43b-c8539882f25d","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:17f504b63dd4409a926c92e5bd91ef31e64dd1e2d42281eb0701b7415e10ff9f","observation_id":"211fc036-8cf8-4845-8f34-9645e4586f24","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Clip-kd: An empirical study of clip model distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:b2d4f5a986ed1bfad362ad2cf79f9f11c0207e6dba70de763456974cdecf824b","observation_id":"9b47e5cd-68af-420d-a50e-7a3232733538","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Learning to prompt for vision- language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:10fd861797e43ac53bd112f5c0ab8cfca5b1147728c3473a0fd5129819cc58a4","observation_id":"c95bc355-050a-4418-a845-fa093cd58487","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:1f1610909b95ffafcd1649caaac6168fa232e1e2117c969ffeb1ac4497bc4616","observation_id":"8c2cff21-0360-46fd-8568-fdeddcaf20d2","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Zero-shot semantic segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:810c81a26a8ce7998d4ac4e92d47f1f69388c449b607a48f7a64c9064b330384","observation_id":"094528d3-353b-492b-834a-039a87a63391","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Dual-guided fre- quency prototype network for few-shot semantic segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:8457c1e93a07060ca8e7b5b99897078598dc7ea930add25126c3b3ba0234820f","observation_id":"4d472a74-20a4-4041-9816-dfb8e285528e","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Semantic projection network for zero-and few-label semantic segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:d3c09402c19c9ef2ae0363ae636b26b8b5ccc75d949123c0383dd3529eea1394","observation_id":"1ac944bc-8ffb-49e8-83e9-a99d9fac7c8d","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19846","last_updated":"2024-09-30T01:13:03Z","snapshot_observed_at":"2026-08-01T15:29:43.423084Z","submitted_at":"2024-09-30T01:13:03Z","title":"Towards Open-Vocabulary Semantic Segmentation Without Semantic Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19846","snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Towards open-vocabulary semantic segmentation without semantic la- bels,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"cited_paper":"/paper/2409.19846","citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:411b42e36924f60e9eda29cef78c1d3e1c140711eabad3e80e8904c5726b8f9b","observation_id":"0579c29f-da5c-45b5-acc8-0fe80f7deda4","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Hypercorrelation squeeze for few-shot segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:82b4ac8b007275c9a2302bd460d946ef882bb4da80091271ae0cb27bfcec0902","observation_id":"baec2f08-2ce5-4c33-a067-ed7148e6b50a","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Self-support few-shot semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:6958fffbef06990a241a054a3552026e8dbdee464544aae9696c0f94f4d9ab1d","observation_id":"f035bacd-01bd-4b57-8f4a-a3c5e5b65434","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Learning what not to segment: A new perspective on few-shot segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:3aa17c297bd4d582e95d1a15875aea63d00399d7ea81dae4b88691d6fcea8863","observation_id":"0063a34b-0436-4733-bf0a-770299fc405f","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Mianet: Aggregating unbiased instance and general information for few-shot semantic seg- mentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:3a31dee8dee04f7608f39304f913b266907c8e1c5496af89c0ad8f62f9c23e4a","observation_id":"0ab055c7-da43-484b-a60e-46b5e38bfe03","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Hierarchical dense correlation distillation for few-shot segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:bba177b48ce1ba5422e0b6b14fc19d3b816aa02efc12ff3ef4abb279e25bcacf","observation_id":"7b652a10-1360-4546-8885-b1067eda886a","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Hybrid mamba for few-shot segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:1b3b6231696a250f5a420d39afb968f637578fa221177705638cd447e29ebe61","observation_id":"ea4743f0-9896-4032-adef-76c7e55b7b7c","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Eliminating feature ambiguity for few-shot segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:3984ce25d77a316a7ce035b9b52c2b257b2585a65ca44d3e2e0e55d306363c08","observation_id":"cb3aa4c2-f229-4ff7-aacf-4d894cd369aa","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Addressing background context bias in few-shot segmentation through iterative modulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:e469f29edbd5e5d7e95b90e575349f9dcfb81e378ec94c18cb61365e6a6ae600","observation_id":"9d9cc63c-06f7-4964-9e02-fea185e6bad2","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Rethinking prior information generation with clip for few-shot segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:15db817a906b359d976a200d05ed35e76e4c60d13398bfe6feb6ec1ad228fe99","observation_id":"fbe6019f-22a0-4d0a-9e3d-ed6a6b6b5b7a","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Llafs++: Few-shot image segmentation with large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:058d38b2de04fced6be3b4cbec3d7f5686d20e13358f83648809e36b92e9a967","observation_id":"d5b4e010-7aa0-4cc1-8823-ce73af8d7098","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Dsv-lfs: Unifying llm-driven semantic cues with visual features for robust few-shot segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:df6e6efb0e205b58c785db05c1671ef581051f7ca09e1c715984d7bca71653df","observation_id":"3c1f8ffc-769e-4f29-9ca5-80a52f1e5305","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Prior guided feature enrichment network for few-shot segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:52599b373bd17dfdfd48f0c67bbd216d8b38cc0c74bf10693c2a716cb42c84b8","observation_id":"ba6938f1-2519-4a2f-a058-4df965febc78","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Holistic prototype activation for few- shot segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:77e09729b1d6b13561e19f8e5c0b8397380dda62003c8e30c9309f9337397b32","observation_id":"4905a857-1d18-4540-be00-dd65e33c91f8","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Base and meta: A new perspective on few-shot segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:aaf1f21cf37a6aa3e2551133d6cfb5ed7fa66555702eaeb5927a717b47f21c63","observation_id":"1b34b495-84f3-494e-b817-5b49c33b8403","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Image segmentation using text and image prompts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:d5ecbfb36cd00d3afa3f6ca13acbc2a791f5c356ebb6ab0abd668a0aed3a4ce0","observation_id":"b4d766d5-569e-43a5-8a9a-0d2082cca5a0","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04715","last_updated":"2023-06-07T18:26:22Z","snapshot_observed_at":"2026-07-06T15:39:56.892976Z","submitted_at":"2023-06-07T18:26:22Z","title":"UniBoost: Unsupervised Unimodal Pre-training for Boosting Zero-shot Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04715","snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Uniboost: Un- supervised unimodal pre-training for boosting zero-shot vision-language tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"cited_paper":"/paper/2306.04715","citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:d3b3c53c1ac6b95b7b1c89b57fcf64b46d17bac5e19ca6b15f3cc4bcb3ea1a7d","observation_id":"bf93ba5e-f418-437e-9b38-bdfdd26dc68b","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Prompt-and-transfer: Dynamic class-aware enhancement for few-shot segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:a777670137f55b66b77fd4845c1945f615b767e8a5a3114f918efed3a7def9e7","observation_id":"f59638c1-b918-4ecc-b757-02be25c64f59","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Doubly deformable aggregation of covariance matrices for few-shot segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:6af2fbf5d3d257e66e53f22708e91004e802fb4674c4d488e1adfc3dad79b904","observation_id":"87038aeb-4953-4e41-8944-67a1d64ff2ca","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Semantic projection network for zero-and few-label semantic segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:2a0719256c18b00f79b04cf568b0e1a7e864f37ffb3ab92ffc4f0ddfcd22fed0","observation_id":"1c9466d6-532b-40b6-89b1-4b9367614a5a","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.03410","last_updated":"2017-09-11T14:34:58Z","snapshot_observed_at":"2026-07-06T05:59:03.911368Z","submitted_at":"2017-09-11T14:34:58Z","title":"One-Shot Learning for Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.03410","snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"One-shot learning for semantic segmentation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"cited_paper":"/paper/1709.03410","citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:7c696c390135f312781fceef15943a9e1c57935af339de43ab485c7a08300abc","observation_id":"e6ff44bb-708b-4cdb-a7c8-3868eff4b1e9","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Feature weighting and boosting for few-shot segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:fb723449a29fc4d42573d783a49e93f2f6f1d491a73fbb421d143d8a0da45354","observation_id":"d4678575-cc1a-4da3-9cb9-e8b967c5083b","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Mobilenetv2: Inverted residuals and linear bottlenecks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:67154d1e3c8fc575af3563f4693ad6d57e7762e72c777f86771bc675c1c43b06","observation_id":"593500bf-2f5c-4dd8-90da-3f51717f70d8","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Efficientnet: Rethinking model scaling for con- volutional neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:840da5787dc31c467da57bf5e263ae5d1f59fb89d0f12a4535027a43c410df99","observation_id":"7f102401-0cf0-4507-a020-f4dca11edb89","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:4fce087daa0b103f5fce66afeed698b48c03f4a4505d0fa397f240d6b8abf075","observation_id":"40ddd1e2-42be-4c98-88e3-908d1a870003","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"BLIP-2: bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:a1ca7b86ebcdbcdf1cd6af0d51a1ae86574151a785366d7eb158d6f40691c293","observation_id":"70896c48-5cf3-4ae4-ace0-3b9e2c85c1e6","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Images speak in images: A generalist painter for in-context visual learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:133121573b254fbc838f7905ae455a454d4d97d064afc10a3a09e55b5a07b4c9","observation_id":"247b87e5-5555-41a4-a39d-e62060a81dbe","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Seggpt: Towards segmenting everything in context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:90b2887db79f9c09f7c900feec6541929f68806744940e5054a68d95ca3442dd","observation_id":"50103b13-64b9-49ac-af6a-ea672018cdae","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Llafs: When large language models meet few-shot segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:ea4dd85b152a11af7d2319179e9a3fb853e8ceb6cc9934daa25293caa480e014","observation_id":"7a5064c0-4473-4c7b-971d-588fea545268","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00752","last_updated":"2025-01-01T06:43:18Z","snapshot_observed_at":"2026-08-01T10:46:33.067673Z","submitted_at":"2025-01-01T06:43:18Z","title":"Foreground-Covering Prototype Generation and Matching for SAM-Aided Few-Shot Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00752","snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Foreground- covering prototype generation and matching for sam-aided few-shot segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"cited_paper":"/paper/2501.00752","citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:7f95f0e8d387033d62cd8f94e9d3542553b81257375de088bbbb68d9a121f934","observation_id":"f5417dd9-83bb-41be-b564-c398d5e5ecff","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Sclip: Rethinking self-attention for dense vision-language inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:b5235ca60f493991363952b17b31248967d6b29669d078a3660f45576cdfb069","observation_id":"e4a39697-9ee0-4fda-aa1b-323116a116b6","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"The role of context for object detection and semantic segmentation in the wild,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:51deb5ae8f611d2193dbc72f3355e21e9446bd1dea1fb881e2a7f85c1933e567","observation_id":"13b40b65-1105-4392-856f-aeb78a4fb01c","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"The cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:087502b66b88197dd784fb20829c254f9747463373196a4d01fc740c828be05b","observation_id":"a2e128c0-aa69-42b9-8d1c-1d7f4f1384f3","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Semantic understanding of scenes through the ade20k dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:ed89b2b42e1438fe7cb716c4dcdf759756eb95a385dbc8aa01252af1dbe82099","observation_id":"b929c15b-e710-4462-ba85-b6b41f4694d4","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Groupvit: Semantic segmentation emerges from text supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:d944270cf66350e20554f922b90e13ea4f91ea3952ff9a55b95f1a46aee0d3ee","observation_id":"ce6252fd-1920-4f7b-a4e6-c1747b8977e1","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Clip-dinoiser: Teaching clip a few dino tricks for open-vocabulary semantic segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:fcc8fb01f751882243bad4328e27d3f24ec7236c1a74a9b99025f3170dfb557e","observation_id":"635e8d53-160b-46cf-8474-9e69ca25969e","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Learning to generate text-grounded mask for open-world semantic segmentation from only image-text pairs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:a7e34b65da46600bc3058b398f145d867a356ac667285558308b992c09ebf85a","observation_id":"269ca8c7-0048-41ec-91d0-1a8749bd1501","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Clearclip: Decomposing clip representations for dense vision-language inference,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:9b417aa23e0de70b910f7b0eb2280deeacd567f5633092e74aa9428df4f8c36e","observation_id":"6b5a36ba-2e76-4552-a424-3b5820b45669","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:30:42.555053Z","title":"Resclip: Residual attention for training-free dense vision-language inference,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T07:30:42.555053Z"},"links":{"citing_paper":"/paper/2607.05253"},"observation_digest":"sha256:cc00579451514d80d332e6dfe2b2e1429acd87a938538c7f5109974fe3705d0a","observation_id":"94e91cfb-a81a-45f8-b8e9-fdf82f1a6ef4","resolution":{"observed_at":"2026-07-11T07:30:42.555053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05253","last_updated":"2026-07-07T04:11:07Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T22:36:45.944082Z","submitted_at":"2026-07-06T16:00:17Z","title":"Repurposing CLIP to Localize at Pixel Level"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2607.05253."}