{"as_of":"2026-08-06T21:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:863b099cfb83ef9189a6488edfa26a26d0079e8480eecf3a06167d22ea78127c","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:18:47.795677Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T09:04:34.878288Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T09:05:20.226087Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"cited_work":{"arxiv_id":"2508.20265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20265","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plataniotis","venue":null,"work_id":"a23378aa-1a3a-4480-807d-d0125c060f65","year":2025},"citing_paper":{"arxiv_id":"2604.18591","last_updated":"2026-03-18T08:09:51Z","snapshot_observed_at":"2026-07-06T23:05:26.398712Z","submitted_at":"2026-03-18T08:09:51Z","title":"SPRITE: From Static Mockups to Engine-Ready Game UI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T09:04:34.878288Z"},"links":{"cited_paper":"/paper/2508.20265","citing_paper":"/paper/2604.18591"},"observation_digest":"sha256:fc63ea84d73bf6fef3616f04e3ead5fa02eee97220aff56a2a5dd364d9e19e05","observation_id":"455d405c-e5f4-4a8b-9932-a6ff6e07a076","resolution":{"observed_at":"2026-05-15T09:05:20.228294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20265/citation-record","integrity":"/paper/2508.20265/integrity","json":"/paper/2508.20265/citation-record.json","paper":"/paper/2508.20265"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T15:18:42.285589Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.285589Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:19621e727f655c5329b05a6ec3fc1edb35043714c5b4637b0a6a74439a2bfc56","observation_id":"4c8f8402-7d7d-4fb7-813c-9a15ff75e70f","resolution":{"observed_at":"2026-08-05T15:18:42.285589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00878","last_updated":"2023-12-14T11:24:46Z","snapshot_observed_at":"2026-07-06T16:55:49.813116Z","submitted_at":"2023-12-01T19:06:12Z","title":"Grounding Everything: Emerging Localization Properties in Vision-Language Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00878","snapshot_observed_at":"2026-08-05T15:18:42.385138Z","title":"Grounding everything: Emerging localization properties in vision-language transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.385138Z"},"links":{"cited_paper":"/paper/2312.00878","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:48f952fa202c9cfdbc1acf67261c54e033c817471ce66d99280558ca4d285e6c","observation_id":"1e99a581-e5d0-4226-b63f-5398805a4cd3","resolution":{"observed_at":"2026-08-05T15:18:42.385138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.770128Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":"b06846d9-adc2-49d6-9cb5-5edbe5bfc099","year":2018},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.463919Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:54dc54fafc8600a58b36e43b4cd95e7b64a0e1df7626256d1c238bb431cab9b4","observation_id":"53fe491c-f44d-4167-9462-0a41a3881163","resolution":{"observed_at":"2026-08-05T15:18:57.773962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.758724Z","title":"Cascade r-cnn: Delv- ing into high quality object detection","venue":null,"work_id":"059de378-4451-48fd-b5f2-8620f855b9c6","year":2018},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.550235Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:f4b29111763cd4d7c3963d7e7fd942a357061820c00bc3ffb98e8bbd95b4e27a","observation_id":"825aead8-d9ed-4931-aa78-403c170de4d1","resolution":{"observed_at":"2026-08-05T15:18:57.762350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.746694Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"c957c38c-c2ba-46d1-a22b-909d04639618","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.644743Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:98275af86c2df5fa0b03d9666676ad1631a4ffe2338828b1789a81f410e3db8e","observation_id":"503c34d5-f7e9-456d-93c8-ea29ce84987c","resolution":{"observed_at":"2026-08-05T15:18:57.750623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.734090Z","title":"Learn- ing to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":"5ad93665-a4e3-4f48-91f8-de3cc9b2e594","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.755748Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:4a4f5ab9f0902d40dc56b8d942fda16d7a3b8c8cacf76c8fb497c8763506b253","observation_id":"63b5cf86-6f0a-4a67-a5fc-fe790ec0dd48","resolution":{"observed_at":"2026-08-05T15:18:57.738599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.720957Z","title":"Exploring open-vocabulary semantic segmentation from clip vision encoder distillation only","venue":null,"work_id":"e31fa0de-94a4-425c-9cd3-c0f5b0a06245","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.832122Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:46cb4d2cb088fbe64307ac4c7bef238607643c9cda9723ba6e1a5030ac7d1092","observation_id":"2f289abe-a247-47f6-b01b-bf08837be19c","resolution":{"observed_at":"2026-08-05T15:18:57.725300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.708518Z","title":"A simple framework for contrastive learn- ing of visual representations","venue":null,"work_id":"117de4cd-e4da-4837-9702-521e96b377be","year":2020},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:42.905767Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:89a249a342e9087e96024cd54e20e7c1cce0b9b69ed6f2703dd9c822305e9afd","observation_id":"958a5d45-d0db-4db2-8a6d-c04114790529","resolution":{"observed_at":"2026-08-05T15:18:57.712264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.695136Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"6a2891cb-fda5-4394-ba07-2c4ad8bee146","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.015369Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:da60affa640842bb883e5e308befd0f9242a9ab16e21d98ac7cb7f0d4bf7ba4c","observation_id":"5b0f5a70-6349-4a51-9dcc-f9babf4c1aed","resolution":{"observed_at":"2026-08-05T15:18:57.700275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.682826Z","title":"All at once: Temporally adaptive multi-frame interpolation with advanced motion modeling","venue":null,"work_id":"aea83951-89bc-40d8-90b1-b9b5ec3da9e5","year":2020},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.121151Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:7e5fc7aa316aed46c040a3f3be7605b0a199a8bb12482abae1891d3563adceab","observation_id":"91429799-8732-4d90-89ec-5092f0aac9ee","resolution":{"observed_at":"2026-08-05T15:18:57.686648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.654978Z","title":"Test- time fast adaptation for dynamic scene deblurring via meta- auxiliary learning","venue":null,"work_id":"5211d1ff-d020-40b6-80b9-ceee25698df1","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.228506Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:a8ec9e9547c78309670f9f6d56f61d436e75335bcd6a2a8ad3531a17cfe1b368","observation_id":"26d84858-cf1a-45a9-9a66-0e9ac278fc57","resolution":{"observed_at":"2026-08-05T15:18:57.674316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.436649Z","title":"Adapt- ing to distribution shift by visual domain prompt generation","venue":null,"work_id":"bdcca62b-05e2-443c-8183-cfa201ab2b70","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.299602Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:f4a4396e66b055afe29ec67a9a2fcb71a50f8b56149bdd3b4765daaff5575b21","observation_id":"e66c17d7-8f9d-44da-9760-51f451da07a9","resolution":{"observed_at":"2026-08-05T15:18:57.543871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17307","last_updated":"2025-06-18T03:49:22Z","snapshot_observed_at":"2026-08-03T16:32:44.454804Z","submitted_at":"2025-06-18T03:49:22Z","title":"Learning to Adapt Frozen CLIP for Few-Shot Test-Time Domain Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17307","snapshot_observed_at":"2026-08-05T15:18:43.364366Z","title":"Learning to adapt frozen clip for few-shot test-time domain adaptation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.364366Z"},"links":{"cited_paper":"/paper/2506.17307","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:22177c99a740d8dbe491dfa6a76a5c47929e486663c3e3df6923e1aef417542a","observation_id":"919d2c6c-5556-4503-af56-b14b3b72d9b1","resolution":{"observed_at":"2026-08-05T15:18:43.364366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.406423Z","title":"Mmsegmentation: Open- mmlab semantic segmentation toolbox and benchmark,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.406423Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:598aab968a1ecc33ecf204c81080887b9fc1e4e4647077f6627f3d907b634345","observation_id":"da6b2e51-d392-442d-9ae2-565e777873b1","resolution":{"observed_at":"2026-08-05T15:18:43.406423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.300508Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"3cde9486-4219-443b-b064-0a942462ea7b","year":2016},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.479890Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:162c6663a75ab9844eace2c299dd45cec13e8f37f35e523391527e176efb7680","observation_id":"c4b94bda-7e23-4e03-b6e6-f96e1ae3b0b9","resolution":{"observed_at":"2026-08-05T15:18:57.409083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T15:18:43.575743Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.575743Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:fafab28224457fa3e83cb3dc2f69138807e9f1462e30e93ebf04e7ede2065a9d","observation_id":"8ae0564f-4689-4d09-a9df-c64dc7ae4086","resolution":{"observed_at":"2026-08-05T15:18:43.575743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:57.095764Z","title":"The pascal visual object classes challenge 2012 (voc2012) development kit","venue":null,"work_id":"a47dbe1f-b0dd-4964-ae23-6c3939a93d2e","year":2012},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.688272Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:2afe082f9a2ef37f57ebb61a83c5176c3e34db986b9ca831db570ffc5c3b7612","observation_id":"b3c67d09-6874-42af-b016-0727b79101eb","resolution":{"observed_at":"2026-08-05T15:18:57.199905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:56.844278Z","title":"Bootstrap your own latent: A new ap- proach to self-supervised learning","venue":null,"work_id":"63fa37d1-860b-4f6c-ba79-8d116681a194","year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.781342Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:c4d3af58214b35551a587a1a7c451fa8356ced771cbb30dd8caea64ddda4b371","observation_id":"a3c26533-838f-4a27-b39b-66b72f3cb032","resolution":{"observed_at":"2026-08-05T15:18:56.954334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:56.301097Z","title":"On calibration of modern neural networks","venue":null,"work_id":"2c66875c-468f-47fc-98bd-fd6a5a492fb6","year":2017},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.858372Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:bd2277eb4ed9fd1610dcfced0bd0746f10435ff4ab8348744b5b50f519468e5d","observation_id":"0eff3dce-0df9-4571-a3a3-2f193065a986","resolution":{"observed_at":"2026-08-05T15:18:56.628099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:55.976457Z","title":"How to train the teacher model for effective knowledge distillation","venue":null,"work_id":"4e550b1e-b731-4c97-bce2-87db3f2f1b70","year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.906917Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:cc3a3547985232105586d19a56c9ec4f5269d8199de7fa6761a6d9befb4c4abb","observation_id":"abf92fe5-a9f0-467d-8fa1-65202325a0f4","resolution":{"observed_at":"2026-08-05T15:18:56.081935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:55.749310Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"b6c1a1d7-2c9f-42d0-9277-29b61b6bed10","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:43.987085Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:ae13b394a59b7fff6c4fb41e472f3370371fbad43ec2ee02cdae2ab5ec95ca58","observation_id":"c589d13c-8665-4f67-b4ac-e7ae8471392e","resolution":{"observed_at":"2026-08-05T15:18:55.844000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T15:18:44.061490Z","title":"Distill- ing the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.061490Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:9a07bb0535eb161ae85e17fea79933d7435b020b32197d91540c0622a299231c","observation_id":"3a9d5026-064e-408e-9590-07429dadc2ef","resolution":{"observed_at":"2026-08-05T15:18:44.061490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.133792Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.133792Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:282da00b7b831883e1bdd96eb68b58c0aa50db8590a712f7c37f86320bb23192","observation_id":"b2b6651f-36af-44d1-9fd9-7d475ff6ea85","resolution":{"observed_at":"2026-08-05T15:18:44.133792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:55.395159Z","title":"Weakly supervised ground- ing for vqa in vision-language transformers","venue":null,"work_id":"384f03e5-52ec-4da6-ac67-baae95495c69","year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.204473Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:f906e6a895bd7323ba39183c2cdc20f2ad928f773a328392bf618d1110199413","observation_id":"02215da3-bd15-41e9-8684-68c833753649","resolution":{"observed_at":"2026-08-05T15:18:55.559972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-05T15:18:44.277725Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.277725Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:c3da386b3453eaf3d4f082e4afee2bedfe5ff252034ccdbb829737605c6c3baa","observation_id":"5984d493-cf17-41a8-91d1-a81ce13eb5b9","resolution":{"observed_at":"2026-08-05T15:18:44.277725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12442","last_updated":"2024-07-17T09:52:20Z","snapshot_observed_at":"2026-07-06T18:47:42.757727Z","submitted_at":"2024-07-17T09:52:20Z","title":"ClearCLIP: Decomposing CLIP Representations for Dense Vision-Language Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12442","snapshot_observed_at":"2026-08-05T15:18:44.355578Z","title":"Clearclip: Decom- posing clip representations for dense vision-language infer- ence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.355578Z"},"links":{"cited_paper":"/paper/2407.12442","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:18a2b612c770cb23c0bfbc5f8421fdeb9a77f394de23f44f2011081ebaa60d6f","observation_id":"603f27bc-08f2-4cdf-ad3a-dea061a70b7d","resolution":{"observed_at":"2026-08-05T15:18:44.355578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04883","last_updated":"2024-08-09T06:17:00Z","snapshot_observed_at":"2026-08-06T04:42:43.823313Z","submitted_at":"2024-08-09T06:17:00Z","title":"ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04883","snapshot_observed_at":"2026-08-05T15:18:44.439993Z","title":"Proxyclip: Proxy attention improves clip for open-vocabulary segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.439993Z"},"links":{"cited_paper":"/paper/2408.04883","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:f35721db4b3e230e1d6469b13c73d30f71253ec865a732f70784bf793dc6719c","observation_id":"0fb55852-2750-47b3-94b2-6378990cdffd","resolution":{"observed_at":"2026-08-05T15:18:44.439993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:55.113416Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"f243af3a-fa71-4da7-ae9b-6453091be93b","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.544507Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:ad3c18adcf2a9868d3d90dff863b18029acc92bb8d095b93ef1feb465ff7b27c","observation_id":"3a4bae03-dc9e-46da-aa3f-2f522202a075","resolution":{"observed_at":"2026-08-05T15:18:55.261872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05653","last_updated":"2024-09-16T09:10:00Z","snapshot_observed_at":"2026-07-06T15:14:44.015806Z","submitted_at":"2023-04-12T07:16:55Z","title":"A Closer Look at the Explainability of Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05653","snapshot_observed_at":"2026-08-05T15:18:44.610754Z","title":"Clip surgery for better explainability with enhancement in open- vocabulary tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.610754Z"},"links":{"cited_paper":"/paper/2304.05653","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:95746f6a9be30901213fa6299e22b952947c7c8dc43512193f964aaaf6b49366","observation_id":"cff859a8-04cd-4ba5-852a-da86b2977f00","resolution":{"observed_at":"2026-08-05T15:18:44.610754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:54.897485Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"8ee82ae9-1f47-401d-bac7-fb68db20e279","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.684723Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:0c27a706aabeb00497f3aafb757ad9d235e568c7d7447fad3c5a81bc016fde20","observation_id":"cfa6775c-8685-4c5a-8234-14510cf58537","resolution":{"observed_at":"2026-08-05T15:18:55.010279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:54.562044Z","title":"Self-supervised spa- tiotemporal representation learning by exploiting video con- tinuity","venue":null,"work_id":"260ed1f5-380f-4f2d-8c56-3333729a9dcf","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.761125Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:0f2543b0c29f807ddadd5c8850bfa11a80fa4e3ab18fda93c41477655233289a","observation_id":"392ca7c1-e396-456a-ae19-ff6534184b32","resolution":{"observed_at":"2026-08-05T15:18:54.716306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:54.311815Z","title":"Refinenet: Multi-path refinement networks for high- resolution semantic segmentation","venue":null,"work_id":"cbee0295-3648-476d-8974-fc7be1123043","year":1925},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.831199Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:b5c67a312152c76cc112cb2ec83ff01c87c5530d59f978ae50d22ef2f6a9b6b1","observation_id":"62771230-047f-4d51-91dd-3e3821d72f1b","resolution":{"observed_at":"2026-08-05T15:18:54.431218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:54.033098Z","title":"Few-shot class-incremental learning via entropy-regularized data-free replay","venue":null,"work_id":"d40600d7-fee0-4a2b-9d4c-6217c115bf1c","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:44.937846Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:8b16bd5a62bddbaa45a3f17c4f2c0893e6ec01dc049006f5a7da52d7a5405923","observation_id":"99b9f23d-256b-4135-937e-fe73f395562c","resolution":{"observed_at":"2026-08-05T15:18:54.139437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:53.798360Z","title":"Meta-auxiliary learning for future depth pre- diction in videos","venue":null,"work_id":"b0b53a00-d633-4baf-851d-50717ff2bd40","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.014092Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:e6c8a47c73bcdbe0ceb6d5553a16f25ccbeb61007db750a09985d56e9638c17c","observation_id":"e9f1c4a2-1f2c-415f-a16f-5dfc700ad698","resolution":{"observed_at":"2026-08-05T15:18:53.911814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-05T15:18:45.100187Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.100187Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:680be147b58d55bc834a956bcf593d956aba0b3518538423aed05732b472b32e","observation_id":"3c652007-8bbb-467f-bb70-c46512418adb","resolution":{"observed_at":"2026-08-05T15:18:45.100187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:53.548117Z","title":"Ttt++: When does self-supervised test-time training fail or thrive? Advances in Neural Information Processing Systems , 34: 21808–21820, 2021","venue":null,"work_id":"cb11b1e2-443d-46cd-8dea-1a9146249dd5","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.197884Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:11a19ab21b376fdcd66f254a532955692ce221c423d24bc157b5eaf9e150152f","observation_id":"4bce4cd7-1536-4056-a57a-70ff3e4e9566","resolution":{"observed_at":"2026-08-05T15:18:53.672703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:53.500114Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"09f57d6f-ef64-4881-bf3b-6c65d89123bc","year":2014},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.304968Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:e2c3689130008b742620b7011c0e4f307ce2469e429b1033a339ac296158155e","observation_id":"61f4784f-b55d-4b31-95e5-164c86bfcfd0","resolution":{"observed_at":"2026-08-05T15:18:53.535910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:53.253388Z","title":"Open vocabulary semantic segmentation with patch aligned con- trastive learning","venue":null,"work_id":"6d9c9495-283d-4b2c-b668-66649776687d","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.416190Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:a073b9c6103e745e62487362fc30f73ffd1c3b1ff2d42e23ef8f6abebcd6ead8","observation_id":"c899dbd3-7563-4cf7-968b-9126c882c740","resolution":{"observed_at":"2026-08-05T15:18:53.367629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T15:18:45.489307Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.489307Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:13b152b89abe9b6c56fe459a59876e0b9d4506a94cdd89009ddf6ca5bf54bc4b","observation_id":"c02d1780-a156-4c57-8abd-f17f04a570e6","resolution":{"observed_at":"2026-08-05T15:18:45.489307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.980074Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"38e83dec-27b2-40aa-8665-250e1e052bd7","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.559026Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:2be0bb20f80740e5e4b9eb171132c81ceb3d225816eab54e5744fcfd86921c15","observation_id":"aa78c7fe-3489-4e73-a576-e598d8fe16bc","resolution":{"observed_at":"2026-08-05T15:18:53.094673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.738204Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"9ab45c80-99f4-4bb6-800a-f23825b92840","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.626186Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:c07c2935ca6b08aaed2e8b397f9f7265bd5877de0d4ca8ccd6ac3cd85fca08f1","observation_id":"aede51ec-74e4-4696-9490-7ca4316bd5b8","resolution":{"observed_at":"2026-08-05T15:18:52.860246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.501886Z","title":"Test- time prompt tuning for zero-shot generalization in vision- language models","venue":null,"work_id":"bbaf75a1-1434-4476-b8e2-6899b35a5e76","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.699685Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:731bedfba53efc3412ebdd1387a477bf6599a39bb17196b20093635563235ab6","observation_id":"3ef7b6bd-ae45-4403-8b87-a44c258b55c3","resolution":{"observed_at":"2026-08-05T15:18:52.629830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.265095Z","title":"Test-time training with self- supervision for generalization under distribution shifts","venue":null,"work_id":"6586e8c9-7878-4b11-ac14-6a95b013987a","year":2020},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.769552Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:8a1a511e71602288fbfef5aa1c5caeb781fc2522291b0291bcfd6cef0a687eec","observation_id":"c192cda1-503a-4fb6-94a5-a98e27c5e50c","resolution":{"observed_at":"2026-08-05T15:18:52.379024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10726","last_updated":"2021-03-18T17:58:01Z","snapshot_observed_at":"2026-07-06T09:30:32.320227Z","submitted_at":"2020-06-18T17:55:28Z","title":"Tent: Fully Test-time Adaptation by Entropy Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10726","snapshot_observed_at":"2026-08-05T15:18:45.818485Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.818485Z"},"links":{"cited_paper":"/paper/2006.10726","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:ec37d3a614525d7541686bf0140c38bcd17225ac155320216a5a7e7bea9d4d15","observation_id":"3b23de30-b662-4ab4-95a7-07f31bbaae39","resolution":{"observed_at":"2026-08-05T15:18:45.818485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:52.032079Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":"cb884792-5c8e-49a3-ade5-ee673f1b471e","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.884601Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:6a6be9a04f276aab8e3d5d7b3a178f94e01224431c0573a06c87c35f26361d2d","observation_id":"01407358-22be-474e-b0ef-b08a94f818ba","resolution":{"observed_at":"2026-08-05T15:18:52.144342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-07-06T16:56:21.561513Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-08-05T15:18:45.993153Z","title":"Sclip: Rethink- ing self-attention for dense vision-language inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:45.993153Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:99408c32ae9da354df5ed8fea31b5a887f50f3d536f32f73f0696068984e5472","observation_id":"e2bf5ff8-3e61-47e1-87bc-2b01717e3ca2","resolution":{"observed_at":"2026-08-05T15:18:45.993153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:51.857429Z","title":"SAM-CLIP: Merging vision foundation mod- els towards semantic and spatial understanding","venue":null,"work_id":"dad894ea-46af-4400-b495-5f5677e0390b","year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.079912Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:9fa4da18b71a3902b9ce51ef28a0c31b1187591df15439e3e2a50250aa975306","observation_id":"97e1706f-286a-437f-8223-9b9b0c14d122","resolution":{"observed_at":"2026-08-05T15:18:51.962413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:51.619765Z","title":"Distribution align- ment for fully test-time adaptation with dynamic online data streams","venue":null,"work_id":"d6e73f8c-17ff-4e65-93bb-0c56e0a39bef","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.140194Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:af0f1414815cb1a3d8384c6b1ce89ba13786b0e82defcc65825612bf91cc515d","observation_id":"6c6bbe76-ec2d-4cda-a6e5-d46a983f1f02","resolution":{"observed_at":"2026-08-05T15:18:51.733788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:51.441549Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":"8694d059-3582-499d-a9be-35df556504fa","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.209486Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:305fb67c3a814c7e2bb96a8bbf3b74a957fe83987ac8114c49973c0f19367ebb","observation_id":"9f9b4050-7074-4a82-82f4-2fb4c125ee8c","resolution":{"observed_at":"2026-08-05T15:18:51.506714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-05T20:11:45.942545Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-08-05T15:18:46.285386Z","title":"Clipself: Vision trans- former distills itself for open-vocabulary dense prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.285386Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:0b8dd73abefc2060f49c149ed7ae642e59b6ab0a47d5a263db4ab1a736b9c143","observation_id":"11049448-0be3-4165-b231-f11384954726","resolution":{"observed_at":"2026-08-05T15:18:46.285386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:51.222341Z","title":"Metagcd: Learning to continually learn in generalized cat- egory discovery","venue":null,"work_id":"500f4458-2045-40c5-b4fe-2956ba38b309","year":null},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.346372Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:662bdb99284aedc3f69b1928092317dd0864c483e38bfdc9b6f4001d5e772b28","observation_id":"452a3e49-6ddb-4fe7-9bd4-21b489b43d46","resolution":{"observed_at":"2026-08-05T15:18:51.300948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:50.996155Z","title":"Test-time domain adaptation by learning domain-aware batch normalization","venue":null,"work_id":"a2b82fda-a2d1-4d9d-9182-a35b9c8fdd7f","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.443600Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:9c4be9e31e6ae69fc15d30e6127df84d3f1e60cb341e67ef55d64e43bb39b607","observation_id":"767de156-5785-431c-866f-2d0550357d28","resolution":{"observed_at":"2026-08-05T15:18:51.105747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12359","last_updated":"2024-03-27T10:18:04Z","snapshot_observed_at":"2026-07-06T17:05:27.005904Z","submitted_at":"2023-12-19T17:40:27Z","title":"CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12359","snapshot_observed_at":"2026-08-05T15:18:46.555130Z","title":"Clip-dinoiser: Teaching clip a few dino tricks.arXiv preprint arXiv:2312.12359, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.555130Z"},"links":{"cited_paper":"/paper/2312.12359","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:263d0e8200c91a47184aa497c94106b5078ffd272c4b52e04db012f9c852dfb1","observation_id":"32ddfacc-5600-41c8-9c72-85f9cbef18d3","resolution":{"observed_at":"2026-08-05T15:18:46.555130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:50.746451Z","title":"Clip-diy: Clip dense infer- ence yields open-vocabulary semantic segmentation for-free","venue":null,"work_id":"8125cb74-3e0e-495c-99f5-e80886046133","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.651667Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:7d4d344b22cdd855f89249a95df02b083b1d95fd08dd5b1fc29d5a07754ddb8a","observation_id":"41eacf99-e32c-4ed0-9ead-b95f248e42be","resolution":{"observed_at":"2026-08-05T15:18:50.873604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-05T15:18:46.726110Z","title":"Demystify- ing clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.726110Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:e3a55bd15503555b844deed236873f8086f047cf84437a6f25b728a36ac4967e","observation_id":"8200cad9-845d-4632-8902-1b7b0eb19665","resolution":{"observed_at":"2026-08-05T15:18:46.726110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:50.511203Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"5c2f4798-a024-4350-a3db-8ddad9e721d8","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.821584Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:54660fece37860ddb5f50ab7eccf77d8e92f108daf87a802f51dd7c00a1bb0ab","observation_id":"f6c48f5f-4cae-4540-bd05-d69b88cdfe90","resolution":{"observed_at":"2026-08-05T15:18:50.620230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:50.275650Z","title":"Markov knowledge distil- lation: Make nasty teachers trained by self-undermining knowledge distillation fully distillable","venue":null,"work_id":"adf4b2bb-808e-449c-8594-ece214b4beb1","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.895351Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:06535ca3d70a59cd1813e80bb77e1aeb0b2d5de431b6cc5f5d87f1bfda2021b4","observation_id":"5445e7df-5a99-4794-974e-3c6b94c3f27e","resolution":{"observed_at":"2026-08-05T15:18:50.386358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:49.913802Z","title":"Conditional mutual information con- strained deep learning: Framework and preliminary results","venue":null,"work_id":"a9229de6-91ab-4f81-8acb-78103b838f32","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:46.973745Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:e3a631bd609ab935bcff4129ca370e73522da07320186cb8936e81b63d34a525","observation_id":"e04b65be-2ab3-4623-ba98-de063c856119","resolution":{"observed_at":"2026-08-05T15:18:50.089977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:49.660693Z","title":"Bayes conditional distribution estimation for knowledge distillation based on conditional mutual informa- tion","venue":null,"work_id":"1a2c4885-f7f7-459b-8344-7f868dc8a786","year":2020},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.098442Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:aca79f56aba9dfcbff44a56e58d5b71359c13e72f7e4c1b6610436c5bc2e3564","observation_id":"d453b326-abd3-4c96-952d-b793ab74e514","resolution":{"observed_at":"2026-08-05T15:18:49.777746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:49.483744Z","title":"Towards undistillable models by minimizing conditional mu- tual information","venue":null,"work_id":"1efacedc-f2c4-4d6c-a7dd-8f12dc18ebc8","year":2025},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.196825Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:568eeb98c4d32b26b154f62b76737e1d6be9ddd7b1bc4e7daf62c037dd246d25","observation_id":"68faeeef-c03d-4e8f-b2aa-87c75fda512c","resolution":{"observed_at":"2026-08-05T15:18:49.569716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T15:18:47.280828Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.280828Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:6f01005d4bb814c0f5ddb89313a4906a15a0cc597211bce96f1b39fda96827cc","observation_id":"71e4a3e5-1462-4f26-a39b-c1299d645184","resolution":{"observed_at":"2026-08-05T15:18:47.280828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02955","last_updated":"2024-09-14T00:26:00Z","snapshot_observed_at":"2026-08-03T22:00:24.530023Z","submitted_at":"2024-01-05T18:59:22Z","title":"Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively","version":2},"cited_work":{"arxiv_id":"2401.02955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02955","snapshot_observed_at":"2026-08-05T15:18:47.926547Z","title":"Open-Vocabulary SAM: Segment and Recognize Twenty-thousand Classes Interactively","venue":"cs.CV","work_id":"5084b05c-9f86-4e11-9ffa-3174ed9a8dc1","year":2024},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.360944Z"},"links":{"cited_paper":"/paper/2401.02955","citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:9a6b20635082323abe21766c9a69fbbeeb01a73473a3718e797cc7278f122618","observation_id":"632dfc9b-daa1-42d8-bbc5-a7939c911bd0","resolution":{"observed_at":"2026-08-05T15:18:47.960712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:49.228853Z","title":"Be your own teacher: Improve the performance of convolutional neural networks via self distillation","venue":null,"work_id":"bae77ca5-a9ce-47d8-a81b-919e4a346665","year":2019},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.432871Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:e4cc35303b3095aa247f9614c98f216893b5de543049e87d9cdce1c2fa8f632d","observation_id":"0de2b30c-e202-4f2b-b83a-d71e8e3f6d49","resolution":{"observed_at":"2026-08-05T15:18:49.317783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.984784Z","title":"Self- distillation: Towards efficient and compact neural networks","venue":null,"work_id":"4fec6211-1db2-4daf-bb2b-3c92ec519e78","year":2021},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.508836Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:f2ccba5c0cd1fa729c3c00cc1785eee5a1115eaaf3347f74f82c885162d0a622","observation_id":"d6ac0135-095d-4f49-b2b3-33a426c69a0c","resolution":{"observed_at":"2026-08-05T15:18:49.081325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.697130Z","title":"Meta-dmoe: Adapting to domain shift by meta- distillation from mixture-of-experts","venue":null,"work_id":"a0a454e9-47dd-44a7-8146-3e4e5da2be62","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.614409Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:8fcb882299604afc7650056bfb9a1e62f721a0282610b99de6389c8c29d69741","observation_id":"9943b111-95f2-4d86-801c-61ae06673861","resolution":{"observed_at":"2026-08-05T15:18:48.831920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.470901Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"bde51975-70d4-4c75-8bcd-224ba43674e2","year":2019},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.719855Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:adb53a38355b6321afa5b4d03e2c213dfa9b0ddb28648d7376caeb4fcea9d208","observation_id":"b821efcd-7313-4474-a892-5e669569f3c5","resolution":{"observed_at":"2026-08-05T15:18:48.588304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:48.278086Z","title":"Extract free dense labels from clip","venue":null,"work_id":"eb6ab370-97a4-4871-bdeb-cc8074c18e6a","year":2022},"citing_paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:47.795677Z"},"links":{"citing_paper":"/paper/2508.20265"},"observation_digest":"sha256:04d6c835c225faff68c37aaceefe863bb15af96359a4d56a85e3fc63017a7ab9","observation_id":"b249469a-dfb8-4fc5-93c8-81469ebd2797","resolution":{"observed_at":"2026-08-05T15:18:48.387446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20265","last_updated":"2025-08-27T20:47:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T15:18:36.121420Z","submitted_at":"2025-08-27T20:47:03Z","title":"Plug-in Feedback Self-adaptive Attention in CLIP for Training-free Open-Vocabulary Segmentation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":47},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 1 inbound Pith citation observation for arXiv:2508.20265."}