{"as_of":"2026-08-09T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:248bd6a63142edc70844741e2c8d88158ab64f527db7f85c71c0fb6559c0968f","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:17:04.584054Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00395/citation-record","integrity":"/paper/2508.00395/integrity","json":"/paper/2508.00395/citation-record.json","paper":"/paper/2508.00395"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.505643Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"428b0393-75c3-40fa-adef-4c20f0d87007","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.304085Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:3f0d9fa285c0ccc1ddf38f26c17d83b844ebd5007ab9f4400810022f3e9b6c24","observation_id":"8632558a-6c95-4da2-a4a8-bc576b5a62a1","resolution":{"observed_at":"2026-08-06T10:17:05.509893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.490891Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"c1e1e6ee-1e78-4cf0-84a9-6d7e72051169","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.308608Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:1a955b80f5929c7922454e00b66c277ceff1f10a866f0abaeae0637458588bb1","observation_id":"5091dcff-1478-4b3a-bb80-0cd17ec039b8","resolution":{"observed_at":"2026-08-06T10:17:05.496240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.476638Z","title":"Open-vocabulary object detection via vision and language knowledge distillation,","venue":null,"work_id":"403e2b76-5ff5-4570-ac38-3c0da1abc075","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.313112Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:a7c3fd8749cd7df04e50974596bb2de40053e44812a0b48bf66d0d31b614f0e8","observation_id":"7a6abef0-88a1-45b9-ae4d-982f8a17477d","resolution":{"observed_at":"2026-08-06T10:17:05.481344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.463050Z","title":"Denseclip: Language-guided dense prediction with context-aware prompting,","venue":null,"work_id":"342f9be3-eba2-4dd6-b8ab-ff5a14fcbe0a","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.317199Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:3c4f8122a851a4834efab17644011607a6e272e8cbb70b4464693e16d6e7d4fd","observation_id":"a36114ee-e4ad-4964-a24e-18cf1af3f39c","resolution":{"observed_at":"2026-08-06T10:17:05.467285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T10:17:04.321912Z","title":"Bert: Pre-training of deep bidirectional transformers for lan- guage understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.321912Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:cb76daeff93618f122bd863476d5ed1efd35c14c508ecef811605c5a38e654fd","observation_id":"c9d6aed8-9ae1-4fe8-94d5-e13d4f1f16ed","resolution":{"observed_at":"2026-08-06T10:17:04.321912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.448409Z","title":"Language models are few-shot learners,","venue":null,"work_id":"e45c3969-774e-4ee6-a17e-8dace38803f3","year":1901},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.326542Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:6e230921bf60edf009e12da816a343314cb939d119894b9512531cf00a6e6779","observation_id":"90f8933b-f5ac-48ae-8d4f-95003421b66f","resolution":{"observed_at":"2026-08-06T10:17:05.453312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.434197Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":"32f5fcba-ab59-4fa9-a412-5c65e5d20b40","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.331473Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:45ab090ea051834f9149412a626fbee0bb68377ef4bb35da39957513b62f8a50","observation_id":"58e08433-a596-4abc-97d1-4fbd70a97bf5","resolution":{"observed_at":"2026-08-06T10:17:05.438717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.420413Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":"a25d77b4-9bfc-4b9d-9376-fa425bdc7c0f","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.335395Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:ab7fc220fd8b84c217e944b8c6b9986bdc09619bf56114923f83dd17db249ace","observation_id":"91a357cc-5361-4042-9cab-0aae4796dabf","resolution":{"observed_at":"2026-08-06T10:17:05.424974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.339259Z","title":"Visual prompt tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.339259Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:72c8416a432b1b4e079fc6de1962ecaf890c2b59c3d1b2ef1137029f64a7042a","observation_id":"5055badf-2fd0-4831-a8f8-0efad9fa4632","resolution":{"observed_at":"2026-08-06T10:17:04.339259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.398477Z","title":"Prompt- aligned gradient for prompt tuning,","venue":null,"work_id":"3f1b9483-219c-486f-b6db-5b1a23b24e41","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.342949Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:d7b467d9f06653442581d6e8d3c0fdbbee7e217fa66af68502f9831fadf66f42","observation_id":"3228aebb-f75e-4380-a41e-cbe3867d2096","resolution":{"observed_at":"2026-08-06T10:17:05.402770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.385565Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":"306cc324-72f0-4ee8-ac4e-aac55378fd45","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.347004Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:5277cf50958bfc5b79ee215a7595ff2279503dcda168153637ce9e0b33379b38","observation_id":"db157fd6-4d06-43c0-8d8b-40fef442ee9c","resolution":{"observed_at":"2026-08-06T10:17:05.389577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-06T10:17:04.350951Z","title":"What does clip know about a red circle? visual prompt engineering for vlms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.350951Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:3fdd56a70f03aefbd99a3acbfb375dd83fea9be92085bf11b5bf486f50ec5fb4","observation_id":"b7290177-dbcc-48bf-afe5-da6924556643","resolution":{"observed_at":"2026-08-06T10:17:04.350951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T10:17:04.354989Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.354989Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:4913679fd872f2bdf3a19c4be37cfdf41d92f70f353beeed6d977a3c0487493b","observation_id":"329963e4-2f87-4401-b2b4-9ef2f7e2a7f6","resolution":{"observed_at":"2026-08-06T10:17:04.354989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.373276Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":"b089d687-847f-431c-af30-91e9147e63e9","year":2017},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.359337Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:020cb4662e9e0a4531da35e2dfeaddf3cab4f1fd8b072144ca15c519cd2d5c30","observation_id":"843cadba-1961-4b0e-a955-8b8ff549fdb1","resolution":{"observed_at":"2026-08-06T10:17:05.377214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.360371Z","title":"Segment everything everywhere all at once,","venue":null,"work_id":"4aa732b5-529e-441e-8f8b-6bf5e6872e3d","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.363194Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:c21ea9a4d287e8953b2dc26c9352dcd5dfad9dcfd3eea7b59f5fb393ba299d89","observation_id":"e24704fb-5804-4974-9e33-866322ec62e6","resolution":{"observed_at":"2026-08-06T10:17:05.364420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.348023Z","title":"Plot: Prompt learning with optimal transport for vision- language models,","venue":null,"work_id":"9d70750c-86aa-4640-93bd-67f9a41f8cfd","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.367032Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:73305a00ebda2488aef0ea1c942e85945cd0fd6ffeb93707749b6cf33d914bfc","observation_id":"35825a5e-64f2-4e44-9fd9-7bdab9f24535","resolution":{"observed_at":"2026-08-06T10:17:05.352031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.333435Z","title":"Visual-language prompt tuning with knowledge-guided context optimization,","venue":null,"work_id":"fae712a2-a7fd-4f1c-af00-0ec726a0bf54","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.371222Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:6259598625c9fc86bc63855f66cb1d95aeed7b4f2dd79207bce121fafe9da9c8","observation_id":"46f1fbb1-31d4-44f8-af18-fda37a12369d","resolution":{"observed_at":"2026-08-06T10:17:05.338638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.320891Z","title":"Texts as images in prompt tuning for multi-label image recognition,","venue":null,"work_id":"8c1d9acb-681e-4518-8bde-36881ca7c522","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.375806Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:6466c0b8c2c0b09f714bcaa43768d3e665d1f1b37f523dcb82637952c6065550","observation_id":"49d9db32-b6f5-43aa-9917-b4505847b026","resolution":{"observed_at":"2026-08-06T10:17:05.324937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.308570Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting,","venue":null,"work_id":"f94f2869-fb33-40c9-96e7-882500dffdc8","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.379773Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:13f3fabdddfc31fdb097b285280e9e85336d9215b078573bf249d94b3b84f15c","observation_id":"82635ffc-243f-4c9b-82f4-47c61e036c57","resolution":{"observed_at":"2026-08-06T10:17:05.312631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.295761Z","title":"Promptkd: Unsupervised prompt distil- lation for vision-language models,","venue":null,"work_id":"07ab697f-de35-43c1-88dd-7ac512064432","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.383707Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:53b8b5201205234278d25cc6b6ce06b16e53c5bd4c65d33fc3b4cb9a76805a15","observation_id":"b0e24e3e-a9ee-4426-a704-b1ff1a652e5f","resolution":{"observed_at":"2026-08-06T10:17:05.299961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.283423Z","title":"Domain prompt learning with quaternion networks,","venue":null,"work_id":"39984fdb-e4b6-4b43-93f3-75b66d86a835","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.388615Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:09896ee3dbe93931d3b8abbcdf3e5d70a471d2c0e39e9359a410df0b2376db48","observation_id":"6d88f0fe-861a-4fb3-8a2f-a4e6626333a8","resolution":{"observed_at":"2026-08-06T10:17:05.287465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.270856Z","title":"Generalized domain prompt learning for accessible scientific vision-language models,","venue":null,"work_id":"333393e4-f4e9-4b0e-8349-ced4a4edc095","year":2025},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.392734Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:e309eab5d0957622402a65d356d8a32c2384552ca62cdc0424ee9534c003dcb1","observation_id":"90f0c0a7-e27a-4721-9507-23202a36aa46","resolution":{"observed_at":"2026-08-06T10:17:05.275125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T10:17:04.396669Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.396669Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:982b13a98c752be7a5052fe0baf4f95155cb35c4973d85cabed594d086cfaf22","observation_id":"c204adb9-9f26-4c90-af62-1bd3c7c52e26","resolution":{"observed_at":"2026-08-06T10:17:04.396669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.256710Z","title":"Complementary patch for weakly supervised semantic segmentation,","venue":null,"work_id":"0a1b93e4-fc72-44a6-93be-ffe8d03f3038","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.401135Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:e1bc2c78ef2d092e6343eaa87ea1b079bcea3f5f28ee67eca873d7c415632d93","observation_id":"4af2ae64-23b7-4343-b49c-c0478581c7c7","resolution":{"observed_at":"2026-08-06T10:17:05.261312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.243868Z","title":"Uncovering prototyp- ical knowledge for weakly open-vocabulary semantic JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, OCTOBER 2024 14 segmentation,","venue":null,"work_id":"0e27e248-8316-4235-81b6-516185f3919e","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.405102Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:1894c4adbc39ba9643fc89d38830848dcfefb000fdb38d12c6392da91e11fd08","observation_id":"e413f948-1327-4e4b-a2ac-03f051e01a0f","resolution":{"observed_at":"2026-08-06T10:17:05.248356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.231246Z","title":"Attrseg: open-vocabulary semantic segmentation via at- tribute decomposition-aggregation,","venue":null,"work_id":"3f70d90c-77f5-4b88-ab7c-18cc36a6b275","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.408928Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:c314293208f5f3bf2df01a53e25dc304258ae5b8211947a43d97b94389b6a585","observation_id":"9fa6da40-f9fb-423f-acfe-880aa7eeeee8","resolution":{"observed_at":"2026-08-06T10:17:05.235429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09813","last_updated":"2023-03-17T07:47:55Z","snapshot_observed_at":"2026-07-06T15:04:49.291968Z","submitted_at":"2023-03-17T07:47:55Z","title":"DiffusionSeg: Adapting Diffusion Towards Unsupervised Object Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09813","snapshot_observed_at":"2026-08-06T10:17:04.412924Z","title":"Diffusionseg: Adapting diffusion to- wards unsupervised object discovery,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.412924Z"},"links":{"cited_paper":"/paper/2303.09813","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:f00b7433cf739e2ba1d003ee0b5a754fa8f7639e03dc878001899419e0d52080","observation_id":"92e5a3c8-82ef-46e7-af4d-a3929db0af43","resolution":{"observed_at":"2026-08-06T10:17:04.412924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00096","last_updated":"2024-01-06T04:10:27Z","snapshot_observed_at":"2026-08-03T16:24:18.233783Z","submitted_at":"2023-08-31T19:34:09Z","title":"AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation","version":2},"cited_work":{"arxiv_id":"2309.00096","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.00096","snapshot_observed_at":"2026-08-06T10:17:04.776272Z","title":"AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation","venue":"cs.CV","work_id":"68e9bfc3-424d-48f8-9be6-da6bed7f3c2d","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.417946Z"},"links":{"cited_paper":"/paper/2309.00096","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:6d8ff5c1b1b4ee0cece083fb8c4efd9e981512a5ad4d94ac7d59eb85b7e9d1d1","observation_id":"b6620bff-3b9f-424f-a783-64faa8d8b597","resolution":{"observed_at":"2026-08-06T10:17:04.780664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.218469Z","title":"Probabilistic conformal distillation for enhanc- ing missing modality robustness,","venue":null,"work_id":"c863a23c-3889-405d-9773-afbb3dac36c6","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.422986Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:cd6ebf28e5b9ab9f47e3de437cfc1ccb8db617187fa995a07fa93679e5f3008b","observation_id":"ecd0fce9-c3ec-473a-87c9-d5c271454a58","resolution":{"observed_at":"2026-08-06T10:17:05.222713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03799","last_updated":"2025-06-04T10:06:32Z","snapshot_observed_at":"2026-08-08T13:03:29.824359Z","submitted_at":"2025-06-04T10:06:32Z","title":"ConText: Driving In-context Learning for Text Removal and Segmentation","version":1},"cited_work":{"arxiv_id":"2506.03799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03799","snapshot_observed_at":"2026-08-06T10:17:04.757643Z","title":"ConText: Driving In-context Learning for Text Removal and Segmentation","venue":"cs.CV","work_id":"5ee023d9-c9e3-43de-a87b-79ece14b85ae","year":2025},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.427228Z"},"links":{"cited_paper":"/paper/2506.03799","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:db79971c6bdc01d9444bf5cabb82f0a8a276517a8bd176007d9f0f9524e4f800","observation_id":"67d5aa8e-f874-4373-bc2a-3b5bcc26b4d2","resolution":{"observed_at":"2026-08-06T10:17:04.762107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01539","last_updated":"2025-06-02T11:05:28Z","snapshot_observed_at":"2026-08-08T06:00:29.569012Z","submitted_at":"2025-06-02T11:05:28Z","title":"G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.01539","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01539","snapshot_observed_at":"2026-08-06T10:17:04.738485Z","title":"G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models","venue":"cs.CV","work_id":"45e73a67-a9cc-4736-8423-c56a8d092f9e","year":2025},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.431281Z"},"links":{"cited_paper":"/paper/2506.01539","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:d4a8a97115beb9c24de849af26abfbcad46bc8ad5f6e08be90726bc96ccab429","observation_id":"1a1a3170-d693-448e-9ce7-18397ec3bc8c","resolution":{"observed_at":"2026-08-06T10:17:04.743285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.206092Z","title":"Fine- grained visual prompting,","venue":null,"work_id":"1af47100-af75-4049-bdf6-a53cbdf61342","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.435654Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:b0234ddc4343538318b2564114e3b7c5aa90410dac4eb58c717842608d878359","observation_id":"b82e79ae-eca6-4195-8f4e-81fa959d533a","resolution":{"observed_at":"2026-08-06T10:17:05.210154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.192887Z","title":"Alpha-clip: A clip model focusing on wherever you want,","venue":null,"work_id":"bd1b7eee-3553-4d68-aa1c-cbdcf574a03e","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.439352Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:2d00475bfbf3876ba8a963eb34cb9c62fbdff7c12ba70fd2e20b8f4bf1dc41e3","observation_id":"33492d0b-5933-4532-80aa-5a9c1a96a1d7","resolution":{"observed_at":"2026-08-06T10:17:05.197312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.180383Z","title":"Vip-llava: Making large mul- timodal models understand arbitrary visual prompts,","venue":null,"work_id":"e38485b4-926f-43b0-bc6c-af700c63aee1","year":2024},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.444130Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:f4954e1b7c57ce89d0f898ed79d619987aad517c180ba77411116b461728e59d","observation_id":"8542b140-649b-4055-9c84-073e34113362","resolution":{"observed_at":"2026-08-06T10:17:05.184585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.168293Z","title":"Learning deep features for discriminative localization,","venue":null,"work_id":"52b4e4ff-3505-4403-bfd3-e9e3c46bd34c","year":2016},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.448496Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:b4e3c8e21ef8b11ade2db381263fe62d81b96ac3642ec3db7e5e8055001eb561","observation_id":"b8b1a979-c9c9-496f-93cc-c05b53b18b6d","resolution":{"observed_at":"2026-08-06T10:17:05.172186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.155064Z","title":"Weakly-supervised semantic segmentation by iteratively mining common object features,","venue":null,"work_id":"9b4196dd-1010-4d48-b8f7-acd93eeba4d0","year":2018},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.452270Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:9677bf6f676a379c1805f1924525e022a5c85429d7146e6e930bcc2edf077231","observation_id":"8fb1669c-1190-4642-84eb-bd258fe69637","resolution":{"observed_at":"2026-08-06T10:17:05.159498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.142426Z","title":"Learning affinity from attention: end-to-end weakly-supervised semantic segmentation with transformers,","venue":null,"work_id":"ca339a9b-e1ed-4117-9baf-627d73f76173","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.456544Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:ab445ea3f8e4207a32715dcecb439cee80021e54bf695b66395483d42d534d2f","observation_id":"4cda64fe-3a06-4736-bdd4-f7f7f7211c48","resolution":{"observed_at":"2026-08-06T10:17:05.146563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-09T03:50:44.384164Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-06T10:17:04.461068Z","title":"Seggpt: Segmenting everything in context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.461068Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:5851ef894d931a84a6ef3b65a3a1860a251b9e1b23a611991cd33a2182f39f88","observation_id":"62873a9b-c56b-4f7f-98bf-49240d3e6394","resolution":{"observed_at":"2026-08-06T10:17:04.461068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.129748Z","title":"Clip is also an efficient segmenter: A text-driven approach for weakly supervised semantic segmentation,","venue":null,"work_id":"cd7b9c7c-922e-42de-a44b-9444e221fce2","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.465117Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:be5e571d53695a1a69a5609e0ee847c069c0ecf2c40d6d071cc3908222f2c676","observation_id":"6ab70f0f-1fca-49a2-89c9-53fae3069442","resolution":{"observed_at":"2026-08-06T10:17:05.133890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.116466Z","title":"Learning to rank in person re-identification with metric ensembles,","venue":null,"work_id":"ac1d7230-b974-4ece-ab01-dca47dfad3b5","year":2015},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.468964Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:11a79ed60b0a56406d2782b39aa7acf01e2a313508ab3291752592617811e771","observation_id":"f897479b-681a-4a5c-b383-0389db5b1d4b","resolution":{"observed_at":"2026-08-06T10:17:05.120661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.104115Z","title":"Large-scale unsupervised semantic segmenta- tion,","venue":null,"work_id":"ab154ca1-5fb7-4a42-aa0e-07f56d5497ef","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.472820Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:988d10be8b497ac9cf2505043f90a29f4e2a48c7610420167802c227fb2dddad","observation_id":"db7a3e62-8145-44e6-ad75-38f22b6a476f","resolution":{"observed_at":"2026-08-06T10:17:05.108147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.090789Z","title":"Learning gener- ative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":"ec46e240-5d1f-428e-af7d-d41f8758f7c5","year":2004},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.477223Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:a187d955414682b9cd199a0b20cbb46991e48118083bf8b6fcda9cc91c2edab3","observation_id":"51d94a14-c22e-4cf8-8d4e-fb8564735adc","resolution":{"observed_at":"2026-08-06T10:17:05.095104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.077431Z","title":"Cats and dogs,","venue":null,"work_id":"23391b04-b54e-416b-b6cd-8aa686ada7c7","year":2012},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.481228Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:73b88bdfea5ef0f4429cf0cbc19ec3b2f436ad07727b6d90b56ff8622d1ac4d4","observation_id":"96dfb658-8e52-4658-9f1f-fa98c5429d56","resolution":{"observed_at":"2026-08-06T10:17:05.082054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.064879Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":"0eb665e7-548b-402a-93ec-d9059ce49e89","year":2013},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.485227Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:66400ec34873d84a88e175aa51e90b9ea13152d5aa107190482c744edaaa6637","observation_id":"cca6fbb5-1cef-48ef-bde5-d3b86b3ea342","resolution":{"observed_at":"2026-08-06T10:17:05.069197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.051681Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":"5e0cd358-1819-4bf9-bf4b-6f9e3b768560","year":2008},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.489561Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:2b6c19119137d18ee1f7d831949d23d9a40bcc14e94d532a0ce894eaaa3692bf","observation_id":"0ee894b3-fc2d-445d-ad8e-cf3b15845764","resolution":{"observed_at":"2026-08-06T10:17:05.055872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.039056Z","title":"Food- 101–mining discriminative components with random forests,","venue":null,"work_id":"0683c8a8-135f-4ac1-b337-2819e50cdf64","year":2014},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.494173Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:22a107853a417ca0c1ba905a0aa70abbffbe5bfeadb58b6040029b3ace8803bd","observation_id":"76fce46b-8fed-46d9-abb2-da05f5de353f","resolution":{"observed_at":"2026-08-06T10:17:05.043246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-06T10:17:04.498073Z","title":"Fine-grained visual classification of aircraft,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.498073Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:89ed0f5cbb9d4ce6863417fdee54164578f2d268e257a75b60b9fa54d1971eb5","observation_id":"83a4b08d-0b25-40ff-98b6-030db720cfd3","resolution":{"observed_at":"2026-08-06T10:17:04.498073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.025586Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":"1c2af3b2-b2c4-4f74-8e7f-d40dfc606a53","year":2010},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.502419Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:28e8f9106ad61129f143935a43598f3e2997ae5bd41b25ae4022b39bb6c4b4a5","observation_id":"61aa026d-264a-4c8e-8270-78b07e5d8c37","resolution":{"observed_at":"2026-08-06T10:17:05.029654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T10:17:04.506212Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.506212Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:62e58ac4a51b10143acafc66d4e9370ab873166727c837bd09eb628885f0a981","observation_id":"15b3c7cf-32bf-4421-a999-6458a82b8657","resolution":{"observed_at":"2026-08-06T10:17:04.506212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:05.012255Z","title":"Describing textures in the wild,","venue":null,"work_id":"28b79496-3870-4c05-8ad4-a406f84b067a","year":2014},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.510226Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:392db0445deb5e2b5d55cd1520411353aec72a030f09d8a4dd85ad7a6d5d2c43","observation_id":"6b19a19f-c70a-4145-a876-69db582470c6","resolution":{"observed_at":"2026-08-06T10:17:05.016654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.999745Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":"b67e2366-89c4-4622-9792-e15aa775d4e3","year":2019},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.514270Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:8d2a36a991189d15be7770a294a090786a9f418449597667992fdf2772845c2d","observation_id":"20d35196-5701-4bce-a800-efb767c63838","resolution":{"observed_at":"2026-08-06T10:17:05.003783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.987068Z","title":"Do imagenet classifiers generalize to imagenet?","venue":null,"work_id":"8c2f6059-1a19-41af-a359-03504549a0c5","year":2019},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.518111Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:12b3ab2bd07090cacdc40c4c0b7e240f605d9df70b774024ad5d8c4fea1629b0","observation_id":"5545c0cd-1845-46b0-b809-fb4eab9fe644","resolution":{"observed_at":"2026-08-06T10:17:04.991215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.974670Z","title":"Learning robust global representations by penalizing local predic- tive power,","venue":null,"work_id":"e553d814-ce1d-4a68-a655-db8f80702025","year":2019},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.521878Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:8e436b976cd2d58ee2f2908178967e4e0eeeab0729f52742bed9112bb0179cd0","observation_id":"3449f01d-c8dd-409c-ae09-de7eeeb76181","resolution":{"observed_at":"2026-08-06T10:17:04.978756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.962041Z","title":"Natural adversarial examples,","venue":null,"work_id":"08646465-6ec1-47ab-89c9-9904e45ca764","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.525848Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:de798ed8f8a4a2c28a6d804dc890127059d08b7a51b616d14fbd1c8d99363898","observation_id":"9b1975b8-52e7-4d5d-8696-db0ea5345977","resolution":{"observed_at":"2026-08-06T10:17:04.965947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.948726Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization,","venue":null,"work_id":"a6fe453c-39dc-4f13-93e8-779a4782c971","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.529566Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:0c4fea550c2af5a253fc6e41349fb74c47cf6a54104e908e2ac395bf1fdce325","observation_id":"3a502d18-e5fc-4cfc-ae0d-415ddd33f752","resolution":{"observed_at":"2026-08-06T10:17:04.952874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.935753Z","title":"Blip-2: Bootstrap- ping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"c6fe3adf-463a-48f6-a471-2fc5788b5c72","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.534064Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:6dc839311a2b3a8cdd8b8c50e7810c840a235f19f77f0266fce8452ba7e79380","observation_id":"3c2b402b-3c24-4b85-a875-0c30f15ac9d9","resolution":{"observed_at":"2026-08-06T10:17:04.940251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.922004Z","title":"Deepcore: A comprehen- sive library for coreset selection in deep learning,","venue":null,"work_id":"d22b78bd-363a-4bab-89c9-f8518f125c57","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.538609Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:2cb052d4f1a5705ea28321c2caa6c8ae03ec56d45abb47253ee3c79705b0737f","observation_id":"7bec0db0-b627-4e0c-8a1b-958301d1a790","resolution":{"observed_at":"2026-08-06T10:17:04.926640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.907660Z","title":"A combinatorial strongly polynomial algorithm for minimizing submod- ular functions,","venue":null,"work_id":"84dce8ce-b2e6-4e1e-baa2-1c6fc246b06a","year":2001},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.542423Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:2bdf94e72a6a1e74001842a08a63750d8dbe6bdbdd07ce5025aac8c7d173740a","observation_id":"55cd18a0-5646-4caa-96ee-c4dce0946636","resolution":{"observed_at":"2026-08-06T10:17:04.911820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11829","last_updated":"2020-10-27T00:52:20Z","snapshot_observed_at":"2026-07-06T08:03:24.054624Z","submitted_at":"2019-06-26T23:01:47Z","title":"Selection via Proxy: Efficient Data Selection for Deep Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.11829","snapshot_observed_at":"2026-08-06T10:17:04.546588Z","title":"Selection via proxy: Efficient data selection for deep learning,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.546588Z"},"links":{"cited_paper":"/paper/1906.11829","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:c1c375c4c6c36bcd23b1d35fc92400c7b99aca371db49bc3ecdfca2e24032441","observation_id":"4d154144-7ada-4e10-bd63-a14f107b3b9b","resolution":{"observed_at":"2026-08-06T10:17:04.546588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.894768Z","title":"Glister: Generalization based data subset selection for efficient and robust learning,","venue":null,"work_id":"9b8e2b66-52e3-415a-bf9b-23f4787cf52e","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.551460Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:625b5e6f11beb51a3de66e0b8efaa710473e9a5f681bfbc00461973ab337daf6","observation_id":"903a19b4-b084-4cf0-92df-b3a8b943b177","resolution":{"observed_at":"2026-08-06T10:17:04.898942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.881646Z","title":"Deep learning on a data diet: Finding important examples early in training,","venue":null,"work_id":"43ca53ff-ab43-4ef3-a600-82a2ea5fe82a","year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.555307Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:63180468e5ee2b6daeff2aa74085abb15eb9aa5ea435cb8f88e87ac0cd0f1c22","observation_id":"99b34c44-5825-411c-b2f1-7b5efc6b5924","resolution":{"observed_at":"2026-08-06T10:17:04.886054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03764","last_updated":"2021-09-08T16:40:18Z","snapshot_observed_at":"2026-08-06T03:32:43.504624Z","submitted_at":"2021-09-08T16:40:18Z","title":"Active Learning by Acquiring Contrastive Examples","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.03764","snapshot_observed_at":"2026-08-06T10:17:04.559004Z","title":"Active learning by acquiring contrastive examples,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.559004Z"},"links":{"cited_paper":"/paper/2109.03764","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:f3c30a5416232fae1fc7db92b7ef276ad165242b3229c4833d1fb65f9c3c4789","observation_id":"601c9ab7-57e0-48d3-b90f-955fa93aa16d","resolution":{"observed_at":"2026-08-06T10:17:04.559004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.868284Z","title":"A survey on label- efficient deep image segmentation: Bridging the gap between weak supervision and dense prediction,","venue":null,"work_id":"28640b8c-88b9-402d-ae8e-d4419cf56e3e","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.563379Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:e45fb1f39c990ffd1314499c28ac6aa36ec4ae2909438fb52555822322272f8e","observation_id":"2402a63d-9b96-4615-8a1b-c9b39f7476be","resolution":{"observed_at":"2026-08-06T10:17:04.872609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17225","last_updated":"2023-03-30T08:42:49Z","snapshot_observed_at":"2026-07-06T15:10:01.106455Z","submitted_at":"2023-03-30T08:42:49Z","title":"FreeSeg: Unified, Universal and Open-Vocabulary Image Segmentation","version":1},"cited_work":{"arxiv_id":"2303.17225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.17225","snapshot_observed_at":"2026-08-06T10:17:04.653645Z","title":"FreeSeg: Unified, Universal and Open-Vocabulary Image Segmentation","venue":"cs.CV","work_id":"a46e4d2b-4846-4d69-bd23-4885642cab5c","year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.567254Z"},"links":{"cited_paper":"/paper/2303.17225","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:b3cc10f54516ba5081a81b0d6561fcf521d0a46a1f427e0cc5698bdc159d282c","observation_id":"e7e731e8-eed8-44f6-9dd0-1ce37b11096b","resolution":{"observed_at":"2026-08-06T10:17:04.659799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04356","last_updated":"2023-12-12T06:36:53Z","snapshot_observed_at":"2026-08-02T18:09:02.754027Z","submitted_at":"2023-06-07T11:39:56Z","title":"Fine-Grained Visual Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04356","snapshot_observed_at":"2026-08-06T10:17:04.571789Z","title":"Fine-grained visual prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.571789Z"},"links":{"cited_paper":"/paper/2306.04356","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:3a6078dedcc81ebd2163af0cbce7ba02bbe29676a821ec632972efb839c156e8","observation_id":"0276194c-b1d0-4698-9f5e-68a15d521121","resolution":{"observed_at":"2026-08-06T10:17:04.571789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-02T19:28:48.954133Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-08-06T10:17:04.575798Z","title":"Distributionally robust neural networks for group shifts: On the importance of regularization for worst-case generalization,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.575798Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:0ff8d082b20fd277f9fc677ea8746cb941fe51e21f892895a31024e2c3427fb9","observation_id":"95fb7e37-6ce4-43ab-8e00-532a4ecd17e2","resolution":{"observed_at":"2026-08-06T10:17:04.575798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:17:04.854431Z","title":"A compre- hensive study of image classification model sensitivity to foregrounds, backgrounds, and visual attributes,","venue":null,"work_id":"fcdaffa6-289b-4e2a-91d6-3834e4dac71f","year":2022},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.580142Z"},"links":{"citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:3b22c0a86b00d75e3336f82c35f4d7e1cce802576a67dd83a0958a549bfccd1a","observation_id":"8f8c706e-e85d-4188-81c3-27907f1e66ae","resolution":{"observed_at":"2026-08-06T10:17:04.859296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09994","last_updated":"2020-06-17T16:54:43Z","snapshot_observed_at":"2026-07-06T09:30:08.595544Z","submitted_at":"2020-06-17T16:54:43Z","title":"Noise or Signal: The Role of Image Backgrounds in Object Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09994","snapshot_observed_at":"2026-08-06T10:17:04.584054Z","title":"Noise or signal: The role of image backgrounds in object recognition,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:04.584054Z"},"links":{"cited_paper":"/paper/2006.09994","citing_paper":"/paper/2508.00395"},"observation_digest":"sha256:4a2a33858b2e0d4697922962d1576aca12c950d9a6047f387a959adba3b8229f","observation_id":"4b4cec6f-1885-4c62-aeb6-936a2a2d803c","resolution":{"observed_at":"2026-08-06T10:17:04.584054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.00395","last_updated":"2025-08-01T07:46:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:35:44.147502Z","submitted_at":"2025-08-01T07:46:00Z","title":"Decouple before Align: Visual Disentanglement Enhances Prompt Tuning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":4,"verified_fuzzy":50},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2508.00395."}