{"as_of":"2026-08-07T05:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a663bff9facee61e219ef9eafe543861ea5f3070f2fc3acf9bdb9b213b57c0e2","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:27:47.245370Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08410/citation-record","integrity":"/paper/2507.08410/integrity","json":"/paper/2507.08410/citation-record.json","paper":"/paper/2507.08410"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.747091Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.747091Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:1da55586f099b15ff8c23032efe274419e94da2da03780f006fd6e32f61e07ef","observation_id":"9156d484-00be-4473-948a-c2cad2f6b3c9","resolution":{"observed_at":"2026-08-06T18:27:46.747091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18415","last_updated":"2024-11-03T18:23:45Z","snapshot_observed_at":"2026-07-06T18:21:30.595036Z","submitted_at":"2024-05-28T17:57:06Z","title":"Why are Visually-Grounded Language Models Bad at Image Classification?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18415","snapshot_observed_at":"2026-08-06T18:27:46.828449Z","title":"Why are visually-grounded language models bad at image classification?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.828449Z"},"links":{"cited_paper":"/paper/2405.18415","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:18fca6fdcde45c69f3739a8ddf72246f7879df39bd5815349194e6f8759af672","observation_id":"2f4deb52-f0f0-4b76-8427-1491df391ee8","resolution":{"observed_at":"2026-08-06T18:27:46.828449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.858025Z","title":"Eva: Exploring the limits of masked visual representation learning at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.858025Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:f262990e7955b1b91fbfceac23feb12a76d0603a269e5f1c196a4d1dc8d6e4ef","observation_id":"13029e43-a1b6-49e4-bafc-42fb665b7bfb","resolution":{"observed_at":"2026-08-06T18:27:46.858025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.862663Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.862663Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:7a924b3302d5723821e2bd955aecf123bc10187900fcdfa688a11611854b6a7a","observation_id":"39aa69af-70b4-4a4f-8183-f1198ec0dbeb","resolution":{"observed_at":"2026-08-06T18:27:46.862663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.867601Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.867601Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:4620ad9418b4db87df68719df63dea70b87ca3972dffba279d656c5119d8548d","observation_id":"46276c91-e114-4954-aa13-5a3a05cb3661","resolution":{"observed_at":"2026-08-06T18:27:46.867601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.871905Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.871905Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0486873c81485ce9a84e9f8dab3c5497c1f7334cd668637d549958f3f58c5aab","observation_id":"e285e8a3-1e6c-46ea-beb8-b17c138e9631","resolution":{"observed_at":"2026-08-06T18:27:46.871905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.876620Z","title":"Tcp: Textual-based class-aware prompt tuning for visual-language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.876620Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:f314e666acb75362893f4fda3bdf308399f132a5c4ff47e3086d8f221ed03abf","observation_id":"a6fc409e-cd32-491d-b6b6-0a58406c2ab0","resolution":{"observed_at":"2026-08-06T18:27:46.876620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:53.253256Z","title":"Dept: Decoupled prompt tuning,","venue":null,"work_id":"1f090aa5-b8f4-48f2-b7c5-d4a3ed323278","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.881369Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:a1e5eeb03d49a79be731eb58e3f197de172af3535a3face7e27052af1b7b5e31","observation_id":"d1b1b93a-719a-4ddf-8302-3d48af181791","resolution":{"observed_at":"2026-08-06T18:27:53.308142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02781","last_updated":"2024-08-13T07:50:02Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T08:53:30Z","title":"PromptKD: Unsupervised Prompt Distillation for Vision-Language Models","version":5},"cited_work":{"arxiv_id":"2403.02781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.02781","snapshot_observed_at":"2026-08-06T18:27:47.622484Z","title":"PromptKD: Unsupervised Prompt Distillation for Vision-Language Models","venue":"cs.CV","work_id":"b149260f-de95-4e18-9c35-ebb1744aa70b","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.885780Z"},"links":{"cited_paper":"/paper/2403.02781","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:8fb9b4823c5c2b7a595d76b8ae351e35fcb47a933ed5d093904cca57214e3d45","observation_id":"1e11ad71-9bdb-44c6-96e9-9c28f9822ee4","resolution":{"observed_at":"2026-08-06T18:27:47.628086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.890805Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.890805Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:844a45e15d1e9b254740d773dad500d3b268ce281272229e80e0ef4b31397271","observation_id":"ff40152d-8d67-4828-ba13-342a9de8c0cb","resolution":{"observed_at":"2026-08-06T18:27:46.890805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01195","last_updated":"2024-08-03T18:48:43Z","snapshot_observed_at":"2026-07-06T15:36:56.786182Z","submitted_at":"2023-06-01T23:20:47Z","title":"Consistency-guided Prompt Learning for Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01195","snapshot_observed_at":"2026-08-06T18:27:46.895300Z","title":"Consistency-guided prompt learning for vision- language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.895300Z"},"links":{"cited_paper":"/paper/2306.01195","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:275d269e44588525afe2ad2359b4dc4cdabe3890e8c43fd8b25a5a38a7719e41","observation_id":"6bf813c6-152a-4bcf-9010-af13b40d0145","resolution":{"observed_at":"2026-08-06T18:27:46.895300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04076","last_updated":"2024-04-02T21:47:35Z","snapshot_observed_at":"2026-08-03T14:13:56.496555Z","submitted_at":"2023-12-07T06:43:34Z","title":"Large Language Models are Good Prompt Learners for Low-Shot Image Classification","version":2},"cited_work":{"arxiv_id":"2312.04076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.04076","snapshot_observed_at":"2026-08-06T18:27:47.583661Z","title":"Large Language Models are Good Prompt Learners for Low-Shot Image Classification","venue":"cs.CV","work_id":"52215a3e-2ae8-4db4-8030-f2d90231b358","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.900106Z"},"links":{"cited_paper":"/paper/2312.04076","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:79129703e3eb49b62df54c85905859dc94af9a1aba81be0718ca59935f31dfe9","observation_id":"beabbd0c-6a93-456d-884e-253b41e88a75","resolution":{"observed_at":"2026-08-06T18:27:47.588821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:53.070684Z","title":"Improved zero-shot classification by adapting vlms with text descriptions,","venue":null,"work_id":"13758758-46ce-44c3-b5a1-6571c01f9915","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.904781Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:1f7916b927b59a2f672d50ed3748c4844953cb8f78182dd6a25bca890510d184","observation_id":"b0972253-29f7-495d-b171-ee7e2656d84a","resolution":{"observed_at":"2026-08-06T18:27:53.132833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.975252Z","title":"Bilateral adaptive cross-modal fusion prompt learning for clip,","venue":null,"work_id":"0146697c-9072-4d0f-807e-053668f744cc","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.909676Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:e86a5d2e6cf033076673f31e661e138a35b3a5cb72683a37a904ac0a5effa9bc","observation_id":"b51b309f-f8ee-4a08-aa8c-88b0b494d25e","resolution":{"observed_at":"2026-08-06T18:27:53.023998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07225","last_updated":"2022-10-13T17:50:24Z","snapshot_observed_at":"2026-07-06T14:04:55.099373Z","submitted_at":"2022-10-13T17:50:24Z","title":"Unified Vision and Language Prompt Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07225","snapshot_observed_at":"2026-08-06T18:27:46.914058Z","title":"Unified vision and language prompt learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.914058Z"},"links":{"cited_paper":"/paper/2210.07225","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:859b1fce580920deaf65a9c6aadde86dabf7358be6c381c707b33a2af50b5591","observation_id":"238e3490-284d-4bb2-961f-47d8d62720ee","resolution":{"observed_at":"2026-08-06T18:27:46.914058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.918620Z","title":"Visual prompt tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.918620Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:90a14bfb0db02fee7dc4e5c55a1e33015d11262e060acc2890620030df62907d","observation_id":"df39cd68-4808-4b93-84a3-376673743d68","resolution":{"observed_at":"2026-08-06T18:27:46.918620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.864113Z","title":"Enhancing clip with gpt-4: Harnessing visual descriptions as prompts,","venue":null,"work_id":"8f12c857-fde3-4db2-8164-b3aec13ec91c","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.922850Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:a45850d02eccbd741cf16a883f9423dddbedd8ad27d4ca586c88b85a2a3d4ca9","observation_id":"8de8356e-06a5-4660-bfaa-dcb20f95c1c9","resolution":{"observed_at":"2026-08-06T18:27:52.914404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.771932Z","title":"Prompt distribution learning,","venue":null,"work_id":"21919315-a94c-4eac-990c-1667f264f5c3","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.927549Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:6ab4a7fc03cd78178a813c66cd57f92f2896fb6aabade7e4dbba25f18bad6426","observation_id":"3bd84a38-a290-439d-98ea-de7097bf09bf","resolution":{"observed_at":"2026-08-06T18:27:52.819718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.641681Z","title":"Prompt-aligned gradient for prompt tuning,","venue":null,"work_id":"222c33ea-c91f-40f9-9ddd-5e500db9ab83","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.931748Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:55b1249dab79d9e2c0b4fe4b851e3f90c49b56044f4272bf8fdd5bfb23f0a62f","observation_id":"746ad6f6-bf5f-4710-a27b-837d46252273","resolution":{"observed_at":"2026-08-06T18:27:52.688397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.529981Z","title":"Visual-language prompt tuning with knowledge-guided context optimization,","venue":null,"work_id":"6f9ea9df-c79e-4a40-af9f-57b104c6c1a8","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.936059Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:5b12e40a2142567a312874ed70056a007c81dc62fcdd649c809fa9f6be20980d","observation_id":"ce721eb8-229b-4418-bd7f-ddf5a5307220","resolution":{"observed_at":"2026-08-06T18:27:52.589453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.429027Z","title":"Gradient-regulated meta-prompt learning for generalizable vision-language models,","venue":null,"work_id":"f6413089-85e6-4efa-b59b-446dbddc5cde","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.940199Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:7d0ffe7ad05e2f76ef2147665ad9ccabfb697eaef9368a627005bba88f2fda0e","observation_id":"bd6d3c8b-1362-4dc4-9d32-66c8364755c7","resolution":{"observed_at":"2026-08-06T18:27:52.463189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15914","last_updated":"2024-04-16T03:25:25Z","snapshot_observed_at":"2026-07-06T17:21:38.223755Z","submitted_at":"2024-01-29T06:57:48Z","title":"Overcoming the Pitfalls of Vision-Language Model Finetuning for OOD Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15914","snapshot_observed_at":"2026-08-06T18:27:46.944447Z","title":"Overcoming the pitfalls of vision-language model finetuning for ood generalization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.944447Z"},"links":{"cited_paper":"/paper/2401.15914","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0d64c3685848a88a3a10884a0cb73be741cbf7f774fa57cb0d0ce0a69276af5d","observation_id":"10ae3ddd-ef59-4170-a0e7-6ca883cffe58","resolution":{"observed_at":"2026-08-06T18:27:46.944447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00851","last_updated":"2024-04-01T01:42:23Z","snapshot_observed_at":"2026-08-07T01:07:34.003095Z","submitted_at":"2024-04-01T01:42:23Z","title":"Prompt Learning via Meta-Regularization","version":1},"cited_work":{"arxiv_id":"2404.00851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00851","snapshot_observed_at":"2026-08-06T18:27:47.523119Z","title":"Prompt Learning via Meta-Regularization","venue":"cs.CV","work_id":"ea2e060c-3d5a-4383-8701-f796a0db24cb","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.950350Z"},"links":{"cited_paper":"/paper/2404.00851","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:4fa794db6a18836c61f41e6b2b48411e2d0675adf493be9c4f2057d91817037a","observation_id":"9a37ab55-322c-41fb-aa5d-67c6ecef6e1f","resolution":{"observed_at":"2026-08-06T18:27:47.531123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.954920Z","title":"Extract free dense labels from clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.954920Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:1a817a27fc6947c576e297c691a833770883d60ddf13df28071c6e432dad6909","observation_id":"220f93bd-0fb4-4ca8-9531-dfae0fce96f5","resolution":{"observed_at":"2026-08-06T18:27:46.954920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.264163Z","title":"Maskclip: Masked self-distillation advances contrastive language-image pretraining,","venue":null,"work_id":"7b2d7d51-327b-45b7-acea-b00fb61ff5fa","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.959853Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:d05ad4ee992f3d5e67da478fc6efd28870425b002d83160fd33a63df09cdeace","observation_id":"30df0cf1-407e-485a-b5cf-7dffa62d7dc8","resolution":{"observed_at":"2026-08-06T18:27:52.347774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.132791Z","title":"Scaling open-vocabulary image segmentation with image-level labels,","venue":null,"work_id":"03c1b57c-7188-473e-939b-b114435c35cd","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.964096Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:de5199eb7f44eea8e67774896333fe4ae5a6eafe1f0c688d9f0f33defb8e7e72","observation_id":"656ca6ad-35e3-44cb-8f23-7b855be7738e","resolution":{"observed_at":"2026-08-06T18:27:52.187378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:52.011535Z","title":"Clip-actor: Text-driven recom- mendation and stylization for animating human meshes,","venue":null,"work_id":"c3855d14-fa33-4fb0-9492-20f6e0d3f4a3","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.968647Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:a80c474f44525c622280c087d6c6a1b8c077bc364877eec8d26b09414e22664a","observation_id":"91fa11dc-3e8a-4aa1-a9ca-edfed4077d34","resolution":{"observed_at":"2026-08-06T18:27:52.049810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.868664Z","title":"Motionclip: Exposing human motion generation to clip space,","venue":null,"work_id":"f78d0db5-d33d-48e6-9f0f-f388a4f2fef4","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.972909Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:09a13e29f261a9e33c0be8e1b3bdd688269e9a27f34dbc24a02d2f746c1bee84","observation_id":"0a060441-440b-47f6-a6c8-5f8ac15e06e3","resolution":{"observed_at":"2026-08-06T18:27:51.926665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.730956Z","title":"Lerf: Language embedded radiance fields,","venue":null,"work_id":"200f0b9f-ce72-4d8e-9985-f2525ddac02d","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.977678Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:4197fa9ec0ca9b9d8b7ac87e3efe4344661f0b4448f7561b8e3a5e15b072d436","observation_id":"4eecf22f-9870-4ade-b773-d53cbb9d45ec","resolution":{"observed_at":"2026-08-06T18:27:51.794526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.631566Z","title":"Zero-shot learning—a comprehensive evaluation of the good, the bad and the ugly,","venue":null,"work_id":"40c6d75e-2ba4-404d-8877-56290c63d574","year":2018},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.982662Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:b061889c3d1abb4084a08c5b997c99e2e895250dfbd877ac932e5a1f0878a6d8","observation_id":"02d23dc6-b701-44f5-ada5-0e86715b5721","resolution":{"observed_at":"2026-08-06T18:27:51.672169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.986836Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.986836Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:f24c667f3c147dc844eb9554f53ce72e5f67f056ded58328e5b38970e33bd18d","observation_id":"23b94d3d-e2e8-4244-8bbb-6e32f8929bca","resolution":{"observed_at":"2026-08-06T18:27:46.986836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:46.991834Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.991834Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:f87c16e340395d05cacd6503f1c5b31ff739ae0021b0f7c90f6c79728fda5bc3","observation_id":"35d1dcec-ae34-4f33-bb68-d42d1619d1db","resolution":{"observed_at":"2026-08-06T18:27:46.991834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.506591Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip,","venue":null,"work_id":"55738826-589e-4184-90e9-6b3c4b4fe240","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:46.996424Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:8ebae9e1bc7c91b9510ee1c2264680207a2e6d4f0bd621aa9761761118bf0197","observation_id":"6abaeceb-78db-4f94-a602-10c36459ebab","resolution":{"observed_at":"2026-08-06T18:27:51.558422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.382896Z","title":"Learning multiple visual do- mains with residual adapters,","venue":null,"work_id":"69980451-3a8d-4d5f-86cc-be047aebed98","year":2017},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.000463Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:2b4112ba5246f7e794133e21e1d5a909c64bceb188b3ad4d72c7299db1b066b8","observation_id":"dc50ac75-8e87-4e05-b27d-bdd526939afd","resolution":{"observed_at":"2026-08-06T18:27:51.422176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.004756Z","title":"Task residual for tuning vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.004756Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:42fa59e05cf24fab838191122d7d7f1edfb0ba5e87e576f609489987764c2585","observation_id":"df3884a4-e868-4a13-b3f5-779d240ad034","resolution":{"observed_at":"2026-08-06T18:27:47.004756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.237802Z","title":"Graphadapter: Tuning vision-language models with dual knowledge graph,","venue":null,"work_id":"79caf452-99de-4d3e-9c8c-a9f6c3775af8","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.009320Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:f6bb1be1f2e5ca8bd426e1fae75c9b3aff656090bfd9bfa96e65efe911cc559c","observation_id":"1049f89e-7bdc-42f0-842a-40ef4abe2cfb","resolution":{"observed_at":"2026-08-06T18:27:51.287187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.115747Z","title":"Tip-adapter: Training-free adaption of clip for few-shot classification,","venue":null,"work_id":"b5ca1bdb-3890-4153-a219-d3943340a720","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.014458Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:c7b71cc9b9163fc7e6d1320516b7d9096b4e33c0c9e355c3a7af9cfeab37d78c","observation_id":"1eda3c94-5ad5-4f4d-be25-959d22145c73","resolution":{"observed_at":"2026-08-06T18:27:51.184126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:51.007272Z","title":"Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners,","venue":null,"work_id":"52afcc33-5cee-49d8-9a37-31184790bfab","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.020022Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0efca87375f5960e56e78443aa57fd6c89bd4bcbae47885c67c1ac9865cec10c","observation_id":"1abc598d-c2f6-4616-ad26-a737a108eb74","resolution":{"observed_at":"2026-08-06T18:27:51.062183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.881123Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":"a806a00e-84ae-4499-adae-4eb34b698387","year":2021},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.024837Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:cb4efff7ea8050d75d2263fe00fb8e562caf5ea5ad5dbba8d200577d2eaf90f0","observation_id":"9f914995-6d80-4a1f-9ae2-225555a4edfd","resolution":{"observed_at":"2026-08-06T18:27:50.934926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.029881Z","title":"Clip-adapter: Better vision-language models with feature adapters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.029881Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:f59a66dba335132de12fe6bb4bdf8fc46cbfe512f5df0039e47635bc8556d264","observation_id":"a0da0837-f247-4fa4-961c-15e60e0e2d10","resolution":{"observed_at":"2026-08-06T18:27:47.029881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.726386Z","title":"Visual instruction tuning,","venue":null,"work_id":"ef57fd76-c257-4fc0-973d-c23a89479e02","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.034432Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:25bcbf780381a836d81e5959fdb2b4516da494b5464d2336ccc2b289c5e7a85e","observation_id":"c4e96674-b6bb-4465-8a7b-65835d098491","resolution":{"observed_at":"2026-08-06T18:27:50.825910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.581056Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"52cc5f63-ed0f-4e93-ae6b-73373a0b54d0","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.040924Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:d5c7a255603fbac55e5d17a2c9102bdca894b9ff02624bf269ce41b02b241c9f","observation_id":"ef0bc9f0-d96f-414c-8020-02d97cf13d3b","resolution":{"observed_at":"2026-08-06T18:27:50.620422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T18:27:47.045952Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.045952Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:8d4697d121ad042081f3f236147a3c9612d854daafc4c3d9f68eef6822ef4293","observation_id":"28ae536f-a7b7-4040-a6a4-6e8d39f811f1","resolution":{"observed_at":"2026-08-06T18:27:47.045952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T18:27:47.051880Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.051880Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:16b4d8386db48c2d521a7d631c2f713c9f6c79d1211a70793f01d63563412ed6","observation_id":"fb9e63f8-2e1f-419d-83b6-5ea2e4e0e2bc","resolution":{"observed_at":"2026-08-06T18:27:47.051880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T18:27:47.056475Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.056475Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:f084024eabf089715ea4b39bf94df054e2c7a447956630e92faba562ccca0433","observation_id":"b6fbb7e0-9f7a-4505-a77c-8edc06cd4e2c","resolution":{"observed_at":"2026-08-06T18:27:47.056475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T18:27:47.061316Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.061316Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:4586cc0551befb16934dce1fd69a99e6fb2b8788459c7fffa20cb4a1d0f61625","observation_id":"db69644f-4f1c-46dd-892f-a28717e3872e","resolution":{"observed_at":"2026-08-06T18:27:47.061316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:27:47.067589Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.067589Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:adef62a0e4e30e6ea99331edcf8822eeacb615546a2a31f4b00e32c1291bca8f","observation_id":"4ea8671e-27eb-4810-9f07-15b354a3fbe0","resolution":{"observed_at":"2026-08-06T18:27:47.067589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.407321Z","title":"Language models are few-shot learners,","venue":null,"work_id":"e91aa0dd-ffab-46e7-9780-f3fa64e9cae5","year":1901},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.072777Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:509c7878cc0a009dffdc25d7488b487a565cba08b98b4d0dc0ed721f5ffb61aa","observation_id":"df2878d6-2386-40f8-a3be-cf412156b8f0","resolution":{"observed_at":"2026-08-06T18:27:50.483391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T18:27:47.077647Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.077647Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:b0157458a2e6c837ade5cd67f757cd3a946ee67b25f9b1a9ac319211b8ef61c3","observation_id":"e21620ed-086e-4534-9205-d2ba8e2d569d","resolution":{"observed_at":"2026-08-06T18:27:47.077647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.290689Z","title":"Lit: Zero-shot transfer with locked-image text tuning,","venue":null,"work_id":"6a3f0ad0-8564-4cf9-9128-a70b14937146","year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.082212Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:797e12320d62ab78238302997f36cef3c53ff01afafd948f7ebce4b256fe5d53","observation_id":"da45060a-6976-45f4-af72-cf3165bc0341","resolution":{"observed_at":"2026-08-06T18:27:50.324687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T18:27:47.087432Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.087432Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:41c41f434360a8ac088989dad0710a7ea19894dcbf52d1397b901b884061c494","observation_id":"35d68594-d399-4b80-9387-415d325d1bc9","resolution":{"observed_at":"2026-08-06T18:27:47.087432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.159698Z","title":"Compound text- guided prompt tuning via image-adaptive cues,","venue":null,"work_id":"e2c72370-eb4a-465d-b295-f1955f2af496","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.091790Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:c6b811c77504b09ad6aa1015a45a848a104c86498cc1645f380fa209d1e07a58","observation_id":"9f233f02-4d06-4e35-acbb-1f53b16ebe0c","resolution":{"observed_at":"2026-08-06T18:27:50.217897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:50.043574Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification,","venue":null,"work_id":"1fd010a4-87a7-4c8e-b388-0ddb2e7fa09b","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.095841Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0c95c9ef9f8c813c451a6b304c52aa8652cca8b765922903ef730defbc1ad81d","observation_id":"e3af5be0-e7e6-4bbf-ad16-cf73bf0f6d94","resolution":{"observed_at":"2026-08-06T18:27:50.121431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.850092Z","title":"Knowledge- aware prompt tuning for generalizable vision-language models,","venue":null,"work_id":"ad556cdb-3717-433a-aa56-b887357031d9","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.099862Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0ef98216b092335cb38d63e530937ca7bcb9a21c73f911e58bc02c8e88c7480c","observation_id":"058280ef-4874-4509-bcbf-2194a2a50869","resolution":{"observed_at":"2026-08-06T18:27:49.956199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-06T03:16:51.796129Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-08-06T18:27:47.103905Z","title":"Visual classification via description from large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.103905Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:d0c3e1c84381ad74696acef987d21b4818d03094116d64d81637b5d240f8a209","observation_id":"1d8720a8-38d4-4b3a-8478-00c46d016f16","resolution":{"observed_at":"2026-08-06T18:27:47.103905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.708200Z","title":"Learning concise and descriptive attributes for visual recognition,","venue":null,"work_id":"e588d759-0f6b-4af5-9d33-8a89810c6039","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.108072Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:a81c058ddaca61d681a529fd0f4fd8e65bce7b918c69a64a98ebd87113b4dcbe","observation_id":"75668555-2309-4fa6-bb4c-f2118b5d3851","resolution":{"observed_at":"2026-08-06T18:27:49.775912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.547771Z","title":"Language in a bottle: Language model guided concept bottlenecks for interpretable image classification,","venue":null,"work_id":"4732658b-10e5-4ca1-b567-43e743f591f9","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.112614Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:1f9e073e58d0aa35ec5e17c45d3017fbffab7384cbc554a59464634416dde182","observation_id":"34ada827-974f-4242-ba9b-9fd737e8d60b","resolution":{"observed_at":"2026-08-06T18:27:49.621856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16825","last_updated":"2023-10-25T17:56:07Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:56:07Z","title":"CommonCanvas: An Open Diffusion Model Trained with Creative-Commons Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16825","snapshot_observed_at":"2026-08-06T18:27:47.118712Z","title":"Commoncanvas: An open diffusion model trained with creative-commons images,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.118712Z"},"links":{"cited_paper":"/paper/2310.16825","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:e1b82730eefece7a74124e2cfa2b83cf42fcbe618ae5c19fee801179888f3e09","observation_id":"50027c03-64e6-4f04-9744-23d2afa54312","resolution":{"observed_at":"2026-08-06T18:27:47.118712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.387104Z","title":"Enhancing clip with a third modality,","venue":null,"work_id":"f1f96100-75e6-4cb4-9a7e-724be2fd54ac","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.123856Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:ce901c7c65fde438e5065ca289080486a06445a15de14de2dc168d6d7692aa30","observation_id":"c6b5550b-2977-42f3-9ad0-d2c49cf999a3","resolution":{"observed_at":"2026-08-06T18:27:49.445333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13837","last_updated":"2024-03-10T16:01:25Z","snapshot_observed_at":"2026-08-05T06:22:00.176279Z","submitted_at":"2024-01-24T22:28:26Z","title":"Democratizing Fine-grained Visual Recognition with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13837","snapshot_observed_at":"2026-08-06T18:27:47.128776Z","title":"Democratizing fine-grained visual recognition with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.128776Z"},"links":{"cited_paper":"/paper/2401.13837","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:3adae0f742d73080e010d884f79f2cf30e94a0d79ee4176d7e74397742574af9","observation_id":"ec1c2b0c-570f-417f-8122-21e4f8930b80","resolution":{"observed_at":"2026-08-06T18:27:47.128776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.264658Z","title":"Fine- tuned clip models are efficient video learners,","venue":null,"work_id":"491f52ee-60db-4219-9efe-fdcc4d9cf805","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.133211Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:3f15f7214e5964023b3830798b6b4ae5e58f04fdb2cfeea6aab124a952cdaa1d","observation_id":"47bfcda6-c303-4016-97c9-7eb8c868765a","resolution":{"observed_at":"2026-08-06T18:27:49.292751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.137318Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.137318Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:a13b5798687e34bfe7c8b995b9cd7e351123038173728a86998925f26855ab11","observation_id":"14e7dd2a-a6e4-44ef-83af-2c44af5d7ca2","resolution":{"observed_at":"2026-08-06T18:27:47.137318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:49.120433Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":"2ab9b6eb-7ebc-4ca6-b63a-26c7fc44b4f1","year":2013},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.141493Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:1a85abbf6488f58bfe330df4c2f33f82852ab6de4091613e9377f64db98b3783","observation_id":"475c5e0c-cfcc-4dfa-988d-dfcd5af801cf","resolution":{"observed_at":"2026-08-06T18:27:49.180107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T18:27:47.145588Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.145588Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:29010ea6c0e85067df290bf59c391ace3ee1e669d1c39c284352e473d2a8bdf8","observation_id":"9857915e-5ab4-4c8a-8e06-b24ec7478460","resolution":{"observed_at":"2026-08-06T18:27:47.145588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.150373Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.150373Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:9833d7f102841f4d2fb8492efadb3f5475ebfd1a0b7853f5a47f661ea1c8e993","observation_id":"15ca188b-e6c5-41de-ac53-07fcd31661af","resolution":{"observed_at":"2026-08-06T18:27:47.150373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.936202Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":"48db96f5-bbd5-4761-9a74-3060cb572f51","year":2008},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.155160Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:b40d3c54d6418c6faddeade24c980e03ee0747d561be7bb53f497d6a2608783e","observation_id":"0a4b130c-298f-4fa9-8c3b-a67156111844","resolution":{"observed_at":"2026-08-06T18:27:48.995277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.788623Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":"f0f074e3-9328-4bd7-91bf-41db98cd9f6f","year":2010},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.159461Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:46fff227129c150cba08d1bc05a6028374c46b0e331c1835e0989662d34b23b7","observation_id":"cfb0970c-d0ef-4a1e-9a4e-cdb51eac85ba","resolution":{"observed_at":"2026-08-06T18:27:48.855739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.164738Z","title":"Describing textures in the wild,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.164738Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:5cd92ee25a963389f8095dcf65a06512af041b12a8965f1f2f134c96a81e08a1","observation_id":"cb1de294-5148-4188-80ce-d383d634eec2","resolution":{"observed_at":"2026-08-06T18:27:47.164738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.169601Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.169601Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:d768f579ee8e605aa5b99425277b3b2da32449ac7177fddfb66a1c3f0b8493cf","observation_id":"a67ce6cd-e736-4acf-ab61-68a8ea592866","resolution":{"observed_at":"2026-08-06T18:27:47.169601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-06T18:27:47.173763Z","title":"Fine- grained visual classification of aircraft,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.173763Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:ff502bdecf1bd1aeb188355496826b1ed22608be18c1ceda5b57272e790c5405","observation_id":"e59cc4cc-4243-4123-a5ec-3092aa3d8d3a","resolution":{"observed_at":"2026-08-06T18:27:47.173763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.492829Z","title":"Cats and dogs,","venue":null,"work_id":"26c45c3e-3f28-4de6-82aa-889976e1a7f5","year":2012},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.178390Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:ca56eaf5dc1f7efde05aa804228dc4ca924b985c1e006b28966c9b0b49b70dac","observation_id":"b3085d30-3809-40f2-8b98-d7c610e63ed1","resolution":{"observed_at":"2026-08-06T18:27:48.630071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.294494Z","title":"Food-101–mining discriminative components with random forests,","venue":null,"work_id":"2bc1a41d-3ece-405e-95af-bc4fe654b19c","year":2014},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.182947Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:cb66a7f9633d565b29d8c4a8edbf74d9c91b7951afd6c2b9a696f4690d37fdf2","observation_id":"909a32ad-7675-47a7-b735-0ae79adae21f","resolution":{"observed_at":"2026-08-06T18:27:48.360216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.187502Z","title":"Natural adversarial examples,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.187502Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:4d08b7c3eff99e381abb453981f57e9c8a4b43eee25637b566dcfa304d948cc7","observation_id":"72fc57ec-122e-432a-9988-717872c231ea","resolution":{"observed_at":"2026-08-06T18:27:47.187502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.152959Z","title":"Do imagenet classifiers generalize to imagenet?","venue":null,"work_id":"97612df6-3554-4e09-8926-cf3f471339fc","year":2019},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.191888Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:907f4fc451b943205044ea6769e0d6793b26ac95a525dac125212cd92cfb70ed","observation_id":"cc9ce98a-bbfc-4d28-8fe6-d2c3c6a19bb2","resolution":{"observed_at":"2026-08-06T18:27:48.217435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:48.021247Z","title":"Learning robust global representations by penalizing local predictive power,","venue":null,"work_id":"86a302e6-8b48-4cd2-922e-5cf2f962cffb","year":2019},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.196049Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:2e352d0fdf187fa88fb7a7fb43327316b038766152332b3ce55d4ad4662692b0","observation_id":"65100d47-d282-481d-8bd0-386ace54c4d1","resolution":{"observed_at":"2026-08-06T18:27:48.073216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:27:47.200213Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.200213Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:215f0f438ac6a50e1880a1c9181004be8800e4491f795b18c36d8d924805cef3","observation_id":"3f9b258a-8bca-4d7d-a7a9-79e5628ee05f","resolution":{"observed_at":"2026-08-06T18:27:47.200213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13600","last_updated":"2024-03-20T13:48:50Z","snapshot_observed_at":"2026-07-06T17:47:42.867147Z","submitted_at":"2024-03-20T13:48:50Z","title":"VL-Mamba: Exploring State Space Models for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13600","snapshot_observed_at":"2026-08-06T18:27:47.204582Z","title":"Vl-mamba: Exploring state space models for multimodal learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.204582Z"},"links":{"cited_paper":"/paper/2403.13600","citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:98d86046a25d18efc6d212105a541e798d1026fd2615bb968da1b64d70454c83","observation_id":"ae1a09a8-1962-4d48-a8aa-019755f1e3df","resolution":{"observed_at":"2026-08-06T18:27:47.204582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.208713Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.208713Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:884d9e0be31f1e5de588b75a2b61503ce4960db2f6e6e6743f6a5dd3765c4088","observation_id":"fbef7d83-68a3-4d39-aaeb-6e6f10e51d9c","resolution":{"observed_at":"2026-08-06T18:27:47.208713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.212991Z","title":"Efficiently scaling transformer inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.212991Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:f94d685bf4e99440ebf3b144dcb01a5ef081b73d1d067d1962ab045b41ee0ceb","observation_id":"c553cb0d-8a20-4659-9ea2-1ba1c4a0a9f7","resolution":{"observed_at":"2026-08-06T18:27:47.212991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.847887Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"cf606901-8a15-443a-928e-a18c22960164","year":2020},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.217153Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:abc4093d8c7eafb1e67ca099c4e9092fd19129ce742b5dd096315280d88ac322","observation_id":"5a4c514e-fda3-44e4-acaf-7f7137416859","resolution":{"observed_at":"2026-08-06T18:27:47.920034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.774550Z","title":"Modality- consistent prompt tuning with optimal transport,","venue":null,"work_id":"c486d9db-89b1-49b9-bc17-a30ee469493a","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.222518Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:0d76af68f07fb0680f65e1e335735ef2571ab5bf803d0256671d373610d83a04","observation_id":"934244d5-50ea-42da-a768-6dbe291ce291","resolution":{"observed_at":"2026-08-06T18:27:47.791480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.751146Z","title":"Hierarchy- aware interactive prompt learning for few-shot classification,","venue":null,"work_id":"aa9d239a-8ace-4547-bdd8-85148ef92eab","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.226756Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:c91dc0697f00ab1aad5db9afbb22621c31f8dd92394f07ee00f1cb4001cd00fd","observation_id":"c1c080de-e9d9-4f7d-8580-e4b6fec02d7c","resolution":{"observed_at":"2026-08-06T18:27:47.761692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.727805Z","title":"Language-driven visual consensus for zero-shot semantic segmentation,","venue":null,"work_id":"0d6386f5-3d3b-4aa6-8ba4-5566d3e20312","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.232099Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:6d9ed07dbeced8971988a35a217df00400726604ac7553fff16948f5e806bb93","observation_id":"b8cd94c3-82c5-4186-96e5-eb32b176a837","resolution":{"observed_at":"2026-08-06T18:27:47.737604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.699877Z","title":"Pedestrian attribute recognition via clip based prompt vision-language fusion,","venue":null,"work_id":"76f16607-ea6a-4c5d-a4a8-7e75ae9ff9e1","year":2024},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.236731Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:6cadaf8eed9fb0bced9dbe16d1b7c8b8542ef35f83ee28193f911d95d01fd160","observation_id":"0626ab68-3e72-4287-8bd3-3356f62aaa44","resolution":{"observed_at":"2026-08-06T18:27:47.711586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.240681Z","title":"Understanding and mitigating overfitting in prompt tuning for vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.240681Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:27ee79d0f99a166eeb35c79cc40d03d58b940c8f32f65f78f2c49c1e56ee380d","observation_id":"d0247ef0-75df-4c82-9424-44f458c37556","resolution":{"observed_at":"2026-08-06T18:27:47.240681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:47.660861Z","title":"Clipood: Generalizing clip to out-of-distributions,","venue":null,"work_id":"35684cca-fa8b-4600-b7df-94955de41935","year":2023},"citing_paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:47.245370Z"},"links":{"citing_paper":"/paper/2507.08410"},"observation_digest":"sha256:1630ae7ecf77c03e9458859b48b2de8d075f52d13d52925b21b6b3e341c9398f","observation_id":"536fa8b1-0817-4ccd-873a-84eb3ba6cabb","resolution":{"observed_at":"2026-08-06T18:27:47.672562Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08410","last_updated":"2025-07-11T08:45:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:17:03.909496Z","submitted_at":"2025-07-11T08:45:27Z","title":"Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":3,"verified_fuzzy":43},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2507.08410."}