{"as_of":"2026-08-19T14:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6709f4de10b6c3c68aed54ed51c64d08cd64bed6a7267580ba6f642f551e0cd7","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T14:18:26.034732Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06185/citation-record","integrity":"/paper/2607.06185/integrity","json":"/paper/2607.06185/citation-record.json","paper":"/paper/2607.06185"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.737588Z","title":"Zero-shot sketch-based image retrieval via adaptive relation-aware metric learning.Pattern Recognition, 152:110452, 2024","venue":null,"work_id":"5d4956fd-8833-4439-a17e-d62040cb02f9","year":2024},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:71c99360addb786b73cd3cd77e709d3bb88e780978449e369c95272fe4952a8c","observation_id":"5f054b01-2446-40c3-9f4c-5d7df7dcf5a1","resolution":{"observed_at":"2026-07-08T14:25:02.739658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.732504Z","title":"Complementary two-branch transformer for multi-label image retrieval.Pattern Recognition, 168:111806, 2025","venue":null,"work_id":"5ae599f6-93e3-443d-9acb-2a01c64a0da9","year":2025},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:6432179d3afcb369a5564b5157bd880b448a3ef3cb0ecbd8f2611e2726ec55bb","observation_id":"4257dea1-2f34-488d-8647-24340aea0992","resolution":{"observed_at":"2026-07-08T14:25:02.733909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.757593Z","title":"Changes to captions: An attentive network for remote sensing change captioning.IEEE Transactions on Image Processing, 32:6047–6060","venue":null,"work_id":"2d599bb5-e3b5-40ac-bb1d-e8835df34cc2","year":2023},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:d5a0a635713ab0b3200e76f671ac2fc2c777d874e5bf29e3e35bfc3886e8f999","observation_id":"c6bcdfc1-f9b7-4274-93b5-6220fd887b93","resolution":{"observed_at":"2026-07-08T14:25:02.759051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.763717Z","title":"Reparameterizing and dynamically quantizing image features for image generation.Pattern Recognition, 146:109962, 2024","venue":null,"work_id":"9f59c966-cd5b-44b1-a5b8-ffc52ddab132","year":2024},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:877e0afb82729c9f08d4484fd282346ffd37d2a475caf862e3766cc01fc5c955","observation_id":"2619a5e9-4986-4e2e-9505-a776128d2e1e","resolution":{"observed_at":"2026-07-08T14:25:02.765179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.743346Z","title":"Txt2img-mhn: Remote sensing image generation from text using modern hopfield networks.IEEE Transactions on Image Processing, 32:5737–5750, 2023","venue":null,"work_id":"ff40e221-1305-4ad2-b3f5-76bb2605f9d6","year":2023},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:abc7c6fd3ee1945d505bcec2f93e7056179baf575840707dd99795c124c4ca4f","observation_id":"457afc4a-fbff-47e4-b2c5-044ee1daecca","resolution":{"observed_at":"2026-07-08T14:25:02.745153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.755272Z","title":"Fine grained food image recognition based on swin transformer.Journal of Food Engineering, 380:112134, 2024","venue":null,"work_id":"dda1157a-35b7-4076-9d02-8615b32773b4","year":2024},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:a2c47cf343536a2599e93eb97d6e80fe459bf7dfaa678de85d0eb6b9077c0d3a","observation_id":"8cab65bd-bc48-470e-8b87-d1954ace260d","resolution":{"observed_at":"2026-07-08T14:25:02.756922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.706838Z","title":"Convolution-enhanced bi-branch adaptive transformer with cross-task interaction for food category and ingredient recognition","venue":null,"work_id":"5a377617-8a05-4c76-874e-d7aa7f8793aa","year":2024},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:1a677a243710c8eeecf85c4f3fdd4c686fb0813b695820729ade45f3de9ccdb1","observation_id":"2a15d086-99f8-459b-a9e6-c9bb8ca40704","resolution":{"observed_at":"2026-07-08T14:25:02.708646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.699790Z","title":"Synthesizing knowledge-enhanced features for real-world zero-shot food detection.IEEE Transactions on Image Processing, 33:1285–1298, 2024","venue":null,"work_id":"40028e00-e946-4cff-9237-ab0639f65665","year":2024},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:d854313fa446f682e3cae34990248e2437127f00c1c15bce004269e5dbc4152b","observation_id":"0e5bf17c-d22f-4446-95e4-6484bf41ee95","resolution":{"observed_at":"2026-07-08T14:25:02.701543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.803154Z","title":"Food recommendation towards personalized wellbeing.Trends in Food Science & Technology, 156:104877, 2025","venue":null,"work_id":"ab1d6ba0-d718-4ae5-8bfb-c5a706d2a06b","year":2025},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:37610009b636c28789c320abeff6a6d4f9112a39d143e7e48517abe2c190daca","observation_id":"fd9f48da-440a-4d1b-8c27-3b0e0d2205f9","resolution":{"observed_at":"2026-07-08T14:25:02.804563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.718574Z","title":"Large scale visual food recognition.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(8):9932–9949","venue":null,"work_id":"f5515726-7cef-4afb-9759-47b7b23711e9","year":2023},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:aff35a69db43659654a104b1f9dac0d2664e9d6c40f94ec35de2f39b181a1227","observation_id":"760a09ca-7194-4ac9-8175-0c6f8a660621","resolution":{"observed_at":"2026-07-08T14:25:02.720127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.730531Z","title":"Instance-level few-shot learning with class hierarchy mining.IEEE Transactions on Image Processing, 32:2374–2385, 2023","venue":null,"work_id":"b2fb37ff-e600-48e3-9ec3-b372e9929d61","year":2023},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:93aee32381fe299d0c60e04cf71677047afd27038eda0bbcc76de3a4174242be","observation_id":"ba2339bd-0f9a-44fe-8cd1-35132eea04eb","resolution":{"observed_at":"2026-07-08T14:25:02.731885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:06:57.984523Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"f5366ac8-80a2-4ab6-8fcb-c4327ceb34bd","year":2021},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:2cc139629f09448ff72eb3bd6a216af5672121587755e1e081b6245085face5b","observation_id":"ec300e6a-f8b0-47bc-abbb-3e228c2e1453","resolution":{"observed_at":"2026-07-08T14:25:02.713043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.702320Z","title":"Learning to prompt for vision-language models.International Journal of Computer Vision, 130(9):2337–2348, 2022","venue":null,"work_id":"700a38a3-8818-4d3b-b64a-e5991f5cebd5","year":2022},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:e1643b8709857fbe9c33299bb379b8814f1282a9bda00d19d2c06507b94a5817","observation_id":"357c78c1-2237-413a-bb6f-645cf057a416","resolution":{"observed_at":"2026-07-08T14:25:02.703943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.807679Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"ccdc7827-393c-44e5-8e5e-74c3a082cc81","year":2022},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:9f6c46d4bd44da0854870b6d86c285f8146d7398cbbee15158d022885a913bca","observation_id":"b80f3659-15af-4c29-993e-2ad629acaaaf","resolution":{"observed_at":"2026-07-08T14:25:02.808991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:35:49.009000Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"6a05416f-1d85-41a0-b124-51f80cfd3067","year":2021},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:34fe4dbf47d20812e6a532cbd58c0f616b8d1673afd90dd4f2eb24d870206f29","observation_id":"c5b61138-780c-4961-93b4-9ed13c01ac5b","resolution":{"observed_at":"2026-07-08T14:25:02.754630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.697260Z","title":"Blip: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":"f14b71fa-3627-4b11-a254-a2bea63c6b37","year":2022},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:7a76549a795abb3d8f23e1c90dd557847b0a62a6617ef3e05c424f5d62b0f8e6","observation_id":"39edc55c-b16c-496a-a4e8-a2a8d3518546","resolution":{"observed_at":"2026-07-08T14:25:02.699003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.728507Z","title":"Effective conditioned and composed image retrieval combining clip-based features","venue":null,"work_id":"48994bae-037f-425a-a147-82e907220c05","year":2022},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:55ad86f7ae1b7a39b6489bc3a98efb782f961645c21b95c7ee4e466c993bef34","observation_id":"3be98d7b-a8cd-4b75-8772-11e8ff4d572d","resolution":{"observed_at":"2026-07-08T14:25:02.729902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.759728Z","title":"Clip for all things zero-shot sketch-based image retrieval, fine-grained or not","venue":null,"work_id":"3586fcf3-4cb8-49bd-97cb-57f3f9740e31","year":2023},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:f3b1fd8ce50dcb7c9759c45d807f2125dffd08cb9a7d308b40680f26aa45acf2","observation_id":"dbb08f34-6117-49e2-8a5b-6b87f42b3ace","resolution":{"observed_at":"2026-07-08T14:25:02.761072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.761690Z","title":"Cris: Clip-driven referring image segmentation","venue":null,"work_id":"7af0276f-c650-4a8c-91df-4f875cc2c922","year":2022},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:999b280011dd24af7812f367cc00de8ee70068ffbdf01415efc67ffb2f5402d2","observation_id":"35c1f510-3ba8-4218-8af8-e3c46500e141","resolution":{"observed_at":"2026-07-08T14:25:02.763079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.691946Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"c185cc08-5068-458c-b422-e3d83c2e5044","year":2022},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:7b0ed4f6c817fe07fcb04b9050f268eebea848f1105e8e78abf1d3333c40c339","observation_id":"ebc3f107-5f7b-4f43-9328-4c4bceb27e7d","resolution":{"observed_at":"2026-07-08T14:25:02.693933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.694824Z","title":null,"venue":null,"work_id":"c77156fd-82a9-435e-a0b9-389b6634ada0","year":2023},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:ebd72769f04a867d43536de623d0420719888b8fc9e85dac9dcf11cf2fa5b60e","observation_id":"5af87730-fc17-4f9d-8d47-e5fb51277c6f","resolution":{"observed_at":"2026-07-08T14:25:02.696427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.771522Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"aa65585e-b474-4b13-80a9-706c85610d06","year":2023},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:3fefddae6034cb826461e0508f48c12d1b1578933e797948444def0b904afb18","observation_id":"554e929e-f92c-4534-9c7d-5f60a82419cc","resolution":{"observed_at":"2026-07-08T14:25:02.773208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.685492Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting","venue":null,"work_id":"15ca10e9-0b79-41ef-a528-5f31d195dc00","year":2023},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:381282267dfadd014761dd5140ce72f5266c98131efddf82622fd87161f750bf","observation_id":"270522b3-e5ac-49e4-84ef-d31d12945800","resolution":{"observed_at":"2026-07-08T14:25:02.686924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.687846Z","title":"Dgprompt: Dual-guidance prompts generation for vision-language models.Neural Networks, page 107472, 2025","venue":null,"work_id":"4dede65b-07cf-4016-8815-7c619da06ef6","year":2025},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:2cb8c22002bcce39c5e9a4ef650bc962f7b6ee07c82c7d010391ee673ebe6cd9","observation_id":"0a195ef6-56c2-471d-9a5c-6b837849538f","resolution":{"observed_at":"2026-07-08T14:25:02.690988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.768906Z","title":"Prompt distribution learning","venue":null,"work_id":"47843d77-1d27-4b7c-a4a9-bae65c030942","year":2022},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:8ed39cb6e297acedfcde07ce2f479e9daf6103c3f2d220af67240563905fa3cd","observation_id":"1214e3ef-99e2-416c-94e6-36fec492cc85","resolution":{"observed_at":"2026-07-08T14:25:02.770597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.709686Z","title":"Visual-language prompt tuning with knowledge- guided context optimization","venue":null,"work_id":"d1044140-cdcc-46f4-8986-34ac5915d755","year":2023},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:55ae505e7dc85e829c8d109386aaccd1abfccd4e2b08b059d2b8eb4ce05d9f9e","observation_id":"4dde492b-c5b0-4e74-be96-f7c94f65f08e","resolution":{"observed_at":"2026-07-08T14:25:02.711039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.745993Z","title":"Tcp: Textual-based class-aware prompt tuning for visual-language model","venue":null,"work_id":"0e3cf4f7-ee8a-49c8-ac25-c6554ac96850","year":2024},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:b1e4f4664d5b7e748df4b09add36c5beb5b3290541fa5d72f657553ef01d82a8","observation_id":"a8e48d72-6fcf-4e7f-bcfd-f40597b12b3c","resolution":{"observed_at":"2026-07-08T14:25:02.747689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.734820Z","title":"Bayesian test-time adaptation for vision-language models","venue":null,"work_id":"021e4b4e-f73c-4912-ac10-b9d35d56d3a0","year":2025},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:a121af2858ef3cd34f6519f2d74d8ba6355bd8212bcb84f2de6c4cc124003a46","observation_id":"a8113e8f-ea49-4745-899f-d6c2ec448aa4","resolution":{"observed_at":"2026-07-08T14:25:02.736706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.773898Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"2f63e284-f919-474b-a36e-ad62f742f64f","year":2021},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:8130960ca0abd09e158a8ab6bf68c6f513faaa03f63d85ecf970749cc2d93d91","observation_id":"846f8cc3-598c-4f7c-84c4-274d24a36295","resolution":{"observed_at":"2026-07-08T14:25:02.775277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:55.367441Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"9a00f23b-71b4-4f99-a115-0d30a296f178","year":2016},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:f4b120899d2ced04f9adf0802b550954b939d4801611217925d0782284826a53","observation_id":"3c412cbb-1321-4ef8-a713-af04d478f521","resolution":{"observed_at":"2026-07-08T14:25:02.777486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.796758Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"7eb9a088-9815-44ad-9586-9f296a907b52","year":2024},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:fedc17f20b43d464081b7c56e04c09b245b71ef33324f516345e7485df192ccd","observation_id":"ff4fd1c5-8ed6-4cce-91a5-7f9ad1a0216e","resolution":{"observed_at":"2026-07-08T14:25:02.798454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.766323Z","title":"Extensions of lipschitz mappings into a hilbert space.Contemporary mathematics, 26(189-206):1","venue":null,"work_id":"d7cae46f-bcf7-42c3-85be-5421a8bb3d0d","year":1984},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:d025c8c59381eba8923e65b3afd89cf00edd2c35814dc03b1abbb79e00446f65","observation_id":"2deaf816-289c-471d-8307-5091649cbce7","resolution":{"observed_at":"2026-07-08T14:25:02.768099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.799096Z","title":"A short proof of the marchenko–pastur theorem.Comptes Rendus Mathematique, 354(3):319–322, 2016","venue":null,"work_id":"c0e80c67-51a8-47d8-b873-f9896e399e73","year":2016},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:24c9a5afff8b7e86063a39ea5d901c8b27062ace8fc2e4b9e51f29e75c7f7f92","observation_id":"aaa8efd3-27d5-45b5-b5a4-75ab60e08c38","resolution":{"observed_at":"2026-07-08T14:25:02.800648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.740503Z","title":"A new dataset of dog breed images and a benchmark for finegrained classification.Computational Visual Media, 6:477–487, 2020","venue":null,"work_id":"904dee8f-c32c-49f6-bf1e-f0c56965486c","year":2020},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:8390e87b88e7b4263e31ab27c6e08d25f881562b67b45ca067911f6f8d1d588f","observation_id":"e5480c41-cef2-4463-8bca-9bae5d8e43e7","resolution":{"observed_at":"2026-07-08T14:25:02.742468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.704757Z","title":"Cats and dogs","venue":null,"work_id":"d377a42e-4585-403c-a772-d28a04c8734b","year":2012},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:4812091b274ada9d2c2cdc88eab022674db98e4d49c7ede072eccb0d4414b536","observation_id":"b239ff54-d106-4862-8476-b2975bd19fb5","resolution":{"observed_at":"2026-07-08T14:25:02.706123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.748481Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"65ce14f9-26c7-44eb-961f-3fee13bc35ae","year":2008},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:f42df7a9b2af89ad44efc50eb3139b4ea177c303e0194ae3e3c1964468de2114","observation_id":"4157ee8b-cafe-4175-97dc-03803059fbaf","resolution":{"observed_at":"2026-07-08T14:25:02.750211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.786296Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"1eb4a1fc-09b1-40ba-93e2-0924ad6b1965","year":2013},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:9d3a02e3b0123dd2c14c495be3bd0898b60f457a7c32972aaf648f6a616a26ce","observation_id":"338b57ee-4c07-49c7-b897-24a6ee23249d","resolution":{"observed_at":"2026-07-08T14:25:02.788095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.750936Z","title":"Webly supervised fine-grained recognition: Benchmark datasets and an approach","venue":null,"work_id":"62bac116-0c49-4e6d-abe6-e7e1ab5df951","year":2021},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:0a97db2c8949649b444af087a8fd9849777cf2414ed9579a38757c7aba46a854","observation_id":"0a3fbc71-fbe6-4122-bdf4-7cef068129da","resolution":{"observed_at":"2026-07-08T14:25:02.752440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.713702Z","title":"Novel dataset for fine-grained image categorization","venue":null,"work_id":"c046952a-03d7-4f55-aee3-38b68204f35f","year":2011},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:d04c6e98392a49f5e01370fbd039168eee7ca65b74418357430040fac3431905","observation_id":"040dc5e9-876e-40d8-8ccb-dac6f68452be","resolution":{"observed_at":"2026-07-08T14:25:02.714993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.721025Z","title":null,"venue":null,"work_id":"b7927de5-ddd3-47f6-b8fe-dc9d53b53696","year":2009},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:1c847be3a0f9f1734d52358714035be3b37014968ba5ce20c6fc598fdd761a64","observation_id":"e1048885-7b5b-48a8-90f5-a15f5332079d","resolution":{"observed_at":"2026-07-08T14:25:02.722854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.715673Z","title":"Vegfru: A domain-specific dataset for fine-grained visual categorization","venue":null,"work_id":"960a8be1-0465-4f08-bd4a-7a684f14420a","year":2017},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:52172897c772baead47321d8ffa91f3d30e7d1d27cb7c041433633d4e1d5d05f","observation_id":"7f7b42c4-4c04-498e-9499-b78ac6376642","resolution":{"observed_at":"2026-07-08T14:25:02.717846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.723650Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":"b87b2778-ebbb-49ee-bc48-4abaee55c644","year":2011},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:ac0f846bbc271162151e7e8c6443bc7d1c1331c3f4db65ae3cca6b8ec2088d88","observation_id":"4b900c35-f052-492b-885c-a9e2cbeb83a2","resolution":{"observed_at":"2026-07-08T14:25:02.725340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.788939Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":"d2f360d2-8e0e-4a86-aa1b-abc368fde6e2","year":2014},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:1afbf1dc134da437fec645849b61d4679d81dff8d9f25daf3f3506e3f5491bfc","observation_id":"a5fd430f-d530-45c1-9cf3-48da24703349","resolution":{"observed_at":"2026-07-08T14:25:02.790757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.780597Z","title":"Deep-based ingredient recognition for cooking recipe retrieval","venue":null,"work_id":"3ba09f52-c912-422e-a83f-976bcbc8e8eb","year":2016},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:f29455ca69f73f3fea0798626c34e5cf2063a3f230557c3bd7425a3714e794f7","observation_id":"14e37b16-97cf-4de7-8120-73d186426ce5","resolution":{"observed_at":"2026-07-08T14:25:02.782345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.726220Z","title":"Ingredient-guided cascaded multi-attention network for food recognition","venue":null,"work_id":"2dd4f5dc-f03e-46b3-b768-f7c367113f31","year":2019},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:e978a69d7489102feb8af7ce38478447e46e17018d68d438c10bc00af964456c","observation_id":"34169aeb-c088-4d19-8626-52462a2e8e79","resolution":{"observed_at":"2026-07-08T14:25:02.727864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.778170Z","title":"Isia food-500: A dataset for large-scale food recognition via stacked global-local attention network","venue":null,"work_id":"3f5d1957-d0a8-4a60-a1fc-83ae1399236d","year":2020},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:086d184d6c193b3cf2de5f42de5e08ba7616bdc703395c2eeae74efd728c088a","observation_id":"f382d94b-2ba0-40bd-9d7e-ba71bf8a0ef8","resolution":{"observed_at":"2026-07-08T14:25:02.779786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":"1306.5151","doi":null,"metadata_source":"pith","pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-07-11T03:07:53.092922Z","title":"Fine-Grained Visual Classification of Aircraft","venue":"cs.CV","work_id":"ed360110-3ce4-4959-8c74-1785cd9e537d","year":2013},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:7408c4a04468e8afd3d6ddb1e93b25c6ffc76dab391c8a4aa6d673f038fba438","observation_id":"189848be-6a95-4b27-b490-9dde6306de03","resolution":{"observed_at":"2026-07-08T14:25:02.446980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.791497Z","title":"Learning to prompt with text only supervision for vision-language models","venue":null,"work_id":"79be89be-1be0-4240-bb1a-988462b6fed1","year":2025},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:d5c90c3679cfc8a2e3112bb6c649eeee77118403389d2276dbbf32d6a42ba1d2","observation_id":"f3ebdea0-49b9-4a08-9e4f-b80ee2da92f2","resolution":{"observed_at":"2026-07-08T14:25:02.793349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.805179Z","title":"Advancing textual prompt learning with anchored attributes","venue":null,"work_id":"fa1b622a-c712-4b57-a183-7add6422caca","year":2025},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:f96a42a3a1dc662feb31fd2acad12bc6c8f08bdac20495f99fdfb9d0d234d170","observation_id":"d60c7baa-4c33-4239-9e11-cb9e5b536ba2","resolution":{"observed_at":"2026-07-08T14:25:02.806514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.794114Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"6ac6962a-6756-4df9-bb64-b9cbda14d127","year":2017},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:0a1c4d697562f03a40f4e5dc0e62ee807365c8d9f545db7c25df50512ba4505a","observation_id":"5a6b2106-d663-431a-aaaa-5a588a737876","resolution":{"observed_at":"2026-07-08T14:25:02.795986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.801287Z","title":"Visual prompt tuning","venue":null,"work_id":"cc9de1c7-0a2a-41ef-92dd-052f324189b6","year":2022},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:236309a4465e99f22fc132481525eaaacf9b0a547f4bd9c141312248f6c40597","observation_id":"bb278ed3-4a3d-48d1-9d98-7ee7668426c2","resolution":{"observed_at":"2026-07-08T14:25:02.802529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:25:02.783620Z","title":"Dualprompt: Complementary prompting for rehearsal-free continual learning","venue":null,"work_id":"dcc2750d-1acb-4b01-af1d-3480cc24e8ac","year":2022},"citing_paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-08T14:18:26.034732Z"},"links":{"citing_paper":"/paper/2607.06185"},"observation_digest":"sha256:6362a09d529f1bf1b7462ea0fbb2cee77b8b260b05d6390d64e5e0bc5ee0d276","observation_id":"02ae27a1-5690-42fc-a5e1-298765e2267c","resolution":{"observed_at":"2026-07-08T14:25:02.785403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06185","last_updated":"2026-07-07T12:09:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T04:09:39.414175Z","submitted_at":"2026-07-07T12:09:49Z","title":"Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":49},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.06185."}