{"as_of":"2026-08-07T07:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cf8f2cf7ec4894de710123d987e94f0d9ad709ed2ca1fe7edef2ce2dc5dbcf5","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T01:03:27.721212Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09008/citation-record","integrity":"/paper/2607.09008/integrity","json":"/paper/2607.09008/citation-record.json","paper":"/paper/2607.09008"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:45d549da7c82e499ead01a2b7646e9d63fb46546f0d40c348a0583fa2cf5f989","observation_id":"d8a38870-3797-493b-bbeb-162983dcff0f","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:178552591aca00540e4f3d0c0a6e40a2c755433a85ea02c4263a7b95ac40f135","observation_id":"d13e7d89-cd13-4c3b-bb41-bca2523dc9c0","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Khan, and Fahad Shahbaz Khan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:2de1ff9afa6cee7bd5622fe427471ee9dc23cd8c402f13cdf00957d350bd1538","observation_id":"2322de0a-0624-4ed2-838f-5b6fc8801c8d","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10934","last_updated":"2020-04-23T02:10:02Z","snapshot_observed_at":"2026-07-06T09:14:32.318388Z","submitted_at":"2020-04-23T02:10:02Z","title":"YOLOv4: Optimal Speed and Accuracy of Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10934","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"YOLOv4: Optimal speed and accuracy of object detection","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/2004.10934","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:0718c6aae54f1c4f3db88e8d9d311492f8c7726ee972b74cd74cc2fbee83b36b","observation_id":"5110977b-83bc-4238-9c92-3f7e7430fce6","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:d7150c7168dfd44d8f789409dee8e5f28f9e1a17da47cc42ff0aa004c9e82ecf","observation_id":"a61b1cb2-2eb2-4eb0-ba16-f983abe7b986","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:339e5f302d57a8f2f6d788a6900dc5ee56d5ce976097342d3f9308b2c9369952","observation_id":"996b68e7-2615-42e5-8229-79f898e06de2","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"PaLI: A jointly-scaled multilingual language- image model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:d873cec1b57eef631a421e4fb1ed699317c8b6035d0e3620b6ea80a5aec5b044","observation_id":"9c8b6d85-92ae-4bf1-900a-4cfc330958c2","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"YOLO-World: Real- time open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:8e8f8847763b2642db3ca027ca02431f64c38cadcdbdeb9e070d6f8f79cb3d54","observation_id":"d00a79d0-b91f-4043-8b89-01476a61dbdf","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13040","last_updated":"2023-03-23T05:10:22Z","snapshot_observed_at":"2026-08-01T23:32:57.695949Z","submitted_at":"2023-03-23T05:10:22Z","title":"Open-Vocabulary Object Detection using Pseudo Caption Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13040","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Open-vocabulary object detection using pseudo caption labels.arXiv preprint arXiv:2303.13040, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/2303.13040","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:6c6c64d34b977f70d42e19ee75847e9bea126b3f0912186d1e86010c392ff972","observation_id":"784c6c7e-7790-47dc-98ee-dd8095ce60d9","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"The cityscapes dataset for semantic urban scene understand- ing","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:8204020dd8a2992c21a4c67d849ad01f448ae89628f1e48111719621963ce04c","observation_id":"9d367007-6b9b-4635-a381-d4270cff1f22","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Class-balanced loss based on effective number of samples","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:9d9601e909e59f73a67c7fbacf687942a76d031161b0889e6b58826d65cf3fff","observation_id":"bae68df1-83b8-433e-87d2-0c1a49b639b4","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"BERT: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:2fd363c796247261f782fde57c26392fb628ad7d3d8d203806edd1244ce8a9fa","observation_id":"06b14241-3d0b-4955-831b-df198936504c","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Learning to prompt for open- vocabulary object detection with vision-language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:fcbb6f5bfafaf0f789501203f127011ae2fdb15eba71360bbd3076fe82764c5a","observation_id":"9b1f51df-28a1-470e-a511-1f895a8ddcbd","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Cut, paste and learn: Surprisingly easy synthesis for instance detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:2134efbb082f509e833ca50c99867af20edaabeacebc04f529b30a118f0da61e","observation_id":"a755bfc6-df12-4df7-8deb-9b416a64843f","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"PromptDet: Towards open-vocabulary detection using uncurated images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:7473e5bc619d33543c5c7e1b01b62f08ebe6eaee73757ed171466e824e5a19bd","observation_id":"a2d1b15a-d7bd-406a-bbf4-60eda22cc28c","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Simple copy-paste is a strong data augmentation method for instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:817fce82a0bf9a5b902806faf24669f8b916675463c6e5861dba2cac27c6b948","observation_id":"3c7b3fd9-f071-437f-a555-8acc41454441","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Open-vocabulary object detection via vision and lan- 9 guage knowledge distillation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:ebdf39bca9d2a7580c25b5d65cf0f1f486a1cc8b8d0369b5ab0989c4b13b11ba","observation_id":"852ab463-4088-4f6d-9462-baa7a61985b2","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"LVIS: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:f0d37d4d2748da14ec6d6c22c07ac9644461b42f793acb9d84bd1a4a0144f9a6","observation_id":"1b6abb73-c4b2-4f1e-a8d1-acaf8900f662","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:888931c00aebd2a8790d70da0478425141b9c266bd3d4a2b37e4c68d5b0dd3e5","observation_id":"78eac4c5-17bd-4fc6-96de-ff3604acb886","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Disen- tangling label distribution for long-tailed visual recog- nition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:77811d5cf5ccfa8f39d2d19844635a6946acb5634849217e135945f074bfd856","observation_id":"afac1053-d8ab-4431-8f51-768c82b5299a","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03649","last_updated":"2022-08-22T08:45:33Z","snapshot_observed_at":"2026-07-06T12:57:58.716731Z","submitted_at":"2022-04-07T17:59:57Z","title":"Unsupervised Prompt Learning for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03649","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Unsupervised prompt learning for vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/2204.03649","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:9a358b439baa9cb2aa9c7b80f4015454c006f6d6f0e914a9adf45e6a9640e6ab","observation_id":"4877e3ab-2079-4b1a-8a80-ea349dde6ede","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"MDETR – modulated detection for end-to-end multi-modal under- standing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:372bf80c906c3b67a357a61d61470f9afa022bafeb4f34359155538a04cf21e0","observation_id":"13b3d113-b329-4486-9eca-a6ce819f0c01","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"MaPLe: Multi-modal prompt learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:21f550d954d300494a9d23ef736e7a876630e19b2099f603e3dd820e9293252e","observation_id":"39cb5d50-cbc4-4339-812a-b20d370a71dd","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Grounded language-image pre- training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:48640b8db78b5f5948e048a4a00b37ec4c6c83b37a71d44662284c82bdeebbb3","observation_id":"51e1d214-9737-4752-bec8-a138ea705bfc","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15361","last_updated":"2024-12-12T09:06:56Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T16:32:21Z","title":"A Comprehensive Survey on Test-Time Adaptation under Distribution Shifts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15361","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"A comprehensive survey on test-time adaptation under distribution shifts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/2303.15361","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:6105528dc0af67d5aeaaf066ad1f84501f420dff0b8db268672f36c1e0a04f22","observation_id":"edcddd80-8352-47ed-af94-1fb7f35c4408","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:83f7eccd6705aed17bbc37c623e1fbffe4e63970c89402dafaa856d66c5614b7","observation_id":"eca558fc-169c-42d8-b903-9a3f0f5bafd2","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:4a7d28e48c46fa281aa402f62106f43427c0b049bc2c3c83d6087fb0a4da1d3e","observation_id":"dd9b96fb-cb14-4686-974a-2a608fd81d6f","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:413b942c958ad2231e55989c7f6f9a77452872f214b301c2db84dcff2f91b1b4","observation_id":"bf20bdb2-b07a-485b-aed1-2b6755ebafc5","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Grounding DINO: Marrying DINO with grounded pre-training for open-set object de- tection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:2c1572f8d1c1980ebaa3582936351eaee83e6f64b02fdb8a5bf97992f5e5f9c9","observation_id":"420e6937-a05a-41d0-9022-e989a5b74643","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Long-tail learning via logit ad- justment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:282c1f74c64cb263e051f04a20b5a0d6ecfc59da881ad7d7a96f6aeb2240276f","observation_id":"45caed43-a91c-4a46-9f7e-cef67e63673d","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Simple open- vocabulary object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:ab0b9d333aee36bad2fc8772f9fd96a981b578f44dd1f5f7a56dd2fc10726682","observation_id":"4bc5d39e-c307-4b8a-ae9e-438f0652649d","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:e29c1dcc05e04f303ba904645cc2ccc6b881d50d5fdcd71085e1df82778defcd","observation_id":"24bc332d-16ba-4a59-a2e7-8844ba187985","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Imbalance problems in object detection: A re- view.IEEE Transactions on Pattern Analysis and Ma- chine Intelligence, pages 1–1, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:a4b7899a75cc33363bd4c2a67daf9822f1b7740ba461f848c4960705d4911d36","observation_id":"b1fcdddc-ca28-4614-a1a9-66d558aa5f2e","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:3de2f42874f3451b9fb56664dcaef274c44fde42edd7cb2ea6d0a7bd0ac3d439","observation_id":"98c1e5a8-f933-4098-b424-195aa0265c0b","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:0648c738937734e07198be766302d6467a52363acf9213f769661f249a50fd59","observation_id":"39793ec3-826d-4a21-ad58-a94ce4be7726","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Aligning and prompting everything all at once for universal visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:26363b6019a2c7600015c9ac08a7071bb7dbd31aa7d9f4b2beaabf6b769833a0","observation_id":"7dbd3952-5111-4cbe-8bd1-e94153b1d361","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Test-time prompt tuning for zero-shot generalization in vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:8cd2ec39e9919acdc1e003fd5dd139ed3fce4c043efe9ce195a709bf201ee02d","observation_id":"3cc1253e-990c-4caa-a3ef-36f34ce6a0be","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Equal- ization loss for long-tailed object recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:52d03b047f6e2cc448bd55b0b1511da16239fd933195a390d48b8189eb678496","observation_id":"983d7793-9601-4f0e-b8d2-2a6b3c4eb4ab","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Equalization loss v2: A new gradient bal- ance approach for long-tailed object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:af0c5a34200ca94af9e1a05ebf96f3abf74a31e36e4ab6c9e252fab6411233e6","observation_id":"22b51d12-11ae-4a4e-9f70-09bf6db4206f","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Moondream: A small vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:62e94e0930b7f1f660bbc62a5072024c65fb7608dbc5d801298af4ed53d7c298","observation_id":"a1950c97-a0a4-4955-a771-ac22b754fb06","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Tent: Fully test-time adaptation by entropy minimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:36617dff088c0957be5a2ff91ac4def5a6338518e5626136f997d4360097e23a","observation_id":"48b95d46-a9dc-4858-8741-24f423ec97dd","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Seesaw loss for long-tailed instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:aadde2d9f5d4caa12c0f3ecbf93516e71cdb8c095d25f544199e9c0f79661d60","observation_id":"721e0868-4bd8-4aa3-802a-d8e3645ba53f","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"GroupViT: Semantic segmentation emerges from text su- pervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:18f3d4bd1b940d0ef883d70714dd1e2481a5f8b1332f0a7ee442e9de4218fb7c","observation_id":"08072b10-2a2a-4447-a8a0-e2132c57e693","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"End-to-end semi-supervised object detection with soft teacher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:d0b3197168d1cc313cb5c1fc70b49eced2d4ebb66b847958724f445a90963994","observation_id":"b6da45c8-35a1-4885-8de2-73e8687bc2eb","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Improving pseudo labels for open-vocabulary object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:efc8d71a4c5ec21370809e2e03707f9f911984e1eb75bc4e854e56431b05dfe7","observation_id":"39efb0a4-b80e-4f99-8375-9ad5ddf7e143","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"UniTab: Uni- fying tabular learning at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:f8bd0306d210e477ba1d5b3dd6914dda1de441e2617ade23618f449082991e8b","observation_id":"66f5c8a1-031c-4b6d-8abd-f0c393ac2644","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Visual- language prompt tuning with knowledge-guided context optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:3eef5a214f091c5807d51f73235eba100d60b41707b8c5163f8cf69dd9bf1573","observation_id":"26ff197a-012a-4acd-92bd-b4d8a6880300","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"CutMix: Regularization strategy to train strong classi- fiers with localizable features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:b458d555ea904958a93d1115701df93efb69002e8e0f9e399a9325302fae3f0a","observation_id":"2ce8b913-0bfd-41b4-a936-3805228cf8df","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Open-vocabulary DETR with condi- tional matching","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:5cfa5ba979781c847577a4a042e7fc6a1bf7d5e9990fcaa222a905b7afdbf0ad","observation_id":"3e0f31da-da57-4de7-ac15-d60d471b9346","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07225","last_updated":"2022-10-13T17:50:24Z","snapshot_observed_at":"2026-07-06T14:04:55.099373Z","submitted_at":"2022-10-13T17:50:24Z","title":"Unified Vision and Language Prompt Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07225","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Unified vision and language prompt learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/2210.07225","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:3810d780f6d27f1eb42b28985e6ee755bbc709179568463919481003a61185f2","observation_id":"b6ab8ff8-cd44-49a3-838d-280f7150b7ac","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:20fef65a93f59d70c7283c0f9533b4435857f9b19101d9a8ba6b469247faebdb","observation_id":"a2b59379-07e9-4489-9002-69f0db897f57","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Dauphin, and David Lopez-Paz","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:4ec8320cb87bb52dcd70a3c290a49df43b58c449c58c659755138799550d7aa2","observation_id":"e53bb192-3b6a-4386-99d4-7dfef59dc38e","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"GLIPv2: Unifying localization and vision-language un- derstanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:c6a0110b45b458fe7a367e9f1a53002b5fde0918dc750d6f8f81c936d73db68f","observation_id":"18886383-2b5d-4abb-a251-1e25754983f7","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06892","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Real-time transformer-based open- vocabulary detection with efficient fusion head.arXiv preprint arXiv:2403.06892, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/2403.06892","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:d5ac40cb095890f84165d4a92a6be178e4f43944afbea4d2e914ed2d3c60999a","observation_id":"1c5efbe0-6bac-4900-ae2b-967ca6bd989a","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Re- gionCLIP: Region-based language-image pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:ba8d2831e52fcfa90e7bc272960423d7410dffc42bacaca8faf960e54e88a59d","observation_id":"a84fd865-03b7-47d1-aeea-89fd4789f3da","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Conditional prompt learning for vision- language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:c4971b52732a4d83391662955bcbe42220820499806e90206ba37ae2ee343ba5","observation_id":"2a963a03-883f-4982-b7be-eaeec8698097","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Learning to prompt for vision-language mod- els.International Journal of Computer Vision, 130: 2337–2348, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:71db70bab0b0e55cbbea5b6f6fee46de58d7a8919cb4b6f0063eec647c5caff1","observation_id":"d2657d6f-e39d-4fb1-94ea-bb949bb84597","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Detecting twenty- thousand classes using image-level supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:b9dc3b4dd054e94dfec90573424160b0b9610e0375002a4ae0b239e07a422527","observation_id":"42efb28c-514c-400d-924a-d51c04ad94cf","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"MiniGPT-4: Enhancing vision- language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:b3983130dcc80fba17f18de03c4b80db60378c4ef048107cc4746cc64484b7e0","observation_id":"556e3719-ae7a-4acb-a5d4-7e33b07f74e9","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Data augmentation remedies include copy-paste [16], Cut- Paste [14], MixUp [52], CutMix [48], and mosaic tiling [4, 8]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:1a4199752dca1467a9ee893e3d2c3fafe0a34ad642f30d1901ad7a3660116f04","observation_id":"21aa748b-e3b9-4057-94dd-21aba2636fee","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Per-class instance counts in each validation split","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:ee1bc0304438f2ae3c038dba84a79a1dda066c096e5ef1c85da44ce1fca79c98","observation_id":"a994cda8-e940-4d52-8dc5-edafcfcf7e4b","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Detector Inference Settings All detector weights are frozen throughout and no fine- tuning is performed at any stage","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:f604575b0475551d654a6c04dfc712e875a6a7a712c50d817a51d8e0af1a2ec4","observation_id":"9d3694a6-70d3-4e77-8f54-386af1c7e605","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:5c5416746e43f944ff01528864faf1e721ed60ed7900768d91b45f55da1167de","observation_id":"49b62e83-7c75-41dd-a01e-a5702685c0a8","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"We additionally ran CGAP with LLaV A (7B) as an ex- ploratory Phase II refiner for all completed backbone– dataset configurations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:2a4acb4beb84a8e5ccbb77f3bbe8bb1a955b796c644501ed5e8a7779cd205652","observation_id":"284de3bd-8397-4603-823a-0749dd230a35","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"moondream (K=15,T 0=CC, strati- fied, three runs)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:19bc88c7ce40836f94eb9056c3baa1ec67739ea1575cd959e13926d8293c5c9b","observation_id":"0a06acf6-d83c-42cc-a248-0c042377e4c3","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Detection Quality Figure 12 plots refined caption length (words) against minority-class AP@0.5 across all 1,104 CGAP trials, colored by bucket assignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:74be7fd536bf245a8e758c4dfb2d576798a00eaeb422674d4da6e516319e76ea","observation_id":"3d8846d6-8ea0-416b-9570-da464608a8c7","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"The primary metric is AP@0.5 for the designated mi- nority class (bus/COCO, truck/Cityscapes, Bike/Chula Vista)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:872b8941aa0d91d24acca38a552cebf659a64f6220bfc4121b51d9a6e683ea77","observation_id":"01377427-9604-490a-891d-354dbd5c6985","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2607.09008."}