{"as_of":"2026-08-08T21:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f27f5da013a8f0737f5d6b304e07e3c573590438a7d929435fbd507c1b387ade","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:34:24.068813Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13661/citation-record","integrity":"/paper/2607.13661/integrity","json":"/paper/2607.13661/citation-record.json","paper":"/paper/2607.13661"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:19.732075Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:19.732075Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:854e0db86a3746fe80801e4c14504d850ebf988fb84589e6a9c0e42f2f46de56","observation_id":"8bd193dc-b30d-4078-8177-d7083e37a48e","resolution":{"observed_at":"2026-08-02T04:34:19.732075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:19.783657Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:19.783657Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:004be4dd18983241b78c751d717c1edf5b2e8ca450d96e1b109b8a40e43e967d","observation_id":"63d26381-afdc-4909-bda2-548169a26959","resolution":{"observed_at":"2026-08-02T04:34:19.783657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:19.911115Z","title":"Domain generalization by mutual-information regularization with pre-trained models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:19.911115Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:d70076dab69a4c67d990f1afcadcb24ddd5ac7b498d18f5c139f75692205ca94","observation_id":"ddb9cc4e-543c-423d-991f-478e2ee00029","resolution":{"observed_at":"2026-08-02T04:34:19.911115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:20.028038Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning.Neurocomputing, 508:293–304, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.028038Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:40715e6145c38a28900a9d1a8049d61a7720bc0238c4c0552f62b31489bf0995","observation_id":"3c0642e0-1d44-4817-adae-3bde31c03eab","resolution":{"observed_at":"2026-08-02T04:34:20.028038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:20.137894Z","title":"A simple baseline for zeroshot semantic segmentation with pre-trained vision-language model.ECCV, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.137894Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:45c000eedb0945903a5b4793369416d221dbfb7bb823d14e8ae8dd2bac77929c","observation_id":"32ba5634-332f-4950-a23b-8ee151898524","resolution":{"observed_at":"2026-08-02T04:34:20.137894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:20.267337Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.267337Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:77fa8ef2a24ad354794bed0e7c86fb8f6a8051cd03a832b9f1d8cc2dcd490c67","observation_id":"6de4a91c-378c-4c3d-9f61-982631c05f86","resolution":{"observed_at":"2026-08-02T04:34:20.267337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:20.395029Z","title":"Open-vocabulary object detection via vision and language knowledge distillation.ICLR, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.395029Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:ba693f72ea84756c2520b614a99ea891ce8d27096f4fb03dc722b4bbee923a4f","observation_id":"11bf04f8-b573-4897-8467-4c55297b54c3","resolution":{"observed_at":"2026-08-02T04:34:20.395029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:20.522685Z","title":"Learning to prompt for open-vocabulary object detection with vision-language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.522685Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:f8c9e862b3d6a2bfa82724482cda68e90adc497c787201c4c1ba1715ce80efcd","observation_id":"1b1ce2ea-0b29-4882-b758-c8d3ec22c2e1","resolution":{"observed_at":"2026-08-02T04:34:20.522685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:20.598985Z","title":"F-vlm: Open-vocabulary object detection upon frozen vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.598985Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:06d8f0f9b1543403fd877153b9d77be85ae4e8826d20b370adfe8d467d3d2bac","observation_id":"565de053-86d3-4a2e-8d37-626adad563dc","resolution":{"observed_at":"2026-08-02T04:34:20.598985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:20.710137Z","title":"Cora: Adapting clip for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.710137Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:e98732e4cf51990070a746707660e879eff71154827ee1c1c2ec4f2f95ce1e70","observation_id":"b8dcd1f4-4855-4adf-963d-405c14e8163e","resolution":{"observed_at":"2026-08-02T04:34:20.710137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:20.784279Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip.NeurIPS, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.784279Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:aad9910a019d314dae9216d60309e40269719ef10ae1def70b1e4c5845c6899a","observation_id":"d6a36991-b888-41d2-8104-2e835b78156e","resolution":{"observed_at":"2026-08-02T04:34:20.784279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-02T04:34:20.882417Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.882417Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:5542c88ffc730039b20ae3f00c73596e569b351753005cac4b685044d011f4ae","observation_id":"eb9e5c88-b18c-48dd-b5fb-419445fe7bb6","resolution":{"observed_at":"2026-08-02T04:34:20.882417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:20.994264Z","title":"Fg-clip: Fine-grained visual and textual alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:20.994264Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:423a840cea79b180bff72cb210952809a452cf7800ee18037c40b7e38f0cb0c6","observation_id":"35d417ee-a6ef-4c79-9ebc-15a5b96c56dd","resolution":{"observed_at":"2026-08-02T04:34:20.994264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:21.067883Z","title":"Improving fine-grained understanding in image-text pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.067883Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:017094d90a03afbaef2291aaaf5817f62ac0e2ad62949ca98a723a18ec47e57d","observation_id":"4025cb0e-223d-4a04-9a14-b3b58f99fea0","resolution":{"observed_at":"2026-08-02T04:34:21.067883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:21.144614Z","title":"Position-guided text prompt for vision-language pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.144614Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:8a5603e7869102d8c6ab0acbc5aaac92ace109acbc78a70e8eb13d58b72e3e78","observation_id":"77529e6f-7493-4b61-9f75-161c2dccf433","resolution":{"observed_at":"2026-08-02T04:34:21.144614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:21.272963Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.272963Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:ae3ab23add657ef97f9db1948ebbccbe85a7e8ac58489ce9e3071a021292d318","observation_id":"6a4a53db-8026-4009-8207-31fb8c29c6fe","resolution":{"observed_at":"2026-08-02T04:34:21.272963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:21.399489Z","title":"Densevlm: A retrieval and decoupled alignment framework for open-vocabulary dense prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.399489Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:befb52d5ba36929f9e1c5ed104322ed0f3a9c0bfb942cf2b7b094bc6c16c68e6","observation_id":"f74a3a0a-d803-456f-874a-7f819ad08ca3","resolution":{"observed_at":"2026-08-02T04:34:21.399489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:21.508614Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks.NeurIPS, 28, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.508614Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:dcab42ccd7af6a1399cc105afba9d0b44d09555a08d989b1637486741b8dc99b","observation_id":"2fc4abb7-f457-4d88-90c9-7a70dce8e874","resolution":{"observed_at":"2026-08-02T04:34:21.508614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:21.610915Z","title":"Fineclip: Self-distilled region-based clip for better fine-grained understanding.Advances in Neural Information Processing Systems, 37:27896–27918, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.610915Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:9be2f4d26aeafdc83e93df532fbf8a8e9061224b4902ddde2bea0aff7ce5d4ff","observation_id":"32a894cb-2843-4da8-a076-3556dcf10c95","resolution":{"observed_at":"2026-08-02T04:34:21.610915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:21.688429Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.688429Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:75334bc97f91bd68e9d3c66e73cbb1b355c7581c84fd643ff80365fc4ce7cee7","observation_id":"c1be3bf9-5335-4ab8-b12e-af7abd41c793","resolution":{"observed_at":"2026-08-02T04:34:21.688429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-05T20:11:45.942545Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-08-02T04:34:21.757260Z","title":"Clipself: Vision transformer distills itself for open-vocabulary dense prediction.arXiv preprint arXiv:2310.01403, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.757260Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:1ee4b670ece7bb476c44b8db2cdb00b31d4566e79d06da416e33376bd52baef1","observation_id":"f86e41b0-c080-4a67-b931-7a6d6092232a","resolution":{"observed_at":"2026-08-02T04:34:21.757260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:21.837936Z","title":"Atas: Any-to-any self-distillation for enhanced open-vocabulary dense prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.837936Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:bd52a890ebb4b8d45c5b29b57a8fe3f4ce0c0d39388796decb0137ca55586306","observation_id":"6fea05e2-1c49-4392-903e-2e2ec146ea25","resolution":{"observed_at":"2026-08-02T04:34:21.837936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:21.960049Z","title":"Clim: Contrastive language-image mosaic for region representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:21.960049Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:711de5a072786c0e7e69a3e2de7f67a05e75c410590e44c160542ad55b2ebe0a","observation_id":"e2969ff4-6d48-4357-b08b-10d160aea840","resolution":{"observed_at":"2026-08-02T04:34:21.960049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.052633Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.052633Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:4465816447c72c7f635cf44429e0e1fbaf833632d8d2f625f493fd58c799a61e","observation_id":"2ec8a351-5b2b-41af-a3d7-29ee243695a9","resolution":{"observed_at":"2026-08-02T04:34:22.052633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-02T04:34:22.167250Z","title":"Coca: Contrastive captioners are image-text foundation models.arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.167250Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:2460e1cac6e27bf71f52ecc9da723fffbf4031705b0d0429c60103a96b83bc67","observation_id":"f34aa329-6d56-427e-be60-15064d712336","resolution":{"observed_at":"2026-08-02T04:34:22.167250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.240787Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.240787Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:328f9e86b0a36bcfe9ab33ba3f4c898914d170b8e1c2f8c7f3749ab3cf22ced8","observation_id":"0818cb07-8563-4be6-83b6-66b9ae21c98c","resolution":{"observed_at":"2026-08-02T04:34:22.240787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.348171Z","title":"Region-aware pretraining for open-vocabulary object detection with vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.348171Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:afe6c27a39062715a887d3c591c26776051769872592cf3cca7257e491809fb3","observation_id":"ea92005a-c474-4d63-8c91-8cf61cc49883","resolution":{"observed_at":"2026-08-02T04:34:22.348171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.421378Z","title":"Open-vocabulary object detection upon frozen vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.421378Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:381df4d36ed48a755d002902fd241d47afa3f6a19f4d42eb2c8980084153ddca","observation_id":"b348c575-dc87-487b-b4c1-837e80beb3cb","resolution":{"observed_at":"2026-08-02T04:34:22.421378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.482490Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.482490Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:c16bae7981c340b57d91271c829787034896b5c1154962c072f7e0af6cb76b79","observation_id":"ee5b9da2-0c64-4109-bc6c-6afea2ff4193","resolution":{"observed_at":"2026-08-02T04:34:22.482490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.551463Z","title":"Scaling open-vocabulary image segmentation with image-level labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.551463Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:8f8c9dc64b0207836e9127667108947e6a7cf66bd2e16c85686da94b412ff89b","observation_id":"461b57f4-e6e2-4136-8ece-e49634b213ad","resolution":{"observed_at":"2026-08-02T04:34:22.551463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.605796Z","title":"Cascade-clip: Cascaded vision-language embeddings alignment for zero-shot semantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.605796Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:36ce19df200f2c291e040028313ab417463faf6f372ea995816cddee39aeb635","observation_id":"597862d6-c43b-4b4e-8c4d-21297c1af748","resolution":{"observed_at":"2026-08-02T04:34:22.605796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.666618Z","title":"Visualizing and understanding convolutional networks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.666618Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:8c89870bda2aef10b6d3eba47b2f4579d7f7309f90a881ea1366141b0f50ce58","observation_id":"0dddf0e2-4cd3-4e4c-8838-73e619e389cc","resolution":{"observed_at":"2026-08-02T04:34:22.666618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.716689Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.716689Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:b8e474f9680f8e05c0d43d56ac7fb75cbfb17d467f01e0b7347f4e0c368520d1","observation_id":"fe6d806c-2905-435d-8059-6219fb50845b","resolution":{"observed_at":"2026-08-02T04:34:22.716689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.774483Z","title":"why should i trust you?","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.774483Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:80c38f230add6a2d7cc1af55f4b01858b4932e49b6c2ff0b219d5a86c57e42c0","observation_id":"30586115-75d7-4000-bae3-65275a1d9758","resolution":{"observed_at":"2026-08-02T04:34:22.774483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07421","last_updated":"2018-09-25T18:16:18Z","snapshot_observed_at":"2026-07-06T06:45:42.492990Z","submitted_at":"2018-06-19T18:41:30Z","title":"RISE: Randomized Input Sampling for Explanation of Black-box Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07421","snapshot_observed_at":"2026-08-02T04:34:22.815449Z","title":"Rise: Randomized input sampling for explanation of black-box models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.815449Z"},"links":{"cited_paper":"/paper/1806.07421","citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:6d3347c86e4e5f20aacc7666f4483e6dd99d0c8a6aaea5ffd65ee50ed5c5130c","observation_id":"515bce79-e3d9-414a-8667-04882cf09d0a","resolution":{"observed_at":"2026-08-02T04:34:22.815449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.875888Z","title":"Odam: Gradient-based instance-specific visual explanations for object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.875888Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:d38ccff8152ddc70049077d75f58ee460df6f3fe49fa4c41d602a15dbfd914a0","observation_id":"9a1c5731-fc8d-4aec-9dff-2fcb024282b4","resolution":{"observed_at":"2026-08-02T04:34:22.875888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.926313Z","title":"Attcat: Explaining transformers via attentive class activation tokens.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.926313Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:f4b9a9ddc2f40a849b2d5ba2602f222780c98349dd4a9c7e4f4cbd0a0d204650","observation_id":"600f2382-940b-4e1c-99e6-583c91c474da","resolution":{"observed_at":"2026-08-02T04:34:22.926313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:22.978761Z","title":"Vit-cx: Causal explanation of vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:22.978761Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:39457ebcf4d70faaba46465e53c9436ae6b7d7a11271267898ac7616aaf947f5","observation_id":"2fcd5a22-9bb6-4959-906a-6f43fa45edc7","resolution":{"observed_at":"2026-08-02T04:34:22.978761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.027755Z","title":"X-pruner: explainable pruning for vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.027755Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:7291a219a5e384b14020442446f45d5f8982daafe30a279b7b132b8d3cd7030e","observation_id":"426aea57-7706-4963-a6ad-75770ba38d26","resolution":{"observed_at":"2026-08-02T04:34:23.027755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.086757Z","title":"Gradient-based visual explanation for transformer-based clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.086757Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:6ba80e986da09f804e096081db5fa39054f46481790a8cf9e526a5eb2facfcf2","observation_id":"444c21dc-5c62-448f-9e75-d2e059dc324b","resolution":{"observed_at":"2026-08-02T04:34:23.086757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.130648Z","title":"Extract free dense labels from clip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.130648Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:6e38babb6f56b547fc9f0e6f3459f0f2386768a64527199687a997b279f78d0e","observation_id":"c9b6e25d-0459-4d2d-a378-0d1fce8d4c8d","resolution":{"observed_at":"2026-08-02T04:34:23.130648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.187146Z","title":"O’Reilly Media, Inc., 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.187146Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:00a541ec9d9f564230e9ae3d2d04ab8de2ced7d1c8e2779244a4ff0cbfb98851","observation_id":"94584bb7-1049-4471-ae94-be1cd70f3a1b","resolution":{"observed_at":"2026-08-02T04:34:23.187146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-02T04:34:23.228619Z","title":"Eva-clip: Improved training techniques for clip at scale.preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.228619Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:2cdb51b20b11195648faaca7e06959744c280b2370e4c6f7b05ac11ff6537889","observation_id":"99c64763-8baf-433a-992d-4803d6f90527","resolution":{"observed_at":"2026-08-02T04:34:23.228619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.320295Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.320295Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:89de9c2c3cc0ab1cc3754e93ac33e14cc6d8adc2f312cd04af5ec79134febea7","observation_id":"ff33e22f-c38a-4388-a02e-9cb2916b1545","resolution":{"observed_at":"2026-08-02T04:34:23.320295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.367081Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.367081Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:ae43b52fa323a93c25497638040341e7324ecea3ed57918ee257a659cf170e4a","observation_id":"1cda5196-ea45-4be9-b5f0-450626689087","resolution":{"observed_at":"2026-08-02T04:34:23.367081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-02T04:34:23.413004Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.413004Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:7182ce8b74131f54fc559db5a7efbf989bf73006078d8264437d175deb90606f","observation_id":"7ec207f7-1166-4fec-b74b-41a90a1cb363","resolution":{"observed_at":"2026-08-02T04:34:23.413004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.484746Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.484746Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:7c749d1c69a79af76715f47830941224f21cf3638d7d1dbe0aef5e6a20fa1d09","observation_id":"60a84edb-86d0-41fd-ba53-cab7dbf6fd26","resolution":{"observed_at":"2026-08-02T04:34:23.484746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.564582Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.564582Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:33c2aa3a7bda7f1edb8d5fb9dae65ed2555264f69a9e78a9201e71d32f4921bf","observation_id":"3aedc7db-11ac-459e-878e-0cb683dd086c","resolution":{"observed_at":"2026-08-02T04:34:23.564582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.619581Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.619581Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:5e8ebcf62ccc9907ded1621c0d12a0aed74897ef4536f766a40c7b4e9e2b0111","observation_id":"37a13a99-87f3-4a96-8828-89617d4ca713","resolution":{"observed_at":"2026-08-02T04:34:23.619581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14843","last_updated":"2022-11-27T14:47:31Z","snapshot_observed_at":"2026-08-06T03:25:36.980355Z","submitted_at":"2022-11-27T14:47:31Z","title":"Learning Object-Language Alignments for Open-Vocabulary Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14843","snapshot_observed_at":"2026-08-02T04:34:23.697318Z","title":"Learning object-language alignments for open-vocabulary object detection.arXiv preprint arXiv:2211.14843, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.697318Z"},"links":{"cited_paper":"/paper/2211.14843","citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:fcce69318fddd9355be6687afc3accf50dacdd334de65d4eff65fc283eddbb00","observation_id":"70f1f7f9-eba6-42e5-9a90-bbe7c2f29837","resolution":{"observed_at":"2026-08-02T04:34:23.697318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.775181Z","title":"Everingham, L","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.775181Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:3cd4fdb543f45a7039c9c7435fe2cccff1df94d76ac888de977d3294591a4c9a","observation_id":"4015e22e-3554-412d-a9ef-d73385683845","resolution":{"observed_at":"2026-08-02T04:34:23.775181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.855596Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.855596Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:26541b76179fb284d396a934620120958c8753d938a5238c0eaaae51cb42558e","observation_id":"5291320a-5457-4b97-80fa-605b2501cc42","resolution":{"observed_at":"2026-08-02T04:34:23.855596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.912590Z","title":"Cat-seg: Cost aggregation for open-vocabulary semantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.912590Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:59e240b1ef91a403793732cd4063004cff957ac4153988edff6c089b6f955b32","observation_id":"d2d19235-5285-41e9-9ae4-545f4796b220","resolution":{"observed_at":"2026-08-02T04:34:23.912590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:23.991946Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:23.991946Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:66b4541d16d18ba61b22549ee85f8718a1e04ff5da56433d206148d10a6ee653","observation_id":"deaab706-55ba-4d15-928f-54ad94fe9b78","resolution":{"observed_at":"2026-08-02T04:34:23.991946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:34:24.068813Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T04:34:24.068813Z"},"links":{"citing_paper":"/paper/2607.13661"},"observation_digest":"sha256:8c8472559c222a5e5262ef142d67f3cf89ca77f1c8bd7a4c3b28d539a014171b","observation_id":"dbedda91-2484-4bca-b016-c1f364cb5091","resolution":{"observed_at":"2026-08-02T04:34:24.068813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13661","last_updated":"2026-07-15T10:06:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:48:57.570839Z","submitted_at":"2026-07-15T10:06:39Z","title":"Fine-grained CLIP fine-tuning with self-annotated region alignment"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.13661."}