{"as_of":"2026-08-18T22:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:776cfdda3ba503f6c54d7382580431f8ef5f1adc87dd1953b341dd526c3039aa","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T15:51:57.429693Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07135/citation-record","integrity":"/paper/2607.07135/integrity","json":"/paper/2607.07135/citation-record.json","paper":"/paper/2607.07135"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.17518","last_updated":"2024-04-05T19:18:30Z","snapshot_observed_at":"2026-08-16T14:39:19.622136Z","submitted_at":"2023-11-29T10:40:52Z","title":"The devil is in the fine-grained details: Evaluating open-vocabulary object detectors for fine-grained understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17518","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"arXiv (2023).https://doi.org/10.48550/arxiv.2311.17518","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2311.17518","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:4f34b7d95421dbbf799099e26e645874babdbe80a0326ffb9d499f26b2a8d0f8","observation_id":"ac92bd8c-7059-4dcd-8d4c-100be0fa7b56","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"In: Chaudhuri, K., Sugiyama, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:92f26d0c21190e6d14bc80b0b768392fdf912905654705514be4e8bfbbbd7e01","observation_id":"b6d92444-7ff6-4eda-816f-19113a66b8d5","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:62f226bb437146ad45c3187e3d18cb32aee14a3ed0b71b0a4451fa352df8d026","observation_id":"a007ac14-b9b3-429c-8cc3-f555c58c8b5b","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"In: Proc","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:f04c4e87766ead86b91a54b0de49a49cd68ea14010bf5d5763dfed56e04c02c5","observation_id":"12d98669-4703-47a3-bfb8-07adc6e94f61","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:58e6e962bcfa48d9e66f6a891a0ce01a735c207b14d163220dbcbb1688dbc8cd","observation_id":"75129e31-3482-4b2b-a2e6-b8d14192cf7c","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"International Journal of Computer Vision111(1), 98–136 (Jan 2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:0eae7700869099e71a680490da8971d765cb3c49fa36d51291bfcd10fe130222","observation_id":"9835073e-5122-4fd3-a9be-257f443d1f99","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:f7af5670df8472bbb2ad34cf85618499f7050848fe023dc6801f09d5a3123a41","observation_id":"d68317b5-3be8-4b41-9b3f-4f6ffa2736ef","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"In: Proceedings of the Winter Conference on Applications of Computer Vision (WACV)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:efd99705ba8e70e0f9a71639e25e91de7db8ca7fedf2e40f478b4f74f9424ced","observation_id":"8cc8815d-36c6-4d6c-8587-7a72000a6941","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:e2af86a421faeab4580f12bb5367240ccc30dff5f4efbd4d2f172332d7d43025","observation_id":"6ac6bed8-78c4-49fc-9664-96197e436796","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"In: The Thirty-eighth Annual Conference on Neural Information Processing Systems (2024), https://openreview.net/forum?id=nExI4FuKWD","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:471de2526ace7c14a55ef6e7ebfbb986190c4504a91e5eb68765cae0c199b5f6","observation_id":"279c5718-1bf2-4929-8fe1-3e6b9211722a","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:e09be0f335a6f29e86619435ff38401d3087ff9705fde3b015f2c25e20976be2","observation_id":"0ab2171d-3585-4caf-abcf-f7385b1af114","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"In: CVPR (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:8e702c4970785088d983f8997bec7d122277ab1fc34c291ecc2168fc4846e94f","observation_id":"01efaaa9-247f-4367-a79c-c84b06dfa9e7","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:18e2f599fc661639bfabaeb2049ce573ea95a2b485bc947dac59cbc16b9476a7","observation_id":"cea9ad86-2eec-40a9-b1fc-b6f130eb5659","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07796","last_updated":"2023-05-16T16:27:08Z","snapshot_observed_at":"2026-08-16T16:08:53.852053Z","submitted_at":"2022-12-13T19:17:36Z","title":"CREPE: Can Vision-Language Foundation Models Reason Compositionally?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07796","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2212.07796","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:262a23991a0c66ae40fa9806b631598020502b9905bfd7668faae721bc446c59","observation_id":"2bf96362-472a-4631-8630-4c90c9fe0ac9","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"02068 16 F","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:69ee4bb762722a157bc7ce769e002a67f6dc1e27d339510f1187ab9bf3bc9285","observation_id":"7e36a2dd-05c6-4277-8236-71f5600a1cee","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02644","last_updated":"2020-10-05T11:20:54Z","snapshot_observed_at":"2026-08-15T11:43:00.993248Z","submitted_at":"2020-04-06T13:09:10Z","title":"Sparse Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.02644","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2004.02644","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:773480238b7e6483fe261f259ec8d21d4c812f250eace2b1650149e5deec796e","observation_id":"bfd9fdad-8a17-4906-86c4-a39fe9ca294e","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (June 2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:2b2d929badb7628a8e20970a3b7f65428894abb8f294aaa03c0db1c354edc626","observation_id":"fdeae959-8e26-4ca6-b34f-774b6c873dd5","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05702","last_updated":"2019-06-12T18:20:25Z","snapshot_observed_at":"2026-08-14T16:32:25.824753Z","submitted_at":"2019-05-14T16:21:34Z","title":"Sparse Sequence-to-Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05702","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/1905.05702","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:2f31be5694758cd822437df78a6b9ea72c55b6004213c3d8868d4eec05b68c55","observation_id":"b8e6b49a-5fea-4d39-8f1b-ac7a1915bb3e","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02328","last_updated":"2025-04-03T07:04:56Z","snapshot_observed_at":"2026-08-16T12:44:22.939996Z","submitted_at":"2025-04-03T07:04:56Z","title":"Refining CLIP's Spatial Awareness: A Visual-Centric Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02328","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2504.02328","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:42b6b254cb704371b7d7c26e98e7ff91580eb2c6ddaca9bb8be1b604a362f970","observation_id":"add2e408-66f8-4a4f-a2f9-9c6cf6edbb27","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"ICML (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:ac407779d9d1277d3661ebdce6d51d046acffd93040a9c9bc033707a530a0b07","observation_id":"6c66253d-ea31-4abd-8861-e0ce8c948771","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09996","last_updated":"2023-08-22T01:40:44Z","snapshot_observed_at":"2026-08-17T01:06:05.476094Z","submitted_at":"2022-10-18T17:01:35Z","title":"Perceptual Grouping in Contrastive Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09996","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2210.09996","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:3f3fca862f7b61b2515fef7c087f16784040fb75861347b4feee79d7626822c6","observation_id":"96d56fde-0d17-4a14-89de-2ab5c661be13","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08268","last_updated":"2024-07-11T08:12:16Z","snapshot_observed_at":"2026-08-16T18:20:04.601363Z","submitted_at":"2024-07-11T08:12:16Z","title":"Explore the Potential of CLIP for Training-Free Open Vocabulary Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08268","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2407.08268","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:7093fa5573a27bfe770684a86b2b49de1549b3f7b60df74536df07b2948ea4e8","observation_id":"04e98a8f-7155-41c9-bc6c-c14977b55eae","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:b113f1962cb6ea055b75a3d35d719d12f7108a2e8504977a1df1962fd727b3b8","observation_id":"0720ea1c-4fbb-4dbb-ac2f-1fc6056db84c","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09418","last_updated":"2019-06-07T14:00:58Z","snapshot_observed_at":"2026-08-14T16:28:06.194757Z","submitted_at":"2019-05-23T01:13:24Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09418","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/1905.09418","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:4d13b6d9b663669ab2fbd8b218c52b06f6a26feb543b16ea0caaa61671b9d5c5","observation_id":"4f24a196-1fc1-434b-9fb9-d7a0dc38c51b","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01597","last_updated":"2024-10-26T15:58:10Z","snapshot_observed_at":"2026-08-16T14:38:00.694387Z","submitted_at":"2023-12-04T03:18:46Z","title":"SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01597","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"arXiv preprint arXiv:2312.01597 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2312.01597","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:a2e8e48bbfd9439bd9953644d13502ea60ff52f5d7fe60406dec44254bd206de","observation_id":"ecf2435e-9775-47b6-8ef4-e92d53dad321","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-17T19:34:59.417167Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:91ff024252103c4493da41a7b1cb1aabbf8d8c8548e8ce35d54914b8b5aaeae7","observation_id":"a5e2d96e-839b-4c66-8d91-8236e72a6bec","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"In: CVPR (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:051c2b26910c58dc89d3d205a6817e7ce60d2b5a54c4d292c71cf0e5e0390194","observation_id":"d9e20162-6e9d-4646-8a95-6e69b1c01097","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:507db9f51e9965a1a4c342303f4ad534d9d21aaad9505837aeecbc9d37056b65","observation_id":"7d8bd39a-bf69-4d85-b141-f968ba167baa","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-18T16:07:44.010497Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:670c33faef4a55e9c2a9049768fd1a344ae49164732340b4f432048cc38595b4","observation_id":"6a0b2fbd-b3b5-42cb-b2ee-62af29f5c5bd","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:20a015f48f518764d87f565f4fced8e0a8d3544601307960ad22f784a569b3a5","observation_id":"650b78ed-1640-4cff-8551-45b1b74f6393","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:06472e04fc27d8da9527666da6d2b3e9a13a15bcd42dac3f46c1642e4e37acf7","observation_id":"7afc5517-19f4-43d8-86c1-000569b96145","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01189","last_updated":"2025-01-08T07:59:53Z","snapshot_observed_at":"2026-08-16T13:46:48.183741Z","submitted_at":"2024-06-03T10:51:43Z","title":"MultiMax: Sparse and Multi-Modal Attention Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01189","snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"cited_paper":"/paper/2406.01189","citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:4493d9f8461427417afdfef4108720c3dacc1a4bced95a7ecaaa15bc8ead96ee","observation_id":"d7781360-738b-4c6f-9a18-8022ea2e36dd","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T15:51:57.429693Z","title":"arXiv (2026).https://doi","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T15:51:57.429693Z"},"links":{"citing_paper":"/paper/2607.07135"},"observation_digest":"sha256:14ffa10b9f6783170bfaefc4f82fc3eefb14a347dbaaa8b941f475279acba8fb","observation_id":"19d2bf2d-cc41-4785-aee4-b2553028fae5","resolution":{"observed_at":"2026-07-14T15:51:57.429693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.07135","last_updated":"2026-07-13T05:58:12Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T04:09:56.377276Z","submitted_at":"2026-07-08T08:30:48Z","title":"Sparse Attention for Dense Open-Vocabulary Prediction in CLIP"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2607.07135."}