{"as_of":"2026-08-07T16:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b292a60656b469269278e692acf8e1e4ac6f0ffece4634255ea94654ca6addb","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:11:51.717772Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03683/citation-record","integrity":"/paper/2507.03683/integrity","json":"/paper/2507.03683/citation-record.json","paper":"/paper/2507.03683"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-07-06T05:13:30.860932Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-06T20:11:48.623426Z","title":"Understanding intermediate layers using linear classifier probes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.623426Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:728eb0d2d2ea9b4033bd333d5337a41cd9eae8b59b0c0d0a30631129d8a16036","observation_id":"72fcb7d1-1878-4a5b-987a-7a8956bbd1b7","resolution":{"observed_at":"2026-08-06T20:11:48.623426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.674241Z","title":"Conditioned and composed image retrieval combining and partially fine-tuning CLIP-based features","venue":null,"work_id":"4d7a8add-3cf8-4722-aa58-11709cfc9f48","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.662843Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:32a18fb0287dc4d4e7d014168624f15b88d9cea709adca3b28cc499ece9ea12a","observation_id":"72f8616e-862e-4547-92c6-4f8ae4d82f13","resolution":{"observed_at":"2026-08-06T20:11:53.679728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17142","last_updated":"2025-03-21T13:46:53Z","snapshot_observed_at":"2026-08-07T12:07:43.429339Z","submitted_at":"2025-03-21T13:46:53Z","title":"Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2503.17142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.17142","snapshot_observed_at":"2026-08-06T20:11:53.133484Z","title":"Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models","venue":"cs.CV","work_id":"a6245f06-c6b2-4204-a5ac-26d0023decf2","year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.742002Z"},"links":{"cited_paper":"/paper/2503.17142","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:a57e23abc61ff1a12a31ed9524bc4bd5c543763e66e63660cc61ba67fc960080","observation_id":"671d080d-4f91-48ef-b91b-bc3ff30dd0f1","resolution":{"observed_at":"2026-08-06T20:11:53.140579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.658635Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","venue":null,"work_id":"b323ea1f-d24f-480e-9af9-5e011207a289","year":2020},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.803202Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:baa84cf4cafe7bfeac988d822da23b460fd74bc02d1d2694d766e48554646d65","observation_id":"82b92998-93e2-45a5-9a65-d480c670884b","resolution":{"observed_at":"2026-08-06T20:11:53.663979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.641568Z","title":"Deep Learning for Instance Retrieval: A Survey","venue":null,"work_id":"b47c1d7e-e474-4488-a35c-224391c73e42","year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.894792Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:02d8ce684265a703902fc5dde88a1d1e1c56d3babcc9cb26b801f91efb61ee9b","observation_id":"511cf3cc-d07f-4c12-a0ae-b1d11993093b","resolution":{"observed_at":"2026-08-06T20:11:53.647220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.624653Z","title":"Deep learning for instance retrieval: A survey","venue":null,"work_id":"1395c446-5f13-4ce9-b55f-1af1204787e0","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:48.981497Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:0ae6af7df690692445faaed4c7935a72f5ff5030faefb6ad111334a962a8c22a","observation_id":"0208f5c9-189e-4893-a53b-1e5093e7b4a4","resolution":{"observed_at":"2026-08-06T20:11:53.630656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:49.072090Z","title":"Composition Loss for Counting, Density Map Estimation and Localization in Dense Crowds","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.072090Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:995c0483baaddf345b633e76ba0ecfa830e0405fb0548aabc671870f2351573b","observation_id":"af97d169-f7c6-4cc0-8ed5-efa72c98a39c","resolution":{"observed_at":"2026-08-06T20:11:49.072090Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09172","last_updated":"2024-01-18T17:13:21Z","snapshot_observed_at":"2026-08-06T01:14:41.681744Z","submitted_at":"2023-04-18T17:59:45Z","title":"Hyperbolic Image-Text Representations","version":3},"cited_work":{"arxiv_id":"2304.09172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.09172","snapshot_observed_at":"2026-08-06T20:11:53.106483Z","title":"Hyperbolic Image-Text Representations","venue":"cs.CV","work_id":"309995b8-45c2-499a-a2cb-ece0375f373e","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.128084Z"},"links":{"cited_paper":"/paper/2304.09172","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:b42606cf9692a973c5cf6cddc9c1714edeb42c2a0172a8fdba49ae17f2c5df25","observation_id":"94a871ac-e6e3-41c2-b3b3-06ddd5a78bde","resolution":{"observed_at":"2026-08-06T20:11:53.112878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T20:11:49.229769Z","title":"arXiv:2010.11929","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.229769Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:8c27a76f740215e9b4aa2348de61b2878bd6a022fde8cce19dd8e21df80b0650","observation_id":"2d825a8c-c3ea-4a01-a78d-877669bf5ce3","resolution":{"observed_at":"2026-08-06T20:11:49.229769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03574","last_updated":"2024-08-07T06:26:04Z","snapshot_observed_at":"2026-08-06T02:47:34.343973Z","submitted_at":"2024-08-07T06:26:04Z","title":"Teach CLIP to Develop a Number Sense for Ordinal Regression","version":1},"cited_work":{"arxiv_id":"2408.03574","doi":"10.48550/arxiv.2408.03574","metadata_source":"pith","pith_arxiv_id":"2408.03574","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Teach CLIP to Develop a Number Sense for Ordinal Regression","venue":"cs.CV","work_id":"dd4cc20d-ec5d-4f30-b0c0-3fe48d0b3e88","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.329152Z"},"links":{"cited_paper":"/paper/2408.03574","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:33127de870f778b742246128e70b1eb28168e24cabace062de46b5221682a3c3","observation_id":"b6cc826c-934f-489b-94e1-f44b9422ddc1","resolution":{"observed_at":"2026-08-06T20:11:52.059438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/6906255","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.079846Z","title":"Age and Gender Estimation of Unfiltered Faces","venue":null,"work_id":"0ff40bc1-2906-4478-9ae9-1b44716b9e98","year":2014},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.450137Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:8720299088e3d5049e4e3453a4ddf41bc20d8e987bed6c55ec62bdad00f3237d","observation_id":"8883acf4-b68b-4343-903e-8706086d6021","resolution":{"observed_at":"2026-08-06T20:11:53.088420Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-08-06T20:11:49.531103Z","title":"Its Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.531103Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:b8de18fbac05a089bf0edd277c62e262d1568caa0284d212c5c63bb5b6fbc758","observation_id":"9cfaf071-0d3c-4582-83b4-b5dd8d280749","resolution":{"observed_at":"2026-08-06T20:11:49.531103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.608040Z","title":"Heterogeneous face attribute estimation: A deep multi-task learning approach","venue":null,"work_id":"83d56901-2879-4ae6-bd9b-076360896086","year":2017},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.721697Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:970ca146c6314af17a67f3232b561c2f8932a487b2dd775f8e1e75c08b51e865","observation_id":"9dd7610a-3d37-4134-a268-e1343c54c0f3","resolution":{"observed_at":"2026-08-06T20:11:53.613502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:49.805256Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.805256Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:8a089100446a4d5262cdd04a38ce933eb316b851e8544032fe79f6c8830c68d2","observation_id":"477da1c2-50ff-4f16-8b1d-05c3201567d5","resolution":{"observed_at":"2026-08-06T20:11:49.805256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.592201Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":"61342aea-6220-4f7c-b42c-c10a5e842cfc","year":1989},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:49.928316Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:d07e63d78aa859ba0d43755c85b509d5743bc0e828810fe8258ec26f97174aee","observation_id":"307ea798-7ea6-4281-aa6e-2432bac0103f","resolution":{"observed_at":"2026-08-06T20:11:53.597532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.577335Z","title":"KonIQ-10k: An Ecologically Valid Database for Deep Learning of Blind Image Quality Assessment","venue":null,"work_id":"644dc0f8-09e1-4f4b-8b84-30f7d620a49f","year":2020},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.055806Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:52c9ff13ca7932f8fcbba056448a6d1a8451db059a027ee8cfb85a2122d0656b","observation_id":"bb2b5fda-2abe-47f1-b5e9-2c4c8f7635f0","resolution":{"observed_at":"2026-08-06T20:11:53.582027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.560926Z","title":"Lp++: A surprisingly strong linear probe for few-shot clip","venue":null,"work_id":"5301adc2-2e38-4fb3-9dae-72b501aff1d6","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.309455Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:79dfe2dd443770a27db75df9bd2f0afec5f63ceba1fec658083d92c40a2bae73","observation_id":"97fb22fc-96d4-4760-9b18-e002309f4483","resolution":{"observed_at":"2026-08-06T20:11:53.566871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-06T20:11:50.427501Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.427501Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:837a8965343f1ff86a9bdf76bf2af011c34ee94e713f5db14795efe409699464","observation_id":"9d9125c5-7393-4fdd-90fd-9213f230accf","resolution":{"observed_at":"2026-08-06T20:11:50.427501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:50.544893Z","title":"CLIP-Count: Towards Text-Guided Zero- Shot Object Counting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.544893Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:c93511d0ceb4029fcb82954eaa417bb62f44269750414966a54e99dc0f048e5b","observation_id":"1e02910c-73b7-4adf-a889-8aa29d70c8f0","resolution":{"observed_at":"2026-08-06T20:11:50.544893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.539735Z","title":"Hyperbolic Image Embeddings","venue":null,"work_id":"80b93f4e-063c-4fe1-a986-4be2ecee885b","year":2019},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.625607Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:0081ab0d786f6931d4dafd6da3c9ec9748484db4ef53fa00f21fef6b89a7c007","observation_id":"22adfc6d-f764-4110-8eea-9146e82b38b7","resolution":{"observed_at":"2026-08-06T20:11:53.549000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16837","last_updated":"2025-01-13T05:04:59Z","snapshot_observed_at":"2026-07-31T01:26:58.071569Z","submitted_at":"2024-07-23T21:02:38Z","title":"MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16837","snapshot_observed_at":"2026-08-06T20:11:50.693133Z","title":"CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.693133Z"},"links":{"cited_paper":"/paper/2407.16837","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:8f6317c9d8815eb924370331d50fd9f4cfcf07a1867f71b30000e31242218d2d","observation_id":"86d92a71-4aea-4f83-ad09-41ba0cd792a0","resolution":{"observed_at":"2026-08-06T20:11:50.693133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.523978Z","title":"Interpretability beyond feature attribution: Quantitative testing with concept activation vectors (tcav)","venue":null,"work_id":"72ca0797-b67c-45fd-8988-8dce7633cc63","year":2018},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.813651Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:35585ddf7eaeaecc59a489aba3240838c95280709d15c284cc26737ddd3093c7","observation_id":"4c0d978c-48c2-461d-9110-e11b77b6153b","resolution":{"observed_at":"2026-08-06T20:11:53.529295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:50.960886Z","title":"CLIP Behaves like a Bag-of-Words Model Cross-modally but Not Uni-modally","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.960886Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:8b728b658a927026a0e44e00fd116c2e91e0c5506c5373eb4ad4b7d31241630a","observation_id":"d74f666a-fe1f-4221-be11-5cb58b0a6fd4","resolution":{"observed_at":"2026-08-06T20:11:50.960886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.002032Z","title":"CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.002032Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:d4ff88b06092d6bc6885d3588b6b2d2227107375f1f99603781f3f39e4ad9e1e","observation_id":"de4d0571-cc07-4331-a0c2-034a6b53f7b1","resolution":{"observed_at":"2026-08-06T20:11:51.002032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.506390Z","title":"Beyond a Pre-Trained Object Detector: Cross-Modal Textual and Visual Context for Image Captioning","venue":null,"work_id":"064740ce-7ac4-4469-b0c0-c02627fb7b0b","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.033881Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:0fc81bd5207b58e6d97d0e3775fe7dca9887ce4f4a0df695982a37247c05bc65","observation_id":"d160e3ef-edc5-4886-b0e0-5c3704ab4ed2","resolution":{"observed_at":"2026-08-06T20:11:53.512741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04616","last_updated":"2023-09-22T14:03:08Z","snapshot_observed_at":"2026-08-03T15:23:32.687072Z","submitted_at":"2023-07-10T14:58:10Z","title":"MiVOLO: Multi-input Transformer for Age and Gender Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04616","snapshot_observed_at":"2026-08-06T20:11:51.039704Z","title":"MiVOLO: Multi-input Transformer for Age and Gender Estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.039704Z"},"links":{"cited_paper":"/paper/2307.04616","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f9b1b434c2c50b8dbddb4f1d25cdb1337d026649b004df6426daece0b7891557","observation_id":"c5ada6c4-84e0-41ad-b510-1f10d8b09f98","resolution":{"observed_at":"2026-08-06T20:11:51.039704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14517","last_updated":"2025-05-24T16:17:18Z","snapshot_observed_at":"2026-07-06T19:54:00.822571Z","submitted_at":"2024-11-21T16:27:22Z","title":"The Double-Ellipsoid Geometry of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14517","snapshot_observed_at":"2026-08-06T20:11:51.045027Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.045027Z"},"links":{"cited_paper":"/paper/2411.14517","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f12dabd0b09c15714e425514e686f41a482868aa0ffa1cd5392f6fbe055b22cb","observation_id":"9e393176-8412-4a5a-816e-ea283721eaac","resolution":{"observed_at":"2026-08-06T20:11:51.045027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10537","last_updated":"2024-08-30T04:51:28Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:46:28Z","title":"Does CLIP Bind Concepts? Probing Compositionality in Large Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10537","snapshot_observed_at":"2026-08-06T20:11:51.071811Z","title":"Does clip bind concepts? probing compositionality in large image models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.071811Z"},"links":{"cited_paper":"/paper/2212.10537","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f4797b535f16321319873a9cfdd36fed80ad7c0a32b46c30df9d229243fd821d","observation_id":"4d502446-6440-47de-b3a7-37f7735ac5f9","resolution":{"observed_at":"2026-08-06T20:11:51.071811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.489819Z","title":"Align before fuse: Vision and language representation learning with mo- mentum distillation","venue":null,"work_id":"0a539a8c-b955-47d0-b6ed-ec32514ce199","year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.171974Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:a3d43c4d7f04c8d2682f238d45586bb0b98495bf16a5b4faed6c8826195a6972","observation_id":"2624fd97-d6cf-4533-b4f8-02e1e764d3dd","resolution":{"observed_at":"2026-08-06T20:11:53.494930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.473160Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision- Language Understanding and Generation","venue":null,"work_id":"f5327923-6af3-4940-9e9f-730940c0f4bc","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.232772Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:12a2582a24492ba30bea14237b100ede82705ea114eee3e663142f12a07050e2","observation_id":"bf413c30-217d-4123-95e4-6fe4efb58ffe","resolution":{"observed_at":"2026-08-06T20:11:53.478419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02338","last_updated":"2022-10-01T13:45:55Z","snapshot_observed_at":"2026-08-05T13:34:20.335749Z","submitted_at":"2022-06-06T03:54:53Z","title":"OrdinalCLIP: Learning Rank Prompts for Language-Guided Ordinal Regression","version":2},"cited_work":{"arxiv_id":"2206.02338","doi":"10.48550/arxiv.2206.02338","metadata_source":"pith","pith_arxiv_id":"2206.02338","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"OrdinalCLIP: Learning Rank Prompts for Language-Guided Ordinal Regression","venue":"cs.CV","work_id":"f012a182-91c9-411d-8f5f-8c1ed69e3bb6","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.302801Z"},"links":{"cited_paper":"/paper/2206.02338","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:450d8a2f0145de8dc1dbd7b6b205e9b729f0b1fad6e1897f84d726ed56a8160e","observation_id":"f366b8f4-65fd-4e5b-8ae5-52c09621ca3b","resolution":{"observed_at":"2026-08-06T20:11:51.956760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04231","last_updated":"2023-04-09T12:56:54Z","snapshot_observed_at":"2026-07-06T15:13:44.440390Z","submitted_at":"2023-04-09T12:56:54Z","title":"CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model","version":1},"cited_work":{"arxiv_id":"2304.04231","doi":"10.48550/arxiv.2304.04231","metadata_source":"pith","pith_arxiv_id":"2304.04231","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model","venue":"cs.CV","work_id":"b1d45e2e-5b7c-436d-bc99-46561916db73","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.386439Z"},"links":{"cited_paper":"/paper/2304.04231","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f0042aff1ea6917e3a2b4d7a21f94a5da015926057433ce039ac1b0516c83262","observation_id":"00efac1b-a70d-4467-b8f4-0ba5c81b0c6d","resolution":{"observed_at":"2026-08-06T20:11:51.933505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.456223Z","title":"Beyond comparing image pairs: Setwise active learning for relative attributes","venue":null,"work_id":"8132f5ec-400c-450b-af48-8810ff2a50a4","year":2014},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.467629Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:588f25a6ac2ee2dbac05b1d97b659b7ebdc3728fb5a884b9cf34bd6f990ab94d","observation_id":"ffb1b424-5803-447c-983e-274b6ec42009","resolution":{"observed_at":"2026-08-06T20:11:53.462867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09281","last_updated":"2025-03-25T16:47:11Z","snapshot_observed_at":"2026-08-07T16:10:09.018003Z","submitted_at":"2024-03-14T11:08:33Z","title":"CLIP-EBC: CLIP Can Count Accurately through Enhanced Blockwise Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09281","snapshot_observed_at":"2026-08-06T20:11:51.500131Z","title":"CLIP-EBC: CLIP Can Count Accurately through Enhanced Blockwise Classification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.500131Z"},"links":{"cited_paper":"/paper/2403.09281","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f60bbf232d9f3db3418d67e71a9e2f27a2260303286fc3bc974d15b63844b04a","observation_id":"9cdd71ea-a5ce-4033-93fd-6d02518fd554","resolution":{"observed_at":"2026-08-06T20:11:51.500131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T20:11:51.511161Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.511161Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:89b05099011a786ca7635d9c3532428f0efc3a68dbbeec842c7ddcfaebce83c5","observation_id":"ca8ccce3-3a66-418b-96d1-4e4cd7f48a02","resolution":{"observed_at":"2026-08-06T20:11:51.511161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.516129Z","title":"A V A: A Large-Scale Database for Aesthetic Visual Analysis","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.516129Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:3964dccadd1645197c72a243e7b566689f88cf1d161960a840fdb00e70b87a71","observation_id":"ead6e43e-4d76-4484-8b92-a25d7b2ded35","resolution":{"observed_at":"2026-08-06T20:11:51.516129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.435049Z","title":"A metric learning reality check","venue":null,"work_id":"56a22358-1022-4d2d-877e-23f8800f2480","year":2020},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.520788Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:6ba2af7aa5210ed56980ff1a6aa8e8c310e3a76ec8d3579dc100e62b614ee146","observation_id":"55c49fff-8449-4320-8028-83eba01abd3f","resolution":{"observed_at":"2026-08-06T20:11:53.441046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14053","last_updated":"2023-11-12T20:17:47Z","snapshot_observed_at":"2026-08-03T16:44:35.384738Z","submitted_at":"2023-05-23T13:32:19Z","title":"Parts of Speech-Grounded Subspaces in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2305.14053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14053","snapshot_observed_at":"2026-08-06T20:11:52.528058Z","title":"Parts of Speech-Grounded Subspaces in Vision-Language Models","venue":"cs.CV","work_id":"9ca9943e-01b7-4ef5-83c9-003cd72b5788","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.526319Z"},"links":{"cited_paper":"/paper/2305.14053","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:d4d5b0196c94783eb7dc28b6a9ddfafb836d6820aab42d480552821cd983f7de","observation_id":"f8ee04c5-2aa8-46e1-be7d-9572b7fa1707","resolution":{"observed_at":"2026-08-06T20:11:52.533367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T20:11:51.531605Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.531605Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:2f7a436c50d030b47b12ec4c6e3300390d07f55d68458731bd161b55790a7a64","observation_id":"18e7cfd6-4087-4ef9-beec-b45a1a211e6a","resolution":{"observed_at":"2026-08-06T20:11:51.531605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12066","last_updated":"2023-02-23T14:43:53Z","snapshot_observed_at":"2026-08-01T17:01:08.275374Z","submitted_at":"2023-02-23T14:43:53Z","title":"Teaching CLIP to Count to Ten","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12066","snapshot_observed_at":"2026-08-06T20:11:51.537121Z","title":"Teaching CLIP to Count to Ten","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.537121Z"},"links":{"cited_paper":"/paper/2302.12066","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:123347f72e03d2cd2df9c5c542ae30db87f1eb2099651772c1f5603f5db183d5","observation_id":"bd3a1569-da58-45a3-826f-5ab8b6110eaf","resolution":{"observed_at":"2026-08-06T20:11:51.537121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.542600Z","title":"Dating Historical Color Images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.542600Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:a0538da1c891eaa434962accbadd03d09697e1499d16c873381fbe6efbb4f3b6","observation_id":"75fa21f4-3934-4458-8b3d-b3fd6aaebe20","resolution":{"observed_at":"2026-08-06T20:11:51.542600Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.548487Z","title":"Relative Attributes","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.548487Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:9f6a2230dea28313d02343ac33211b429795b131c353d8b87f99e76018b699e4","observation_id":"5e8fa665-8c00-4a0b-b22f-f10365a35b98","resolution":{"observed_at":"2026-08-06T20:11:51.548487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.416787Z","title":"HYDEN: Hyperbolic Density Representations for Medical Images and Re- ports","venue":null,"work_id":"d0f2b7bf-6f5f-4485-b73f-78e8773355b8","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.553683Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:07a9ee6b0dfad2f37341ad1ed7c71e917659eaa84021c4079d1272c2c616e076","observation_id":"0babb719-b950-468c-a839-5b56f2279032","resolution":{"observed_at":"2026-08-06T20:11:53.422955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T20:11:51.559058Z","title":"Learning Transferable Visual Models From Natural Language Supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.559058Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:62b13796e188f4f017a20bdbd68e4c03b1b989e28fabbac3fa8849ed3bdfae6d","observation_id":"a0e88aef-b4aa-4aff-90ec-4a7203a7dd5e","resolution":{"observed_at":"2026-08-06T20:11:51.559058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.398356Z","title":"Learning Transferable Visual Models From Natural Language Super- vision","venue":null,"work_id":"73e577fa-9203-41ec-8762-43be56141984","year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.564088Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:5924cc337b3011b3286afd5ccaf1f59093d9f067a0bdae8a4c4c2f3f6f7ce646","observation_id":"025ec07b-d7e3-459d-99a9-9abf9a1a44e9","resolution":{"observed_at":"2026-08-06T20:11:53.404122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.569573Z","title":"Steering Llama 2 via Contrastive Activation Addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.569573Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:91f2b2c9e37108e487d0177df18a0a96d7ddfd55f34494eb9e0041f1ffc8f324","observation_id":"e2d4c7c3-cb2a-4eed-bf32-218603569642","resolution":{"observed_at":"2026-08-06T20:11:51.569573Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09721","last_updated":"2025-07-04T18:25:46Z","snapshot_observed_at":"2026-07-31T17:58:05.096612Z","submitted_at":"2024-09-15T13:02:14Z","title":"Finetuning CLIP to Reason about Pairwise Differences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09721","snapshot_observed_at":"2026-08-06T20:11:51.575686Z","title":"Finetuning CLIP to Reason about Pairwise Differences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.575686Z"},"links":{"cited_paper":"/paper/2409.09721","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:5cadbdc4fd59bca1c933714ffad178148e6dbdb75bd6be1df9eb23e4987fc2c6","observation_id":"fe3b8e31-c769-4e73-ae32-dd0e949665a4","resolution":{"observed_at":"2026-08-06T20:11:51.575686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1106.35922","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:52.382060Z","title":"Improving Image Encoders for General-Purpose Nearest Neighbor Search and Classification","venue":null,"work_id":"17b96a05-1ac5-43f4-99f4-15cab2ad3995","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.583085Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:1cec74c1e37da54c01878430efc65c2a5db8bfa8074910d5624fdf123e51b6b3","observation_id":"3fd03dbe-f488-4d9f-be8d-8c43e02a1b47","resolution":{"observed_at":"2026-08-06T20:11:52.391746Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.380885Z","title":"Linear Representations of Sentiment in Large Language Models","venue":null,"work_id":"56ba7a58-ea17-4b21-a315-06467e97bb51","year":null},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.588973Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:683645b46ebcfe3c1e6f34d49e455b46676406854afac4b9e8d5277c7e13bfc7","observation_id":"bae4703a-499c-46ee-8035-7a7ab5c85cd7","resolution":{"observed_at":"2026-08-06T20:11:53.386329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.361436Z","title":"Linear Spaces of Meanings: Compositional Structures in Vision- Language Models","venue":null,"work_id":"37adf8f0-210d-4299-a4f1-bff2b25133d3","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.601038Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:feb5b4ecdfa3e0c84729f155ff4790642ad4791a689e2fd83fa2ca8f52673c5e","observation_id":"3238f178-81da-4011-99c2-d6fe4be79ac2","resolution":{"observed_at":"2026-08-06T20:11:53.368075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.342333Z","title":"Deep image prior","venue":null,"work_id":"33199b1a-7b22-4b12-b01e-947e3376316e","year":2018},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.607467Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:e8142bdd0fc2598cd84163abb31c0a16ebd7653d369faa7ff9cd8982c3ea4b65","observation_id":"1b0cdd12-01f9-4d10-9361-19f08ebb1ee4","resolution":{"observed_at":"2026-08-06T20:11:53.348792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.322381Z","title":"BEYOND DECODABILITY: LIN- EAR FEATURE SPACES ENABLE VISUAL COMPOSITIONAL GENERALIZATION","venue":null,"work_id":"75a1b4ce-9dcd-4137-8ff3-24472d53fdbd","year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.612865Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:28d56dfdc01af95ba9cb740861910d07f6c2cf9e10e288fe8cc0ff6b7ff9d04a","observation_id":"e4fe7ec6-2185-47a2-af26-0d7a5a3c787e","resolution":{"observed_at":"2026-08-06T20:11:53.330263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.301994Z","title":"Intermediate Layer Classifiers for OOD Generalization","venue":null,"work_id":"eac312eb-ed6b-4878-94fe-49ef22af9fb6","year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.617981Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:031df03410ec1392899ceabdc6e76a7d1a7f24f952449f277efb4629f377d89f","observation_id":"4230b46f-7018-4a08-8e07-12086fe5af61","resolution":{"observed_at":"2026-08-06T20:11:53.308628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06361","last_updated":"2016-03-01T08:23:50Z","snapshot_observed_at":"2026-08-05T16:11:51.753007Z","submitted_at":"2015-11-19T20:56:14Z","title":"Order-Embeddings of Images and Language","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06361","snapshot_observed_at":"2026-08-06T20:11:51.623271Z","title":"Order-Embeddings of Images and Language","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.623271Z"},"links":{"cited_paper":"/paper/1511.06361","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:2e479a4e541346c11a076f9687e11d15a699b1e7acf686e154800d9b45d14f50","observation_id":"9247635d-3ab4-46b7-847f-bf53ff49548e","resolution":{"observed_at":"2026-08-06T20:11:51.623271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.628732Z","title":"Exploring CLIP for Assessing the Look and Feel of Images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.628732Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:d8408ee9d0d3c6e6d7de149971bc1498cbf898b673118ebc48cea3ee036e1e86","observation_id":"6b5e8000-421a-459c-a408-8b76f589aed6","resolution":{"observed_at":"2026-08-06T20:11:51.628732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.284487Z","title":"Learning-to-Rank Meets Language: Boosting Language-Driven Ordering Alignment for Ordinal Classification","venue":null,"work_id":"54420b90-ddc8-4846-b1c6-0374940a8e0a","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.634171Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:2a63c82caee4bcc97b8d2d0e2ed921b6b86f48b57095ed86c95ed6ba66895aee","observation_id":"936ac420-362e-4fbf-8e94-e91a8469f375","resolution":{"observed_at":"2026-08-06T20:11:53.290182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.265577Z","title":"Learning-to-rank meets language: Boosting language-driven ordering align- ment for ordinal classification","venue":null,"work_id":"718321d1-d21a-464b-a1e5-2c8270722896","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.640208Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:c9d664024bde41a666b9b706250ea5ffcd83530288aae782686b75915d43ff2b","observation_id":"e4732314-04f8-4044-ba8f-e92acfb33c58","resolution":{"observed_at":"2026-08-06T20:11:53.271360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.10242","last_updated":"2022-08-15T22:04:26Z","snapshot_observed_at":"2026-07-06T09:22:05.728894Z","submitted_at":"2020-05-20T17:59:57Z","title":"Understanding Contrastive Representation Learning through Alignment and Uniformity on the Hypersphere","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.10242","snapshot_observed_at":"2026-08-06T20:11:51.646034Z","title":"Understanding Contrastive Representation Learning through Alignment and Uniformity on the Hypersphere","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.646034Z"},"links":{"cited_paper":"/paper/2005.10242","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:92a742460b5749226498552a6376de16ba6bda4d6d84da2180d48a929500e91d","observation_id":"be34882b-7800-4c43-bc56-e814d8e5511c","resolution":{"observed_at":"2026-08-06T20:11:51.646034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.246012Z","title":"Disentangled representation learning","venue":null,"work_id":"b393d0e9-f587-438a-95df-9829a574e447","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.651508Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:e5d37340d4ed73cba0a94560e56e1b66daedd4d1513f219ccc64556a871b89fe","observation_id":"6f1bb15f-0122-4804-9671-9633a12c7e06","resolution":{"observed_at":"2026-08-06T20:11:53.252755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00808","last_updated":"2023-01-02T18:59:31Z","snapshot_observed_at":"2026-08-07T12:06:27.093475Z","submitted_at":"2023-01-02T18:59:31Z","title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00808","snapshot_observed_at":"2026-08-06T20:11:51.656002Z","title":"ConvNeXt V2: Co-designing and Scaling ConvNets with Masked Autoen- coders","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.656002Z"},"links":{"cited_paper":"/paper/2301.00808","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:220bf9bd9327811a8c9fcbccde300ee029e0f98e30f718b1f27256d872b35f31","observation_id":"f0ff0cf9-3c50-4858-9037-a99cb6c6d5d9","resolution":{"observed_at":"2026-08-06T20:11:51.656002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15640","last_updated":"2025-08-02T13:50:28Z","snapshot_observed_at":"2026-08-07T12:22:09.338042Z","submitted_at":"2023-07-28T16:00:21Z","title":"CLIP Brings Better Features to Visual Aesthetics Learners","version":2},"cited_work":{"arxiv_id":"2307.15640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.15640","snapshot_observed_at":"2026-08-06T20:11:52.242928Z","title":"CLIP Brings Better Features to Visual Aesthetics Learners","venue":"cs.CV","work_id":"c815e581-cd5d-4437-8a94-358a68204f2d","year":2023},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.661258Z"},"links":{"cited_paper":"/paper/2307.15640","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:3d8c7bdab21cbc7cac2e991eb900a26dba8efec83b4853ccb1f49df9455073b5","observation_id":"c36c12cd-79c4-42e7-a276-151ea491f4ee","resolution":{"observed_at":"2026-08-06T20:11:52.250347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T20:11:51.667082Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.667082Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f7c9494713bfa09a5478de6ebf9adcbd70e6cccb20abf4aee26b5b38167cf94e","observation_id":"2dd22aa8-820d-4c84-b04a-02be321730dd","resolution":{"observed_at":"2026-08-06T20:11:51.667082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.227372Z","title":"Just noticeable differences in visual attributes","venue":null,"work_id":"8e403aca-2ac9-41a5-9005-57e45e995839","year":2015},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.673658Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:a0b8e1e33d011f59132493ac49971c2065868d4b8ad3ac1d2bef7dc6c84b267d","observation_id":"01c94fe3-87ce-4cef-8ba2-51249241ef8a","resolution":{"observed_at":"2026-08-06T20:11:53.233523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.210499Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":null,"work_id":"bebd1fe0-17e6-4fd6-8fae-9212bd9b003b","year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.679214Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:523b3fdaebe546926b03158324de046d44dd3a78ed51b229c954b62bd5c4fd7a","observation_id":"82ad9c1e-42a9-416c-b056-06aac0007fb0","resolution":{"observed_at":"2026-08-06T20:11:53.216137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.195321Z","title":"RANKING-AWARE ADAPTER FOR TEXT-DRIVEN IMAGE OR- DERING WITH CLIP","venue":null,"work_id":"1fe6bda1-2e9d-4f00-a760-cf516304e049","year":2025},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.684176Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:0695cd0a674a1c4f1e48ffa09cbd1eb5223e8d9ae54d9f49d845c89059e61fa0","observation_id":"db9bfc04-6741-4d31-9d31-7c52aab8b687","resolution":{"observed_at":"2026-08-06T20:11:53.200041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06760","last_updated":"2025-02-08T03:25:39Z","snapshot_observed_at":"2026-07-06T20:04:06.216583Z","submitted_at":"2024-12-09T18:51:05Z","title":"Ranking-aware adapter for text-driven image ordering with CLIP","version":3},"cited_work":{"arxiv_id":"2412.06760","doi":"10.48550/arxiv.2412.06760","metadata_source":"pith","pith_arxiv_id":"2412.06760","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Ranking-aware adapter for text-driven image ordering with CLIP","venue":"cs.CV","work_id":"ab717cd3-a6f9-49b2-a6e0-5e4710415f31","year":2024},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.689502Z"},"links":{"cited_paper":"/paper/2412.06760","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:9ce960ae4a4292136fd364671bf9ae8fd4a96e6b07f5d20125c4a6f9a3e025ad","observation_id":"3f14a96a-9b7b-416c-97c0-65bfe82f4afc","resolution":{"observed_at":"2026-08-06T20:11:51.801956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01936","last_updated":"2023-03-23T23:21:38Z","snapshot_observed_at":"2026-08-03T09:40:32.201832Z","submitted_at":"2022-10-04T22:13:25Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01936","snapshot_observed_at":"2026-08-06T20:11:51.695389Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.695389Z"},"links":{"cited_paper":"/paper/2210.01936","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:615b60f6c02f2e34014c7367e45cd9bc8b4a287f8b05372c25b0837232bb6826","observation_id":"3ed8fddf-ba6d-48cb-8c12-f3952ea698e1","resolution":{"observed_at":"2026-08-06T20:11:51.695389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:51.701459Z","title":"Single-Image Crowd Counting via Multi-Column Convolutional Neural Network","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.701459Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:f3b683ff22db690ed501e4293b08fc45b8dcc9ccb219b828e5cca4afd8c46596","observation_id":"68d75df2-e218-4e43-b214-cd4e2f6db13d","resolution":{"observed_at":"2026-08-06T20:11:51.701459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/7780439","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:52.177893Z","title":null,"venue":null,"work_id":"ee48395c-afc4-4fdf-bcc9-c40c233f0c6f","year":null},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.706634Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:3cf6f2aa0f89e9296f3190d4cc2b1b43a1fa23ef3200a5ab3eb651086d0f94bd","observation_id":"ef6fcadf-a217-4378-ae55-e1e091615786","resolution":{"observed_at":"2026-08-06T20:11:52.187722Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:53.176133Z","title":"Learning Ordinal Relationships for Mid-Level Vision","venue":null,"work_id":"5e621164-8ea6-41cb-983e-055a0219bcbe","year":2015},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.717772Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:ea091be1e0b46c74b1935bc341a938f58506e27e538c1bf3de54a2855cc3659e","observation_id":"e330120c-f2ee-478c-809d-c67b5537b483","resolution":{"observed_at":"2026-08-06T20:11:53.183574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08423","last_updated":"2017-03-28T20:02:15Z","snapshot_observed_at":"2026-07-06T05:31:36.464061Z","submitted_at":"2017-02-27T18:28:58Z","title":"Age Progression/Regression by Conditional Adversarial Autoencoder","version":2},"cited_work":{"arxiv_id":"1702.08423","doi":"10.48550/arxiv.1702.08423","metadata_source":"pith","pith_arxiv_id":"1702.08423","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"Age Progression/Regression by Conditional Adversarial Autoencoder","venue":"cs.CV","work_id":"9d6d34df-2ef5-406a-baf2-161f1f50c72c","year":2017},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.712243Z"},"links":{"cited_paper":"/paper/1702.08423","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:0dc26c9e685845eea239f56791ca1524c8a46ff9aabea69ba5391fb17b2782c1","observation_id":"73c93712-e3f5-4205-97ab-3869d8d60f4d","resolution":{"observed_at":"2026-08-06T20:11:51.767240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15154","last_updated":"2023-10-23T17:55:31Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:55:31Z","title":"Linear Representations of Sentiment in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15154","snapshot_observed_at":"2026-08-06T20:11:51.594734Z","title":"48550 / arXiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.594734Z"},"links":{"cited_paper":"/paper/2310.15154","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:0fd4fe91bec8f7b0a3d9ea02d4c60493a07293fd9685343636fc68f9cf06cd2f","observation_id":"ec1d0391-a4a0-4c85-84d5-c2f4ae582f49","resolution":{"observed_at":"2026-08-06T20:11:51.594734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:11:50.176194Z","title":"DOI: 10.1109/TIP.2020.2967829","venue":null,"work_id":null,"year":1941},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":4056,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:50.176194Z"},"links":{"citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:956bf973fa77fba4cfed62179748c725b0dfed985e6005a9eff3ca03726b1083","observation_id":"7d03c2f3-6c39-41dc-89c0-7120d1ade950","resolution":{"observed_at":"2026-08-06T20:11:50.176194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":3,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":11,"verified_fuzzy":29},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2507.03683."}