{"as_of":"2026-08-08T20:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b52615fd61f712c9a5d1655cd22789ac7e6aa6f1468f3ac5114e05437dae7b5a","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:51:55.185610Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23052/citation-record","integrity":"/paper/2607.23052/integrity","json":"/paper/2607.23052/citation-record.json","paper":"/paper/2607.23052"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.040699Z","title":"H., Kim, Y., and Ghassemi, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.040699Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:f5b6f5946da9f176b2f27d3f381b5a2a020d7c59bd9a35f31be73535f2bf30e7","observation_id":"58a3f014-74e5-45b1-8ce7-25ac52ce3384","resolution":{"observed_at":"2026-08-01T03:51:55.040699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.047256Z","title":"Conceptual 12 M : Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.047256Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:584a4b8838b725fa0bc718bb880a2ac329af8c506b273da45c5c3fe63cf2e443","observation_id":"13533fab-9929-48d4-8652-9622f5cb2882","resolution":{"observed_at":"2026-08-01T03:51:55.047256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.052134Z","title":"K., Winn, J., and Zisserman, A","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.052134Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:d795d772436942bb13bf7d7f1819fa4d7bee349ea81dc8e08d8b8ffa429c7477","observation_id":"aa921af7-d115-45ae-8bea-18dc7d70a05b","resolution":{"observed_at":"2026-08-01T03:51:55.052134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.056791Z","title":"and Kembhavi, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.056791Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:d9327c8f8212389f1c51748833966e8a9759a21a5382754eea4b7f0a6e5fcaee","observation_id":"24551c83-1460-4f98-aeba-40aacfa03330","resolution":{"observed_at":"2026-08-01T03:51:55.056791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.061416Z","title":"SugarCrepe : Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.061416Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:f1b26494e1cccf7a53b5338c843127af794ad45ca5ded72f231ab84691a41eda","observation_id":"6b3108a0-c8d8-4af3-8ee9-ba1db47fe5ce","resolution":{"observed_at":"2026-08-01T03:51:55.061416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.065958Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.065958Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:fd0c98439970296347c24199370e976cb7777e7530574bef74e352b19759f0f6","observation_id":"7f541cde-4f27-4976-8d43-b2f191a3c8af","resolution":{"observed_at":"2026-08-01T03:51:55.065958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.071221Z","title":"ComCLIP : Training-free compositional image and text matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.071221Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:ae99b237ef0886d34b586ff5de0d5bba1bf82191e78967880470ece00149259a","observation_id":"caabac4d-b5dc-4fe0-a7e6-3ef28c0466ab","resolution":{"observed_at":"2026-08-01T03:51:55.071221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.075416Z","title":"The hard positive truth about vision-language compositionality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.075416Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:891cd31e9227a0e13a2cb5361b387b262af6cf790218e5ad0dd08d6b204709ac","observation_id":"7c3c3956-8da3-43ee-ace1-f8484f7e78ee","resolution":{"observed_at":"2026-08-01T03:51:55.075416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.079762Z","title":"Is CLIP ideal? No","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.079762Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:6978ad1c9a6d1ec2aef3e0ebba33554acb55caa8ad894bb955701b971873b22e","observation_id":"cae2886b-b8dc-4e43-88a5-80d1d012052a","resolution":{"observed_at":"2026-08-01T03:51:55.079762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.084523Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.084523Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:393406a149d0e837d4b05d42c10b815a16eb65695e6229717dd6418199be3699","observation_id":"2a007bba-9c7a-4924-9416-19d03327575a","resolution":{"observed_at":"2026-08-01T03:51:55.084523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.088705Z","title":"Does CLIP bind concepts? probing compositionality in large image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.088705Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:d76a3c9a1f58d34254a66c40178f72862f7396217c2fd8c67fbddf00d1a44a53","observation_id":"74fe2927-dffc-435c-a646-a8a339fd6222","resolution":{"observed_at":"2026-08-01T03:51:55.088705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.093182Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.093182Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:6aa433e31543a1f6ff39b247b28a3d2bea1a2bbebb4ee569ccb285e3a44095d0","observation_id":"6ae2b34e-a7e2-43b7-83b3-c45d0cc2ff4d","resolution":{"observed_at":"2026-08-01T03:51:55.093182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.097450Z","title":"O., Gandhi, M., Gao, I., and Krishna, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.097450Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:97408f515145b7883dbd1de16fcbe45c69dd676fa59f35e90c4331f0b84a12ec","observation_id":"d12192ed-7958-4fb0-8741-fdf4ed35a1ff","resolution":{"observed_at":"2026-08-01T03:51:55.097450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.101937Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.101937Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:2e22e581ffad5b90364ebb4c4753cd591084591b53741b6a890a7c1467238a4a","observation_id":"1090c92c-04dd-4290-ac91-10cb4884c3b4","resolution":{"observed_at":"2026-08-01T03:51:55.101937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T03:51:55.106219Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.106219Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:e44e33326cef09fe36d5e5e17669cdbd98414db6cb841e372d301db8b8a99247","observation_id":"4c1da4b2-69ae-424d-b48e-15ffc98e7c42","resolution":{"observed_at":"2026-08-01T03:51:55.106219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.111104Z","title":"Know `` No '' better: A data-driven approach for enhancing negation awareness in CLIP","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.111104Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:1009819342972c2dbdb19507c44b852a19365c7b5d62aaca137e4e16c9fef060","observation_id":"09aec2fb-9d41-4208-84ee-822341bc6ff6","resolution":{"observed_at":"2026-08-01T03:51:55.111104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.115548Z","title":"D., and Hein, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.115548Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:58e7a356d40eea38beb561ea55f5ea13d7d49378010689348f0fe7b3298ad586","observation_id":"2b9ca59a-fa36-472f-ba1c-06d66830cb88","resolution":{"observed_at":"2026-08-01T03:51:55.115548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.119841Z","title":"How and where does CLIP process negation? In Proceedings of the 3rd Workshop on Advances in Language and Vision Research (ALVR), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.119841Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:ebe8bdcdfc0a81f7e73197a1a3c7e43a1f5ce1187ffb2b2f0866b08a7761c1e8","observation_id":"fd4964f9-92eb-4ed3-9f96-2fc34e05430e","resolution":{"observed_at":"2026-08-01T03:51:55.119841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.124066Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.124066Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:d2bbc8df94a625a3c0f4ae8d405297bf9b611f32e9480c5dc8c739e1ed4ca14d","observation_id":"95082a60-a57d-4155-a591-c13bd1f6ff7d","resolution":{"observed_at":"2026-08-01T03:51:55.124066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.128319Z","title":"Collecting image annotations using A mazon ' s M echanical T urk","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.128319Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:36621a910547010f81b103abf24520d0bd7974df2baa0132a8250071d9735a86","observation_id":"46766c74-500f-48df-bcc8-3207d26a422e","resolution":{"observed_at":"2026-08-01T03:51:55.128319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.132836Z","title":"T., Argus, M., Fischer, V., and Brox, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.132836Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:8443e23fc7338f8f23b1af41809ee72b82e2771252f9cd9959ddd640387b72b6","observation_id":"fa702f0c-dd86-4801-843f-45e1e28413ec","resolution":{"observed_at":"2026-08-01T03:51:55.132836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.137512Z","title":"Learning the power of `` No '': Foundation models with negations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.137512Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:8c7458a69e355f7b00ad34fa8920b26077d553eb688d953ec622639a9f54aa30","observation_id":"9d4f5c1b-8fab-4d58-817c-c5001745e9c2","resolution":{"observed_at":"2026-08-01T03:51:55.137512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.142033Z","title":"ViperGPT : Visual inference via Python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.142033Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:cb5edf36d70c81243fcc1dd17f8419f643bfdf21afcc326a13ad3a464fb212e2","observation_id":"86b8ee81-e9e4-48b9-8ace-1dafd5305f5f","resolution":{"observed_at":"2026-08-01T03:51:55.142033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.146312Z","title":"Winoground : Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.146312Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:dec0abf3fe3e89085abadeb2f00b6490933c4e65028a7efb4c3b480d37dab84b","observation_id":"7872f528-de3f-4204-9fbc-128d58e54e64","resolution":{"observed_at":"2026-08-01T03:51:55.146312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-01T03:51:55.150635Z","title":"F., Alabdulmohsin, I., Parthasarathy, N., Evans, T., Beyer, L., Xia, Y., Mustafa, B., et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.150635Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:6d03d2a6a8949eaba05ac99c033e2625373d98efa2ce10ba2c70ce7a71faa4fb","observation_id":"53d5e963-cea0-4615-b065-5da6c47c9663","resolution":{"observed_at":"2026-08-01T03:51:55.150635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08227","last_updated":"2025-06-09T20:53:43Z","snapshot_observed_at":"2026-08-07T05:14:41.333172Z","submitted_at":"2025-06-09T20:53:43Z","title":"A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08227","snapshot_observed_at":"2026-08-01T03:51:55.155521Z","title":"A good CREPE needs more than just Sugar : Investigating biases in compositional vision-language benchmarks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.155521Z"},"links":{"cited_paper":"/paper/2506.08227","citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:7e79a677fcd5abee402327af4405a3ae8b5acfd3a492c02b14ccb89f09d7a5ea","observation_id":"a79a2f97-e8b3-4ba6-8924-74995bc2423d","resolution":{"observed_at":"2026-08-01T03:51:55.155521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.160075Z","title":"Y., Lee, M.-L., et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.160075Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:c770b433a62fec233ab9fb3bc23e8aaaf09e0e1e11e484d09e82022f51fe9935","observation_id":"d70ffbe1-fcd4-4dca-9c33-d94f8b4560e2","resolution":{"observed_at":"2026-08-01T03:51:55.160075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.164387Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.164387Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:234a177ebb92be809c27aea9cb971a244959e54f068d1aa7926e4a8c40668396","observation_id":"36eed525-17d3-4ff9-a9d6-4ae99f7e1fd5","resolution":{"observed_at":"2026-08-01T03:51:55.164387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.168632Z","title":"LiT : Zero-shot transfer with locked-image text tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.168632Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:b5024918dc901d069c6f5412dbe3828227436de69d5e102e2749b3f6a449ee39","observation_id":"d9dbb6c2-5cd6-4cfd-8377-75206d1f2dfb","resolution":{"observed_at":"2026-08-01T03:51:55.168632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.172818Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.172818Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:7af8d5bb42563869041b5e320d2ab07f29a5b8a824f4b541eb5964a3acadc33f","observation_id":"28425009-383c-4a7c-8af8-eefeed24dcb8","resolution":{"observed_at":"2026-08-01T03:51:55.172818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.177250Z","title":"NegVQA : Can vision language models understand negation? In Findings of the Association for Computational Linguistics: ACL 2025, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.177250Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:d6d5df55f57d7a258ae43588871849300135f4dbe954199fc793b075abd41e99","observation_id":"79305521-3cee-41e5-8875-166d05a4e18a","resolution":{"observed_at":"2026-08-01T03:51:55.177250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:51:55.181466Z","title":"VL-CheckList : Evaluating pre-trained vision-language models with objects, attributes and relations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.181466Z"},"links":{"citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:20b7db10017ebfeeb65bdf3b342ae982104370215f1e2aeac8ea3997c1421971","observation_id":"277d1105-0be4-4aac-862f-7ad1ef78776f","resolution":{"observed_at":"2026-08-01T03:51:55.181466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11317","last_updated":"2025-08-15T08:40:13Z","snapshot_observed_at":"2026-08-07T17:38:48.796378Z","submitted_at":"2025-08-15T08:40:13Z","title":"Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11317","snapshot_observed_at":"2026-08-01T03:51:55.185610Z","title":"Logic unseen: Revealing the logical blindspots of vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T03:51:55.185610Z"},"links":{"cited_paper":"/paper/2508.11317","citing_paper":"/paper/2607.23052"},"observation_digest":"sha256:28b3e8414b6306bc007db7119aee58096c09827e096aeb08c9e6fcfacfb66977","observation_id":"23fbf513-596f-416a-a010-1e59a8d823ce","resolution":{"observed_at":"2026-08-01T03:51:55.185610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23052","last_updated":"2026-07-25T05:39:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T23:24:27.612594Z","submitted_at":"2026-07-25T05:39:51Z","title":"Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2607.23052."}