{"as_of":"2026-08-13T07:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c5d5369f986920804349b41e722cb69cd814597b64b473c5fbd73880b5a888f","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:17:18.706692Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T07:03:50.311891Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:28:31.463894Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2412.08111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08111","snapshot_observed_at":"2026-07-03T14:28:31.463894Z","title":"Seeing syntax: Uncover- ing syntactic learning limitations in vision-language models","venue":null,"work_id":"46d42279-1a0d-447b-99b8-b3ad0c03caf0","year":2024},"citing_paper":{"arxiv_id":"2603.29258","last_updated":"2026-05-04T03:13:15Z","snapshot_observed_at":"2026-08-10T23:30:24.520549Z","submitted_at":"2026-03-31T04:48:52Z","title":"Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T23:48:14.217344Z"},"links":{"cited_paper":"/paper/2412.08111","citing_paper":"/paper/2603.29258"},"observation_digest":"sha256:fb4b296fd408a9ce8bde33bdb4eb6dd96ea1a6ea10d02af2fcf7232be7385d88","observation_id":"7dbc94a0-1715-4f50-b44f-1103a5f822db","resolution":{"observed_at":"2026-05-13T23:48:27.693701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2412.08111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08111","snapshot_observed_at":"2026-07-03T14:28:31.463894Z","title":"Seeing syntax: Uncover- ing syntactic learning limitations in vision-language models","venue":null,"work_id":"46d42279-1a0d-447b-99b8-b3ad0c03caf0","year":2024},"citing_paper":{"arxiv_id":"2606.13288","last_updated":"2026-06-11T12:45:25Z","snapshot_observed_at":"2026-07-06T23:52:04.574604Z","submitted_at":"2026-06-11T12:45:25Z","title":"Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T07:03:50.311891Z"},"links":{"cited_paper":"/paper/2412.08111","citing_paper":"/paper/2606.13288"},"observation_digest":"sha256:e212eb76a4ff0e0acccf7b0e236e3d94440042b123e0103348b09862256793ce","observation_id":"4e8c99a8-b049-46bc-91c0-30a2ee5c68f3","resolution":{"observed_at":"2026-07-03T14:28:31.465164Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08111/citation-record","integrity":"/paper/2412.08111/integrity","json":"/paper/2412.08111/citation-record.json","paper":"/paper/2412.08111"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.429246Z","title":"Is bert blind? exploring the effect of vision-and-language pre- training on visual language understanding","venue":null,"work_id":"cca8c066-5c76-48be-bb48-07042cf13ce3","year":2023},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.479900Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:d73a76614a7435dd1cb101c310f7e56723446f9f8624c891bdee70bb8f717464","observation_id":"6019bf36-f00a-4b30-b782-93305f5e8777","resolution":{"observed_at":"2026-08-11T18:17:19.434314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.418229Z","title":"Probing for constituency structure in neural language models","venue":null,"work_id":"877ebf57-03d9-4f88-b2c5-ce8d1c1f0643","year":2022},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.484593Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:6373ae62e42c615be321ebb7065ec52eca4430c5b72a4c1ef248c63b1032640b","observation_id":"4eed0d19-faf3-46b5-a20d-4a21a4c5c149","resolution":{"observed_at":"2026-08-11T18:17:19.422276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.407240Z","title":"Multilingual nonce dependency treebanks: Under- standing how language models represent and process syn- tactic structure","venue":null,"work_id":"39cc05b8-c15f-485f-8ca2-6076f7ec69a1","year":2024},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.488458Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:5193914df31281fa64e6026b7c5f8dec8a7d31498a3ec135848681fcd984dc90","observation_id":"e646a91a-fbc2-4911-90c8-ca0bc6699a50","resolution":{"observed_at":"2026-08-11T18:17:19.411796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.395027Z","title":"On the difference of bert-style and clip-style text encoders","venue":null,"work_id":"4e542d4e-abfd-4d4f-a4f9-1ae2c1ade95b","year":2023},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.491912Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:e433016458460f211a1ce90707d0300163025ea66fecb23c1ecba573ebac43d7","observation_id":"3d6b22f7-4b94-446c-9886-aac1077dfafb","resolution":{"observed_at":"2026-08-11T18:17:19.398997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.385014Z","title":"Chi, John Hewitt, and Christopher D","venue":null,"work_id":"5ad28042-7750-4c75-853d-5e7621eb8c9a","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.495524Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:bd117fc657182575bc2b8a037b33115c119401919c6549bd4dcc69627f329ee7","observation_id":"e8cba4eb-a3ec-47a6-9c69-b14f7948943d","resolution":{"observed_at":"2026-08-11T18:17:19.388244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.367606Z","title":"Manning, Joakim Nivre, and Daniel Zeman","venue":null,"work_id":"eca8d1ca-144f-4c95-9614-81a5a487ca7f","year":2021},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.503732Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:5cf6c6161cffbed37c5c5c4cf6d33510f93d453cc3e09f93ab3e286a9208b592","observation_id":"71378638-50fb-4638-b466-0162390bdcf4","resolution":{"observed_at":"2026-08-11T18:17:19.371160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.357413Z","title":"BERT: pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"7c22a11e-f3fc-4dd0-99a5-ce1cb0a289a8","year":2019},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.507619Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:411c4739d546ff0d168aebc68acd5a4b022f541c8949320a2e37ae7fc7a542b0","observation_id":"9fe3ef78-d8e8-4c99-b5bf-75dd78c927e1","resolution":{"observed_at":"2026-08-11T18:17:19.361151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.347334Z","title":"BERT: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"351bcda8-aa49-4774-9653-c3de03df7523","year":2019},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.511367Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:4561ecf3c19d876b3d23c60852139c96a038d6e965401ae93209614f88ff8bdf","observation_id":"bf7b950d-4060-4efe-b4d9-8340c5c986f0","resolution":{"observed_at":"2026-08-11T18:17:19.350894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11171","last_updated":"2024-06-19T00:03:42Z","snapshot_observed_at":"2026-08-12T23:41:30.817144Z","submitted_at":"2024-06-17T03:22:20Z","title":"SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11171","snapshot_observed_at":"2026-08-11T18:17:18.515449Z","title":"Sugar- crepe++ dataset: Vision-language model sensitivity to seman- tic and lexical alterations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.515449Z"},"links":{"cited_paper":"/paper/2406.11171","citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:700a7b8b6408fe898e5616ca525459be983a2cf953991d4ac05c979af78f3bae","observation_id":"e3cf3b0a-fd45-4b6b-b48e-34ac5c0be9fb","resolution":{"observed_at":"2026-08-11T18:17:18.515449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.336743Z","title":"Colorless green recurrent net- works dream hierarchically","venue":null,"work_id":"ce752724-7251-40bf-8a09-e0cbff93874a","year":2018},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.520505Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:c2585896835c85fb7aded15966226a100e077ab49fbdccb1fa26d72559e4889a","observation_id":"caca6ae7-7e20-4daf-bdb1-d0e7cc91d130","resolution":{"observed_at":"2026-08-11T18:17:19.341328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.325443Z","title":"Sensi- tivity of generative vlms to semantically and lexically altered prompts","venue":null,"work_id":"2f86aecc-3af0-4c27-8f74-94f16ebb076c","year":2024},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.524801Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:9ba4dd4a8d621f69577e96dfcd8f63bf0581e1d2930812d0bdd95ee5032bba06","observation_id":"3a31ba6c-75b1-4622-be6e-684d8b3f0611","resolution":{"observed_at":"2026-08-11T18:17:19.329383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.315705Z","title":null,"venue":null,"work_id":"b87aa2be-8f54-4b17-8a2f-a100b9b01399","year":2019},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.527968Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:b6b2738991132893af03b07e7afb20600cd5157b4be13d8dd0119a96384f0f24","observation_id":"c1405538-ff00-4ef2-aaea-7a105d0dff9b","resolution":{"observed_at":"2026-08-11T18:17:19.319189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.304308Z","title":"A structural probe for finding syntax in word representations","venue":null,"work_id":"1d8629b1-330f-44d8-a62e-fdeca374116f","year":2019},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.531413Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:c1df6105018f8c4fad109a3e1aeb14cd12b7e80effb7934690af59eee9ddd277","observation_id":"677c0db1-90c0-40b7-a157-a2acc708d23e","resolution":{"observed_at":"2026-08-11T18:17:19.308438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.293402Z","title":"What does bert learn about the structure of language? In ACL 2019- 57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":"40a8b042-b056-4884-b34b-acc90a9a71db","year":2019},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.535029Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:f9f187b2d93bb5ad1cb74e8767bf46ac4a0dde0becad965bce388b4cbfdb0e90","observation_id":"56c5bccf-9f3c-4f60-9fb9-caa52f971d4c","resolution":{"observed_at":"2026-08-11T18:17:19.297044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.282767Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"7c9b3fab-253b-4ac6-abfe-7c4bb3eee173","year":2021},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.539492Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:c86413cd2c58083f3e50b9357d6b80abb162a76a6464402fdb371df9598998bc","observation_id":"4db364f5-c572-4b5b-a255-f4d78eb9ea8d","resolution":{"observed_at":"2026-08-11T18:17:19.286419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.272235Z","title":null,"venue":null,"work_id":"68616ae2-0b8a-4d9a-8c50-e5ab5a2795b4","year":2024},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.543043Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:344c658c6b1bc6bd6dd4671afcf36d7077b73d6ccec38dc6f785448bf4305fbc","observation_id":"ccb044e4-0f1e-4e8a-89da-f3ab2c09700e","resolution":{"observed_at":"2026-08-11T18:17:19.275226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.261765Z","title":"Which sentence embeddings and which layers encode syntac- tic structure? Cognitive Science, 2020","venue":null,"work_id":"8be02769-a638-4f36-9b51-76fb84ce2f7e","year":2020},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.546500Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:92d12712b7ca802f1f196df2081bf4dc12e6c164fb1b3d2e71e05e0b9730cd28","observation_id":"f1ed2467-88fd-4bf2-b118-fad102901963","resolution":{"observed_at":"2026-08-11T18:17:19.265510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.251920Z","title":"Schr¨odinger’s tree—On syntax and neural language models","venue":null,"work_id":"be74868a-0c6c-4d82-8bd8-cabaca228da6","year":2022},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.550133Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:6b13f6ce6ecd06ee612a8d59a2a186242a1436f4314c1161b9315aeff8fb8d16","observation_id":"133d3228-15a9-48e8-927a-4534ac325bad","resolution":{"observed_at":"2026-08-11T18:17:19.255855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.242358Z","title":null,"venue":null,"work_id":"bc02bbcc-47c9-47a8-88f7-bab10e6dfff0","year":2020},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.553669Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:2e199d8a1ed22db32bbc9b659a21651e7973ef20f7708bd0564288c64036df0c","observation_id":"48a3b413-c8e1-40f7-b350-a08af8dcc826","resolution":{"observed_at":"2026-08-11T18:17:19.245882Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.231107Z","title":null,"venue":null,"work_id":"8a08495e-dad2-4efb-9b98-352c1c34fe33","year":2020},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.557348Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:ee9f02096f1acb3160ddc54d28a40aacd339fc5d06c66da13f3d61bc69897cab","observation_id":"6a1956c3-93f8-4a8d-ab4b-590c99d5d7dd","resolution":{"observed_at":"2026-08-11T18:17:19.235878Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00419","last_updated":"2024-03-30T16:54:45Z","snapshot_observed_at":"2026-08-13T00:40:52.531027Z","submitted_at":"2024-03-30T16:54:45Z","title":"Do Vision-Language Models Understand Compound Nouns?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00419","snapshot_observed_at":"2026-08-11T18:17:18.560850Z","title":"Do vision-language models understand compound nouns? arXiv preprint arXiv:2404.00419, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.560850Z"},"links":{"cited_paper":"/paper/2404.00419","citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:45bf22b4f222fe0be3b7351618e240c3f125ca162300f3e8f363fb131778d5c2","observation_id":"8f9fac10-ee92-45e2-bc7a-639fec5a99f6","resolution":{"observed_at":"2026-08-11T18:17:18.560850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.218951Z","title":"How is bert surprised? layerwise detection of lin- guistic anomalies","venue":null,"work_id":"f559aac6-bde0-483a-8c72-b75bb8c10513","year":2021},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.564664Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:77cf4b07e1c6b2ddf6a8d1e9b504867b848f470d385aa8ea4d60e19577bf7bb7","observation_id":"25a91ce7-b2fd-40f6-a32b-550ad0f48fca","resolution":{"observed_at":"2026-08-11T18:17:19.223254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.206146Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":"53e298d5-bd45-4daa-81c4-b3578638692e","year":2021},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.567757Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:1399985ff946ee8ff96b6823b56ce2eb9b75b0aa5555410d8030b0384eb95b33","observation_id":"ad616650-589a-44ae-be2e-6d33b2fd00d3","resolution":{"observed_at":"2026-08-11T18:17:19.210718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.194565Z","title":"BLIP- 2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"896228ee-9638-42be-a3de-64582402430e","year":2023},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.571182Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:1cf9a95fe1ffd1d3523f27e57e4d0cb0fccdc0ba2e91e780bb6ce9dfa733eae4","observation_id":"46398e1e-8f8f-450e-b40c-8097809491b9","resolution":{"observed_at":"2026-08-11T18:17:19.198846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.183789Z","title":"Open-vocabulary semantic segmentation with mask-adapted CLIP","venue":null,"work_id":"169e260c-34a5-49eb-b94f-1c6362723b77","year":2023},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.574332Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:00cf66417d580b5bb11017b552fa4f570cfbebe7525b4a47562bfc42a36d4069","observation_id":"d313713e-8e90-4089-b5e6-c751fabe1aab","resolution":{"observed_at":"2026-08-11T18:17:19.187249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.174035Z","title":"Syntactic structure from deep learning","venue":null,"work_id":"64b2115b-3e64-4317-812c-4790588ea116","year":2021},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.577550Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:574afad1397fb15eac66fb7f5179de661b482023f69dd98363e3780d98964d25","observation_id":"7e1cdd25-9d3f-4f16-931f-fa74357cd5fa","resolution":{"observed_at":"2026-08-11T18:17:19.177707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.163085Z","title":"Roberta: A robustly optimized bert pretraining approach, 2019","venue":null,"work_id":"33700f86-30c5-4e78-af65-ef4a2207bef9","year":2019},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.580868Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:54c58bf08486c5793e9c8730f7c569228ec084ea8c0be9a23916a79cec4cd7ca","observation_id":"5f946700-7bed-4cc2-9abe-e2606de341c4","resolution":{"observed_at":"2026-08-11T18:17:19.166960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.151686Z","title":"Ivanova, Idan A","venue":null,"work_id":"48d0b5b4-dfa3-4079-9e8c-df096a320b3a","year":2024},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.583978Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:3b16d5fd3c72519ac760b31d6226b0bacd4d6002edf651543121c94de704c574","observation_id":"117266b7-204b-4788-b677-0da0499104f7","resolution":{"observed_at":"2026-08-11T18:17:19.155563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.141204Z","title":"Manning, Kevin Clark, John Hewitt, Urvashi Khandelwal, and Omer Levy","venue":null,"work_id":"aace299b-3335-460d-b3f5-6e0b1a8276ac","year":2020},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.587732Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:90e834da0e43f0939f8b6eb7abeb351790c525cc522377a44721a639b0fd22ce","observation_id":"4fe35e11-429c-43e9-b133-d07860532979","resolution":{"observed_at":"2026-08-11T18:17:19.145111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.130226Z","title":"Probing for labeled dependency trees","venue":null,"work_id":"501e1dd2-1bdb-4515-be3d-ceb53c6ce41b","year":2022},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.591332Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:04a0b57d899561ba3daf6361c9d8ebb16c6e0c5a0bbba4699e3b43609fdbf985","observation_id":"5408055f-c43a-46e5-b383-c558767329d5","resolution":{"observed_at":"2026-08-11T18:17:19.134062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.118656Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"3b869ff5-4154-48e9-9c42-80aa5211cc27","year":2021},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.594879Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:5a0e81092574a7026ef7c763d3009e492c675468a203823c2e7723c75c63b52d","observation_id":"2b125f22-2375-42f9-843a-3a7792f93625","resolution":{"observed_at":"2026-08-11T18:17:19.123192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T18:17:18.598938Z","title":"Hierarchical text-conditional image genera- tion with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.598938Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:675833199d79065e58ddc6ae2f00f26757b781e75078dc044b5c983ca0bbb723","observation_id":"c40b0a3c-c1d8-4ece-9279-d9c1d5ea36dd","resolution":{"observed_at":"2026-08-11T18:17:18.598938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03689","last_updated":"2023-11-03T03:54:28Z","snapshot_observed_at":"2026-08-12T12:30:47.652116Z","submitted_at":"2023-05-05T17:00:16Z","title":"COLA: A Benchmark for Compositional Text-to-image Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03689","snapshot_observed_at":"2026-08-11T18:17:18.604010Z","title":"Cola: How to adapt vision-language models to compose objects localized with attributes? arXiv preprint arXiv:2305.03689, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.604010Z"},"links":{"cited_paper":"/paper/2305.03689","citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:fe04a51082afb9f5ed60dadb5a18ea6a56a1060746a1e671ab65841975d2e34c","observation_id":"3787f038-ae33-4800-b201-95417e4d5cd4","resolution":{"observed_at":"2026-08-11T18:17:18.604010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.609169Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.609169Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:849d9792cc55ad038e95031e22d056df5943f3da0fbf471878f49ee052ca9d0d","observation_id":"a9618cb7-6cdb-472f-bfbf-d27a4a45bf9f","resolution":{"observed_at":"2026-08-11T18:17:18.609169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.098528Z","title":"Pho- torealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"62173ce7-f99c-4afd-b589-1f254eba908c","year":2022},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.613343Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:edb3d6cea0609161143568724b2a8bcfdda3bc5b3db4381b1ea4cda9587f5ecd","observation_id":"41e87015-ed3a-44f9-9a33-8957bf81fb91","resolution":{"observed_at":"2026-08-11T18:17:19.103820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.084813Z","title":"Laion-5b: An open large-scale dataset for training next gen- eration image-text models","venue":null,"work_id":"bd463f0f-b844-4e3c-9b3c-d9e8b6a88864","year":2022},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.616962Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:d41e6babbdcaf1576e578f8c4157e2e1520c3fb62577bb525739d928be240cd5","observation_id":"fb973c5d-be57-4494-b1b1-76da5e961fa2","resolution":{"observed_at":"2026-08-11T18:17:19.089775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.071436Z","title":"A gold standard dependency corpus for En- glish","venue":null,"work_id":"707b2aef-545b-4460-99af-6dfe3e23439e","year":2014},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.620442Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:03e4a74a48c675b26edb284ce57d18fd42674d848331e1cd9ae5cb58a02c847e","observation_id":"7822352c-70f4-43b9-ac57-0043fb4a0abb","resolution":{"observed_at":"2026-08-11T18:17:19.075282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.058266Z","title":"Flava: A foundational language and vision alignment model","venue":null,"work_id":"4ebb54ad-c56f-4387-aeae-ddc3d9f8e27a","year":2022},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.623857Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:8958ea45a4cc09b863522efd25c1653d43615cf9a83a54c6df196ec0189d89b9","observation_id":"92b7924f-07bb-4102-95ee-707b1b530efe","resolution":{"observed_at":"2026-08-11T18:17:19.062988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.044996Z","title":"Masked language mod- eling and the distributional hypothesis: Order word matters pre-training for little","venue":null,"work_id":"44b591f0-e8e2-4e08-9676-8772e8a7b0ea","year":2021},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.628174Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:fc13b39eed943894125f4884f1bbeba20e065a08a374ca717222e5188be30a01","observation_id":"dc01ae02-374e-49f8-a8e2-52702ec72184","resolution":{"observed_at":"2026-08-11T18:17:19.049766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.030514Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"001e4b94-b571-415e-a73a-347e23437ab8","year":2022},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.632017Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:20e3b1854a670f58b2980286ad087158031238d04668ba22c3da31afc77550d0","observation_id":"eccbb23f-cb63-47c5-a8d5-41c8517b142b","resolution":{"observed_at":"2026-08-11T18:17:19.035755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:19.016150Z","title":"Diffusion lens: Interpreting text encoders in text-to-image pipelines","venue":null,"work_id":"2d6909e2-fef7-4efb-9f78-c35bd6f46b12","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.635341Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:decd2cb397c577565dc677da3ff1d2689b2491ef13e4340f66ab179f0e670c3d","observation_id":"a26be74c-d5c4-4b1c-9571-742184488dbb","resolution":{"observed_at":"2026-08-11T18:17:19.022176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.994723Z","title":null,"venue":null,"work_id":"6a308a24-4dad-4660-9041-43081ee8cadc","year":2019},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.643883Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:762482f1c17e2af4bfef8e9cd5616d65257ed40ae94b78c4aa68523ad24db657","observation_id":"09e6efa3-3876-4da0-bd53-ee661e9a3ec4","resolution":{"observed_at":"2026-08-11T18:17:18.999522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12898","last_updated":"2023-08-25T12:22:53Z","snapshot_observed_at":"2026-08-11T07:08:39.497831Z","submitted_at":"2023-08-24T16:17:40Z","title":"Can Linguistic Knowledge Improve Multimodal Alignment in Vision-Language Pretraining?","version":2},"cited_work":{"arxiv_id":"2308.12898","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.12898","snapshot_observed_at":"2026-08-11T18:17:18.747124Z","title":"Can Linguistic Knowledge Improve Multimodal Alignment in Vision-Language Pretraining?","venue":"cs.MM","work_id":"41634880-4368-4775-9075-c49622ee2299","year":2023},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.647520Z"},"links":{"cited_paper":"/paper/2308.12898","citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:53c5c8aea7de3411cadd89317ba69cf826468c641eed45194736ac5a9281b2d6","observation_id":"f2cc2e4c-c08a-4a81-b9c3-2ab518d250a7","resolution":{"observed_at":"2026-08-11T18:17:18.752866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.982201Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers, 2020","venue":null,"work_id":"e460cfa9-c287-45cc-b8f0-e5fb1ba4f4e8","year":2020},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.651685Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:511a32c0fa1d06963f202d9d4bbec4e71d3b80af4b05c22f423b7818072ef955","observation_id":"d64dbb61-b9fa-43b3-8413-3c62234ef341","resolution":{"observed_at":"2026-08-11T18:17:18.987321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.969114Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it? In The Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"1967049b-7824-4cb7-a3e9-7b6be719feef","year":2023},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.654595Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:71f661ba1848a29fcf859c3308e050c5f512541c653635f2768a11c6a32b6609","observation_id":"bd83f3a9-6cc6-4b8f-9a41-596d762ec943","resolution":{"observed_at":"2026-08-11T18:17:18.975073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-11T18:17:18.657659Z","title":"Vl-checklist: Evaluating pre-trained vision-language models with objects, attributes and relations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.657659Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:b683748a9a1767d6087d6f863d34bc5c8ae1890e40d7e0e21cf5d8c6bd05dd55","observation_id":"a418555b-8f7d-4cb4-8f58-b38d546dc182","resolution":{"observed_at":"2026-08-11T18:17:18.657659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.947915Z","title":"We evalu- ated the ’ViT-B/32’ variant of CLIP – ViT base model trained with a image patch size of 32 – publicly avail- able at the following HuggingFace Link","venue":null,"work_id":"2d2adf26-460c-4e88-b454-486354e3d961","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.664228Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:e45856f641f29990bf2cac7c27b7a16da8cfe0b1615998c61b83f7832c79559c","observation_id":"5c3fc2a1-b756-4885-88cc-545aeed48329","resolution":{"observed_at":"2026-08-11T18:17:18.952195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.937164Z","title":"We evaluated the FLA V A pre-trained Model available at the following HuggingFace Link • Unimodal Language Models (ULMs)","venue":null,"work_id":"e9a0c678-9806-418a-9668-7304cd4f610e","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.667682Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:a5165633f8a2cec71ecc525086dfbdcf2ba6ed85d6d259995a92e5aee7c0bfe7","observation_id":"90e9cde7-665f-4a2d-8531-a047f4c0dd79","resolution":{"observed_at":"2026-08-11T18:17:18.940988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.926231Z","title":"We evaluated the RoBERTa-base model available at the following Hug- gingFace Link","venue":null,"work_id":"0a1c092f-2201-4c4c-95cb-caf1aa0aedd9","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.671158Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:d08ba39a76fb769472d1e09533ed2aadda7c3e0ad485f73758b89f884cbc006b","observation_id":"1cb343cf-0ceb-40d7-8adb-ee2c083ca917","resolution":{"observed_at":"2026-08-11T18:17:18.930226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.913894Z","title":"We evaluated the RoBERTa-large model available at the following Hug- gingFace Link","venue":null,"work_id":"d0420d1f-28dd-44e4-8895-584359a60233","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.674810Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:f4299db87ef13343cca610e0e7fc9cdac77d63030061f20362a495a621ac62f4","observation_id":"8ca19960-d6ad-4cb7-aaa7-d97cca0f17c7","resolution":{"observed_at":"2026-08-11T18:17:18.918174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.900545Z","title":"We evaluated the MiniLM model avail- able at the following HuggingFace Link • Sentence Language Models (SLMs) [34]","venue":null,"work_id":"f4b2bfe6-e721-4a1e-87e6-6d7eb565f5c6","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.678733Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:9c3f69508c2c2e027a4c95dee336f7399b9aea205cec64fad07ccb0e7b0658a5","observation_id":"1afe41bf-d967-471c-9c1c-fe4e47ae9c23","resolution":{"observed_at":"2026-08-11T18:17:18.905951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.886150Z","title":"We eval- uated the sentence-MiniLM model available at the fol- lowing HuggingFace Link","venue":null,"work_id":"25324f3f-ef50-405f-a716-c6606c674e2a","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.682486Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:04fa8480e1ac5429ed371e24d179022c7f2dcdb8b9734d9e59803a285890b46b","observation_id":"e610d0ee-a44f-49cc-a46f-c99e0f57f13f","resolution":{"observed_at":"2026-08-11T18:17:18.890664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.873564Z","title":null,"venue":null,"work_id":"7e1a137d-ecd8-434e-b219-5efa368d04d1","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.685782Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:3624e85753d4c824dc9698038af3ec666d3f896edfa5b7a2433a003a2d1c7db2","observation_id":"774188bf-b95c-4093-8799-c95eec0dfa3a","resolution":{"observed_at":"2026-08-11T18:17:18.878568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.860976Z","title":"Here the images are provided as input with a patch size of 32","venue":null,"work_id":"c24a25da-6dcf-40fb-9395-c3a996716d37","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.689005Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:0393ef85eaf798674e596cc4e9064b5acbbb3b061c5f920ccc976b92c2a7732e","observation_id":"ba3fe6db-30a5-4673-b72d-45470004cf23","resolution":{"observed_at":"2026-08-11T18:17:18.865292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.849364Z","title":"This model is also trained us- ing the WebImageText dataset [31] consisting of 400M image-text pairs","venue":null,"work_id":"556966d1-86bd-4623-984e-a0b01a9f4805","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.692477Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:9542165a1ca0a59d3a938bc1405b38548ccf9008b479673d8fd77f10ebe77548","observation_id":"fdd8f2ef-8711-48ac-ab49-3bcee58c7206","resolution":{"observed_at":"2026-08-11T18:17:18.853085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.837923Z","title":"We evaluated the LAION-CLIP-ViT-B/32 model publicly available at the following HuggingFace Link","venue":null,"work_id":"d9021b92-f63d-4c0d-a9d7-8b74e00f2c80","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.696111Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:2e2c6af478a01584d392b1cfbd2e7b4113b2e38f0bdf3c8de5e5e058aadea89e","observation_id":"f59ff747-1040-4bc8-836d-fa883f722f00","resolution":{"observed_at":"2026-08-11T18:17:18.841819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.826797Z","title":"The pre- training process utilized 5 billion image-text pairs from the LAION dataset","venue":null,"work_id":"353f81b8-bc4c-43a8-be82-bdc31342ddac","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.699387Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:9134f320e63b35b42e30c66049a1367abc9bf415c4af040f1501258735d6a18b","observation_id":"5768344e-c8bd-4ae8-b21e-f62ac05dd190","resolution":{"observed_at":"2026-08-11T18:17:18.830896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.813458Z","title":"The pre- training process utilized 5 billion image-text pairs from the LAION dataset","venue":null,"work_id":"9a2439cf-e26b-44d9-bd22-0539826d4084","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.702763Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:fa532fc03ec85e1154a23139f0b32994da4bf8ba0c1fc7d02fab1d2850d303a8","observation_id":"8274126c-057b-468e-844d-0591854cc171","resolution":{"observed_at":"2026-08-11T18:17:18.818325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.801291Z","title":null,"venue":null,"work_id":"52c956a1-b2ac-4c2d-8989-93448dd66471","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.706692Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:034f9118802c28d6c2285baef86ec6cc578e216cd6a1dec87d25e45ee94682f9","observation_id":"59378c4d-841c-4fba-9c5e-75da82a50f9c","resolution":{"observed_at":"2026-08-11T18:17:18.805286Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.499800Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.499800Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:c07dfd68f22ec2feb6604e88be7dca528836dbe407909c77de950486c4b3dedc","observation_id":"323ccb49-4f2c-4eee-a333-82ac94525e1a","resolution":{"observed_at":"2026-08-11T18:17:18.499800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.958540Z","title":"Implementation For instructions to run an example probing experiment, please A.1","venue":null,"work_id":"bb793158-0f6c-438f-acef-9009fc65d9b9","year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.661287Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:90c86f5f989889947fc4b5c027408d765bcd643f36f160ca38a1b0f9b23f81cd","observation_id":"ca105c4b-8f26-4afb-ae78-2d71f4eab987","resolution":{"observed_at":"2026-08-11T18:17:18.962354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:17:18.639779Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T18:17:18.639779Z"},"links":{"citing_paper":"/paper/2412.08111"},"observation_digest":"sha256:774a40bd66a0e343d36e01aac7600bf853d41ca427ad918d3920210e715af706","observation_id":"02fb1b29-5f8a-4f94-a7c8-2f0362d632fd","resolution":{"observed_at":"2026-08-11T18:17:18.639779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08111","last_updated":"2024-12-11T05:37:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T18:10:27.487310Z","submitted_at":"2024-12-11T05:37:04Z","title":"Seeing Syntax: Uncovering Syntactic Learning Limitations in Vision-Language Models"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":46},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 2 inbound Pith citation observations for arXiv:2412.08111."}