{"as_of":"2026-08-12T22:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fbf76873f0ec2b63e3657a21c6f4051139a30ccd1e8c6c7c35632ede6f3c6f8","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T23:56:31.695833Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:04:28.680647Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01201","snapshot_observed_at":"2026-08-03T04:04:28.680647Z","title":"Escaping platos cave: Jam for aligning independently trained vision and language models.arXiv preprint arXiv:2507.01201,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06205","last_updated":"2026-07-04T09:16:48Z","snapshot_observed_at":"2026-08-08T04:29:23.373302Z","submitted_at":"2026-02-05T21:33:45Z","title":"Multi-Way Representation Alignment","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T04:04:28.680647Z"},"links":{"cited_paper":"/paper/2507.01201","citing_paper":"/paper/2602.06205"},"observation_digest":"sha256:b21abfcc6ce782571e0b3e83d182da838432b6b3c38bacaeaf5023edcec17493","observation_id":"2e5ce6c1-74e4-43b8-8da9-6df64d02a772","resolution":{"observed_at":"2026-08-03T04:04:28.680647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01201/citation-record","integrity":"/paper/2507.01201/integrity","json":"/paper/2507.01201/citation-record.json","paper":"/paper/2507.01201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The platonic representation hypothesis","venue":null,"work_id":"425dc7d8-286a-4101-9aa9-871590c3d261","year":2024},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:fc10380bf3c2ac05a4f8efa712ca37a52c709afc149bdf826d4535beef411b38","observation_id":"1884349b-28d1-4e9c-829f-c1d82e12a68b","resolution":{"observed_at":"2026-05-22T00:04:28.037121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Republic (De Republica)","venue":null,"work_id":"82ed4b2f-9ea9-4e85-83d0-a141f800b8b1","year":null},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:d7fdf516219c04550ff95b183613af560c53dc15c0e5c003d33b15c0ab2857ed","observation_id":"aa671778-35d3-4358-9db2-183f61e2ab58","resolution":{"observed_at":"2026-05-22T00:04:28.029254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting model stitching to compare neural representations","venue":null,"work_id":"39a8ec3c-4c1f-4525-88ed-50521d72c2c3","year":2021},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:684ae12e32ee395c25c6aa15619fcf28d924f0437eafcbecc1dbf92c946663fa","observation_id":"6661b766-67bb-4632-a074-af8229b7c29b","resolution":{"observed_at":"2026-05-22T00:04:27.977196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wit: Wikipedia-based image text dataset for multimodal multilingual machine learning","venue":null,"work_id":"d442a3f0-7611-4737-836b-6ce87e3659ca","year":2021},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:870ed22fe0a7ae9447b1a81724cbdfd8a5d7db90a2b127db098fcb499ae21974","observation_id":"09b798a0-7858-4b71-8c3a-43fe2e59ee1a","resolution":{"observed_at":"2026-05-22T00:04:27.991515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kornblith, M","venue":null,"work_id":"71cef6d2-20c3-4731-bbbf-a952cdec3fb9","year":2019},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:ab1e248e709779b5456f93bb9b4e3f8c6d28a148b9c04dcb04f8a512032ab701","observation_id":"d4e11f50-3246-4ef3-82a2-cb983f9693dd","resolution":{"observed_at":"2026-05-22T00:04:27.984410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raghu, J","venue":null,"work_id":"054563a5-1fbd-41d4-ae33-756bf38bdc13","year":2017},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:0a7ddce39c5ac74e79ad64c99959fe3d44755a2c581faf28d6cd27e22c6b2d06","observation_id":"015c6b74-2f46-437e-9b8c-acc4242d9629","resolution":{"observed_at":"2026-05-22T00:04:27.986189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Insights on representational similarity in neural networks with canonical correlation","venue":null,"work_id":"7dee20c7-dce2-4507-9c11-465e23bd5edc","year":2018},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:4dc056be887afc1a395a7c2afadc56cb0b668e94047ff08bd9146cf81e72b137","observation_id":"70185435-131b-4f8f-a325-1e7ef61c47b5","resolution":{"observed_at":"2026-05-22T00:04:27.989874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Similarity of neural network models: A survey of functional and representational measures","venue":null,"work_id":"82b6b573-e577-45fe-b771-8cd7231b0263","year":2025},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:08c65847c87089128412ac52512551b1592302fc93860e2181d32e24e8d9b352","observation_id":"93f621e8-18c8-48b0-8454-70f5a71b96ab","resolution":{"observed_at":"2026-05-22T00:04:28.118993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visiolinguistic attention learning for multimodal coreference resolution","venue":null,"work_id":"524b41e6-8ae6-4f33-833e-7857ce7751b5","year":2019},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:1d72b4ff94e724041959eadd354a3845641912e429d015a7ede195899322a9cd","observation_id":"ba5ce699-0dc4-4b4d-b7ba-458d5856a30f","resolution":{"observed_at":"2026-05-22T00:04:28.109023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":"2302.14045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-07-04T19:20:06.296460Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","venue":"cs.CL","work_id":"2a1e0563-79f5-4521-8293-b8b1aebf7cee","year":2023},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:8cd54272b07eec474811dee8935b5e4b448d8a381171a00d76dd299ca0a19ba8","observation_id":"6e63313e-af84-41c8-9eb5-d6c52f445a02","resolution":{"observed_at":"2026-05-22T00:00:48.011463Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding image representations by measuring their equivariance and equivalence","venue":null,"work_id":"51111db7-432b-4ba4-9daa-5da27f9ffdb5","year":2015},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:45de61f7ed9e49f0df5b35a566a372057482146c90bed71a4715f1b22f2a39f1","observation_id":"1865d481-b8c5-4bca-9027-86f7531156af","resolution":{"observed_at":"2026-05-22T00:04:28.099108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":"52867416-58db-4d8a-805d-89561f9c7eca","year":2023},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:da08ad45c2039f5fe185c1ff970bf8ceb50eba122e48f0757cf2335f61ec6b7b","observation_id":"f40a460e-0f9c-431a-97db-0ce13c1ea7e8","resolution":{"observed_at":"2026-05-22T00:04:27.973675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4 with vision","venue":null,"work_id":"b60c12aa-0344-4adb-9d67-108130702224","year":2023},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:dacd8a354b073c383c7b908e630fb748cf6ea4443917c039ee9517985f88cf3a","observation_id":"df6e5033-126a-4172-8c9d-358e45fab2c6","resolution":{"observed_at":"2026-05-22T00:04:28.027073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T14:41:10.697402Z","title":"Llama 3 model card","venue":null,"work_id":"ac426759-fc95-4576-90e9-cad354462c5a","year":2024},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:1688256b3f1c99e074079426db50271fa116ce4572b8052e4c951ef7d06cea0f","observation_id":"112e250e-94a7-4ead-933b-02bf2b1f2866","resolution":{"observed_at":"2026-05-22T00:04:28.033056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"f8b8bcd3-aada-44ba-ae1b-eec5009b5205","year":2021},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:c698633515b891529a12048de49d017a5f743a802770b984c65d260d8a5b0396","observation_id":"e20b53b3-ebef-41b9-a8ab-7d15cc8ceac3","resolution":{"observed_at":"2026-05-22T00:04:28.028553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.750382Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"99de536c-2c30-41fe-b0f9-77088fafbc80","year":2021},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:5c0bb153c9d734d14317045e04ca1d5572e3fb935192f5e6a99ffd0963ca833e","observation_id":"f6ff8060-6d3c-428b-802c-74dad1b4042f","resolution":{"observed_at":"2026-05-22T00:04:28.026874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"47513630-99ce-4ce9-8245-a816c97bcdc9","year":2022},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:53eefd05d120c2bca034b9b0e24b48779bc0e211eaa72bbea3c2538d2ebe324d","observation_id":"afc26b20-4288-45b1-8e11-2a7407fd45de","resolution":{"observed_at":"2026-05-22T00:04:28.116984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"b15c74fa-9f30-4e53-b0de-9edbc63876b8","year":2023},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:f2e6987414e4770be41ef3b0d278c8e0e25b0ab506d1e562d343669e69f9bc63","observation_id":"bf14bd92-1a09-484b-9876-8684d686a519","resolution":{"observed_at":"2026-05-22T00:04:28.114758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09696","last_updated":"2024-02-26T02:02:34Z","snapshot_observed_at":"2026-08-10T13:35:22.681582Z","submitted_at":"2024-02-26T02:02:34Z","title":"A Conditional Singular Value Decomposition","version":1},"cited_work":{"arxiv_id":"2403.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.09696","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-vl: Scaling vision-language with decoupled multimodal pretraining","venue":null,"work_id":"96ac7ff0-761c-43f2-a017-1e3724691f30","year":2024},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"cited_paper":"/paper/2403.09696","citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:d34729ed25ef24656087b68793c1469025e048e18b3cedffe78e6ab2d6dedfed","observation_id":"b93e8f73-4c1d-47c1-a945-13b128d1e4e0","resolution":{"observed_at":"2026-05-22T00:00:48.026511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sugar- crepe: Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":"e2b2b9d0-16ef-47e1-b4bc-7f1c2f1e0668","year":2023},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:dcffd4c2ba486570f1ef58570e97d5e101b3635bac6b6a7e1017ea17e1c24cbf","observation_id":"1c74bd89-e1dc-4034-aaa0-6ce08acc7071","resolution":{"observed_at":"2026-05-22T00:04:28.112871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"28bd3ce1-08e4-48ca-8908-485632cda020","year":2024},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:23c695e229d9a618d2678e60ec62c853685a432ae9e117a4fcab0181be23bd8e","observation_id":"f7a57e19-6d70-4e95-8107-6c5407cd5af9","resolution":{"observed_at":"2026-05-22T00:04:28.111010Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2 olmo 2 furious","venue":null,"work_id":"eb62194f-1ab7-41de-ade1-278316bd4dc8","year":2024},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:75b424f20c957565e24948912a727db21e71cec5141d6c03ce2b8f8b14be078a","observation_id":"fe11eed0-059d-4a1f-93e9-ba6787197171","resolution":{"observed_at":"2026-05-22T00:04:28.106895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c5429db4-2c7c-4fe4-b82d-09edee28c494","year":2023},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:0c4389ce6a748f21e4f93d7e082a7e4795b97711d4c3a651b92787599cb6929c","observation_id":"f7c615b2-89e6-4841-85e3-0c88df16f2d3","resolution":{"observed_at":"2026-05-22T00:04:28.105103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:06:04.550939Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"c18317b8-5600-4362-90ae-aad378c85f1e","year":2016},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:341fdac7e87d75f9182ac8e788c702496b77284af9097dcfa9f8e7aa4da3acaf","observation_id":"d26a58e9-2d1b-485b-851b-fa1354904948","resolution":{"observed_at":"2026-05-22T00:04:28.103136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What regularized auto-encoders learn from the data- generating distribution","venue":null,"work_id":"7c804310-657c-4ec9-9e67-09ad4dba5ce0","year":2014},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:d8af115541fea42714877e3f91dd1e3256712c115baead7d4282b356757ba01d","observation_id":"b726d433-1636-42af-9c0b-24d6905c3980","resolution":{"observed_at":"2026-05-22T00:04:28.101025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regularized linear autoen- coders recover the principal components, eventually","venue":null,"work_id":"32e7ea96-b855-432b-99ba-492b35b7ba10","year":2020},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:89c00f92c5119f12e1e006f148ce4e2a48034d7672ff0d24a4be8c79b331495b","observation_id":"2cc34b5a-d44e-4b71-800a-6c07812c231a","resolution":{"observed_at":"2026-05-22T00:04:28.097149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fd869d38-76ea-4efe-8623-60ae904a621c","year":2016},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:71546f4beff8db8f1ff83ea8aab36458eb8e3ef14088c83c502d0f868e8e6dd3","observation_id":"64ef0c76-b5ff-4d18-84ac-14ef94b5fc65","resolution":{"observed_at":"2026-05-22T00:04:28.092794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glu variants improve transformer","venue":null,"work_id":"04bd62e3-292b-4fc7-8058-c6e5d1d5481e","year":2020},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:5cd2fb0000d38762e1321cb4f6834213be7751409bbb6256f576feb27cc98c66","observation_id":"0e128f5a-2cb4-4f89-9477-af6dfb3db34b","resolution":{"observed_at":"2026-05-22T00:04:28.040859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T11:34:51.775339Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"7fa33f1f-c516-4925-aa91-af28b4e3c5ba","year":2023},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:61b620bf4b8a607ac057abc3e7eeb55e1309de3273fb8d278b392f852fa5ded0","observation_id":"9abf31b7-e272-497c-a2f2-5f3959c7716a","resolution":{"observed_at":"2026-05-22T00:04:28.091115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations","venue":null,"work_id":"61c41571-33b5-4337-993b-621443ac6adc","year":2023},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:799f90b9ee7e2bb0b517ebe04c33c3d158ef3232df6abcd151e7daba3ad1bc38","observation_id":"0819e5dd-5dc1-43ea-a242-dfe4e7fe1d6c","resolution":{"observed_at":"2026-05-22T00:04:28.002819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chen, Daniel Y","venue":null,"work_id":"f9be3c77-4bf3-4a70-87f7-33216d7ce605","year":2022},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:cf1fdff6e5fd15f1eba9685f73e593488a5905c6a8da2e7f65ffcbfa74c2e87b","observation_id":"de1aacee-62e3-49ee-8b5d-87c326c62888","resolution":{"observed_at":"2026-05-22T00:04:28.089324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fu, Mayee F","venue":null,"work_id":"e480585c-360b-40c4-8444-a4da95c27dcc","year":2022},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:bee24558b79fba5fc850c3fdf3c1dc9ab756ee2119a3beaedff4bbf5d169d54f","observation_id":"fceee09c-7378-4188-a9c9-e8bef8b1ac20","resolution":{"observed_at":"2026-05-22T00:04:27.999046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.11362","last_updated":"2021-03-10T19:11:45Z","snapshot_observed_at":"2026-08-11T01:09:30.499096Z","submitted_at":"2020-04-23T17:58:56Z","title":"Supervised Contrastive Learning","version":5},"cited_work":{"arxiv_id":"2004.11362","doi":"10.48550/arxiv.2004.11362","metadata_source":"pith","pith_arxiv_id":"2004.11362","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Supervised contrastive learning","venue":"cs.LG","work_id":"49875dbd-b693-4382-856e-73e4924fc845","year":2020},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"cited_paper":"/paper/2004.11362","citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:3856e21229ad6d129d958cc8e6f52995c0986090997e6d713846d67ebd5f1b68","observation_id":"ba228811-c1fa-4b6a-932d-fa5760ff1ebb","resolution":{"observed_at":"2026-05-22T00:00:48.017686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality","venue":null,"work_id":"b2c3b0ac-1ca1-4a23-8bcf-23a5c536ca2f","year":2022},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:918a50c3b5727d3c08830453f483cf48e6e77f5352293f97a604fd2436e57deb","observation_id":"f96e9c78-2966-4dc0-bca5-9e5efebe71d4","resolution":{"observed_at":"2026-05-22T00:04:28.085642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-08-12T16:27:34.120981Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":"2111.06377","doi":"10.48550/arxiv.2111.06377","metadata_source":"pith","pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Masked Autoencoders Are Scalable Vision Learners","venue":"cs.CV","work_id":"0747476e-5bd0-4596-908f-391611d9364e","year":2021},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:5925c8fe47a8035b11b1b4c49803e9b0d0be511fcc5bad28a4487f72756157d6","observation_id":"92f2ec17-e16a-4464-8f8a-645a437f9f24","resolution":{"observed_at":"2026-05-22T00:00:48.020599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:38.318698+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:38.318698+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised learning of visual features by contrasting cluster assignments","venue":null,"work_id":"5dbc9cc2-87df-443e-8b79-8d887f19ecc0","year":2020},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:d819966541d2f017c00ffe0cb57fad60a5ef8684571c3f28168681b27bf6347b","observation_id":"413bd0b0-6595-46b7-9e31-c7a78cbd8126","resolution":{"observed_at":"2026-05-22T00:04:28.094932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"5938d444-50eb-4806-8a61-c09f13814ff5","year":2021},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:683fff80fa32e7f9ebea58fff4d4076f8d9709bf5ac4ced7614d1c38aa469374","observation_id":"393e72a8-c88d-4821-8836-b4c8d89ea711","resolution":{"observed_at":"2026-05-22T00:04:28.083458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"3f2394d6-b20d-414d-be8e-156aaf49d515","year":2021},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:cdc4e1aa36ad4d2450bc48085a4b0ac3ae9c0de2eb2124b2af91acd3dd6f7f15","observation_id":"0cd0f8e7-f8aa-4739-a41b-5bd57d5f91b6","resolution":{"observed_at":"2026-05-22T00:04:28.081449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"30ece2e7-3c79-4ec7-afc1-0cb2a9c0f7d9","year":2019},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:2a10b5282707e504834d82bf5bfd3fee1d605a0af486778fb890deea1f131f78","observation_id":"e22e1674-a40c-42f2-9bee-fab1408a1c54","resolution":{"observed_at":"2026-05-22T00:04:28.079206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openclip, July 2021","venue":null,"work_id":"0473b5be-cfb6-4be7-9ef5-41eb0d8988cb","year":2021},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:dd2ea7b4b97125cf75a887f8ec5b7a07dfbc761ce693ae5608eb11b7b0fb2cb8","observation_id":"47fc6a20-e9fb-4fae-8649-781de989cfe7","resolution":{"observed_at":"2026-05-22T00:04:28.076726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LAION-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"ac5ed1da-fc8e-4f3c-a0c7-99f7d9bb1443","year":2022},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:1500aa959e62dab7e221256edd2d32e062d462e2e80a9d7af209bfbf682b72cb","observation_id":"a3e116a6-18b4-4366-b852-a283934dfa30","resolution":{"observed_at":"2026-05-22T00:04:28.074694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":"2303.15343","doi":"10.48550/arxiv.2303.15343","metadata_source":"pith","pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sigmoid Loss for Language Image Pre-Training","venue":"cs.CV","work_id":"a72a5260-62c8-463d-95d2-fc6ab01b4994","year":2023},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:20466c77cbffadf3cc0422df72b9c695d96430d0c3e47afe75fe3bed9edef537","observation_id":"21c867b0-b8ff-47f5-aa2e-8909202fb47c","resolution":{"observed_at":"2026-05-22T00:00:48.023625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding dimensional collapse in contrastive self-supervised learning","venue":null,"work_id":"7c76cdbf-58ad-46fc-b98d-9cd8cff87e58","year":2022},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:8d3974e5ff7ba36a758e097f87e0af7cae099a0be082ff1389b1b5682975f03a","observation_id":"77c04473-9739-4271-8420-707b515d46a9","resolution":{"observed_at":"2026-05-22T00:05:48.047164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curriculum learning","venue":null,"work_id":"5261c94b-ba90-4263-b6c4-bead13aa9c61","year":2009},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:46aaa72d29f327428c200c8b49e0f485579b3a7fbe28f7594908ccc3390d5e14","observation_id":"22686a86-f3fc-4633-af21-e226d54fceec","resolution":{"observed_at":"2026-05-22T00:04:28.072580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interpretability beyond feature attribution: Quantitative testing with concept activation vectors (tcav)","venue":null,"work_id":"1868bf1d-5935-428e-b7ca-4d485ea4bc0e","year":2018},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:2318afda0e030135ca2031e09b4458419ed15f32748ff620fdd1cadc89aa1a59","observation_id":"14356c54-5c0c-4cbe-91cd-ca6d331ed493","resolution":{"observed_at":"2026-05-22T00:04:28.067236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Network dissection: Quantifying interpretability of deep visual representations","venue":null,"work_id":"5edea465-c8ad-4df2-9c9e-ea96ec5b8009","year":2017},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:986af16f73f086e455fe730b39173a778f1240696c63873d2673dd79e81d77e3","observation_id":"980043ab-76ef-4d94-b9bb-65a0343a36f2","resolution":{"observed_at":"2026-05-22T00:04:28.070675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foundation models for time series analysis: A tutorial and survey","venue":null,"work_id":"7bb237fa-e92f-4e2d-b9cc-1aaae6090a24","year":2024},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:d2506df1be46a009c97c171cf30bd7421663c49bca224e8de7e655df8460c7a7","observation_id":"b4847d06-45cd-4dd8-ad15-d03dbfb3174e","resolution":{"observed_at":"2026-05-22T00:04:28.043030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Totem: Tokenized time series embeddings for general time series analysis","venue":null,"work_id":"a9d8742d-484e-4f2b-b83f-19a79ddc2e17","year":null},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:2209a217e491b472f0fe4f6559ef942a9109433a6fa8971c55c25ee58dcc787b","observation_id":"8ad6a9e1-77f1-4219-841b-e2732da0fe8e","resolution":{"observed_at":"2026-05-22T00:04:28.039101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03885","last_updated":"2024-10-10T15:37:45Z","snapshot_observed_at":"2026-08-07T22:30:00.741959Z","submitted_at":"2024-02-06T10:48:46Z","title":"MOMENT: A Family of Open Time-series Foundation Models","version":3},"cited_work":{"arxiv_id":"2402.03885","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.03885","snapshot_observed_at":"2026-07-03T17:38:43.284760Z","title":"Moment: A family of open time-series foundation models","venue":null,"work_id":"26ab8b80-a36b-488c-876d-c5b25358a5b7","year":2024},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"cited_paper":"/paper/2402.03885","citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:f6690adcf08bf824e9bfb20455623a1e70b4a92c1bf2cbecdeb4a0c2a4ad1507","observation_id":"71d08308-1006-449f-8cc3-f930f33cc915","resolution":{"observed_at":"2026-05-22T00:00:48.014730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A decoder-only foundation model for time-series forecasting","venue":null,"work_id":"43a37007-f974-4f16-bac5-e5682fa02a16","year":2024},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:520eb93160958c26c6ee0cf23281c03645f7fcb37c6eaedc7228c7e344b927ed","observation_id":"2890e573-f06a-4de3-af5b-525cf6b937c7","resolution":{"observed_at":"2026-05-22T00:05:48.052324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Relations between two sets of variates","venue":null,"work_id":"b7c9a5e5-5629-4d0c-83ed-ba16fc46eaf2","year":1936},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:5f68e135e7abcedc76d6b01a1d6e5361a2d6e8cb2f8891cc356b07e9f1a60722","observation_id":"0bdff118-588d-4801-9d1b-14a9ec146888","resolution":{"observed_at":"2026-05-22T00:05:48.049742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reproducing kernel hilbert space, mercer’s theorem, eigenfunctions, nyström method, and use of kernels in machine learning: Tutorial and survey","venue":null,"work_id":"a499476c-b8ff-4b00-ac9f-3201cb09917d","year":2021},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:d2337358c454593142649b2ea7935a4f1c460bbf9790efb0d1b498bf8329b000","observation_id":"b4689f2c-96b2-4014-85c9-959dc96c994c","resolution":{"observed_at":"2026-05-22T00:04:28.035487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"36e025dd-0d87-484a-96e6-dbc40ed65176","year":2007},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:81c51546f2b420cc7e540866d561891ca157abf71950e2f06932ea5b6f788916","observation_id":"847a45d3-0880-48a9-909b-72182a59025e","resolution":{"observed_at":"2026-05-22T00:04:28.031252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-dimensional canonical correlation analysis","venue":null,"work_id":"aca52862-1b44-4eb3-a24d-fdbea6c2bb59","year":2025},"citing_paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models","version":7},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T23:56:31.695833Z"},"links":{"citing_paper":"/paper/2507.01201"},"observation_digest":"sha256:a7e014a2d5b05d34dac4883881d2c5c2b0c3d7aed63358fa5e8e1f1416d1d2a4","observation_id":"32af4824-70e7-4fc8-bee6-8a3980c8392e","resolution":{"observed_at":"2026-05-22T00:04:28.087482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01201","last_updated":"2026-05-15T00:26:49Z","latest_version":7,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T13:35:51.220478Z","submitted_at":"2025-07-01T21:43:50Z","title":"Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":3,"verified_exact":5,"verified_fuzzy":44},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2507.01201."}