Pith. sign in

Paper Citation Record · LEDGER

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models

As of 12 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2507.01201.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.01201 v7

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-21T23:56:31.695833Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T04:04:28.680647Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

54 of 54 outbound references displayed

  • verified exact5
  • verified fuzzy44
  • unresolved3
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 1884349b-28d1-4e9c-829f-c1d82e12a68b · outbound

This paper cites The platonic representation hypothesis.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models The platonic representation hypothesis

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.037121Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:fc10380bf3c2ac05a4f8efa712ca37a52c709afc149bdf826d4535beef411b38

Observation aa671778-35d3-4358-9db2-183f61e2ab58 · outbound

This paper cites Republic (De Republica).

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Republic (De Republica)

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.029254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:d7fdf516219c04550ff95b183613af560c53dc15c0e5c003d33b15c0ab2857ed

Observation 6661b766-67bb-4632-a074-af8229b7c29b · outbound

This paper cites Revisiting model stitching to compare neural representations.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Revisiting model stitching to compare neural representations

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:27.977196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:684ae12e32ee395c25c6aa15619fcf28d924f0437eafcbecc1dbf92c946663fa

Observation 09b798a0-7858-4b71-8c3a-43fe2e59ee1a · outbound

This paper cites Wit: Wikipedia-based image text dataset for multimodal multilingual machine learning.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Wit: Wikipedia-based image text dataset for multimodal multilingual machine learning

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:27.991515Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:870ed22fe0a7ae9447b1a81724cbdfd8a5d7db90a2b127db098fcb499ae21974

Observation d4e11f50-3246-4ef3-82a2-cb983f9693dd · outbound

This paper cites Kornblith, M.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Kornblith, M

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:27.984410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:ab1e248e709779b5456f93bb9b4e3f8c6d28a148b9c04dcb04f8a512032ab701

Observation 015c6b74-2f46-437e-9b8c-acc4242d9629 · outbound

This paper cites Raghu, J.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Raghu, J

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:27.986189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:0a7ddce39c5ac74e79ad64c99959fe3d44755a2c581faf28d6cd27e22c6b2d06

Observation 70185435-131b-4f8f-a325-1e7ef61c47b5 · outbound

This paper cites Insights on representational similarity in neural networks with canonical correlation.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Insights on representational similarity in neural networks with canonical correlation

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:27.989874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:4dc056be887afc1a395a7c2afadc56cb0b668e94047ff08bd9146cf81e72b137

Observation 93f621e8-18c8-48b0-8454-70f5a71b96ab · outbound

This paper cites Similarity of neural network models: A survey of functional and representational measures.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Similarity of neural network models: A survey of functional and representational measures

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.118993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:08c65847c87089128412ac52512551b1592302fc93860e2181d32e24e8d9b352

Observation ba5ce699-0dc4-4b4d-b7ba-458d5856a30f · outbound

This paper cites Visiolinguistic attention learning for multimodal coreference resolution.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Visiolinguistic attention learning for multimodal coreference resolution

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.109023Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:1d72b4ff94e724041959eadd354a3845641912e429d015a7ede195899322a9cd

Observation 6e63313e-af84-41c8-9eb5-d6c52f445a02 · outbound

This paper cites Language Is Not All You Need: Aligning Perception with Language Models.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Language Is Not All You Need: Aligning Perception with Language Models

Reference 10

Resolution
metadata mismatch
local_arxiv, observed 2026-05-22T00:00:48.011463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:8cd54272b07eec474811dee8935b5e4b448d8a381171a00d76dd299ca0a19ba8

Observation 1865d481-b8c5-4bca-9027-86f7531156af · outbound

This paper cites Understanding image representations by measuring their equivariance and equivalence.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Understanding image representations by measuring their equivariance and equivalence

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.099108Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:45de61f7ed9e49f0df5b35a566a372057482146c90bed71a4715f1b22f2a39f1

Observation f40a460e-0f9c-431a-97db-0ce13c1ea7e8 · outbound

This paper cites Gemini: a family of highly capable multimodal models.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Gemini: a family of highly capable multimodal models

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:27.973675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:da08ad45c2039f5fe185c1ff970bf8ceb50eba122e48f0757cf2335f61ec6b7b

Observation df6e5033-126a-4172-8c9d-358e45fab2c6 · outbound

This paper cites Gpt-4 with vision.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Gpt-4 with vision

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.027073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:dacd8a354b073c383c7b908e630fb748cf6ea4443917c039ee9517985f88cf3a

Observation 112e250e-94a7-4ead-933b-02bf2b1f2866 · outbound

This paper cites Llama 3 model card.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Llama 3 model card

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.033056Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:1688256b3f1c99e074079426db50271fa116ce4572b8052e4c951ef7d06cea0f

Observation e20b53b3-ebef-41b9-a8ab-7d15cc8ceac3 · outbound

This paper cites Learning transferable visual models from natural language supervision.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Learning transferable visual models from natural language supervision

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.028553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:c698633515b891529a12048de49d017a5f743a802770b984c65d260d8a5b0396

Observation f6ff8060-6d3c-428b-802c-74dad1b4042f · outbound

This paper cites Scaling up visual and vision-language representation learning with noisy text supervision.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Scaling up visual and vision-language representation learning with noisy text supervision

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.026874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:5c0bb153c9d734d14317045e04ca1d5572e3fb935192f5e6a99ffd0963ca833e

Observation afc26b20-4288-45b1-8e11-2a7407fd45de · outbound

This paper cites Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.116984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:53eefd05d120c2bca034b9b0e24b48779bc0e211eaa72bbea3c2538d2ebe324d

Observation bf14bd92-1a09-484b-9876-8684d686a519 · outbound

This paper cites BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.114758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:f2e6987414e4770be41ef3b0d278c8e0e25b0ab506d1e562d343669e69f9bc63

Observation b93e8f73-4c1d-47c1-a945-13b128d1e4e0 · outbound

This paper cites A Conditional Singular Value Decomposition.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models A Conditional Singular Value Decomposition

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-22T00:00:48.026511Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:d34729ed25ef24656087b68793c1469025e048e18b3cedffe78e6ab2d6dedfed

Observation 1c74bd89-e1dc-4034-aaa0-6ce08acc7071 · outbound

This paper cites Sugar- crepe: Fixing hackable benchmarks for vision-language compositionality.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Sugar- crepe: Fixing hackable benchmarks for vision-language compositionality

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.112871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:dcffd4c2ba486570f1ef58570e97d5e101b3635bac6b6a7e1017ea17e1c24cbf

Observation f7a57e19-6d70-4e95-8107-6c5407cd5af9 · outbound

This paper cites an unresolved cited work.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Unresolved cited work

Reference 21

Resolution
parse uncertain
raw_fallback, observed 2026-05-22T00:04:28.111010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:23c695e229d9a618d2678e60ec62c853685a432ae9e117a4fcab0181be23bd8e

Observation fe11eed0-059d-4a1f-93e9-ba6787197171 · outbound

This paper cites 2 olmo 2 furious.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models 2 olmo 2 furious

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.106895Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:75b424f20c957565e24948912a727db21e71cec5141d6c03ce2b8f8b14be078a

Observation f7c615b2-89e6-4841-85e3-0c88df16f2d3 · outbound

This paper cites an unresolved cited work.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-05-22T00:04:28.105103Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:0c4389ce6a748f21e4f93d7e082a7e4795b97711d4c3a651b92787599cb6929c

Observation d26a58e9-2d1b-485b-851b-fa1354904948 · outbound

This paper cites Deep residual learning for image recognition.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Deep residual learning for image recognition

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.103136Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:341fdac7e87d75f9182ac8e788c702496b77284af9097dcfa9f8e7aa4da3acaf

Observation b726d433-1636-42af-9c0b-24d6905c3980 · outbound

This paper cites What regularized auto-encoders learn from the data- generating distribution.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models What regularized auto-encoders learn from the data- generating distribution

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.101025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:d8af115541fea42714877e3f91dd1e3256712c115baead7d4282b356757ba01d

Observation 2cc34b5a-d44e-4b71-800a-6c07812c231a · outbound

This paper cites Regularized linear autoen- coders recover the principal components, eventually.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Regularized linear autoen- coders recover the principal components, eventually

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.097149Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:89c00f92c5119f12e1e006f148ce4e2a48034d7672ff0d24a4be8c79b331495b

Observation 64ef0c76-b5ff-4d18-84ac-14ef94b5fc65 · outbound

This paper cites an unresolved cited work.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-05-22T00:04:28.092794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:71546f4beff8db8f1ff83ea8aab36458eb8e3ef14088c83c502d0f868e8e6dd3

Observation 0e128f5a-2cb4-4f89-9477-af6dfb3db34b · outbound

This paper cites Glu variants improve transformer.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Glu variants improve transformer

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.040859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:5cd2fb0000d38762e1321cb4f6834213be7751409bbb6256f576feb27cc98c66

Observation 9abf31b7-e272-497c-a2f2-5f3959c7716a · outbound

This paper cites Gomez, Lukasz Kaiser, and Illia Polosukhin.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Gomez, Lukasz Kaiser, and Illia Polosukhin

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.091115Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:61b620bf4b8a607ac057abc3e7eeb55e1309de3273fb8d278b392f852fa5ded0

Observation 0819e5dd-5dc1-43ea-a242-dfe4e7fe1d6c · outbound

This paper cites When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models When and why vision-language models behave like bags-of-words, and what to do about it? In International Conference on Learning Representations

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.002819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:799f90b9ee7e2bb0b517ebe04c33c3d158ef3232df6abcd151e7daba3ad1bc38

Observation de1aacee-62e3-49ee-8b5d-87c326c62888 · outbound

This paper cites Chen, Daniel Y.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Chen, Daniel Y

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.089324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:cf1fdff6e5fd15f1eba9685f73e593488a5905c6a8da2e7f65ffcbfa74c2e87b

Observation fceee09c-7378-4188-a9c9-e8bef8b1ac20 · outbound

This paper cites Fu, Mayee F.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Fu, Mayee F

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:27.999046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:bee24558b79fba5fc850c3fdf3c1dc9ab756ee2119a3beaedff4bbf5d169d54f

Observation ba228811-c1fa-4b6a-932d-fa5760ff1ebb · outbound

This paper cites Supervised Contrastive Learning.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Supervised Contrastive Learning

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-22T00:00:48.017686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:3856e21229ad6d129d958cc8e6f52995c0986090997e6d713846d67ebd5f1b68

Observation f96e9c78-2966-4dc0-bca5-9e5efebe71d4 · outbound

This paper cites Winoground: Probing vision and language models for visio-linguistic compositionality.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Winoground: Probing vision and language models for visio-linguistic compositionality

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.085642Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:918a50c3b5727d3c08830453f483cf48e6e77f5352293f97a604fd2436e57deb

Observation 92f2ec17-e16a-4464-8f8a-645a437f9f24 · outbound

This paper cites Masked Autoencoders Are Scalable Vision Learners.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Masked Autoencoders Are Scalable Vision Learners

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-05-22T00:00:48.020599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:5925c8fe47a8035b11b1b4c49803e9b0d0be511fcc5bad28a4487f72756157d6

Observation 413bd0b0-6595-46b7-9e31-c7a78cbd8126 · outbound

This paper cites Unsupervised learning of visual features by contrasting cluster assignments.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Unsupervised learning of visual features by contrasting cluster assignments

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.094932Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:d819966541d2f017c00ffe0cb57fad60a5ef8684571c3f28168681b27bf6347b

Observation 393e72a8-c88d-4821-8836-b4c8d89ea711 · outbound

This paper cites Swin transformer: Hierarchical vision transformer using shifted windows.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Swin transformer: Hierarchical vision transformer using shifted windows

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.083458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:683fff80fa32e7f9ebea58fff4d4076f8d9709bf5ac4ced7614d1c38aa469374

Observation 0cd0f8e7-f8aa-4739-a41b-5bd57d5f91b6 · outbound

This paper cites An image is worth 16x16 words: Transformers for image recognition at scale.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models An image is worth 16x16 words: Transformers for image recognition at scale

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.081449Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:cdc4e1aa36ad4d2450bc48085a4b0ac3ae9c0de2eb2124b2af91acd3dd6f7f15

Observation e22e1674-a40c-42f2-9bee-fab1408a1c54 · outbound

This paper cites Decoupled weight decay regularization.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Decoupled weight decay regularization

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.079206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:2a10b5282707e504834d82bf5bfd3fee1d605a0af486778fb890deea1f131f78

Observation 47fc6a20-e9fb-4fae-8649-781de989cfe7 · outbound

This paper cites Openclip, July 2021.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Openclip, July 2021

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.076726Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:dd2ea7b4b97125cf75a887f8ec5b7a07dfbc761ce693ae5608eb11b7b0fb2cb8

Observation a3e116a6-18b4-4366-b852-a283934dfa30 · outbound

This paper cites LAION-5b: An open large-scale dataset for training next generation image-text models.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models LAION-5b: An open large-scale dataset for training next generation image-text models

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.074694Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:1500aa959e62dab7e221256edd2d32e062d462e2e80a9d7af209bfbf682b72cb

Observation 21c867b0-b8ff-47f5-aa2e-8909202fb47c · outbound

This paper cites Sigmoid Loss for Language Image Pre-Training.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Sigmoid Loss for Language Image Pre-Training

Reference 42

Resolution
verified exact
local_arxiv, observed 2026-05-22T00:00:48.023625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:20466c77cbffadf3cc0422df72b9c695d96430d0c3e47afe75fe3bed9edef537

Observation 77c04473-9739-4271-8420-707b515d46a9 · outbound

This paper cites Understanding dimensional collapse in contrastive self-supervised learning.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Understanding dimensional collapse in contrastive self-supervised learning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:05:48.047164Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:8d3974e5ff7ba36a758e097f87e0af7cae099a0be082ff1389b1b5682975f03a

Observation 22686a86-f3fc-4633-af21-e226d54fceec · outbound

This paper cites Curriculum learning.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Curriculum learning

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.072580Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:46aaa72d29f327428c200c8b49e0f485579b3a7fbe28f7594908ccc3390d5e14

Observation 14356c54-5c0c-4cbe-91cd-ca6d331ed493 · outbound

This paper cites Interpretability beyond feature attribution: Quantitative testing with concept activation vectors (tcav).

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Interpretability beyond feature attribution: Quantitative testing with concept activation vectors (tcav)

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.067236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:2318afda0e030135ca2031e09b4458419ed15f32748ff620fdd1cadc89aa1a59

Observation 980043ab-76ef-4d94-b9bb-65a0343a36f2 · outbound

This paper cites Network dissection: Quantifying interpretability of deep visual representations.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Network dissection: Quantifying interpretability of deep visual representations

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.070675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:986af16f73f086e455fe730b39173a778f1240696c63873d2673dd79e81d77e3

Observation b4847d06-45cd-4dd8-ad15-d03dbfb3174e · outbound

This paper cites Foundation models for time series analysis: A tutorial and survey.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Foundation models for time series analysis: A tutorial and survey

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.043030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:d2506df1be46a009c97c171cf30bd7421663c49bca224e8de7e655df8460c7a7

Observation 8ad6a9e1-77f1-4219-841b-e2732da0fe8e · outbound

This paper cites Totem: Tokenized time series embeddings for general time series analysis.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Totem: Tokenized time series embeddings for general time series analysis

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.039101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:2209a217e491b472f0fe4f6559ef942a9109433a6fa8971c55c25ee58dcc787b

Observation 71d08308-1006-449f-8cc3-f930f33cc915 · outbound

This paper cites MOMENT: A Family of Open Time-series Foundation Models.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models MOMENT: A Family of Open Time-series Foundation Models

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-05-22T00:00:48.014730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:f6690adcf08bf824e9bfb20455623a1e70b4a92c1bf2cbecdeb4a0c2a4ad1507

Observation 2890e573-f06a-4de3-af5b-525cf6b937c7 · outbound

This paper cites A decoder-only foundation model for time-series forecasting.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models A decoder-only foundation model for time-series forecasting

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:05:48.052324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:520eb93160958c26c6ee0cf23281c03645f7fcb37c6eaedc7228c7e344b927ed

Observation 0bdff118-588d-4801-9d1b-14a9ec146888 · outbound

This paper cites Relations between two sets of variates.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Relations between two sets of variates

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:05:48.049742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:5f68e135e7abcedc76d6b01a1d6e5361a2d6e8cb2f8891cc356b07e9f1a60722

Observation b4689f2c-96b2-4014-85c9-959dc96c994c · outbound

This paper cites Reproducing kernel hilbert space, mercer’s theorem, eigenfunctions, nyström method, and use of kernels in machine learning: Tutorial and survey.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Reproducing kernel hilbert space, mercer’s theorem, eigenfunctions, nyström method, and use of kernels in machine learning: Tutorial and survey

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.035487Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:d2337358c454593142649b2ea7935a4f1c460bbf9790efb0d1b498bf8329b000

Observation 847a45d3-0880-48a9-909b-72182a59025e · outbound

This paper cites an unresolved cited work.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-05-22T00:04:28.031252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:81c51546f2b420cc7e540866d561891ca157abf71950e2f06932ea5b6f788916

Observation 32af4824-70e7-4fc8-bee6-8a3980c8392e · outbound

This paper cites High-dimensional canonical correlation analysis.

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models High-dimensional canonical correlation analysis

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T00:04:28.087482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T23:56:31.695833Z digest=sha256:a7e014a2d5b05d34dac4883881d2c5c2b0c3d7aed63358fa5e8e1f1416d1d2a4

Pith citing papers

Observation 2e5ce6c1-74e4-43b8-8da9-6df64d02a772 · inbound

Multi-Way Representation Alignment cites this paper.

Multi-Way Representation Alignment Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-03T04:04:28.680647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T04:04:28.680647Z digest=sha256:b21abfcc6ce782571e0b3e83d182da838432b6b3c38bacaeaf5023edcec17493