{"as_of":"2026-08-07T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:553c4aa70fe5c2187b8899220f8bad59ba0cf88fa33f1cc6b19429403233cb73","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:17:14.935499Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00754/citation-record","integrity":"/paper/2507.00754/integrity","json":"/paper/2507.00754/citation-record.json","paper":"/paper/2507.00754"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:24.054748Z","title":"Language models are few-shot learners","venue":null,"work_id":"c8093092-8caf-4efb-b6a2-0cc4d24ad587","year":1901},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.174747Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:60542801df245c8a24b318048ded4f6035fd160eebd3dd5f131e8305300baf7f","observation_id":"cf57972b-3253-4d67-8cc2-8dbcf447dd24","resolution":{"observed_at":"2026-08-06T21:17:24.184422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:22.874755Z","title":"In these works, they provided litmus tests for measuring how focused the attention patterns of particular models are and how they relate to model robustness","venue":null,"work_id":"eb60e52d-5049-45ed-b0a5-947d761986c4","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.783929Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:88fb7a32da75238e480e13971131638ce7fbc4f120c189a2de85cec8cc7c8aee","observation_id":"0d832a76-bf8a-4879-b8af-89e85431c105","resolution":{"observed_at":"2026-08-06T21:17:22.984748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:20.764752Z","title":"the standard deviation of the accuracy values divided by the number of different seeds","venue":null,"work_id":"e7cb74b6-d451-4011-a739-1958179abe3e","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.633122Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:7344173bcd2a8dfa91f4f44bb661fc4d3f6c6d784da185aac6fd1f092cc815b9","observation_id":"80bb878e-7eab-488d-bf54-fac98f9d577b","resolution":{"observed_at":"2026-08-06T21:17:20.966369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12973","last_updated":"2024-05-06T15:45:30Z","snapshot_observed_at":"2026-08-07T06:17:03.401103Z","submitted_at":"2023-10-19T17:59:05Z","title":"Frozen Transformers in Language Models Are Effective Visual Encoder Layers","version":2},"cited_work":{"arxiv_id":"2310.12973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12973","snapshot_observed_at":"2026-08-06T21:17:16.309288Z","title":"Frozen Transformers in Language Models Are Effective Visual Encoder Layers","venue":"cs.CV","work_id":"9a576f92-0710-488a-98ea-0ff7654f1982","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.952393Z"},"links":{"cited_paper":"/paper/2310.12973","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:d7d73607e4a1b61bc2a5237559538851093d4c61972acfa24587a482831e0ab8","observation_id":"7df17b61-bd53-4908-bfe4-0825ff4c8666","resolution":{"observed_at":"2026-08-06T21:17:16.472633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T21:17:07.140211Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.140211Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:9752ea60877adf0c664498166c366a6a22b78697d6a8bdd66c35ef64d253b64c","observation_id":"8067ec4b-4bd5-4eab-8942-b273bfb5247d","resolution":{"observed_at":"2026-08-06T21:17:07.140211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-06T21:17:08.054862Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.054862Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:6e97a6b4a1decbb09b48338390186c39f4d9a12817df34df72898882bd53cca0","observation_id":"f0432910-0c1c-432f-b169-d2edd481baa3","resolution":{"observed_at":"2026-08-06T21:17:08.054862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T21:17:08.132343Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.132343Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:a08e5c83cf320afce4028842a0e884d77e1cd21c33140e7776cbd595ece809c4","observation_id":"a6a28afd-2ec9-47d8-a024-7db7890eb3fc","resolution":{"observed_at":"2026-08-06T21:17:08.132343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:08.286198Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.286198Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:6a55ec5cb742e2830007536a26d035a2bebe3411030ff52d67d4f9a70fc46d67","observation_id":"f5907d37-48d9-4cc7-9e57-bc8d05756ac8","resolution":{"observed_at":"2026-08-06T21:17:08.286198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:08.730823Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.730823Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:62645cf38f429e45d4a1c6d823635e1a74c9866c45ff9404d0a6c4c05c219ee9","observation_id":"b3724c4e-8c25-47a4-8b1f-0025c935b7d9","resolution":{"observed_at":"2026-08-06T21:17:08.730823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16545","last_updated":"2025-06-25T02:28:36Z","snapshot_observed_at":"2026-07-06T20:11:24.538172Z","submitted_at":"2024-12-21T09:04:51Z","title":"Attention Entropy is a Key Factor: An Analysis of Parallel Context Encoding with Full-attention-based Pre-trained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16545","snapshot_observed_at":"2026-08-06T21:17:08.954914Z","title":"Attention entropy is a key factor: An analysis of parallel context encoding with full-attention-based pre-trained language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.954914Z"},"links":{"cited_paper":"/paper/2412.16545","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:63fb529768c4e093e9f9128e4a83d5de384c83216176e69f098db9216f8b9451","observation_id":"dbb7affd-7b08-4c85-9bcd-6eb3e47e0215","resolution":{"observed_at":"2026-08-06T21:17:08.954914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08203","last_updated":"2023-05-11T21:36:07Z","snapshot_observed_at":"2026-08-05T15:38:15.380186Z","submitted_at":"2021-09-16T20:10:12Z","title":"Torch.manual_seed(3407) is all you need: On the influence of random seeds in deep learning architectures for computer vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08203","snapshot_observed_at":"2026-08-06T21:17:09.069919Z","title":"Stabilizing transformer training by preventing attention entropy collapse","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.069919Z"},"links":{"cited_paper":"/paper/2109.08203","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:cf428534ba5467ae4dcc547d16e417ff9d6440103db42c6389abeb6ccf760e6d","observation_id":"54bfea88-6ae9-486d-80d8-fe4d093f67bc","resolution":{"observed_at":"2026-08-06T21:17:09.069919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07384","last_updated":"2020-02-24T10:47:39Z","snapshot_observed_at":"2026-08-04T16:47:17.980843Z","submitted_at":"2020-01-21T08:33:29Z","title":"Understanding Why Neural Networks Generalize Well Through GSNR of Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07384","snapshot_observed_at":"2026-08-06T21:17:09.234749Z","title":"Understanding why neural networks generalize well through gsnr of parameters","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.234749Z"},"links":{"cited_paper":"/paper/2001.07384","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:4750ca502a1c9635c45ea73b66d220cc41775c690c4aca4d29709cdf9f340707","observation_id":"6a846dd8-e028-4ee5-ad8d-aa0c10fafebe","resolution":{"observed_at":"2026-08-06T21:17:09.234749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T21:17:09.364748Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.364748Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:57df05d88e5efa57f566a488665c97067b0dd2236119548d94909d06e929f864","observation_id":"a964eac8-6510-4018-b4b1-d0208ec5c971","resolution":{"observed_at":"2026-08-06T21:17:09.364748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-07-06T18:43:22.614883Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-06T21:17:09.614748Z","title":"A single transformer for scalable vision- language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.614748Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:3c52d2e75458222b598c4193493b040fc028ed3a0c8b2411db02d294d13ce910","observation_id":"c1b79421-ce28-4c47-b15b-bc68e211d958","resolution":{"observed_at":"2026-08-06T21:17:09.614748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T21:17:09.764750Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.764750Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:7e6a4f6bc641b26408795346e80d56e1ff9aaa120afe0afab12fcf6138b3061a","observation_id":"7eb34fdb-15b0-4387-afd5-973902d3b467","resolution":{"observed_at":"2026-08-06T21:17:09.764750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T21:17:10.275076Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.275076Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:0bc09a5fa787059af59abbce184b3d4d49a05825ffc4ba118ec8bd22870b1139","observation_id":"36fc9a21-bae4-4c9b-82ca-5261a805f6d7","resolution":{"observed_at":"2026-08-06T21:17:10.275076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-06T21:17:10.544749Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.544749Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:3126b9b017f101fa528aa6807db46e018b1d7da19396b2011cb9ae3ac6e5dbf9","observation_id":"b9ac64ec-a47d-4723-b68d-338970fc7d57","resolution":{"observed_at":"2026-08-06T21:17:10.544749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:23.394825Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"a11c18e0-32bf-4a57-9b0d-9a28ef4be282","year":2016},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.764825Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:014f9554587d91174812fffdc2711bd16e36696fcfcca3de4423ed178995c8b4","observation_id":"330ec6c4-24c3-4029-9c70-faf41c147242","resolution":{"observed_at":"2026-08-06T21:17:23.564748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-07-06T06:06:04.571585Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-06T21:17:10.884728Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.884728Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:98309586f35a40f2d3b13baffeb8ec513b42200a06089846d4cb298b101d1772","observation_id":"dde40791-2763-47ba-85c7-68ab4f603424","resolution":{"observed_at":"2026-08-06T21:17:10.884728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-06T21:17:11.024571Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.024571Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:3fca6d76997ea6988e2bd1fdac1135e0917a691c9ce46bef06305632b065d695","observation_id":"e882166e-8e34-4822-a2a3-3639df5af93f","resolution":{"observed_at":"2026-08-06T21:17:11.024571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-03T13:01:27.142233Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-06T21:17:11.224870Z","title":"Mmdetection: Open mmlab detection toolbox and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.224870Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:4f1d77329fef159ecb3e6d329cce7d1229e2c0647b1614eeaf9b9921ade7f15d","observation_id":"3551f281-1f14-42b8-9919-51b480181047","resolution":{"observed_at":"2026-08-06T21:17:11.224870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-07-06T08:31:12.309726Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-08-06T21:17:11.392668Z","title":"Quantifying the carbon emissions of machine learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.392668Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:23ae949351bc540b7c39f9971335c231e1816b5961b02bd74054015db6b07cdd","observation_id":"ea12eca6-b266-45dc-be83-1cae9595b108","resolution":{"observed_at":"2026-08-06T21:17:11.392668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:23.100462Z","title":"Attention Entropies","venue":null,"work_id":"3523c768-8cc2-4cee-a8c4-629a503c1622","year":2020},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.624886Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:f01c5c953c283b805634c5f83b07b9f2898e522db5a41e46b8760159c63b2984","observation_id":"fa83d959-90c6-4d5a-91d8-f7ecd2af6b26","resolution":{"observed_at":"2026-08-06T21:17:23.194826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:22.536783Z","title":null,"venue":null,"work_id":"e2af9871-0d83-4cb1-a7db-fe6bf993e219","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:11.899321Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:4f08c454eaf9dc552cf2f49c83185518b1f5d61ea2d952acf2b9662482013148","observation_id":"fb0eeb87-84ec-4df2-8f9f-f3d8bb842029","resolution":{"observed_at":"2026-08-06T21:17:22.707460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:22.170929Z","title":null,"venue":null,"work_id":"49ddad33-435d-4778-bf57-160eaea2b7c3","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.054837Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:7d5e9f586a329d62c64e648e18142ec8b1dfa826b8a859eb7ee5ccb5baf6ea40","observation_id":"b46e9033-6c7b-4434-83ac-9d401faf3c38","resolution":{"observed_at":"2026-08-06T21:17:22.273985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:21.904787Z","title":"Finally, we highlight the high quality of the attention maps of LUViT in the Imagenet-Segmentation dataset [Gao et al., 2022] in Section B.3","venue":null,"work_id":"30e888c7-29ad-4063-8be8-64b97a840591","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.195882Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:0faa5a6f417d6c350ec516f2e65300c89aede909b85b3bc27429bc8aa25c9a59","observation_id":"23b300f3-d459-43fd-81fd-970983943bcc","resolution":{"observed_at":"2026-08-06T21:17:21.994766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:21.634745Z","title":"The results of both our reproduction of Pang et al","venue":null,"work_id":"62e4e235-595f-4b9b-8ded-e758eafc5856","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.304770Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:c05130bbdd886546bb55ec2539116fed177b3a2caaa4878753d988a2d8d28572","observation_id":"308f5b8b-7143-4025-8fdd-d4e5232c97ad","resolution":{"observed_at":"2026-08-06T21:17:21.721932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:21.184754Z","title":null,"venue":null,"work_id":"1d897f21-6519-4566-b0ef-06878ac72de1","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.514747Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:75afc96dcd5544d6cb7dc8e9bbb94c3bbad4da1ef97104d39dba8015cbffe97a","observation_id":"2c539026-45a4-408b-8d8f-6f6784ee44f9","resolution":{"observed_at":"2026-08-06T21:17:21.364775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:20.404749Z","title":"Each reported value is an average of three training runs with three seeds, (0, 1, 2), and the subscript ± denotes the standard error for each setting","venue":null,"work_id":"c3409d72-ce98-42bb-8f31-30230efced89","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.805484Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:4d2efd5fb1a412ad82cdaa089f893127cf9749d0a1e635ace4af41c7f777a25b","observation_id":"5dc585a5-23fb-4816-8628-515f380fa421","resolution":{"observed_at":"2026-08-06T21:17:20.534750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:20.144752Z","title":"A cell in the downsampled mask is assigned a value of 1 if it overlaps with the original high-resolution mask","venue":null,"work_id":"adbfeded-f1f1-4b49-807e-0e6d0228eedc","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:12.974750Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:f27abc9b7f8ac3977979a5aa094b580a6bfb8f5d6a467c8200c24e7017df6107","observation_id":"e26f0bfe-e2bf-4b04-861c-9b75690a5919","resolution":{"observed_at":"2026-08-06T21:17:20.254747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:19.725234Z","title":null,"venue":null,"work_id":"225e843c-bfb4-4cb9-a985-01ed12e338e7","year":2021},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.145214Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:078272587ecdb46736384abe93ded8cf2d35a2a53c53ce73e2ae9d7e43cdcaa3","observation_id":"839f31c0-7bc6-4924-8a4c-354758aaeef4","resolution":{"observed_at":"2026-08-06T21:17:19.894763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:19.404751Z","title":"While LUViT differs from Pang et al","venue":null,"work_id":"a8dcf170-c35e-4950-877f-e676d672197a","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.371752Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:641d256953728e6324d9952e4fc658a61915ff68c154063beddd48e4fed88d47","observation_id":"c1b92f23-9be1-49a0-89cd-15577e5ca49c","resolution":{"observed_at":"2026-08-06T21:17:19.505420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:19.076857Z","title":"The authors quantified this alignment through demonstrating improved gradient-signal-to-noise ratio (GSNR) under the presence of the LLM block","venue":null,"work_id":"7f2fa0bb-f153-4dbd-a078-3b9ec83d5ac9","year":2020},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.524735Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:6f2f6fafd3dacd7e31da949412b8b18e06897888c3f604cb18c0be45e1126b74","observation_id":"da3ffe0c-fa7e-4a2a-9b93-62a4ef5b3ec6","resolution":{"observed_at":"2026-08-06T21:17:19.186193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:18.869230Z","title":"Following up from this observation and taking inspirations from Tiwari and Shenoy [2023], Bai et al","venue":null,"work_id":"a6b43883-6b45-4a98-b256-358193e9984a","year":2023},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.682924Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:031954bc02e7abeb0e1ae00989a14d39c3e10ff816e6349fa4ef1202b26ba77f","observation_id":"5de44f84-dac2-4840-ac07-61247b0d0f55","resolution":{"observed_at":"2026-08-06T21:17:18.974743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:18.624747Z","title":"This auxiliary training objective distills the representations of the frozen-LLM-appended ViT to a vanilla ViT through a similarity loss in-between [Hinton et al., 2015]","venue":null,"work_id":"9142f7bd-898a-4bae-a0c8-88317ff9fe7e","year":2015},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:13.865294Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:8c4c32dd234d56020704eada173aed9b10370a629db78a6fcce364115d121979","observation_id":"b93c1078-e07f-4bf8-b17e-4ba73ffc0095","resolution":{"observed_at":"2026-08-06T21:17:18.727982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:17.871308Z","title":null,"venue":null,"work_id":"04f98c72-4223-4070-83aa-e0c243ce4fc1","year":2017},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.464832Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:6a082f6aeed491c72c660014dea7efefe7d8cebd9c330f0adda7320e79de1abc","observation_id":"d454685a-4cad-4bbe-8758-f8265300bd6a","resolution":{"observed_at":"2026-08-06T21:17:17.959249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:17.286321Z","title":"Notably, we utilize average pooling setting instead of relying on the [CLS] token for performing classification","venue":null,"work_id":"7608b501-5464-448b-a8ea-3dd4e026751f","year":2020},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.713999Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:0f25f54f96e0416f342202f090666cda5a5176e83f7d4d6de1899543fb011da9","observation_id":"9fdb8a9a-67fb-40f9-a4c6-fe9a7102f9ac","resolution":{"observed_at":"2026-08-06T21:17:17.384759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:16.968226Z","title":null,"venue":null,"work_id":"14220f68-b230-4181-8575-30a39bfc0bc4","year":2017},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.794778Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:8b06bcd0c6e7483f6aa84766b6dc417c2c37c3ebc9a94264d81b3efc2f3453d7","observation_id":"698b20cc-0325-4398-a81c-e2335a8c7cb1","resolution":{"observed_at":"2026-08-06T21:17:17.103304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:16.715079Z","title":"renditions","venue":null,"work_id":"43bd14aa-6196-4e7b-8f20-9fade1e273fe","year":2019},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.935499Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:8356c79d10799b931a1c4ca327eb7e6f45c25374fa70f0eacedffc208486c7f2","observation_id":"fc64965e-b720-4e62-8ec6-4f0240a71397","resolution":{"observed_at":"2026-08-06T21:17:16.834523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:17.602841Z","title":"Finally, the additional capacity baselines in Section 4 all have additional linear projection layers at the head, analogously with where they are placed in LUViT","venue":null,"work_id":"388a9ca9-dc81-466d-8b92-fd833c08c044","year":2022},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.573708Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:5edb70c9b2fc3da5cca74ff0a8b83c69e8fcb1cbb4f338dd7f362f928a3e71b4","observation_id":"e6e964db-c461-44ad-aad6-b0501c535c97","resolution":{"observed_at":"2026-08-06T21:17:17.747453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:18.338649Z","title":null,"venue":null,"work_id":"7400dec9-06d9-4d6a-b2ae-d74cd2b12d14","year":2017},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":768,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.072992Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:8f712d1c2f1ac8439eceb86b2c26d01e1ad0a5db7fb372bb58813e9257c9d043","observation_id":"7d8a0460-13f5-4f0f-ae51-22d3e18d2b07","resolution":{"observed_at":"2026-08-06T21:17:18.423887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-02T09:01:28.869881Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-06T21:17:08.425779Z","title":"Benchmarking neural network robustness to common corruptions and perturbations","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.425779Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:b9a7019cdc3dc99a2968efec9c876a3d13803b0dae4a6c4644434d76edd78cd7","observation_id":"75a915c7-eb95-4384-a911-b85a519eb630","resolution":{"observed_at":"2026-08-06T21:17:08.425779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-06T21:17:07.315858Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.315858Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:18bde7f9d39e058d670572065c4db65e4a5c4c577905d9fac117e04ba553587a","observation_id":"027f2cbc-e45a-4f23-a60b-184b396ade95","resolution":{"observed_at":"2026-08-06T21:17:07.315858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:17:10.424828Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.424828Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:5733cb82fc88c46abfe1fec5407efb75e02f452eb5ccb0fa34375302c0a6a669","observation_id":"47bfb469-ff1f-4a19-829b-6e2b16311c60","resolution":{"observed_at":"2026-08-06T21:17:10.424828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-06T21:17:09.482217Z","title":"Evev2: Improved baselines for encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.482217Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:e9e401ef9d0248d9fd2f470f749c264533e41b5f044a3041982eb5368b314352","observation_id":"d54a2bed-4601-40be-852d-3d6a8fecd470","resolution":{"observed_at":"2026-08-06T21:17:09.482217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T21:17:09.984740Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:09.984740Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:6acc0388d124587834bc74e639345b968ca0293a5b06c525694e80940e122feb","observation_id":"ffa1e9e9-f158-4635-8296-6e50ca07ab6e","resolution":{"observed_at":"2026-08-06T21:17:09.984740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-06T21:17:10.104743Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:10.104743Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:15a780f107c7f6e6ae93010f42996b75e398884c7b80090e5f0c8fe330aba81d","observation_id":"5d8588d1-12b7-4214-92d8-2a3c65addc25","resolution":{"observed_at":"2026-08-06T21:17:10.104743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09994","last_updated":"2020-06-17T16:54:43Z","snapshot_observed_at":"2026-07-06T09:30:08.595544Z","submitted_at":"2020-06-17T16:54:43Z","title":"Noise or Signal: The Role of Image Backgrounds in Object Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09994","snapshot_observed_at":"2026-08-06T21:17:08.554972Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:08.554972Z"},"links":{"cited_paper":"/paper/2006.09994","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:473e9bbf0157c9f101e74af0cebebe9e421ff6f193cca77d009c9643559266ad","observation_id":"3bb7e0bc-074e-4c44-b5fc-3728678743ab","resolution":{"observed_at":"2026-08-06T21:17:08.554972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T21:17:06.272206Z","title":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.272206Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:98f7caaf9eb7f835c67d45631a3b6a91e726a09ff629dd8e29fcd16543a6e666","observation_id":"e2a04bf1-b2b9-4a7c-9aef-03e91098f537","resolution":{"observed_at":"2026-08-06T21:17:06.272206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-06T21:17:07.479266Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.479266Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:2205c2cf379ac89774aa4e17ef80ceed2a1fa6caec9fbc6c8651d53c133c289f","observation_id":"ebad85fb-f08e-4e2c-83cd-bf4aabd2f59e","resolution":{"observed_at":"2026-08-06T21:17:07.479266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T21:17:06.519528Z","title":"Siglip 2: 10 Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.519528Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:e88732f0f6dc9462f4966eb723f5c8024632d3192e75884caa338e05dca1f868","observation_id":"8976a14b-d71a-4b71-a24b-64905332c8cf","resolution":{"observed_at":"2026-08-06T21:17:06.519528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:17:07.660329Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.660329Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:f2b1f9a59426e351d40bb1cfcc5926840d2bc9a5f2c9b2e57116146c6bba30ef","observation_id":"9c1ae321-34d2-4f7c-8dfb-f4ce852f1aee","resolution":{"observed_at":"2026-08-06T21:17:07.660329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20680","last_updated":"2025-03-26T16:15:42Z","snapshot_observed_at":"2026-08-07T16:35:06.566945Z","submitted_at":"2025-03-26T16:15:42Z","title":"Vision as LoRA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20680","snapshot_observed_at":"2026-08-06T21:17:07.858228Z","title":"Vision as lora","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:07.858228Z"},"links":{"cited_paper":"/paper/2503.20680","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:209254b7fc5152c6caa6043b1a0ce87fa43cd445f77f3c0fb7ddcaeb253114f1","observation_id":"2f706a71-111d-4a0b-8e01-496b98b0c5c7","resolution":{"observed_at":"2026-08-06T21:17:07.858228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T21:17:06.711803Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:06.711803Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:ef940d6b8a19217c814bdc99e3396586d3421f7624b433a81b58c0e367b60698","observation_id":"ccd954c7-0920-4a4d-97e2-fd6224cf7758","resolution":{"observed_at":"2026-08-06T21:17:06.711803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:17:18.118459Z","title":null,"venue":null,"work_id":"16924835-ddc7-489b-907b-6032d8fd9301","year":2024},"citing_paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs","version":2},"reference_index":4096,"source":"pdf_text","source_observed_at":"2026-08-06T21:17:14.265854Z"},"links":{"citing_paper":"/paper/2507.00754"},"observation_digest":"sha256:c47462a88cf57a437e6a5ef87d14d4fe77e4871ca9d4bb5cf8f02ca840d7bb3a","observation_id":"6d3a361d-a3ff-45e4-8a4f-53d1e34cc2da","resolution":{"observed_at":"2026-08-06T21:17:18.206814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00754","last_updated":"2025-07-08T19:44:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T06:17:54.949084Z","submitted_at":"2025-07-01T13:58:21Z","title":"Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2507.00754."}