{"as_of":"2026-08-14T18:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b1ea6c56aeda80aead6f86662cf53f4848d2981cac19c2067a84c4013d08032","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:26:00.495364Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.16918/citation-record","integrity":"/paper/2602.16918/integrity","json":"/paper/2602.16918/citation-record.json","paper":"/paper/2602.16918"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.06675","last_updated":"2023-05-08T21:49:57Z","snapshot_observed_at":"2026-08-13T12:45:10.109554Z","submitted_at":"2023-02-13T20:27:30Z","title":"Symbolic Discovery of Optimization Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06675","snapshot_observed_at":"2026-08-02T22:25:58.349439Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.349439Z"},"links":{"cited_paper":"/paper/2302.06675","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:0cfcce2b82f265958adc2fbe64a6aeb277de0bb158968e16bbcd924d233c5f87","observation_id":"4b508cec-537d-41dd-8a86-794fba215770","resolution":{"observed_at":"2026-08-02T22:25:58.349439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-02T22:25:58.434888Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.434888Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:10f30cd7472316c9d708101f6a082bba6e15aa8e5461dc1bc15711a0495a8d1a","observation_id":"861bfd8e-0120-4558-bb20-82a55f20ac88","resolution":{"observed_at":"2026-08-02T22:25:58.434888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14404","last_updated":"2024-01-25T18:59:57Z","snapshot_observed_at":"2026-08-13T04:34:32.714579Z","submitted_at":"2024-01-25T18:59:57Z","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14404","snapshot_observed_at":"2026-08-02T22:25:58.514036Z","title":"Deconstructing denoising diffusion models for self-supervised learning.arXiv preprint arXiv:2401.14404,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.514036Z"},"links":{"cited_paper":"/paper/2401.14404","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:f3e8c89d1d0e576e2497fd08d84577d9292c140fe05e0f3b5828be3c8b8b8b45","observation_id":"e0fc1917-471d-412f-96ca-d39244f146d2","resolution":{"observed_at":"2026-08-02T22:25:58.514036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.22062","last_updated":"2025-08-01T06:40:13Z","snapshot_observed_at":"2026-08-10T12:44:14.015550Z","submitted_at":"2025-07-29T17:59:58Z","title":"Meta CLIP 2: A Worldwide Scaling Recipe","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.22062","snapshot_observed_at":"2026-08-02T22:25:58.596814Z","title":"Metaclip 2: A worldwide scaling recipe.arXiv preprint arXiv:2507.22062,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.596814Z"},"links":{"cited_paper":"/paper/2507.22062","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:83bc43936c429a0de6c3c2abadee143a94781783679b8c6362bee4636b59c3c1","observation_id":"5cc71124-0f00-41db-97c1-36ec5518baa5","resolution":{"observed_at":"2026-08-02T22:25:58.596814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-02T22:25:58.680370Z","title":"Vision transformers need registers.ArXiv, abs/2309.16588, 2023.https://api.semanticscholar.org/CorpusID:263134283","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.680370Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:762f48ea6e9ce5b1c7e5c553e933ce2db84634f4c1962619ef0798bef15d261b","observation_id":"c1b7200c-2e27-405f-97c9-d69808dc5286","resolution":{"observed_at":"2026-08-02T22:25:58.680370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20088","last_updated":"2023-10-28T08:46:13Z","snapshot_observed_at":"2026-08-13T11:28:03.339274Z","submitted_at":"2023-05-31T17:59:04Z","title":"Improving CLIP Training with Language Rewrites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20088","snapshot_observed_at":"2026-08-02T22:25:58.763379Z","title":"Improving clip training with language rewrites.ArXiv, abs/2305.20088, 2023a.https://api.semanticscholar.org/CorpusID:258987272","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.763379Z"},"links":{"cited_paper":"/paper/2305.20088","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:d481b1be235095485646345263f13fb015adfd2f1573e7234d20a46d0bb1d991","observation_id":"d7e408fc-18e5-4f02-b520-14d1d29dcb93","resolution":{"observed_at":"2026-08-02T22:25:58.763379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-02T22:25:58.846646Z","title":"Simcse: Simple contrastive learning of sentence embeddings.ArXiv, abs/2104.08821, 2021.https://api.semanticscholar.org/CorpusID:233296292","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.846646Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:c286b72640c27d39dfa915e3fb1d8515169e5099d45bf25e66706e66fcfedfe4","observation_id":"b594624c-d56b-4114-b2bf-95085c3e3573","resolution":{"observed_at":"2026-08-02T22:25:58.846646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T22:25:58.929501Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.929501Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:79736218f794b5717ee32e3f12f761dce3fb7780020a5c8d057f4f42aab15d76","observation_id":"f5676fdd-2261-48a0-a90d-caa06f22b53e","resolution":{"observed_at":"2026-08-02T22:25:58.929501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-02T22:25:59.074234Z","title":"Edward Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.074234Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:dd06d12dc165789eb3d4be52372b76b85f8a26d494742d9ffbca482c812a73c1","observation_id":"699fa30a-6d82-4273-ade3-3ced50b5e6ed","resolution":{"observed_at":"2026-08-02T22:25:59.074234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-02T22:25:59.149510Z","title":"The kinetics human action video dataset, 2017.https://arxiv.org/abs/1705.06950","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.149510Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:0b2f4c192848c5d8fc5ca5027b40ad9386992cc93c03466d32aa519c471e26c8","observation_id":"504cca27-18fb-4424-a97a-6feb7e8edbbc","resolution":{"observed_at":"2026-08-02T22:25:59.149510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:25:59.314447Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.314447Z"},"links":{"citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:21546cc274dddc9db209860f8c2c21b0da32b69632a3063bfb4ad4048bd10b78","observation_id":"01c48d91-fe66-4049-8a96-885d6737b0ab","resolution":{"observed_at":"2026-08-02T22:25:59.314447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00932","last_updated":"2018-05-02T17:57:16Z","snapshot_observed_at":"2026-08-07T04:01:41.808023Z","submitted_at":"2018-05-02T17:57:16Z","title":"Exploring the Limits of Weakly Supervised Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00932","snapshot_observed_at":"2026-08-02T22:25:59.397561Z","title":"Dhruv Mahajan, Ross Girshick, Vignesh Ramanathan, Kaiming He, Manohar Paluri, Yixuan Li, Ashwin Bharambe, and Laurens van der Maaten","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.397561Z"},"links":{"cited_paper":"/paper/1805.00932","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:d1dcec3f100e49bd47b5f2c059d1135cf754450f95578151f4ee5ed0941d9b12","observation_id":"95340127-4d20-444d-9118-4f8ce75c5177","resolution":{"observed_at":"2026-08-02T22:25:59.397561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T22:25:59.478503Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.478503Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:ab1ac4640d9b93cb27723a13f67958d7bd976502a12e28a17c80762fb9f80f66","observation_id":"f6fa7d81-3589-4fe0-a5cf-6eeadcac4002","resolution":{"observed_at":"2026-08-02T22:25:59.478503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-08-13T17:36:16.794649Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-02T22:25:59.535987Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.ArXiv, abs/2210.08402,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.535987Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:cfa0b5990365210853ec9d579ca088751014b66eb6abe7b056ad7819303c3e57","observation_id":"696c96a6-75cc-40bf-b530-93bb54c9f38a","resolution":{"observed_at":"2026-08-02T22:25:59.535987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04235","last_updated":"2018-04-11T21:42:32Z","snapshot_observed_at":"2026-07-06T06:32:58.709094Z","submitted_at":"2018-04-11T21:42:32Z","title":"Adafactor: Adaptive Learning Rates with Sublinear Memory Cost","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04235","snapshot_observed_at":"2026-08-02T22:25:59.611339Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.611339Z"},"links":{"cited_paper":"/paper/1804.04235","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:beff108ba8daf283a745299e3e8c78b4fbc1bf829e2a09b0af9e32a519acdc3c","observation_id":"3dbfe0ee-661d-4a8a-9b15-41a9782eab60","resolution":{"observed_at":"2026-08-02T22:25:59.611339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-13T10:44:26.934833Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-02T22:25:59.691930Z","title":"Mannat Singh, Laura Gustafson, Aaron B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.691930Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:ed1ecb8ec50d8ac60ac684e7308e624e6c9044e970d5a0c308be6d01ae435b86","observation_id":"a4cc25f9-992f-4ba6-9599-89d16fb03e88","resolution":{"observed_at":"2026-08-02T22:25:59.691930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-14T03:33:46.294739Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-02T22:25:59.752258Z","title":"Roformer: Enhanced transformer with rotary position embedding.ArXiv, abs/2104.09864, 2021.https://api.semanticscholar.org/CorpusID:233307138","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.752258Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:82bf5caed9f4e495fd8d797baf62a6daa4674c230b196fa6c47ae01c8b557813","observation_id":"b55b2978-a860-4702-a0b5-39b37c7870e3","resolution":{"observed_at":"2026-08-02T22:25:59.752258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02727","last_updated":"2024-09-05T07:17:59Z","snapshot_observed_at":"2026-08-14T07:05:33.447586Z","submitted_at":"2024-09-04T14:01:48Z","title":"Pooling And Attention: What Are Effective Designs For LLM-Based Embedding Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02727","snapshot_observed_at":"2026-08-02T22:25:59.821475Z","title":"Gemma Team, Thomas Mesnard, Cassidy Hardin, Robert Dadashi, Surya Bhupatiraju, Shreya Pathak, Laurent Sifre, Morgane Rivière, Mihir Sanjay Kale, Juliette Love, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.821475Z"},"links":{"cited_paper":"/paper/2409.02727","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:fad02a8872d4f5d0b19104d7c6eee5aeb0190bdb81e2e8461fe958367d7ce0b7","observation_id":"9e0582b5-d228-4703-97d3-dc1607de51c5","resolution":{"observed_at":"2026-08-02T22:25:59.821475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T22:25:59.878103Z","title":"Llama: Open and efficient foundation language models.ArXiv, abs/2302.13971, 2023a","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.878103Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:8a904996a870a56f0e049bcb43223a92307a19e420248e578b011410f8ed7e5c","observation_id":"bbc80d26-e53f-4a8a-aa16-25f31f6abe37","resolution":{"observed_at":"2026-08-02T22:25:59.878103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-02T22:25:59.954000Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.954000Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:7bb4b222526d6fc0ac798e00fe33af3ea4394d884c78e0f723fd503f8cee9b3f","observation_id":"db195f75-9445-4edb-8d16-bd3c9152f423","resolution":{"observed_at":"2026-08-02T22:25:59.954000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-02T22:26:00.039076Z","title":"Representation learning with contrastive predictive coding.preprint arXiv:1807.03748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T22:26:00.039076Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:b509ef0a44e630f7c53bb3c50fdb02ea028a311e3f20835d6c303be605ed5272","observation_id":"a03cbcfc-fb3c-4eed-b62c-572431ca23dc","resolution":{"observed_at":"2026-08-02T22:26:00.039076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-02T22:26:00.202547Z","title":"Demystifying clip data.arXiv preprint arXiv:2309.16671,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T22:26:00.202547Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:cdfd8b2663aaaf82c7bcb70d5b411aa58949ccb5912d1a4d5bc13a1819afaf9b","observation_id":"0966b5a3-9fd4-4390-aa95-823c9abd1975","resolution":{"observed_at":"2026-08-02T22:26:00.202547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:26:00.317594Z","title":"Msr-vtt: A large video description dataset for bridging video and language.2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 5288–5296,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T22:26:00.317594Z"},"links":{"citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:797b95944004244fac13a10002b2ee89e59f7a29da31b761050fada67a5ebf9f","observation_id":"1a317e63-dab9-481c-8136-3d3b0d18d5e5","resolution":{"observed_at":"2026-08-02T22:26:00.317594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-02T22:25:59.015365Z","title":"Kaiming He, Haoqi Fan, Yuxin Wu, Saining Xie, and Ross Girshick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.015365Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:f63542d140588f75ac4924390abe85c83bda731d5e3e806b678d4c48ac63b3ab","observation_id":"4b902530-fcc4-4c89-8711-732db56544e2","resolution":{"observed_at":"2026-08-02T22:25:59.015365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-02T22:26:00.495364Z","title":"Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, and Lucas Beyer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T22:26:00.495364Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:c8b794dcce310bbcee6d5f37e8c22f6882c0e53b22fe2fff4c07f2c7461a18d1","observation_id":"e4a64b7c-4877-4d2d-9b1b-2d934359eb4f","resolution":{"observed_at":"2026-08-02T22:26:00.495364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:25:58.269295Z","title":"Hong-You Chen, Zhengfeng Lai, Haotian Zhang, Xinze Wang, Marcin Eichner, Keen You, Meng Cao, Bowen Zhang, Yinfei Yang, and Zhe Gan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.269295Z"},"links":{"citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:780b2b3a1a41aa6530cd4a3795d9fa70c18941130e9a8c9f6943057124c7c221","observation_id":"f5522b7c-7839-4be4-8dce-a74a5544fd79","resolution":{"observed_at":"2026-08-02T22:25:58.269295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19596","last_updated":"2024-11-11T22:39:35Z","snapshot_observed_at":"2026-08-13T00:42:49.427752Z","submitted_at":"2024-03-28T17:20:39Z","title":"LocCa: Visual Pretraining with Location-aware Captioners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19596","snapshot_observed_at":"2026-08-02T22:26:00.121160Z","title":"Locca: Visual pretraining with location-aware captioners.arXiv preprint arXiv:2403.19596,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T22:26:00.121160Z"},"links":{"cited_paper":"/paper/2403.19596","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:ffb351370a95d983e6332c490aad32d4449d2e961ea7d376e6f1cdb8b2aa9945","observation_id":"1e7d7fe6-1d9e-4aab-9d44-46a5177bd1ac","resolution":{"observed_at":"2026-08-02T22:26:00.121160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-02T22:25:58.087918Z","title":"Language models are few-shot learners.arXiv preprint arXiv:2005.14165,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.087918Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:9d4c2963a307025754f2d13b29abe127698948ae3d74e402084ddde6e09cd307","observation_id":"77d81c88-65f5-4b27-a17a-116f7dfc034f","resolution":{"observed_at":"2026-08-02T22:25:58.087918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:25:58.185292Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:58.185292Z"},"links":{"citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:209f10edc5248c91716e150331f01bee72d6dc0431291e391563db85880beabf","observation_id":"eebaee77-cf9e-4e9c-b509-705411c184e5","resolution":{"observed_at":"2026-08-02T22:25:58.185292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09865","last_updated":"2024-01-18T10:28:45Z","snapshot_observed_at":"2026-08-13T04:40:00.173473Z","submitted_at":"2024-01-18T10:28:45Z","title":"Improving fine-grained understanding in image-text pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09865","snapshot_observed_at":"2026-08-02T22:25:57.884381Z","title":"Tenenbaum, and Boris Katz","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:57.884381Z"},"links":{"cited_paper":"/paper/2401.09865","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:8f49a32729c6a75c385c5bb7df520031575b6c5d2990f044cc0eda16d16cfb3a","observation_id":"bc6b390b-0fa7-4974-ba07-ac700ebf8f6d","resolution":{"observed_at":"2026-08-02T22:25:57.884381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:25:59.231880Z","title":"Poggio, and Thomas Serre","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:59.231880Z"},"links":{"citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:a94aebe80878a1d40333b790dc20a76f79f98c15cf23323d7baf77e12fd5e0f7","observation_id":"67e131ad-0a4e-46a9-9c23-526340582a32","resolution":{"observed_at":"2026-08-02T22:25:59.231880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-02T22:25:57.964997Z","title":"Token merging: Your vit but faster.ArXiv, abs/2210.09461, 2022.https://api.semanticscholar.org/CorpusID:252968113","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:57.964997Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:9b1a62c38b94e4e0e68154e6488655032e3b614f290a8dcd9720ecb076cfae51","observation_id":"3a5f23d3-fca3-48fc-bbbe-f97a1817f0e2","resolution":{"observed_at":"2026-08-02T22:25:57.964997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-02T22:25:57.827119Z","title":"Hangbo Bao, Li Dong, and Furu Wei","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T22:25:57.827119Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2602.16918"},"observation_digest":"sha256:1529c4ab0f294bf264ddb8d943e549f35d9a68e2fca807838fd45b976dd7ce4a","observation_id":"8ca2d4af-bf68-4a7a-b8bf-f51fae9b828e","resolution":{"observed_at":"2026-08-02T22:25:57.827119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.16918","last_updated":"2026-07-13T23:32:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T07:37:41.197314Z","submitted_at":"2026-02-18T22:22:44Z","title":"Xray-Visual Models: Scaling Vision models on Industry Scale Data"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2602.16918."}