{"as_of":"2026-08-15T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c60abab0ea60d9d15f14aea549efb3ef0e0718d9be55f7acbcc6929a055657e","coverage":[{"denominator":137,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:17:22.748659Z","state":"measured"},{"denominator":121,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":121,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:35:45.447426Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T01:25:16.481218Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-10T22:03:25.012606Z","title":"Mul- timodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03012","last_updated":"2025-08-13T13:42:57Z","snapshot_observed_at":"2026-08-14T11:30:23.806649Z","submitted_at":"2025-01-06T13:37:13Z","title":"Analyzing Finetuning Representation Shift for Multimodal LLMs Steering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:25.012606Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2501.03012"},"observation_digest":"sha256:0ccf7dd230df8df28ffe152f2e48d4644c5e84770880e8d5a4b0c96f76a41c5c","observation_id":"b9a9bf37-d122-4f11-942b-87fddc10995f","resolution":{"observed_at":"2026-08-10T22:03:25.012606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-10T21:02:00.842792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06708","last_updated":"2026-05-25T22:00:48Z","snapshot_observed_at":"2026-08-12T23:47:24.076762Z","submitted_at":"2025-01-12T04:28:14Z","title":"Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:00.842792Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2501.06708"},"observation_digest":"sha256:caffcab64b80b094d8171c5ea734a506546373e24adf4dc3bdca57eca0984622","observation_id":"35ae0f1d-efac-48c4-b0fa-6a96058e3f29","resolution":{"observed_at":"2026-08-10T21:02:00.842792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-10T20:08:46.054919Z","title":"Mul- timodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09425","last_updated":"2025-05-13T06:30:11Z","snapshot_observed_at":"2026-08-15T04:34:33.617262Z","submitted_at":"2025-01-16T09:55:42Z","title":"Vision-Language Models Do Not Understand Negation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:08:46.054919Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2501.09425"},"observation_digest":"sha256:3d412650a5b3601f7f7432e8d3694decd30314ae7df96a665568107285234d7f","observation_id":"11613278-2c26-4b96-9ae0-c64f4c515b2a","resolution":{"observed_at":"2026-08-10T20:08:46.054919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-10T18:59:22.319238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10834","last_updated":"2025-01-18T17:43:05Z","snapshot_observed_at":"2026-08-15T00:02:25.734842Z","submitted_at":"2025-01-18T17:43:05Z","title":"Visual RAG: Expanding MLLM visual knowledge without fine-tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:59:22.319238Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2501.10834"},"observation_digest":"sha256:f7b7d6f2cb6a52e85b1756de739b77c1840ec26475dc220facc957b15f55d333","observation_id":"38860a84-a34c-4cd6-9d80-ac34c38cf331","resolution":{"observed_at":"2026-08-10T18:59:22.319238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-07T22:43:59.386454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09093","last_updated":"2025-02-13T09:04:28Z","snapshot_observed_at":"2026-08-13T17:42:20.149917Z","submitted_at":"2025-02-13T09:04:28Z","title":"From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T22:43:59.386454Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2502.09093"},"observation_digest":"sha256:11930947b6ef458eafe077669ffd2c4747cccd90c08bb32136fd8500a6cf91ef","observation_id":"fe39133e-42aa-4f9e-83a9-02747cc62934","resolution":{"observed_at":"2026-08-07T22:43:59.386454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":"2411.14402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal autoregressive pre-training of large vision encoders","venue":null,"work_id":"1982a4f1-7cdd-448e-8ddd-85cd782e6e17","year":2024},"citing_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:49:22.279848Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2502.14786"},"observation_digest":"sha256:67a078f2e4870b1627bd102b8f2b5a3b958924f207a236fd683e66f5b351b1cc","observation_id":"8c3bff0d-e2ae-4cf5-a8d7-9c7ecdd809c9","resolution":{"observed_at":"2026-05-10T15:49:22.317639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":"2411.14402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal autoregressive pre-training of large vision encoders","venue":null,"work_id":"1982a4f1-7cdd-448e-8ddd-85cd782e6e17","year":2024},"citing_paper":{"arxiv_id":"2503.02597","last_updated":"2026-05-15T01:15:57Z","snapshot_observed_at":"2026-08-03T04:26:47.170682Z","submitted_at":"2025-03-04T13:18:33Z","title":"Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T01:23:01.892612Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2503.02597"},"observation_digest":"sha256:1cde2ddd84c08bff4e6bba92418645ac8f6199e26a0f5eac5a0ce503d966cb14","observation_id":"db3b232f-c938-47f5-8409-9c61c4a76f1f","resolution":{"observed_at":"2026-05-23T01:25:16.484883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-15T21:35:45.447426Z","title":"Multimodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09498","last_updated":"2025-05-14T15:45:17Z","snapshot_observed_at":"2026-08-15T21:27:28.666241Z","submitted_at":"2025-05-14T15:45:17Z","title":"Flash-VL 2B: Optimizing Vision-Language Model Performance for Ultra-Low Latency and High Throughput","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:35:45.447426Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2505.09498"},"observation_digest":"sha256:d56a45dd41044e50d04b955546061cc409bffb6ff6096db4898fb4f4765d1129","observation_id":"5ff1c0eb-cc4e-4745-9acc-859ebcf812c4","resolution":{"observed_at":"2026-08-15T21:35:45.447426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-15T21:07:59.768232Z","title":"Multimodal autore- gressive pre-training of large vision encoders","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10917","last_updated":"2025-05-19T09:40:28Z","snapshot_observed_at":"2026-08-15T20:58:49.771983Z","submitted_at":"2025-05-16T06:43:02Z","title":"VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:59.768232Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2505.10917"},"observation_digest":"sha256:bab3fe389bc27be177b0732795735182c15dbeafe0438bc5208dc4629b47e142","observation_id":"1692588c-b51e-4fdc-ae1b-c2cdc1f82b46","resolution":{"observed_at":"2026-08-15T21:07:59.768232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-07T15:39:33.091881Z","title":"Multimodal autoregressive pre-training of large vi- sion encoders,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14336","last_updated":"2025-05-21T14:22:18Z","snapshot_observed_at":"2026-08-09T14:12:04.052166Z","submitted_at":"2025-05-20T13:20:55Z","title":"Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:33.091881Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2505.14336"},"observation_digest":"sha256:183c9cd6fe7695a846d3492cdc2814b45fc6d681538f3222f207e87517b0c812","observation_id":"c8812366-15d3-45be-8a37-11d69eec5b6e","resolution":{"observed_at":"2026-08-07T15:39:33.091881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-07T14:09:15.985872Z","title":"Mul- timodal autoregressive pre-training of large vision encoders,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19779","last_updated":"2025-05-26T10:04:40Z","snapshot_observed_at":"2026-08-14T02:08:24.545539Z","submitted_at":"2025-05-26T10:04:40Z","title":"Advancements in Medical Image Classification through Fine-Tuning Natural Domain Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.985872Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2505.19779"},"observation_digest":"sha256:13148b46011005c7784f72f50681f15476e991c2e0faea8af3b7c45dc6ed9d35","observation_id":"0728f44c-cc8d-4784-b3e7-b2147815bf8c","resolution":{"observed_at":"2026-08-07T14:09:15.985872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-07T05:27:16.016313Z","title":"Mul- timodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08071","last_updated":"2025-06-09T17:54:41Z","snapshot_observed_at":"2026-08-13T16:46:01.717476Z","submitted_at":"2025-06-09T17:54:41Z","title":"CuRe: Cultural Gaps in the Long Tail of Text-to-Image Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:16.016313Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2506.08071"},"observation_digest":"sha256:a8aafa4f87a06b2b5c047f11017d38fd6381afb795c5b2c3574014b7f9e9dee4","observation_id":"73860be0-67e3-4044-ad80-3203f726ffc8","resolution":{"observed_at":"2026-08-07T05:27:16.016313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":"2411.14402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal autoregressive pre-training of large vision encoders","venue":null,"work_id":"1982a4f1-7cdd-448e-8ddd-85cd782e6e17","year":2024},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-08-11T14:54:27.718296Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:b287421a573a0c1b65b4d90a71713a53e41bd81c1977c8b006f15d4b0bb8957a","observation_id":"8f3a1ec8-383f-4a72-92bd-bacd9751eb5e","resolution":{"observed_at":"2026-05-19T11:13:02.851822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":"2411.14402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal autoregressive pre-training of large vision encoders","venue":null,"work_id":"1982a4f1-7cdd-448e-8ddd-85cd782e6e17","year":2024},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-08-15T13:40:01.739055Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:29957034ef9cad0f3525e20dae98694a4d47f358774a33d798f292623d2f3db7","observation_id":"0d1cdbad-61e0-4aa1-8757-c176ebea21e6","resolution":{"observed_at":"2026-05-11T00:33:50.796334Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-06T20:53:04.264739Z","title":"Multimodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-10T17:36:05.348568Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.264739Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:cb95806a1f91eba380eba8718c117fbb1e4915314453253b9fb9d74b46c62e3e","observation_id":"420672e1-1066-4026-9620-448ba0bb8c5f","resolution":{"observed_at":"2026-08-06T20:53:04.264739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-06T20:38:28.632831Z","title":"Susskind, and Alaaeldin El-Nouby","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-14T07:01:53.180437Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:28.632831Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:d29589a453106b7004e8d554301272357668b46be0692fc68d5916614d5cd6a0","observation_id":"a26c49c9-2976-4085-b180-0cb9d3af72cb","resolution":{"observed_at":"2026-08-06T20:38:28.632831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-05T12:22:33.329919Z","title":"Mul- timodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-11T21:19:23.858904Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:33.329919Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:aef651630e619c815dd259ccdd45036b7d27183b266740bce56d38567038481c","observation_id":"0318e99b-ce9f-42c5-bb61-293b850ed45c","resolution":{"observed_at":"2026-08-05T12:22:33.329919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-04T05:37:50.158868Z","title":"Mul- timodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.00086","last_updated":"2026-08-03T16:53:23Z","snapshot_observed_at":"2026-08-13T09:01:29.797057Z","submitted_at":"2026-03-31T18:00:39Z","title":"Hierarchical Pre-Training of Vision Encoders with Large Language Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T05:37:50.158868Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2604.00086"},"observation_digest":"sha256:cf6134802319a1f0c71f135d7eca8ff7dbbfff545c852f9b68bfbca7537a07f2","observation_id":"08145ee1-f2ae-4ef8-ac64-74f29d294ab4","resolution":{"observed_at":"2026-08-04T05:37:50.158868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":"2411.14402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal autoregressive pre-training of large vision encoders","venue":null,"work_id":"1982a4f1-7cdd-448e-8ddd-85cd782e6e17","year":2024},"citing_paper":{"arxiv_id":"2604.17376","last_updated":"2026-07-06T16:10:31Z","snapshot_observed_at":"2026-08-13T01:05:04.815886Z","submitted_at":"2026-04-19T10:59:17Z","title":"Towards Generalizable Deepfake Image Detection with Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T06:36:56.465272Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2604.17376"},"observation_digest":"sha256:403ff535358d9f230fb6c62d1deee21142713ffd035cf35f0cff06441bcf5fed","observation_id":"bb0a169b-0d0c-4acd-9423-c1c812e585c2","resolution":{"observed_at":"2026-05-10T06:41:36.897978Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-07-13T02:39:58.984385Z","title":"arXiv:2411.14402 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09488","last_updated":"2026-07-10T15:05:21Z","snapshot_observed_at":"2026-08-13T05:24:37.438542Z","submitted_at":"2026-07-10T15:05:21Z","title":"SigLIP-HD by Fine-to-Coarse Supervision","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-13T02:39:58.984385Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2607.09488"},"observation_digest":"sha256:ee30f9791ca96f8bbbc68b9b6e592c7ddf0b3be4527dee3851ef46beb7051be7","observation_id":"70d6a3f6-3ad7-4717-bdb5-3abddc3e4ec1","resolution":{"observed_at":"2026-07-13T02:39:58.984385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-07-31T06:20:14.033388Z","title":"Multimodal autoregressive pre-training of large vision encoders.arXiv preprint arXiv:2411.14402, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-15T01:08:05.619745Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:14.033388Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:f4d286442637064ea983b4314dcdee7ff65af7205606ba87e63c53ba708da470","observation_id":"552d91c6-28e5-46c2-a490-ea569baa9126","resolution":{"observed_at":"2026-07-31T06:20:14.033388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14402/citation-record","integrity":"/paper/2411.14402/integrity","json":"/paper/2411.14402/citation-record.json","paper":"/paper/2411.14402"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T15:17:22.375349Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.375349Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:7b4a4ec25fa8bbe5c3be4712a8b09f95c83b1efec303c965ebb37ccf1a96371b","observation_id":"9b4ca4f7-aa21-4a23-b87f-385b1a76dfe2","resolution":{"observed_at":"2026-08-12T15:17:22.375349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.380106Z","title":"Nocaps: Novel object cap- tioning at scale","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.380106Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:7ffa94c4c21fa46b6b360b6f645e62112ba5a1cd2ab5e80705d729bdf7c7e0ab","observation_id":"5bc970ba-21f5-412f-9762-c173c791013b","resolution":{"observed_at":"2026-08-12T15:17:22.380106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.383937Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.383937Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:455099dc864a359c73d16e8e6d1845e6fca29f2f47939b9e531fb89506be0719","observation_id":"31e2e298-fb61-4d80-a9b0-73b813ff38a4","resolution":{"observed_at":"2026-08-12T15:17:22.383937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08243","last_updated":"2023-04-13T17:59:37Z","snapshot_observed_at":"2026-08-13T13:01:01.045106Z","submitted_at":"2023-01-19T18:59:01Z","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08243","snapshot_observed_at":"2026-08-12T15:17:22.387847Z","title":"Self-supervised learning from im- ages with a joint-embedding predictive architecture","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.387847Z"},"links":{"cited_paper":"/paper/2301.08243","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:2616c8bf678c849d99ed2275c70e62cd1b54859fd0d8db60d6f41c30aa34c896","observation_id":"8b78b674-1330-43fe-af85-fe247ef76a06","resolution":{"observed_at":"2026-08-12T15:17:22.387847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T15:17:22.391871Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.391871Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:ad30a80d254319e0d5a6b67c6836944213e8f0faa9f2be9e4a19c97ca7974979","observation_id":"30508ccc-e3ba-41ee-a202-96ea9ac6f0d6","resolution":{"observed_at":"2026-08-12T15:17:22.391871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T15:17:22.395674Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.395674Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:3767193c8de7c85e298a0d656894c68eb4133f8b31fc5bf346149936fb0ba2d9","observation_id":"fdae0bd5-2d23-4638-8d52-81c17daf68d3","resolution":{"observed_at":"2026-08-12T15:17:22.395674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.399915Z","title":"From detection of individual metastases to classification of lymph node status at the pa- tient level: the camelyon17 challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.399915Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:a8254d31c489a74274b57fd08aedb8a41e9d69868bf9e64b7ce1a7637e71f59c","observation_id":"6ca328a1-9710-41a6-a5d2-fec628540c1f","resolution":{"observed_at":"2026-08-12T15:17:22.399915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.403826Z","title":"BEiT: Bert pre- training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.403826Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:a54c36c99ff2708e7c980ae3aa1446ed62d3e3fda4275f8a5950429e94e9d8db","observation_id":"a0aaf7d9-e904-46f6-ac68-6ad90c6eac8e","resolution":{"observed_at":"2026-08-12T15:17:22.403826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.407402Z","title":"Flexivit: One model for all patch sizes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.407402Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:c4c60b50c523dd24019e4afa5f36ce0f5e8aaba79be4ffc90d65e983a2504bb5","observation_id":"bcf6dafb-1f3d-476c-ba2e-4b2f8ae9efe9","resolution":{"observed_at":"2026-08-12T15:17:22.407402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.411184Z","title":"Food-101 – mining discriminative components with ran- dom forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.411184Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:97cb8e477fab9de2de552d7b7958a471d0f12488305e457ea6e47915f7dce0ed","observation_id":"d1e0d4bb-7189-4809-b5e2-fee77737d066","resolution":{"observed_at":"2026-08-12T15:17:22.411184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.415076Z","title":"Time series analysis: forecasting and control","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.415076Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:b21c63c69fff5be202a798b00e4a62798b902b795104c22b2bb1acd0dd06c9a5","observation_id":"fea36b10-7818-4644-b7e3-81ca5fc6a9a1","resolution":{"observed_at":"2026-08-12T15:17:22.415076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T15:17:22.418593Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.418593Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:1f89c75aa708254897573219a36d819332fd3a0b741fb8bcf59e921bb69df148","observation_id":"1bfeb3e2-5170-4879-937f-83f4dd8060c3","resolution":{"observed_at":"2026-08-12T15:17:22.418593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.422405Z","title":"Coyo-700m: Image-text pair dataset, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.422405Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:d05a9990fca3d263111ac722a5ff1ea09d21692033069f78294f0691a24ccda3","observation_id":"faf41b7a-c743-442e-83a2-6ecbf8723a24","resolution":{"observed_at":"2026-08-12T15:17:22.422405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.425638Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.425638Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:c650d512096473bd0624f8cc381c9f87511337a9cf8242586b66363bdd141dbf","observation_id":"cfe5a846-2afb-449b-83c3-ba8d4b50bd97","resolution":{"observed_at":"2026-08-12T15:17:22.425638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.429185Z","title":"Unsupervised learn- ing of visual features by contrasting cluster assignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.429185Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:8636bc0666abbe2482b735fe87aa0f01b493e6270f7c9b8ac9836e1606be8506","observation_id":"9aae2335-5283-4c6f-9ae1-08d9149961fc","resolution":{"observed_at":"2026-08-12T15:17:22.429185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.432738Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.432738Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:e32bd10ba42045ae7f71b446800f90b373e27f3f521a22d4da3eacd6acb9e770","observation_id":"b02d1d74-2054-4069-a87c-e5af80c729c7","resolution":{"observed_at":"2026-08-12T15:17:22.432738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.436223Z","title":"A generative approach for wikipedia-scale visual entity recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.436223Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:72aeb78b397724b92f409a03098895fb659953248575aef4b282f38e41fe5b5d","observation_id":"bd86e4ca-80fa-4289-b35c-fe7d84ec4339","resolution":{"observed_at":"2026-08-12T15:17:22.436223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.439932Z","title":"Mmdetection: Open mmlab detection toolbox and benchmark","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.439932Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:ca799bcfb691e815b88d7cbba38ecffd9d8254d9db9bf79990cf3b07338ca375","observation_id":"82341a4f-b06c-4602-9c52-85318551e01e","resolution":{"observed_at":"2026-08-12T15:17:22.439932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.443385Z","title":"Generative pre- training from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.443385Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:735987a58422157b59b8b4fcd407baac87fa54aa1d33c180dc9dffde15f0c917","observation_id":"7f693463-45a9-4f47-9598-bf16e1eecb30","resolution":{"observed_at":"2026-08-12T15:17:22.443385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.446597Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.446597Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:e98d65cfa99bd8bcff8da8a75141ae664f0d546bd4b85ab1b7167f23ecaa945c","observation_id":"49f7072e-60e7-44f1-bc1e-2b55fb7d9bd3","resolution":{"observed_at":"2026-08-12T15:17:22.446597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-12T15:17:22.449822Z","title":"Microsoft coco captions: Data collection and eval- uation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.449822Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:8595547e519a2710e8c9a3568146a7a92e1c23020467fdca8498fbbf00d7c3c4","observation_id":"98afe1f3-3b4f-4e56-a41f-3f6d42fbaaab","resolution":{"observed_at":"2026-08-12T15:17:22.449822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.453804Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.453804Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:2e539f880d45462051a65ac5aabd52433fc18b38e51b8f25ab680eab01058261","observation_id":"d2ad7346-77b2-48b3-a3da-8878fb5733a2","resolution":{"observed_at":"2026-08-12T15:17:22.453804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-12T15:17:22.457456Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.457456Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:7f2bd8d28745a1825446b94e15015f22cf7aed5b872adb54308c7ab689ba0f24","observation_id":"3d45c89c-538e-4a6a-9985-3d4791db9511","resolution":{"observed_at":"2026-08-12T15:17:22.457456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.461117Z","title":"Functional map of the world","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.461117Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:28dae6a4b6dbb0fe57e0e3e973f944de5d99c2f7f721d604e55d4ab1ee522559","observation_id":"dd188d22-d450-478e-b068-16a62335877f","resolution":{"observed_at":"2026-08-12T15:17:22.461117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.465645Z","title":"Cimpoi, S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.465645Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:11e4495957f989837bafc3082bd45e646a0712d70d27df174f8d98e5d1a02eb4","observation_id":"80c5bd87-eacb-4ac9-8091-3d0ea2648a1f","resolution":{"observed_at":"2026-08-12T15:17:22.465645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.469894Z","title":"Patch n’pack: Navit, a vision trans- former for any aspect ratio and resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.469894Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:477060f607e14bc9b0adcbda470f436c6cbb9ee655726d88f117087567cf90c0","observation_id":"2aca9d57-3dea-4db5-a53a-f39a78fcc253","resolution":{"observed_at":"2026-08-12T15:17:22.469894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.474699Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.474699Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:6bb5c51df60b848f62bdc6714546f54db6a208a6aa20c835ceb4734d8e2f4dc8","observation_id":"91829b37-0168-497f-ae80-517a6d679241","resolution":{"observed_at":"2026-08-12T15:17:22.474699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.478817Z","title":"Virtex: Learning visual representations from textual annotations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.478817Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:45c09b133e60cdbaee841f06c81694157b35460b1e9ec693df30e5cf3bf156d8","observation_id":"4eb682a7-1c36-42bf-b02a-acaa29fea8cd","resolution":{"observed_at":"2026-08-12T15:17:22.478817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.482407Z","title":"Unsu- pervised visual representation learning by context predic- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.482407Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:46ede6f4528f7ab773446238bc314ff4a6bdadbd8e5c939821ef61e972aa376a","observation_id":"690aec9b-61b4-4662-97f4-54e7a7285180","resolution":{"observed_at":"2026-08-12T15:17:22.482407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.487173Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.487173Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:0cf41a41cb901715d25ee338ae7c32b324e21c366f78b8e0014eaf72dfdfc558","observation_id":"ae746e19-b83e-4bf3-8fce-8ce1df98e0bd","resolution":{"observed_at":"2026-08-12T15:17:22.487173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T15:17:22.494393Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.494393Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:6b5515018cf74a66d380568e054062ed1f2b03934bdce5224db322d9fe8c25eb","observation_id":"a8a7aa3d-9257-4e57-a637-4714d1977bdc","resolution":{"observed_at":"2026-08-12T15:17:22.494393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08541","last_updated":"2024-01-16T18:03:37Z","snapshot_observed_at":"2026-08-13T04:41:49.603230Z","submitted_at":"2024-01-16T18:03:37Z","title":"Scalable Pre-training of Large Autoregressive Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08541","snapshot_observed_at":"2026-08-12T15:17:22.498155Z","title":"Scalable pre-training of large autoregressive image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.498155Z"},"links":{"cited_paper":"/paper/2401.08541","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:64b8645beabf3ff496d74f87fdeb888a6e2ad3f2d2c8a4019662d7b9600787c2","observation_id":"1992e40d-ba70-456d-b241-0dcf513c88bc","resolution":{"observed_at":"2026-08-12T15:17:22.498155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.503099Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.503099Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:8992137ea63fddca8e000651e6015bf7cf7e8a4e81cde5c6a763ba6a91f246d5","observation_id":"5fb55291-be1a-4bbe-ba82-cf079e8a24dd","resolution":{"observed_at":"2026-08-12T15:17:22.503099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-08-14T02:42:50.349648Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-12T15:17:22.507418Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.507418Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:de4d9a95ca8dc39791cf769c0c012388ff2496d06e710ff78cb1712b6343362f","observation_id":"a1765765-aa45-4efa-a01b-f7b35f3a3339","resolution":{"observed_at":"2026-08-12T15:17:22.507418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.512043Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.512043Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:a97dcf7007bd61653adf701a0f61ddfe7f449b9df8f3766ceb9ebe1f4ce1befd","observation_id":"088deace-bdcd-43f2-bbe0-d76de2778712","resolution":{"observed_at":"2026-08-12T15:17:22.512043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08675","last_updated":"2023-11-04T17:55:12Z","snapshot_observed_at":"2026-08-13T11:42:30.247273Z","submitted_at":"2023-05-15T14:31:49Z","title":"Improved baselines for vision-language pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08675","snapshot_observed_at":"2026-08-12T15:17:22.515438Z","title":"Improved base- lines for vision-language pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.515438Z"},"links":{"cited_paper":"/paper/2305.08675","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:c18ae4487f08a44acc7b661a5106198ccbad5c7d5dfc248683083be659b71a2c","observation_id":"bf53a0a5-6d35-4b63-9e11-ce2d0c64349b","resolution":{"observed_at":"2026-08-12T15:17:22.515438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T15:17:22.519701Z","title":"Mme: A comprehensive eval- uation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.519701Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:47f444ad8d4347a45144c6f34efc6351151b314527423063e6814f924248c5cc","observation_id":"a0b8ea7e-0c8b-4fb4-a487-a74684970089","resolution":{"observed_at":"2026-08-12T15:17:22.519701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07728","last_updated":"2018-03-21T03:21:14Z","snapshot_observed_at":"2026-08-14T19:34:07.960520Z","submitted_at":"2018-03-21T03:21:14Z","title":"Unsupervised Representation Learning by Predicting Image Rotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.07728","snapshot_observed_at":"2026-08-12T15:17:22.523051Z","title":"Un- supervised representation learning by predicting image ro- tations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.523051Z"},"links":{"cited_paper":"/paper/1803.07728","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:7e2af46436d27cde7d48f5052748f3c31d5e0b1b7ee4ae5687b0eb6c7eb65a6e","observation_id":"d70bbe70-3d40-42b7-9f27-f293dfce0bef","resolution":{"observed_at":"2026-08-12T15:17:22.523051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.526494Z","title":"Making the v in vqa matter: El- evating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.526494Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:77151d4c1ae5d12aeb4f315dc21e741527f27102d80673474c355c07dcdb9f7c","observation_id":"86b772e0-2934-4f93-8c38-6549c91ecee1","resolution":{"observed_at":"2026-08-12T15:17:22.526494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.529626Z","title":"Making the v in vqa matter: El- evating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.529626Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:87e068399a44e4484fbfba48372a4f2ca32fd20480181adad822defe8d4bb705","observation_id":"8fa25754-c13e-4cf0-8f5b-1b7b38ad7865","resolution":{"observed_at":"2026-08-12T15:17:22.529626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.533061Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.533061Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:e27aab795210bceed4c69de36cac4f03a1977e3592d743ab052778fc270c1301","observation_id":"23c64246-7b44-458a-a79c-1226b5b4ce5b","resolution":{"observed_at":"2026-08-12T15:17:22.533061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.536199Z","title":"Lvis: A dataset for large vocabulary instance segmentation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.536199Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:56136d262dc408b39cf9bd88135e6586ec3f3e63c83d0454d9aa33269ab6a8d0","observation_id":"3ff49287-8071-47bb-8fb6-68544ef8dff3","resolution":{"observed_at":"2026-08-12T15:17:22.536199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.539365Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.539365Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:465afa171e3a2e95251ca26aa9110a16c2adaf4da8b70845ffa4f24ce1dc0b17","observation_id":"13d5870a-e29d-4229-8d66-f7f743879f10","resolution":{"observed_at":"2026-08-12T15:17:22.539365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.542616Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.542616Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:44758c585553acc7ccd13e230ab91be3d4366c242f5a34de8cd1bd27062c96a4","observation_id":"12e83030-6b2d-4746-ab7c-d33e8bea2616","resolution":{"observed_at":"2026-08-12T15:17:22.542616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.546135Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.546135Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:2151f9e06ff3d92d3546a12e8d970d5753499cb93b845a0940b47038a2e04b61","observation_id":"7ee7a35d-744a-4062-99a0-2a58a7fd32ce","resolution":{"observed_at":"2026-08-12T15:17:22.546135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.550155Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.550155Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:733d0ab86495422f822dccf2f880bd37c2d783cbd7aa02ee878c12524a511c34","observation_id":"5c28c0b0-9a26-4489-b643-e5c3febe66e2","resolution":{"observed_at":"2026-08-12T15:17:22.550155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.553317Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.553317Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:8fe4200215cf7b17e44048e3cf101b1b5d64667f22816ff18bbfa1c9600c0f77","observation_id":"fd3291c8-42a7-4c0c-9baa-875300758e53","resolution":{"observed_at":"2026-08-12T15:17:22.553317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.556383Z","title":"Eurosat: A novel dataset and deep learn- ing benchmark for land use and land cover classification,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.556383Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:50f24e6bc2e235fdade24cf882416e55fd94bcb4b99f865f28885f4a725592e0","observation_id":"80e27a5a-c5da-485f-8275-34714b1e1286","resolution":{"observed_at":"2026-08-12T15:17:22.556383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-12T15:17:22.559990Z","title":"Training compute-optimal large language mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.559990Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:f1b43527b775f971054f017cf35116995c7a0d596cd944733f2012b513c8ef88","observation_id":"eb1403ae-34f0-443f-853c-5cd826108dab","resolution":{"observed_at":"2026-08-12T15:17:22.559990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.564126Z","title":"Scaling up vision-language pre-training for image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.564126Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:77fe6c57fa6c0f4cdc3fafb414de97609e4e8b9011b67e5ed814a27d0f15d052","observation_id":"05e366ef-30f2-4008-85a3-79ad81433cf5","resolution":{"observed_at":"2026-08-12T15:17:22.564126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.567566Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.567566Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:ff7743d98cf07b4fc4c6a1af4a04e763e4f17773aa5a4f449b6836f28b5736f4","observation_id":"63a60023-7453-4440-b278-620ce14c247a","resolution":{"observed_at":"2026-08-12T15:17:22.567566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.571585Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.571585Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:f6ba2e075616477575b5e5dc24e23058f257b7c379a37ab2534c490c62af2379","observation_id":"d39d5962-7672-41ff-babf-2bc86d1b0491","resolution":{"observed_at":"2026-08-12T15:17:22.571585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.575427Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.575427Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:cef0eb65d96b9c917145cbbd4fddca07ade9ac1f169696cdb4eedc5eee86b36b","observation_id":"0aecd157-d05d-41ad-a0ea-d033fc9b4533","resolution":{"observed_at":"2026-08-12T15:17:22.575427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T15:17:22.579013Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.579013Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:12c72b0042acd16ed1784ef5eee4e846904ed1417c6374ee1d34e3b9e9ade2fb","observation_id":"5748ad72-33e4-4763-a8aa-98118d65e4bc","resolution":{"observed_at":"2026-08-12T15:17:22.579013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.582688Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.582688Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:6c7ba8dd393875d7926ae71adad73dfc3e74c378c8b6aa3222bec422047d1849","observation_id":"c1318717-68e9-4439-a9f8-c0befa5cc540","resolution":{"observed_at":"2026-08-12T15:17:22.582688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.586992Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.586992Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:7f47d70c03c61aec20d9ecf3e2aadaf4fa4f736b2b8946fb2070abc3c839f94d","observation_id":"3b351665-a929-4a3d-bba2-0eff118a7108","resolution":{"observed_at":"2026-08-12T15:17:22.586992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.591376Z","title":"Big transfer (bit): General visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.591376Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:691b8902fcd0c10f1e961a9de1e3c61aacef7bb0b67651ac44878e572be621f4","observation_id":"7e5807bb-5974-4221-afa7-8045de742895","resolution":{"observed_at":"2026-08-12T15:17:22.591376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.595126Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.595126Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:a942f6446930935214f4dc88ce0e665b444291a6771a39210a7d22e67142e246","observation_id":"76009505-4fbb-413b-8663-1e5308d636da","resolution":{"observed_at":"2026-08-12T15:17:22.595126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.598503Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.598503Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:fa739195f5689826e0cfd3793b5fa613877397ab89f2c5433b6e63a26ae378f7","observation_id":"9cdf6400-8965-4acb-8341-ddc5a06bcbe8","resolution":{"observed_at":"2026-08-12T15:17:22.598503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.602219Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.602219Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:47d6bff698070e6cb3dfb3ef52fc6cac45a93f3e4a302a4d49eb5c7c4966a70c","observation_id":"b9f089a3-89e1-425f-b757-0011b3f42c5b","resolution":{"observed_at":"2026-08-12T15:17:22.602219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16839","last_updated":"2023-08-09T05:39:34Z","snapshot_observed_at":"2026-08-13T12:13:56.062238Z","submitted_at":"2023-03-29T16:42:30Z","title":"MaMMUT: A Simple Architecture for Joint Learning for MultiModal Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16839","snapshot_observed_at":"2026-08-12T15:17:22.605601Z","title":"Mammut: A simple architec- ture for joint learning for multimodal tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.605601Z"},"links":{"cited_paper":"/paper/2303.16839","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:93eae1125760b8b048dfcf22641dc322850f952455afb08ad876960c25d8f796","observation_id":"bc337774-0b21-459f-bd9e-05cb3c7dac15","resolution":{"observed_at":"2026-08-12T15:17:22.605601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02740","last_updated":"2024-10-03T17:54:52Z","snapshot_observed_at":"2026-08-15T08:16:43.787915Z","submitted_at":"2024-10-03T17:54:52Z","title":"Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02740","snapshot_observed_at":"2026-08-12T15:17:22.609197Z","title":"Revisit large-scale image-caption data in pre-training multimodal foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.609197Z"},"links":{"cited_paper":"/paper/2410.02740","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:148e3b3035d774285c1c36b517b010311ca1b5bb4002261413d7447a25adbf5c","observation_id":"a833fbd6-1add-4ddf-8647-8e803f910412","resolution":{"observed_at":"2026-08-12T15:17:22.609197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-12T15:17:22.613773Z","title":"Seed-bench: Benchmarking multi- modal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.613773Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:37462d0f2c7a49b32dae3a6b2357020dd421003711fc5e01e25975b25e1868ba","observation_id":"fa4c8a09-bab1-4142-96d4-0199b6d75596","resolution":{"observed_at":"2026-08-12T15:17:22.613773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.617750Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.617750Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:1fba435cb6959ce110efafafef5b6cf119d22d114166b6f6a0bf15395150daa8","observation_id":"132390e8-8aae-4c4b-aea4-1ae3368f32fe","resolution":{"observed_at":"2026-08-12T15:17:22.617750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.621329Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.621329Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:04f8a377106f564ec9f789132f0a9638c0456f6cee94557bf3be15ba1479e53e","observation_id":"560a87bd-409a-4538-b435-258c73db3539","resolution":{"observed_at":"2026-08-12T15:17:22.621329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.624641Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.624641Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:0dbd17e767b513673229865d388815482602684513fbd1e23c71220eee946049","observation_id":"8198cf4a-a4ef-4afd-a553-3be1aabad19b","resolution":{"observed_at":"2026-08-12T15:17:22.624641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.627917Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.627917Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:8cda67b830a779eea34a5b3f2113fdb636c7026848721f64051dbe5aef4b251d","observation_id":"ca82604f-08b2-4827-b329-88128bad07bf","resolution":{"observed_at":"2026-08-12T15:17:22.627917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.631804Z","title":"Exploring plain vision transformer backbones for object de- tection, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.631804Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:0c59d119eda7934037f166be3d97f9b172ffb58575644f244c4045d4732d5ae7","observation_id":"c7f349a3-6580-43ca-8b2e-a5e15848f4fd","resolution":{"observed_at":"2026-08-12T15:17:22.631804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-12T15:17:22.635481Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.635481Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:0c8144aed869046fd1c32420a18dee4f1338709829fa2dac9b0eb4d5643ad4f3","observation_id":"4202a41f-ab2b-4e18-a454-ba210cf316be","resolution":{"observed_at":"2026-08-12T15:17:22.635481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.640231Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.640231Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:7068439152267d6928344cff3b63cd09e3148b0d9984359e6660b7ec97681b72","observation_id":"ac9ce47e-8e0b-4bd7-9f98-13c7930fda00","resolution":{"observed_at":"2026-08-12T15:17:22.640231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-12T15:17:22.643774Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.643774Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:879030fdcfb5bdc2cad800d3c8b855ab1c85c285e8a098e6f79116246916df66","observation_id":"9afdd6f1-283f-4598-896e-be3439bff8dd","resolution":{"observed_at":"2026-08-12T15:17:22.643774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.647238Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.647238Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:607b039c31d366b5ad0b9ee08c898229a59a2ae3c1d9a1101ca3819564c4fde9","observation_id":"f866b314-9cce-43a4-9011-b15f6c55691f","resolution":{"observed_at":"2026-08-12T15:17:22.647238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.650754Z","title":"Grounding dino: Mar- rying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.650754Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:1bed7af1a421ffa437c4bc2228deb39dab8a34566806717977865151c97accfa","observation_id":"d2ae77fa-0722-40cd-9765-4d6ad0daf1a8","resolution":{"observed_at":"2026-08-12T15:17:22.650754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.656500Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.656500Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:b033241754ec9d09b74f6e49642ab9798649181fd23d15b427683590654b1bb4","observation_id":"0047e8f2-658e-4f8f-b9e9-c3ddba6b01c7","resolution":{"observed_at":"2026-08-12T15:17:22.656500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T15:17:22.660174Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.660174Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:1a8750a8f16b2bb0978e4ac476715eaaa735206014c7aa4f4cbd1c90ccae7433","observation_id":"a4fce8aa-c5aa-4817-be8f-0be5cd4befb5","resolution":{"observed_at":"2026-08-12T15:17:22.660174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.664742Z","title":"Unified-io 2: Scaling autoregressive mul- timodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.664742Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:415f4816a61337de88d59b3b46d4cf3a0ea677d5d9a8070528896ae7e2c2723d","observation_id":"f1697871-86ca-4499-a580-a7acba5fca1f","resolution":{"observed_at":"2026-08-12T15:17:22.664742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.667961Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.667961Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:8c622c691bd47294358a4b496ec2e261f1fc419fd8a5c45c7f6a970b985188e7","observation_id":"90824477-ae47-423c-bdf4-e46c9fa7e2ec","resolution":{"observed_at":"2026-08-12T15:17:22.667961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.671099Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.671099Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:7cc461f80d376c2408ed349e444e9d0727e8ef8235d781d7f63e24c2449bf037","observation_id":"52fa79ac-f9ad-4a93-9289-df5ffdd51b15","resolution":{"observed_at":"2026-08-12T15:17:22.671099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.680261Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"3a6cd296-0d2e-4635-a852-fdf9d96c1b2a","year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.674161Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:4c2b4aa631e6c3e14ebfdcc6391aa90d6a161d83743477fa512df910037d2d78","observation_id":"2ca744f4-295d-42da-b98d-afaa0a98c49f","resolution":{"observed_at":"2026-08-12T15:17:23.684365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.667931Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"589f12f0-c991-4966-ba04-312088fd909e","year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.678504Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:99abe0f1020608d76144b6c3e864f04018120f2ffc789b5fb061841d5929c8a7","observation_id":"0abe84aa-6dee-4f3f-9be3-220987b200e0","resolution":{"observed_at":"2026-08-12T15:17:23.671892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-12T15:17:22.682104Z","title":"Chartqa: A benchmark for question 12 answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.682104Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:e42d752eca907c1284c24b0000b5a333da7e6cda5102b02fc98dbbb2364f3073","observation_id":"bea6496d-aa2e-4caf-b0d2-3b82603a3a1d","resolution":{"observed_at":"2026-08-12T15:17:22.682104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.654393Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"48aea46a-0565-4304-a6d6-6dc9274d1ddd","year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.685585Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:6811aa26cf2d02dfc7d3c2664eedc5e997237871f20edc5736a0a61632f8f516","observation_id":"f8ecadcb-5000-4dbe-bf0a-f24340b5c8a3","resolution":{"observed_at":"2026-08-12T15:17:23.658332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.643053Z","title":"Infographicvqa","venue":null,"work_id":"0abce42d-ee88-4710-88fa-c57d626fa702","year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.689412Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:b219515b887d660ea3ff188b19ef037ac931de18e748631746b61dc493c6ff4d","observation_id":"a853ea2a-9a0c-4984-8eac-8852141e4573","resolution":{"observed_at":"2026-08-12T15:17:23.646818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-12T15:17:22.692838Z","title":"Mm1: Meth- ods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.692838Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:6e6b072f88d218abf4c6dc3c6028810397f99991f49ca13f29383328390ef024","observation_id":"36a14cf9-c4b1-4240-aa1a-b7e7ca2a5d02","resolution":{"observed_at":"2026-08-12T15:17:22.692838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.696091Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.696091Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:9beaf2d610ae298faef0f3731fc84c2ccbd5fceaa15af0b24405799cfc296fc0","observation_id":"1d64046b-f57e-4bfb-ac4a-b991eab63b52","resolution":{"observed_at":"2026-08-12T15:17:22.696091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.625250Z","title":null,"venue":null,"work_id":"bf206665-daa0-4a91-b8e7-7d20b090d5fd","year":2023},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.699767Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:d41a54f7c46995be64708edb7686bece90f74a2b7c83bd4d57ca943b27b7d93f","observation_id":"77b4acc1-b1e3-4955-940a-b30e1a2b54a2","resolution":{"observed_at":"2026-08-12T15:17:23.628987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.613566Z","title":null,"venue":null,"work_id":"23961655-a8af-415b-94e5-7fc0a9f3066c","year":2012},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.702845Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:75350721092841779415997b5061ee041622599f53336ddf66d6ca9c0bb98a7b","observation_id":"056ed4f9-b7c3-48f7-8054-b0d53f8977a4","resolution":{"observed_at":"2026-08-12T15:17:23.617133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.602874Z","title":"Moment matching for multi-source domain adaptation","venue":null,"work_id":"98627c49-d138-4da1-8172-902c46427069","year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.705978Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:420c30f0730bdd02f71789986544eaf0b3a20a2de0e3024516efa5c64271f510","observation_id":"981aae9a-5948-410d-9a05-2c1bcc9ca78f","resolution":{"observed_at":"2026-08-12T15:17:23.606978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.592504Z","title":"Plummer, Liwei Wang, Christopher M","venue":null,"work_id":"a390340e-087f-4876-9358-8c9287f099c6","year":null},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.709790Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:aa4d03cec7962091a5681c28eb988f4e77e1613bd6f541bd315ae1213fe4765c","observation_id":"837b0f71-f317-4159-90cc-57ef100438dc","resolution":{"observed_at":"2026-08-12T15:17:23.596192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13226","last_updated":"2025-01-06T23:51:47Z","snapshot_observed_at":"2026-08-13T00:02:37.644747Z","submitted_at":"2024-05-21T22:26:01Z","title":"Dataset Decomposition: Faster LLM Training with Variable Sequence Length Curriculum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13226","snapshot_observed_at":"2026-08-12T15:17:22.713005Z","title":"Dataset decomposition: Faster llm training with variable sequence length curriculum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.713005Z"},"links":{"cited_paper":"/paper/2405.13226","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:06a5c3bbe4eda2c0692e292392fc246220dbd9f4986a947f40147c58c350ca66","observation_id":"70cf87f0-7534-407b-90ba-181f700b07fc","resolution":{"observed_at":"2026-08-12T15:17:22.713005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.581318Z","title":"Improving language understanding by genera- tive pre-training","venue":null,"work_id":"d7963b7b-2b42-49f6-b79f-321ff3e745ac","year":2018},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.716442Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:60da8f3bb295c74fa263c594c50d0ea71a656d2e8752dd369936c7a5aee6514d","observation_id":"f0fd77eb-00f8-4758-a39b-cb163db3bb9b","resolution":{"observed_at":"2026-08-12T15:17:23.585017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.570705Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"12814bf9-9477-4552-be07-5b2e5008f588","year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.719677Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:cc6dd4102bb533100fea9fd6031c5944c4f2608fdec997aefa540d30c565f4dd","observation_id":"a9206d5f-e916-4bcb-9e10-25881c872060","resolution":{"observed_at":"2026-08-12T15:17:23.574339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.560769Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"6d61a17e-acfa-4e53-8eb5-bdeb2d01f601","year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.722945Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:b76d9506fd03efc941f89843c55c47e9718cea22029e57f4311e0ce9bd4df77e","observation_id":"73d0b2e4-c04c-459c-9fa9-1cc43ff0898a","resolution":{"observed_at":"2026-08-12T15:17:23.564349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.550857Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"951438e9-6401-4778-bcf0-87da07dc6b21","year":2020},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.726126Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:0fe20e54bec76036d94eea3540655e2049333849a257689b7c4274abaca4a8ca","observation_id":"31576629-c6c8-42ba-b0e3-b70ab8335efc","resolution":{"observed_at":"2026-08-12T15:17:23.554504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T15:17:22.730042Z","title":"Gemini 1.5: Unlocking multimodal un- derstanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.730042Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:1c85e1876cab14bc441bd298cd300fac680934d11e187298b1763cf280285fba","observation_id":"95e33792-7b00-4930-85a6-636fcca93cbf","resolution":{"observed_at":"2026-08-12T15:17:22.730042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10972","last_updated":"2021-08-05T15:04:28Z","snapshot_observed_at":"2026-08-06T21:17:51.553405Z","submitted_at":"2021-04-22T10:10:14Z","title":"ImageNet-21K Pretraining for the Masses","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10972","snapshot_observed_at":"2026-08-12T15:17:22.734482Z","title":"Imagenet-21k pretraining for the masses","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.734482Z"},"links":{"cited_paper":"/paper/2104.10972","citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:b2b46d357e06e432551c5ab9d452afe992686e95e1b54e1fb148941065f5fedd","observation_id":"f7bc0033-fea6-4e3e-b576-b92d6dd8c2c4","resolution":{"observed_at":"2026-08-12T15:17:22.734482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:22.738582Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.738582Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:3a042076efadc03d39ecc921fda4ff82d1597b765c94eac25177e3bcddce5798","observation_id":"a4e7862f-5c31-4469-9a18-e0f51c30bcef","resolution":{"observed_at":"2026-08-12T15:17:22.738582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.533591Z","title":"Learning visual representations with caption annotations","venue":null,"work_id":"09c333ed-d44f-4c25-a68c-e8c8b4008f5d","year":2020},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.742118Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:1b0b37dd2b8963542c60241aed32f1176ffa8f37b0934ce3f461fc285ecd14d3","observation_id":"73459927-ae09-4c30-b219-c6542dfc8834","resolution":{"observed_at":"2026-08-12T15:17:23.537678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.522597Z","title":"Laion- 400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":"55e28ce3-5dff-4dfb-be64-dcf1d116c5e8","year":2021},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.745434Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:0090f4598f5fa15afd24714574997fb73a399bc96530dddf899fe6cb24e9a8fa","observation_id":"6832edac-8faf-42c4-8946-8bedddc15daf","resolution":{"observed_at":"2026-08-12T15:17:23.526452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:17:23.512386Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"7cbeb744-7d0e-413a-aa34-34e93a9ee1c7","year":2019},"citing_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:22.748659Z"},"links":{"citing_paper":"/paper/2411.14402"},"observation_digest":"sha256:2f9f52f0edeb977e58b87ae66ff63ef22f29e3f7e7e780988eb98049e3487915","observation_id":"a6202d2b-30c8-4fd7-b472-2a0244c38e96","resolution":{"observed_at":"2026-08-12T15:17:23.516189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T17:05:44.623314Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":137},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 137 outbound references and 21 inbound Pith citation observations for arXiv:2411.14402."}