{"as_of":"2026-08-08T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:efdea2cf2df5aedbd52377f6e643dc59454bc0606ec562c5d6bfd2acc53db139","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T01:07:20.766474Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03624/citation-record","integrity":"/paper/2607.03624/integrity","json":"/paper/2607.03624/citation-record.json","paper":"/paper/2607.03624"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:bdfb172b9948b7db44770a259b368aacd99f9b7434dee2c7bb3b3e8154ecbb93","observation_id":"66caf685-be41-48be-a201-9ebaf35dc24a","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"BLIP-2: Bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:08bfd200acc47db01f581ebc2254e4f3c3fe33a64669df5b7faf99a744577ee0","observation_id":"649677a9-321a-42cc-99eb-bb259d835013","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Language is not all you need: Aligning perception with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:e6d0ee3af1d0a052fb952708c573bd3ee579b5673bc2cb54ee1683db6b201d64","observation_id":"83d05092-8465-40ae-a363-34acb78c5246","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:b5c4b1b7f60c36c440bb5422cc682653564f82c621f8de7f14622fddaa081407","observation_id":"2729808d-b74d-4414-852e-f4de603e2957","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:526f5323ed294cd828bba12e35ee3be46dc125a96947dbf77007dbd1c1f4a52c","observation_id":"cc0c6dda-8b77-4550-afd5-0a09274a61e1","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Siglip 2: Multilingual vision- language encoders with improved semantic under- standing, localization, and dense features, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:61ad69ab9d01356527baaf92975ace171c62b179cd608a82ab1f21bf367f2086","observation_id":"b4e8b263-c779-45a5-8665-88c5eeb5aa94","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Paligemma: A versatile 3b vlm for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:0e3bebb6305d6c6410d77f859ff50031b02656caba4869e019365f01ad5ec291","observation_id":"ff0e86db-0c8c-4716-aee0-47e46c9bb751","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"What matters when building vision-language models?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:08b2a2691d6df769deae2a99400a832f2081c9331a58cf607d0d51cd920d397f","observation_id":"3425b0fc-02ef-4160-84f0-d0889b1b3e97","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:b9ebdbcdc034382349eba88262b6a77f48f4307008b7be79e61c051586ce90cc","observation_id":"6f740f26-d7de-4d0d-aeb2-0c7793c251cd","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Nvila: Efficient frontier visual language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:3a56c4c107c89a4b9c7906e714c5710267df7bdac6fdf4be26a7d33fb15f4a99","observation_id":"89826ebe-5819-4ffd-a570-9dbf1521d10b","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:35c2dd158f1dd8ba5471467d4d77ec957fa0d76690be369b3a763b565045d040","observation_id":"981597fb-7f4b-4ae1-89d9-0c02a279d687","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Radiov2.5: Improved baselines for agglomerative vision foun- dation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:d2693d0c74f3ee7401d421d5d0bcdf228d1c0203a1ff0acedff4cb12cb01f1fc","observation_id":"7330b42e-8738-4433-8747-a026a6ef14cc","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:f07e9841efe99dcc6b6ecb4cb6192dabca4723f8598dfda43f536511dff7381b","observation_id":"b66eb5b0-fed4-4dbe-8022-4187bf71d53e","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:bb89fa81ffae0566039a41f0281363c94bb344fc1dfec6d154d019fcae41d2a0","observation_id":"753be084-d9a9-4903-8007-a0d6e3da9b50","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Sam 3: Segment anything with 11 RADIO1D: Elastic Representations for Condensed Vision Modeling concepts, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:9c72f502752b454a209320f1e9dc349f41dba6de2b9ada1cb5cbef458a215bdb","observation_id":"c59013d7-ec72-4d46-9bfc-5f41d561a554","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Eagle: Exploring the design space for multimodal LLMs with mixture of encoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:4f397e261bc0cc9d65f9f0290b5b6887386e1edccc4dd80d267577b15e7df898","observation_id":"7486a3ee-c219-41a7-b09e-48ad9bd30107","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"VILA-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:49407577d703562891fdbc9b2e083436123e40ec8f42c913b2935b85cf087454","observation_id":"6f75ea9e-ab5a-4abf-9b66-1dda9a5b9129","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Qwen-VL: A versatile vision-language model for under- standing, localization, text reading, and beyond,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:cec2ca414e8b36887c1bfe445c9ec9b4ec8900bb423c820d75f8f0b4d5cda4bd","observation_id":"d816267e-b8c2-4385-b7de-6804e3fa1cc6","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:b686aef0ae2633dfdd1348c84fdd62f09bde76a0b9802ce56077bbbcabe50204","observation_id":"b529dc4a-ac26-4eb9-8b0a-1dc38d6b038e","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Llava- uhd v2: an mllm integrating high-resolution se- mantic pyramid via hierarchical window trans- former, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:90c3fbe1c60ac71e04506d41ae515426179b803d0e7ff6e341af8969f7b759ee","observation_id":"cdb03c63-ac96-41cd-b557-54e2890f3a6c","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Scene parsing through ADE20K dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:6050573cfc178532e50d5528247d48ece631e87576d43364ea1d42dff5e08379","observation_id":"eec94014-4c85-4388-864c-9077dff19806","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Schwing, Alexander Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:15d8412c10cdf457800eba584704d3bde2a49a925cbe3b632de3d03df9b3bc0f","observation_id":"0b670147-5789-4d89-9d6b-49701cf1cbbd","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:51855def333b5243e6d6c1da258e95cca1788ea0ca4284672987db6a2a3edeb1","observation_id":"3f39cf81-c855-4dfe-81c8-23bd62c7077d","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/s26020406","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv3-driven se- mantic segmentation for landslide mapping in mountainous regions.Sensors, 26(2), 2026","venue":"Sensors","work_id":"d47cd36f-d097-481e-9cad-b3183b4fad3b","year":2026},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:f5a2cb1529910545f9a939035c3e269affe2478c14679a02ef6c1b8628e57ea6","observation_id":"e3efc387-ff03-40e9-b7d9-0c425878f774","resolution":{"observed_at":"2026-07-12T01:08:22.975093Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T22:20:33.82925+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T22:20:33.82925+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:5654259ecdabb87ea61f59ab4a84d882133fbfdb8b57aba488b88bb73387e3d3","observation_id":"7b208968-cf6b-45b3-80ee-1b1a2699b973","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:3ec94802c309ccca4816d3f8772cb45d15eb6a2ccfb105db507acb1827025b67","observation_id":"3fcef4d6-2d43-484b-907e-78114ff4c0f3","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Lawrence Zit- nick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:ca8bca5e47a57b6986265e2e41bc8317b674994879bcca972e2c675fb57273bb","observation_id":"c4fa02a4-4d50-4f62-b8fc-00247176752f","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"C-radiov4 (tech report), 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:b7070820a3218ba0f54822028aaf157444f2fd6d16d4312350edafd5a21fe6ee","observation_id":"ce04983f-4c12-4b34-9514-9d3c258db8ee","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Pereira, and William Bialek","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:51234734363a5a487db8e8fcd56fbf44ce51ed30d98515972e83cb8b611b2cf9","observation_id":"5e653ed3-47fd-4bf1-b489-5dd587627d0e","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Modeling by shortest data description.Automatica, 14(5):465–471, 1978","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:6878efd1a4ca3bcf8fd396e73c1a9923649d0e03fa3f8f524dc41c94384ba770","observation_id":"0b70eefb-7a76-4dc7-9032-7eb2101de28b","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"AM-RADIO: Agglomerative Vision Foundation Model Reduce All Domains Into One","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:7e8bbece07dafa13ce4e4e0ed453510e549144e321bbc7146f2c30d9460b7b3b","observation_id":"4f332976-3e04-4e2e-ac85-88a8e7db861a","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:e00b78db5fee84030f3166c9d72b65e0967b7cb95b6677ebca199938a4e488b4","observation_id":"2e28156b-c771-4b87-8db6-2829b584e89f","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Flextok: Resam- pling images into 1d token sequences of flexible length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:57558971f4996596a1e59835b90034d395e63c39be0ae2f6958b61d393e1cd54","observation_id":"69362b1e-f22f-4eb7-b66c-e219cf945c0f","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:6f9e2e6a08f27b2633e8591f196353e55d10d950dde547ac9766fa554b422023","observation_id":"d0a3f5da-d4fe-4108-a26a-803d177fc429","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-07-06T15:20:41.322682Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Efros, Jenia Jitsev, Yair Carmon, Lud- wig Schmidt, and Vaishaal Shankar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:5ae25fe4e0fb9cd62efc366457e3ebc0b1f044f34621fc95b8d4659e30efcac1","observation_id":"64f9987d-9b2e-495e-97c9-e375d3f97e63","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13035","last_updated":"2024-01-09T10:43:02Z","snapshot_observed_at":"2026-07-06T15:30:42.173342Z","submitted_at":"2023-05-22T13:39:28Z","title":"Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13035","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Getting vit in shape: Scaling laws for compute-optimal model design","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2305.13035","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:986e2546dcf343c1edff0732eb8418b51a41e3b80d3fc6204309e3b10fe5d0d2","observation_id":"f4d1825f-7d6f-49c2-a2e0-48f4e84aeeed","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/047174882x.ch10","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cover and Joy A","venue":null,"work_id":"a96c1519-a4d5-48f4-9c57-ae720ecfba79","year":2006},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:4024809f9a7ee924cd43453df912d22ea5e3bb5eca8207a5333d3c2898613376","observation_id":"29f51107-8494-4970-9be4-cb42825b3884","resolution":{"observed_at":"2026-07-12T01:08:22.982569Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T22:20:34.543252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T22:20:34.543252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14444","last_updated":"2025-09-02T16:12:36Z","snapshot_observed_at":"2026-07-06T22:15:27.120497Z","submitted_at":"2025-08-20T06:00:57Z","title":"NVIDIA Nemotron Nano 2: An Accurate and Efficient Hybrid Mamba-Transformer Reasoning Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.14444","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"McAfee, Laya Sleiman, Leon Derczynski, Luis Vega, Maer Rodrigues de Melo, Makesh Nar- simhan Sreedhar, Marcin Chochowski, Mark Cai, Markus Kliegl, Marta M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2508.14444","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:a5f8cd94ef611ba0b44cfad8f05019f7caace8f410e4a86c053d9ecf1d681613","observation_id":"804dbc10-94b1-439c-a10b-d3979b0f1d76","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:e78a88d3cd9b9f59e5770fcd0b91a9549d63301d7d453a48a523280c1b880614","observation_id":"dbefd43c-09a1-43fa-af84-f742e1ce83e9","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-07-06T09:34:24.643148Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:e057774a4fe6d059ee0468ea21a6288aa20f9b6fd23ad91d68184ef72b774765","observation_id":"d0a1ea24-90f5-47ea-a7ef-7e51dccc1a17","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:157f84684613eeecc040b49f99cdfaed8453e83d776baa6c78034e5ec69528a6","observation_id":"55a4d441-fd07-464d-8ab9-848e44d22386","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"OCRBench: On the hidden mys- tery of OCR in large multimodal models.Sci- ence China Information Sciences, 67(12):220102, dec 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:b72fd2bc934f3ac3c4c52c113f06c2002b288afda00137d19933a016fff8fd6e","observation_id":"ceabeb51-c265-4956-8071-29fcef4cb21f","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Ocrbench v2: An improved bench- mark for evaluating large multimodal models on visual text localization and reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:4a57bdceb7a2d7d0192b5dad45788adcce9a042d7ec773a28e05db335077a657","observation_id":"0b898045-7a72-44b1-a8b8-ee2d60cf0b6a","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:2e21e3396f2983e8cdbc591d233eb3821b61d0d3d9b4e03d5eca76696a14590a","observation_id":"5b8448dd-d5af-458c-b582-ca231587385e","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:25d084bac11d5c330262dda071dcc0db8890af7f5bd5e63a9fabeaac49dc29a1","observation_id":"461920ee-dd50-4318-ab0d-74fcaaaea9c2","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"findings-acl.177","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:22c9ea883b6655ec1a211d254db89e93cb83c24cfbf3e91c96a9d36829a13633","observation_id":"f69973c4-41e2-4e3e-8c2f-91e7df19fd66","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:969099d6eaa2ce5a9767ae1a59dcaa927150c1f9ab132a29d31b71ece8efc26c","observation_id":"f364fbe3-0860-454d-82c8-afdf54fae839","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:8492516d093e10d341e958edd99434283e23982e71efedbc223e4d39bd4e751c","observation_id":"4d5edd92-9330-46c6-83b4-312464a78755","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Longvideobench: A benchmark for long- context interleaved video-language understand- ing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:272f2cba6087db347a1cfa0430752b78cc6082e1c7476fc91b93ad813a296f19","observation_id":"9bee5ee8-9c47-4b2c-83dc-8bdf3f6797f9","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:97dffd12105fa1c59eca363f42643fd5d5617386517ad51c3756ad9c251925fc","observation_id":"8e10099c-2ee2-4bde-9bd8-18fad7fbfe66","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T00:46:59.698739Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10967","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Beyond attention or similarity: Maximizing conditional diversity for token prun- ing in mllms.arXiv preprint arXiv:2506.10967, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2506.10967","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:4554ab3be0077fd93bd46209c744469360031cb21b4e3965add6ea8123176c6f","observation_id":"af6ec779-02cc-4cd9-9823-eff642eca4cb","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Generalized intersection over union","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:e2b196dae4536609fd716c36208253d7be845b0e88f9fe066e1575c95dcedaec","observation_id":"f6521bc4-61be-4709-bdfd-a16a87087341","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:75d2322120d28910f6b05b5eac3ba4ec37468929facc686b9b817e7de5cf89a2","observation_id":"75a16e6d-d832-405c-ba20-5780c54e871b","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.11027","last_updated":"2020-05-05T09:13:24Z","snapshot_observed_at":"2026-07-06T07:41:49.415532Z","submitted_at":"2019-03-26T17:19:56Z","title":"nuScenes: A multimodal dataset for autonomous driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.11027","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Lang, Sourabh Vora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/1903.11027","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:99541ab6d0f527e7a7c483417360343eb5a8ad01f3bd7c890852b87fd32e0547","observation_id":"54a38a24-d414-4cbe-95ab-73f04a3552b7","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Vision transform- ers need registers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:e9548855e0f1ff5ffa220a695f4dfdb746a02098f0b09fec5548eb659f9b5be6","observation_id":"9bd40bc9-03a8-4e3d-a9f8-a92971d1603a","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:930ac1e5cfd5ca9a4169d2f61a6235335368939e7877eb9b66db172d57d33c89","observation_id":"aeb46822-da92-4a36-b465-b232079d691e","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:9caf9331aa924e1fd7e08d9d0a5afe475104a84c951277e542142f32d7eac746","observation_id":"55116568-fc65-4b8a-a22b-30387427ee3b","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05641","last_updated":"2016-04-23T23:14:39Z","snapshot_observed_at":"2026-07-06T04:36:52.555912Z","submitted_at":"2015-11-18T02:09:20Z","title":"Net2Net: Accelerating Learning via Knowledge Transfer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05641","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"Net2net: Accelerating learning via knowl- edge transfer, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/1511.05641","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:8d8fd3cf4fdc80686c8d06a82cf537008ea7b29a725a48058155e2f32f313cd6","observation_id":"af783732-6037-44ee-ba36-c46a55a80944","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":null,"venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:3c8d358bf3060a82c1d774e8a3e1d241a767b8def2f0aa34af3934992332a946","observation_id":"75e8dad6-1e16-439d-8faa-08ce07560d8d","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-07-12T01:07:20.766474Z","title":"512min_T2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T01:07:20.766474Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2607.03624"},"observation_digest":"sha256:b70a0f1c946d247db14bb1299b113130767a321f190e8cd7e8e2a1cb4459402b","observation_id":"a5a0d2a4-68a1-4e6e-a731-74058dca946f","resolution":{"observed_at":"2026-07-12T01:07:20.766474Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03624","last_updated":"2026-07-03T22:58:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T21:59:16.066897Z","submitted_at":"2026-07-03T22:58:54Z","title":"RADIO1D: Elastic Representations for Condensed Vision Modeling"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2607.03624."}