{"as_of":"2026-08-18T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:748f4881bde0fdc211572c51b03d24104dbd3697d96285b4e24bbb47e310663a","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:09:33.397262Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03433/citation-record","integrity":"/paper/2506.03433/integrity","json":"/paper/2506.03433/citation-record.json","paper":"/paper/2506.03433"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:25.503220Z","title":"Attention attention everywhere: Monocular depth prediction with skip attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:25.503220Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:4ea8f286db60a83533d448a2752cb0dd7da5768556401248db374ca0a990e536","observation_id":"3259072f-c0c8-465c-8dad-8d1ea6d68f7c","resolution":{"observed_at":"2026-08-07T11:09:25.503220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:25.562474Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:25.562474Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:4318b2534b488b38820b9397ac3ed213938b76eeaf3f32c527bd96bc8d4fdccc","observation_id":"5a6dff74-e5a1-4030-bc6e-f33e08baecd7","resolution":{"observed_at":"2026-08-07T11:09:25.562474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13721","last_updated":"2023-07-25T17:59:18Z","snapshot_observed_at":"2026-08-18T09:05:58.448899Z","submitted_at":"2023-07-25T17:59:18Z","title":"Foundational Models Defining a New Era in Vision: A Survey and Outlook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13721","snapshot_observed_at":"2026-08-07T11:09:25.650110Z","title":"Foundational models defining a new era in vision: A survey and outlook","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:25.650110Z"},"links":{"cited_paper":"/paper/2307.13721","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:0a535769c570993f259b8764632df4d4a7e2682e78dab537031bfb55e1e174bb","observation_id":"e73c98c1-debc-4e24-b8ee-4e211477e1ae","resolution":{"observed_at":"2026-08-07T11:09:25.650110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T11:09:25.727381Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:25.727381Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:c0f3bcb74c6c09dc19ea1c20682c5ff8dc85898c8b3d381e89989a1edf75ab6e","observation_id":"6ba129c2-f5bd-4a00-9077-29881ed2d33c","resolution":{"observed_at":"2026-08-07T11:09:25.727381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:25.804823Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:25.804823Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:4dd6de126c37393307d0cb0ac9d576772dbaceb6a4b22cab0c08c030b8e0cbc6","observation_id":"2b5833a3-8193-4182-a5db-69f97e246698","resolution":{"observed_at":"2026-08-07T11:09:25.804823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:25.877859Z","title":"Adabins: Depth estimation using adaptive bins","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:25.877859Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:245d47aa8a8246da19c6bcaeb2deb0030dde068b0dc145f404ce9c4ec843dbb1","observation_id":"7dc0cbb8-fa7a-487f-899f-9edc42513260","resolution":{"observed_at":"2026-08-07T11:09:25.877859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T11:09:25.951784Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:25.951784Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:ce95444f51d67c265d45f71f0d14053d7042376bc8b584def46dd175c138ad58","observation_id":"015458de-a05f-44a2-b47e-cb13db6d2f52","resolution":{"observed_at":"2026-08-07T11:09:25.951784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.014027Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.014027Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:503b2b4de6d205b1c856a71b6a81871e4e2027c23783113b761753d804771548","observation_id":"c79ea6be-af6d-4428-ae06-59686630daef","resolution":{"observed_at":"2026-08-07T11:09:26.014027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-16T03:32:25.570081Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-08-07T11:09:26.091367Z","title":"Mmdetection: Open mmlab detection tool- box and benchmark","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.091367Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:e06facc7bc6a3ffe5e28e5db0b76b3b0b86b538c85763685d65659cecb89a60b","observation_id":"f1cfa443-a58f-4865-9e6e-c8e2b946b5b0","resolution":{"observed_at":"2026-08-07T11:09:26.091367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T11:09:26.157579Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.157579Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:a45688cef6ae8eba0657bafb88d476b66cbd1c94dfec2ed7e6b6c03cce7224ab","observation_id":"7ae5764e-d0bb-4e12-88dd-7b3ebd393ebb","resolution":{"observed_at":"2026-08-07T11:09:26.157579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.216007Z","title":"Mixformer: Mixing features across windows and dimensions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.216007Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:021c71e6ae773df68d07f79046eb43ea0358752e34051d2394c9dff6a724a848","observation_id":"41a51fa6-5d03-4d66-a720-74aeed9eb11b","resolution":{"observed_at":"2026-08-07T11:09:26.216007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.304768Z","title":"Adaptformer: Adapt- ing vision transformers for scalable visual recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.304768Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:35d24a08fdf4858d09a3af4169b24fb144f3a69a182a0ca18acf5903b600382c","observation_id":"e1627e6d-8d87-4f4f-b0a3-da425aa2dc82","resolution":{"observed_at":"2026-08-07T11:09:26.304768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.365979Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.365979Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:3164910b1bcdf6b1546a553e3cc37b8d1105cc01e65bff608f0c8fdb34198d05","observation_id":"f29d0633-c3aa-42a1-b7ef-8b85eda17217","resolution":{"observed_at":"2026-08-07T11:09:26.365979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.435734Z","title":"Vision transformer adapter for dense predictions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.435734Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:278d6dca2597c296a0d4fc1d59a01505f4a2876c8e31751d7362dae891db7fea","observation_id":"8a9c32a1-630e-43b9-80ce-35eefb827812","resolution":{"observed_at":"2026-08-07T11:09:26.435734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.502832Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.502832Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:cf7f43fab58d7fd608f62127da5a402af2832da130eb8bcea67bfe3adb71f02c","observation_id":"3ec0a4e6-e918-451e-907c-fc9cf16c620e","resolution":{"observed_at":"2026-08-07T11:09:26.502832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.571580Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.571580Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:11cf10958501761a8136836e186aa5128475a19013bdfd6048afa0ff4cef5b7a","observation_id":"4b000884-592d-44fe-8e69-dfa7b8495789","resolution":{"observed_at":"2026-08-07T11:09:26.571580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.716702Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.716702Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:d210f98a8f053a2ae93733e7efaa34435e15317cda37729cf7219a0344aeba93","observation_id":"be2d17de-c24f-42a2-8a14-b95afb121481","resolution":{"observed_at":"2026-08-07T11:09:26.716702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.893912Z","title":"Twins: Revisiting the design of spatial attention in vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.893912Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:a1e20eb03108e7db475e6edbe80df05c6ca9fb135c8f8f7c9403718065c2a98f","observation_id":"8e461f47-cf2c-4408-8883-c89bdcf751d9","resolution":{"observed_at":"2026-08-07T11:09:26.893912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:26.953108Z","title":"Mmsegmentation: Open- mmlab semantic segmentation toolbox and benchmark,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:26.953108Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:e2c7594fd6d2686a6cb55d3475f617708223beea4d1d505d35db4fce7f65f25e","observation_id":"22d2b970-7161-4f76-a774-3ebcb701146b","resolution":{"observed_at":"2026-08-07T11:09:26.953108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:27.156861Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:27.156861Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:c23ce0f6011805d53e7550e57af258d0c6c0729d1a47f371077cd1f9698b34b4","observation_id":"89ba021c-d6f1-44de-9e27-7679cb9af83c","resolution":{"observed_at":"2026-08-07T11:09:27.156861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:27.322128Z","title":"Deformable convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:27.322128Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:543b55baf3eef06b3245cb4592ba12202fec66e2fadebcc9332a87ab60ae956f","observation_id":"f1dfef07-8d21-4eb9-89d1-5487746f385a","resolution":{"observed_at":"2026-08-07T11:09:27.322128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:45.189935Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"ae5ba20d-33fa-4faa-8be8-b547f4f3b635","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:27.472002Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:41a0b57455017683bf9924468abc4e5d4b5607a22c0305f1fcdf2815e2b50eeb","observation_id":"97a62938-dd01-4df9-9635-99b541c44670","resolution":{"observed_at":"2026-08-07T11:09:45.255268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:45.097532Z","title":"Scaling vision transformers to 22 billion pa- rameters","venue":null,"work_id":"cb0f311e-d27c-4baa-b6eb-4e10a78c2b3a","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:27.616858Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:7316d3f92d9e0312cb4ec3ec52d2e4ae56a0f246cdb8bf3f5bd28d6e4d5bd925","observation_id":"b61b55ad-462f-47c2-84d7-a8c558f6347e","resolution":{"observed_at":"2026-08-07T11:09:45.180387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:27.826601Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:27.826601Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:78fc19c2f4c3a0697271f7a991760c94ed070166cdaa34dedd57eb12d10b6027","observation_id":"7d531c04-b57e-41e6-bd97-e66b886870ac","resolution":{"observed_at":"2026-08-07T11:09:27.826601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:44.823960Z","title":"Eva: Exploring the limits of masked visual representa- tion learning at scale","venue":null,"work_id":"f97fae97-07e0-47f8-9ea8-817a75d795ba","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:28.059819Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:099bc17dfcc95b5c93156b789b731f83ed168cf85e547511926cb3e88d828cd6","observation_id":"e2fb3560-fa9d-430a-9bf8-7d30682d6726","resolution":{"observed_at":"2026-08-07T11:09:44.959574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:44.552110Z","title":"Deep ordinal regression net- work for monocular depth estimation","venue":null,"work_id":"51459b48-67a3-49cd-9106-e3bf32200840","year":2002},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:28.181241Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:bbd14186a0d1164d83777550785c1209972a07f7130621afda0885cf0bc37e19","observation_id":"e99d77dd-cc26-4d5e-8413-36dbbd58fb33","resolution":{"observed_at":"2026-08-07T11:09:44.652414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:44.349588Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"6bc55669-5db9-4ef0-b7cf-319a0eae808e","year":2017},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:28.307437Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:657f912466ee658db412d7aed5bf1165c4f31b3b6d1c52225eed002876d45d05","observation_id":"3fc27194-76cc-4bc4-ba45-1e646738c68a","resolution":{"observed_at":"2026-08-07T11:09:44.431782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:28.417640Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:28.417640Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:9af548d5638e3cc44124424866db94d571f5a9c027fe3dc6e4c321c32ec30a6e","observation_id":"a9e5e659-6a19-4b56-947b-115dfb8a7e96","resolution":{"observed_at":"2026-08-07T11:09:28.417640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:44.145244Z","title":"A survey on self-supervised learning: Algorithms, applications, and future trends","venue":null,"work_id":"db6b5f5e-9c5c-4a8b-a8c6-0b9104c3e2fe","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:28.529369Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:68ade2611898c2856c29a7c148f857344f199ff52a8450f978962317d861bef1","observation_id":"45015805-4052-4acf-9c11-d527202d93be","resolution":{"observed_at":"2026-08-07T11:09:44.169139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:44.052638Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"b51f553e-2111-474e-8734-d88f894f172f","year":2018},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:28.660175Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:1f03a863d12e05c3702517f8cb3d6c26dd1a3bb11cb66d0cb1d85bde7b04d8dc","observation_id":"f47fa069-4e62-48af-a500-1b9cf28921cd","resolution":{"observed_at":"2026-08-07T11:09:44.132535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:43.927802Z","title":"Flatten transformer: Vision transformer using fo- cused linear attention","venue":null,"work_id":"88a5f555-56b5-4416-b81f-8227b5d63e24","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:28.781953Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:1d7682314c44ffa83a36d7fa284da7e0895b968bbacb68a8eba37ab74fef42f6","observation_id":"7809092b-2956-4525-a06b-6afbddc61f86","resolution":{"observed_at":"2026-08-07T11:09:43.979734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:28.900404Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:28.900404Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:ca6e08d29f1aa6907c31297776e1c32b330863809e761e5e84b0f19615e5f322","observation_id":"5edb397e-3521-460d-8699-efba01735197","resolution":{"observed_at":"2026-08-07T11:09:28.900404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:43.799614Z","title":"Mask r-cnn","venue":null,"work_id":"2218f654-612d-4e5d-a4cb-0f657930af75","year":2017},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.007919Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:032191eed013e57a4981e4a653f45f40eebb1580b29043847770d902437eedb4","observation_id":"efb7723a-88fc-4cd1-965a-18ab8b0b525c","resolution":{"observed_at":"2026-08-07T11:09:43.851888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:43.565384Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"960feda1-1ffb-4e10-9798-5d78ee322689","year":2020},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.127166Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:6437e5dfef845d8e662f9be0388f9eac81d9abd0e7755d3c062703e4fbd32971","observation_id":"2983936a-1c41-4978-9176-afedc02cfe0d","resolution":{"observed_at":"2026-08-07T11:09:43.704596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:43.387285Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"8714c974-2230-4392-8bcc-53e74a7090bb","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.277013Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:e8f09fad61c31277a76a7e2cf08ccf86f586dd0adf7d75f72bf969d21d64fb07","observation_id":"1bbbe33b-d901-4c99-aee8-ec89037e9312","resolution":{"observed_at":"2026-08-07T11:09:43.450809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:43.130141Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"70598c58-1c2a-4915-8a9c-91e783be1e62","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.400922Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:62f66964847809e8ccd444a63d8f5809e9cee230b02afd24756a8a08f45bed2c","observation_id":"fd28fc32-2224-4c36-85e3-d8335af63ef9","resolution":{"observed_at":"2026-08-07T11:09:43.236551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:42.901254Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model","venue":null,"work_id":"6dab175c-b513-4610-bfcb-778f2064ce1f","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.511917Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:711a814041ff5073c27f8d6dcab1eb478018d884863f0f95c10441b32015fde8","observation_id":"b2a137e0-97db-425e-84c9-ef78873510ca","resolution":{"observed_at":"2026-08-07T11:09:43.026866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:42.571474Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":"c2142f1f-dee6-4f75-b8f3-5ccc4a5ad896","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.629874Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:18811968b785647e7d0a1baae00ae2e4a01e46db7dfd616cc4978ab32b828e9e","observation_id":"442c063a-cfd3-441f-abc8-4d0d5d5b8b4b","resolution":{"observed_at":"2026-08-07T11:09:42.770096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:42.258409Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"53420922-8ca2-49c5-8836-162f2fdb07d7","year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.727886Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:7b63f9e0cb7ec6b0de449f4c8936eb0d4b0b8e18ac339604e4d5822da172bef8","observation_id":"4b8870aa-0c84-4aab-8234-897454c6b332","resolution":{"observed_at":"2026-08-07T11:09:42.424384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:42.012139Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"cbd1c68c-628e-4c44-be2a-fb349f114a21","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.759347Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:459709dd3485bd88a2d58f768e2abeb20321920dd66ac657b3ce6d670d474cdc","observation_id":"38f5c9eb-7431-4405-9d1b-6e7d0b2c5bdd","resolution":{"observed_at":"2026-08-07T11:09:42.116748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07039","last_updated":"2022-08-09T10:40:06Z","snapshot_observed_at":"2026-08-18T15:12:12.387936Z","submitted_at":"2022-07-14T16:32:28Z","title":"Convolutional Bypasses Are Better Vision Transformer Adapters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07039","snapshot_observed_at":"2026-08-07T11:09:29.789945Z","title":"Convolutional bypasses are better vision transformer adapters","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.789945Z"},"links":{"cited_paper":"/paper/2207.07039","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:626698c87ed076c2a7b6780661f80816f33d1b4b0681806285449a22ca6856df","observation_id":"967c7d6c-dad3-4300-b192-e839dd0a1f87","resolution":{"observed_at":"2026-08-07T11:09:29.789945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:41.762380Z","title":"Fact: Factor-tuning for lightweight adaptation on vision transformer","venue":null,"work_id":"f7b69b85-d636-44b7-9226-a4bd3bdcb0f3","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.815986Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:d63444d5fbac5185cb906a3adf3289462c382550c93f23a3415208ecc3fadbbb","observation_id":"530a8c4c-5fee-4b4a-b166-753686497d3c","resolution":{"observed_at":"2026-08-07T11:09:41.890658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:41.430701Z","title":"Segment any- thing","venue":null,"work_id":"89419ce0-02f9-41b3-b667-d0d66db3f127","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.847153Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:16ba4ce59205053f0bd9c57e99a013be996d5fd3b011b4d498752bc1faeb4b31","observation_id":"6824f71b-b31d-459c-912f-fdc7ad2c62c4","resolution":{"observed_at":"2026-08-07T11:09:41.606310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:41.176079Z","title":"Similarity of neural network representa- tions revisited","venue":null,"work_id":"61d1a31b-e66e-415c-84bc-5fe13cb9e752","year":2019},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.877229Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:206f928d7350db128bb1aa0416fb6b9c69be457dbb1ff0dfeb168d8723ff7b80","observation_id":"38eac8ca-5c8a-400b-bc4a-c0c6258cc369","resolution":{"observed_at":"2026-08-07T11:09:41.308185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:40.917579Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":"6962d91c-57c2-4423-892e-46209bf11ce8","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.910879Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:33f83429158f119a88baee54a83ce0cc0f956537a251f2c5e07eaf59649ca14d","observation_id":"7ea0415c-00f6-4ded-b754-5d323829846a","resolution":{"observed_at":"2026-08-07T11:09:41.037793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:40.663220Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"10bf5012-901e-4172-a3dd-c0937a3e493b","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.954039Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:ae02632ada4d2987ad31c9dfb00e5cd30156d78b7d008fb97d930367284498c6","observation_id":"940846d3-e1ca-4e71-87c3-9ec17420200d","resolution":{"observed_at":"2026-08-07T11:09:40.786115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11429","last_updated":"2021-11-22T18:59:15Z","snapshot_observed_at":"2026-08-17T21:42:42.870219Z","submitted_at":"2021-11-22T18:59:15Z","title":"Benchmarking Detection Transfer Learning with Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11429","snapshot_observed_at":"2026-08-07T11:09:29.983561Z","title":"Benchmarking detection transfer learning with vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:29.983561Z"},"links":{"cited_paper":"/paper/2111.11429","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:d4881142b788e838fa845e8989f60505a951233172cb57d4ff683c6939c3d8d5","observation_id":"23514c34-1a8e-4d4a-9c7e-d94883a6abcd","resolution":{"observed_at":"2026-08-07T11:09:29.983561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:40.390110Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"5d5bb29f-d014-4165-aea5-10e28b05969d","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.020550Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:de999aed9d224e4f590d1e0c3c0c1ccd7dbd9241d1501251e58168275086392c","observation_id":"32c03cab-0be8-4dfe-a5bf-80fc4e7dc4f2","resolution":{"observed_at":"2026-08-07T11:09:40.500008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T11:09:30.053409Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.053409Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:b7e10b2542d7832fc2a728d3ba24fa8b0642c0e0be4e61162d211894569b66bb","observation_id":"3c753889-975f-4647-b694-b46ae19bb292","resolution":{"observed_at":"2026-08-07T11:09:30.053409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-14T12:32:34.328935Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-07T11:09:30.084456Z","title":"Visual large language models for generalized and specialized applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.084456Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:259e2959ee0cdef889766e6d1b78c576358f027bc77b2e1742d401c7297b567e","observation_id":"f2bfbacc-3d5b-48d5-a79f-f8303ca9cd2c","resolution":{"observed_at":"2026-08-07T11:09:30.084456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:40.178146Z","title":"Binsformer: Revisiting adaptive bins for monocular depth estimation","venue":null,"work_id":"e82c7fcf-a47a-4aa7-a751-e7b5b26dd38c","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.125615Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:0955ff5617bba625db6c4b22cfdcf5df4cf1cb873c30b7e05deaf0ef90264428","observation_id":"aedae50e-d8c5-429c-9a71-1036f9d57010","resolution":{"observed_at":"2026-08-07T11:09:40.254830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:40.124024Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"46fac07a-79e6-46a6-9d8a-217639dec7d3","year":2014},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.174830Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:9a9799aacf211c58cc151887e24754684d184f4d3c2b887dedc169a35dfc690d","observation_id":"221cc480-74af-484c-a42a-739ca599f18c","resolution":{"observed_at":"2026-08-07T11:09:40.127811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:39.917871Z","title":"Va-depthnet: A variational approach to single image depth prediction","venue":null,"work_id":"a3b9ec8a-a996-4744-9783-b6ef7f81b45b","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.212604Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:d92f3487884a5395271415fbd9d7cb1f0bf4a5e31e76c06f775568373af4493a","observation_id":"402d1373-bcb3-4db1-be39-1f37bdff4500","resolution":{"observed_at":"2026-08-07T11:09:40.016625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:39.764730Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"1a7fa69a-79ed-436d-a483-534d0107eeea","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.265002Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:e218787d8abc237d33d295c1ac42db26755b2b219dc8ecd774feff566aa3acdc","observation_id":"b768bfb2-ceee-42df-8090-c5d879a4a74d","resolution":{"observed_at":"2026-08-07T11:09:39.840043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:39.614237Z","title":"Visual instruction tuning","venue":null,"work_id":"0a618a61-bafb-40b4-827b-21b13c25e269","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.308517Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:342ee01e2083f177b365648206ceefb2f9e2dde0c4abd79a9c86315b06b576a8","observation_id":"6edd2ff8-1d5b-47dd-a504-0b6a6778b6a7","resolution":{"observed_at":"2026-08-07T11:09:39.673372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:39.460446Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, pages 216–233, 2024","venue":null,"work_id":"d10df821-9ccd-4868-8a9c-af3c30fc93ef","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.345111Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:9eadae5315fcfa3c266cbf8494822ba4734c22aeea2517c4f71c8ac96234f0eb","observation_id":"1e7808ca-2b1e-4969-aa9b-c350a195dae5","resolution":{"observed_at":"2026-08-07T11:09:39.540123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:39.317474Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"98d28ad6-ab87-44d0-b195-e8c5a5d59e8b","year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.380457Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:65a707d48a60e1107f004dfaa70ccdc750a0c21d6a763a22ed980e4ae77d292a","observation_id":"1892988f-deeb-4a54-b3c8-3f6bf66b9eb5","resolution":{"observed_at":"2026-08-07T11:09:39.389456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:39.182170Z","title":"Swin transformer v2: Scaling up capacity and resolution","venue":null,"work_id":"77be4baa-bc19-4751-a2e4-d31f2ade9b3f","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.420759Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:9648a49e8662a587826d9ee6c3e79758be0baca14ee866b820d4b781bdcba797","observation_id":"d909d31e-cc09-41ba-aa0e-caadb06e847b","resolution":{"observed_at":"2026-08-07T11:09:39.235168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:30.465268Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.465268Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:5dbc0968e59aa36a0f14004ffbf3795ca28267fc5d2f8ddb8367731cf31628bf","observation_id":"6ed1515f-7dfb-427c-ab4c-d713d70df107","resolution":{"observed_at":"2026-08-07T11:09:30.465268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T11:09:30.511672Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.511672Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:0fec322ce9ac7b88d850323b447575039186eb942173af59708d6daf7b925873","observation_id":"4ce4e11f-e25b-4838-a428-f1eabc752a1f","resolution":{"observed_at":"2026-08-07T11:09:30.511672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:39.052567Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"4c6a4797-bcf6-4758-a3c0-8c05dd391089","year":null},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.560640Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:c9d3c095cd2c278fdf0566a251d83f4c21be3d55854591de59ec7461f07866e6","observation_id":"6311134e-0259-4838-a3c6-dba2c3df9297","resolution":{"observed_at":"2026-08-07T11:09:39.109290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:38.894438Z","title":"Time-memory-and parameter-efficient visual adaptation","venue":null,"work_id":"cb0b0ef9-ee17-43c9-a7f3-be047676c69e","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.622635Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:6f52b6ce44e83d8c4f1232a8db6fd08e2d3b2e10cc7d6fca0d44f3fdbe4586c4","observation_id":"1e8725e5-96fc-4b70-a576-2f353482bd17","resolution":{"observed_at":"2026-08-07T11:09:38.957515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:30.668483Z","title":"The role of context for object detection and se- mantic segmentation in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.668483Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:02977486b0a4c3fae5e8d189c224f1026da6673c1f04af80b2a3f4549f6314e3","observation_id":"3da4c4c1-c22e-4f7e-bf3f-9712bfd7926e","resolution":{"observed_at":"2026-08-07T11:09:30.668483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:38.729133Z","title":"All in tokens: Uni- fying output space of visual tasks via soft token","venue":null,"work_id":"b470daf8-1449-430e-869d-e9906fc8dc84","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.720359Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:00fe5a262c22a3bab0828e512020e026d65c0c7f39e51b58e04862ad85fa934a","observation_id":"768dd031-b549-405a-821a-9093e571fb85","resolution":{"observed_at":"2026-08-07T11:09:38.821616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:38.609314Z","title":"Dinov2: Learning robust visual features without super- vision","venue":null,"work_id":"9cb46e8c-ea1b-4f7d-a1e3-c18a54ff3e17","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.783766Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:425d0d3d8cfe09d1720a811246eddeea85f8db9a00f1f4c5602d372571b5ba20","observation_id":"a8e34fd1-ed0c-4efd-9b2b-ac77a0aaffaf","resolution":{"observed_at":"2026-08-07T11:09:38.655320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:38.478181Z","title":"St-adapter: Parameter-efficient image-to-video transfer learning","venue":null,"work_id":"e59eab43-9620-44f7-bebd-53f5155f5d48","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.864905Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:efdb1b6645a60c2faa67494ac463ecbc6c6cdbf5ce2369f3e0dba29b3f42c004","observation_id":"1d470de2-7de9-4c78-931c-8d2c1eddd2f3","resolution":{"observed_at":"2026-08-07T11:09:38.525231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:38.349259Z","title":"P3depth: Monocular depth estimation with a piecewise planarity prior","venue":null,"work_id":"b1273bc0-0c1a-4400-9d05-4bc684a7ef6a","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.899319Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:c4a7ff8e106e690acd7144898705ab33f20c9ebe67700c0d3a88857fdafe96b1","observation_id":"eaaad0c8-d6bf-4eb8-8eb3-fd02189d1822","resolution":{"observed_at":"2026-08-07T11:09:38.412615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:38.168202Z","title":"idisc: Internal discretization for monocular depth estimation","venue":null,"work_id":"9e1891a1-165d-4bec-b51a-e8902986aba2","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.934606Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:0b3923ee3351f30eb2087c45ed5dc3a7a2135437f280633d2f8a6d0f6c170ef0","observation_id":"7f985a76-b600-400d-92e2-203cf90d4391","resolution":{"observed_at":"2026-08-07T11:09:38.273501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:37.989707Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"73609700-9c7e-4bbe-aa3e-90ee1a6bb47d","year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:30.973431Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:08805d147a46350fb5866f3d9fc08148a8ea7d3ed26c4f35fc16935bf9417339","observation_id":"079de25f-fd81-44e1-b743-8dbb0879aa80","resolution":{"observed_at":"2026-08-07T11:09:38.084748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:37.781685Z","title":"Do vision trans- formers see like convolutional neural networks? NeurIPS, 34:12116–12128, 2021","venue":null,"work_id":"355be6a6-8f25-44a1-a841-7b95fda66daa","year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.018949Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:619a3e5606e380f81aa6f2c26407ef51ead4fe5b31a5ef5d6a165158f7b11a17","observation_id":"c5e79113-f7c9-476e-9772-452b273caa55","resolution":{"observed_at":"2026-08-07T11:09:37.867793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:37.627346Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":"eb10eb2e-c344-40f0-b7a6-41fb7d3e5aec","year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.062085Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:88312d67334993b489a00775765d8b8c98e2d46d8605e4fb18b675652c783cf9","observation_id":"34c1f187-4247-4add-8273-8f50d6476cfa","resolution":{"observed_at":"2026-08-07T11:09:37.700892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:37.443928Z","title":"Learning multiple visual domains with residual adapters","venue":null,"work_id":"959dc184-ccf0-4580-838f-3dc9bc7eb7de","year":2017},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.098133Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:a0630f03f8fb5afbb733dad6dd12e5c44545cee71b138e28f774180a413eb7c0","observation_id":"0f13137d-2af3-4c93-a9ce-fde997b11f10","resolution":{"observed_at":"2026-08-07T11:09:37.533889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:37.269683Z","title":"Iebins: Iterative elastic bins for monocular depth estimation","venue":null,"work_id":"b9f1452e-33f3-4206-813f-9396755a723c","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.179733Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:12266e436431dd2f42484499a6fa456fa28d04f462e80a89f0f54a83de7333d5","observation_id":"9e96e077-9e8c-4457-8363-09a34de5ffa2","resolution":{"observed_at":"2026-08-07T11:09:37.365669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:37.104116Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"b6dc8c72-6b8f-4195-8201-c90b212bdd8d","year":2012},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.259767Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:126a44e2aaf5021080743411843080223a97673e39817530f3548d582da837ec","observation_id":"a70ce1e0-d841-45de-94e2-4d38e66e0718","resolution":{"observed_at":"2026-08-07T11:09:37.186757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:36.925842Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":"85ccc5ae-22a8-4ae1-9c68-7a444a7ee8ca","year":2019},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.340193Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:2e9c67a634b82b4129fce2b99ac32a079378af7c1614873f6821cd4e425ff84a","observation_id":"8b5ff976-2a4b-4782-bbcd-1614c3ba9216","resolution":{"observed_at":"2026-08-07T11:09:37.004730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:36.753069Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"c2c271ae-8c6d-4a3c-bbcd-a9d088acb698","year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.410523Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:47b163fb1ed49ba746851d71d6c10cd7ecc2a90419dac19bc1b90e2881c7829e","observation_id":"2ae3adb6-4b20-497d-9bf6-907e3b866b5e","resolution":{"observed_at":"2026-08-07T11:09:36.824104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:36.541803Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"e54c606f-d7fb-45cc-8f18-0a555b9eb6d4","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.499091Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:142b7d3b3f0961f319898fa22bc001905c04f5df9f371040a3c54af21d353bc8","observation_id":"ebe46b12-e275-45aa-aa67-102b073baf57","resolution":{"observed_at":"2026-08-07T11:09:36.645650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:36.392005Z","title":"Internimage: Exploring large-scale vi- sion foundation models with deformable convolutions","venue":null,"work_id":"c28c00ef-57a6-4ac0-8aeb-a0637f777e16","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.576541Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:4c56eab750b427f0bc153ccad584b43c8157f4b465db571b7bc1389528087787","observation_id":"0c88edec-f5a5-4c64-b025-35746b277c91","resolution":{"observed_at":"2026-08-07T11:09:36.458608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:36.213643Z","title":"Vit-comer: Vision transformer with convolu- tional multi-scale feature interaction for dense predictions","venue":null,"work_id":"6dcedd73-bf62-4c48-aa1d-fe2e00120715","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.654238Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:3871abdd7d4b87b5e1904d6a3dbf232f9518df6755571a5df396fe2b3888ee23","observation_id":"287062d4-a3bf-4e7c-a07b-b40b8cf97fff","resolution":{"observed_at":"2026-08-07T11:09:36.291060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:35.997718Z","title":"Unified perceptual parsing for scene understand- ing","venue":null,"work_id":"0be33c89-163c-47fc-add1-2062452db6f2","year":2018},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.743058Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:75bc2c4defe62c8d054f8cc7fc814ef5fce996eb2a9d7cbad722a81be86cbfdd","observation_id":"63817e5e-53f0-4dbe-8191-3fba7dda9178","resolution":{"observed_at":"2026-08-07T11:09:36.120647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00641","last_updated":"2021-07-01T17:56:09Z","snapshot_observed_at":"2026-08-18T19:44:41.038251Z","submitted_at":"2021-07-01T17:56:09Z","title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00641","snapshot_observed_at":"2026-08-07T11:09:31.821493Z","title":"Focal self-attention for local-global interactions in vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.821493Z"},"links":{"cited_paper":"/paper/2107.00641","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:b39bcdf23a6cabd14b37b7d1777ed359b9c99c7ee391bf51d74b2ed4d4404339","observation_id":"8c4a6ed8-c6a8-4050-b989-c8a690177d4d","resolution":{"observed_at":"2026-08-07T11:09:31.821493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:35.846214Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"90f69aba-d85f-4d25-8535-5641ce1efa16","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.902326Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:b4ec21342d97e4ac0bdcbedcee3669fe73b9c964f9fcc27baee40520a4773b9c","observation_id":"e0ab7dbb-5722-43e5-b715-e735e7f345e9","resolution":{"observed_at":"2026-08-07T11:09:35.912858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:35.710282Z","title":"Visual tuning","venue":null,"work_id":"cde676ad-525d-45ca-9b3a-400c73a4d4b4","year":2024},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:31.984771Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:021194442dfc3d36a446fa4f4a7ce40e37abc8f188e7f2a77ac786ff4c98c123","observation_id":"3c4781a8-e821-41d6-b17d-c6366900841e","resolution":{"observed_at":"2026-08-07T11:09:35.783031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:35.550291Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":"a4b646e6-e63e-4922-bb13-c6cab3d2f74c","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:32.077506Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:975d6001f633e114a974cc2c602f68f8bbb1adc5e66c21f36f8a3aa5a4bfa6b4","observation_id":"ee55490a-26a2-4b93-b9fa-1deade12af1d","resolution":{"observed_at":"2026-08-07T11:09:35.629902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T11:09:32.186257Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:32.186257Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:d2d64454f9f158009f4ae5c0a07482cd2ccafe2ac60fc3a57dc20b323774ae6c","observation_id":"d3f3e392-39d7-424b-ac60-5e27922ff185","resolution":{"observed_at":"2026-08-07T11:09:32.186257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:35.386447Z","title":"Neural window fully-connected crfs for monocular depth estimation","venue":null,"work_id":"220976dd-6c0b-44d3-b700-1495f122af96","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:32.296037Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:b2bc62eae2ed2d8283bc70d91fc192bd717e17de8b4b28b66a65b171efbf17ee","observation_id":"152b1732-5b13-47fc-9073-523dd585f361","resolution":{"observed_at":"2026-08-07T11:09:35.462006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:35.166273Z","title":"Spanet: Frequency-balancing token mixer using spectral pooling aggregation modulation","venue":null,"work_id":"f3c483a9-efc9-44bf-94da-20107f8959be","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:32.383399Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:5f460993baca56e4e15468f51ed7230562c278c755568b0a52b32e7f144c840e","observation_id":"e91391c4-2d1e-4b2f-8e56-80ab8e863f47","resolution":{"observed_at":"2026-08-07T11:09:35.307375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:34.943687Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models","venue":null,"work_id":"1c08c244-6ab8-4a2d-b843-1df69858c0a9","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:32.514627Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:87b86c12faea5060dc3721c781a74f366e3e7ca3901662a4582d9045c329b2da","observation_id":"722a9709-a5b9-4c82-934d-07082b6f963f","resolution":{"observed_at":"2026-08-07T11:09:35.050142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:34.762669Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"e38a2125-39f0-4c01-a350-1a745b1aa666","year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:32.661067Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:80d1bdac3a704c961f564c1c01819011301db228a91aa379c764910adf7bc4d0","observation_id":"a97d7428-4760-4ec0-ac4e-0d40505cc666","resolution":{"observed_at":"2026-08-07T11:09:34.856362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:34.537939Z","title":"Memory efficient transformer adapter for dense pre- dictions","venue":null,"work_id":"180ad54b-4f66-4b45-a9f5-d4d911761230","year":2025},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:32.747114Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:a5031e0894a82194fee0e21e7681f7ae74e833f205ac6a7760a6cabf93c5abd2","observation_id":"5f21ecd9-32a9-4f1f-8eda-75b0b2becc75","resolution":{"observed_at":"2026-08-07T11:09:34.680805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T11:09:32.845078Z","title":"A survey of large language mod- els","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:32.845078Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:e1a40c8ad03a64c3fedd009733865c5296e427364e2feb1a496ed06a40c0db36","observation_id":"9add61c0-1e67-4eb3-9aac-443fa919854b","resolution":{"observed_at":"2026-08-07T11:09:32.845078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:34.312233Z","title":"Semantic under- standing of scenes through the ade20k dataset","venue":null,"work_id":"e3567a3a-8142-49ec-b556-da33d5640bcf","year":2019},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:32.991960Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:ad1fcc454c0b33756c9d30f3830ce2c773d05c78b06fb9920cd8f89652f8020b","observation_id":"b2d4daee-3c0d-4ae2-9304-95c7e4902b2a","resolution":{"observed_at":"2026-08-07T11:09:34.418231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09419","last_updated":"2023-05-01T07:48:05Z","snapshot_observed_at":"2026-08-16T15:54:23.434874Z","submitted_at":"2023-02-18T20:51:09Z","title":"A Comprehensive Survey on Pretrained Foundation Models: A History from BERT to ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09419","snapshot_observed_at":"2026-08-07T11:09:33.099450Z","title":"A comprehensive survey on pretrained foundation mod- els: A history from bert to chatgpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:33.099450Z"},"links":{"cited_paper":"/paper/2302.09419","citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:80004615107947fcb978743d6b945132b04b294ce39b98df34216a27bfd39b74","observation_id":"63af6f46-6ab1-4d00-8c30-9cb4d3a1d2cf","resolution":{"observed_at":"2026-08-07T11:09:33.099450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:34.098260Z","title":"Image bert pre-training with online tokenizer","venue":null,"work_id":"13d7a63e-9d74-4595-85af-47b55f4d507e","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:33.212107Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:a31b22f7a90a75d68efc6adc32172a79ab8c5f034c9852402ed8780451c8d8c9","observation_id":"f6730720-017b-4f8a-8bd4-88f3cc8a04c2","resolution":{"observed_at":"2026-08-07T11:09:34.203844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:33.888349Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"5a249190-b3f8-47fa-91bf-00a7980c0a13","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:33.318241Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:24d73ae3ddb524e5c5207dfa79b18e6307618e716fe04935b32a0eae1477f6e4","observation_id":"8f1f3dac-08b2-47be-ac72-112bfc71bfd1","resolution":{"observed_at":"2026-08-07T11:09:33.984139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:33.694965Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":"aa4748bd-ad7a-4d0a-b43c-56158a330959","year":2022},"citing_paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:09:33.397262Z"},"links":{"citing_paper":"/paper/2506.03433"},"observation_digest":"sha256:3c8c827c10aa2c9033e6ed3ce5c3d5e02bff6be0ae7fe6fc36ad19e19d6d5552","observation_id":"d994396c-d3b9-46b3-9c55-d3ef05e317a6","resolution":{"observed_at":"2026-08-07T11:09:33.801518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03433","last_updated":"2025-07-18T22:02:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T12:33:17.317265Z","submitted_at":"2025-06-03T22:34:17Z","title":"ViT-Split: Unleashing the Power of Vision Foundation Models via Efficient Splitting Heads"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":61},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2506.03433."}