{"as_of":"2026-08-22T22:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c5641ba5afd82f5aa77a45c52bc583868626c662e8341d9009e47645f8a26ad","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:53:20.749426Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09029/citation-record","integrity":"/paper/2607.09029/integrity","json":"/paper/2607.09029/citation-record.json","paper":"/paper/2607.09029"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Composer: A search framework for hybrid neural architecture design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:4cf5149fdd1d8c3880fe339f5319f6d461e80bd2dec9f14066b463c1ee3d19ad","observation_id":"d4963028-cea7-42fb-85eb-d58299c74469","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:180003f594fbee926a7deea1908b817b693b5935481c0d1c82e5f2d215bc3a25","observation_id":"ee5afdd4-2fad-40fa-95bc-e43deb5fe6c5","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:1c90115506a72da8d0c7ec7a44435f85f02c926171cd44476ab6f529c4c88f74","observation_id":"1a893ae9-1b50-426c-9a26-f288e5ee2d6f","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Long- former: The long-document transformer.arXiv preprint arXiv:2004.05150, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:779bfc2560363576be062485676319d143f41d695cbc5fee1c3487326c7ab721","observation_id":"74fe8b72-f0dd-47a9-8c48-8af1e4b0e80a","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15930","last_updated":"2023-11-27T15:38:17Z","snapshot_observed_at":"2026-08-18T19:03:33.497046Z","submitted_at":"2023-11-27T15:38:17Z","title":"WorldSense: A Synthetic Benchmark for Grounded Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15930","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Worldsense: A synthetic benchmark for grounded reasoning in large language models.arXiv preprint arXiv:2311.15930, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2311.15930","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:4b50e6ce918c3f08677fc95c622bf3aad3da4ae406c297d1bd2c671f68a5d01b","observation_id":"f46d6a71-f30f-4a3e-a6e9-16b47e02561d","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Puzzle: Distillation-based nas for inference-optimized llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:05cd1f10c7089639271573d563e0ba5a6b4235f539f2bd9d6f9799d96adbb785","observation_id":"a5b1341b-2f75-4af1-bfa9-c06027d4ee2c","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:b3b5addf095e1d336241760b5c2069feabbb5b227437d89e1ee23fad47b25b83","observation_id":"d18cdb29-e46b-4416-8613-99d02ef4b336","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Once-for-all: Train one network and specialize it for efficient deployment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:ceb2ab990a049896a4783544539fd8784ba8b7277523aef8a8641e4203f9a0de","observation_id":"4c12516d-c271-43cd-9f96-16f16a517944","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Generating long sequences with sparse transformers.arXiv preprint arXiv:1904.10509, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:5fca655289ef3cb2bfe2fc11fa9c16311cf88f5e9fdd1976bee2bddf838b53a4","observation_id":"4ad33f56-95b5-467d-b131-246ceb651600","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-16T00:44:08.264820Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Molmo2: Open weights and data for vision-language mod- els with video understanding and grounding.arXiv preprint arXiv:2601.10611, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:886ae72936b5cc369252544b9a6c582f48354576c1a2450e55d540b7a4f24976","observation_id":"cad253a9-6995-4069-8724-96a5a4ddec1e","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:a4c0267b879d7dd5091bb4fa859c63601208733db35721e8f703ce36073d2617","observation_id":"79594ec4-3e9c-4446-ae9f-3f11afb499a2","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Train- ing verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:e203ceb380ef8132fa905c62a5e9c17dd3a8d414c291aae98b07691404e3aea4","observation_id":"3dc7213c-40cc-4ed4-b780-133dcd4496a1","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Deepseek-v2: A strong, economical, and ef- ficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:3481487e077da98970373057ac41ace95b6a9e8f8bfdb288259e53446cf8b90b","observation_id":"d06523f8-ba05-4b70-a4e3-c4d2291c7075","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13161","last_updated":"2025-11-30T07:03:40Z","snapshot_observed_at":"2026-08-16T12:11:22.940380Z","submitted_at":"2025-04-17T17:58:13Z","title":"Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13161","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Nemotron-climb: Clustering-based it- erative data mixture bootstrapping for language model pre- training.arXiv preprint arXiv:2504.13161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2504.13161","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:86389bb2afaeb8696a3c6fbfbbbaf821a4eeff9cfa2bf6ff5e2beba649f58860","observation_id":"bebda3d0-1da3-4448-b0fb-e89f4d254f5e","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11517","last_updated":"2023-04-23T02:08:00Z","snapshot_observed_at":"2026-08-16T15:38:27.818629Z","submitted_at":"2023-04-23T02:08:00Z","title":"LayerNAS: Neural Architecture Search in Polynomial Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11517","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Layernas: Neural architecture search in polynomial complexity.arXiv preprint arXiv:2304.11517,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2304.11517","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:3ed089482295bf62c285e560188e7ae58675f687a9dd0a81e90684d24fd59ba5","observation_id":"5303f941-f4bd-497f-af92-7209ce8da800","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:29bc48f3a5d8663d4de69114323a04820248024b49d9fe3fcd3cc33826d24bc0","observation_id":"9aff1944-1833-48e9-9c65-07d58c43bb72","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in 10 video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:4832866b7b156537b90d63bac568f928c439da63e872fe37c0867ffbb7f9a6ff","observation_id":"31115c86-e5db-407a-80c0-fc3406cd993b","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:511f7a0ba6789506b2e74873884a53955e14d7e9d5114a8e3008f0716f942a7d","observation_id":"8a06598b-317e-4566-bc59-9d269a873df6","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Mamba: Linear-time sequence mod- eling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:9de74b5230ed2271e3b59aedcef6725d94d45a5cf77ffdfdf5c8086d3b40f7cf","observation_id":"30d48631-9e39-401c-a4ef-5c3cd703e333","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-20T20:37:36.775968Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:c2d70576c60adea1ff7daead389bb940d9dabb41c7320bb6c2ec114b35ca1a0d","observation_id":"2b8ebf7d-1915-4347-96e2-fc8455158c3b","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Mea- suring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:e4e349282263673a5356c999135c249f2efa741acc9af8d082d8dc10d0822c83","observation_id":"bf7bc42f-9c7d-4a84-9d9b-8e2dc95790a2","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Step 3.5 flash: Open frontier-level intelligence with 11b active parameters.arXiv preprint arXiv:2602.10604, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:ce984809615f9a71003e879ee6d654b7150c5f192b5856e7377aa85e79586a3b","observation_id":"cca5df99-1c8c-4737-b8d5-e8282a167574","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:0ac044933a0ae653e8a5269ff4f6962a44045e4e237ef8a1e59ceeda8c435e4a","observation_id":"acd11089-d067-4bd6-a987-1d0aef6a56f2","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Python-MIP: collection of Python tools for the modeling and solution of mixed-integer linear programs.https://github.com/coin- or/ python-mip, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:8323f499096e3d0c92df9b8739a16b577e41b7047014a76c51c6acd3f3691c84","observation_id":"e58ce5d1-ea09-4028-8cbc-55e2be4c80c1","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:aee28a73dcbf6b789bdfaf11bd3e9575a2b3ab2d863373f26feb37e23e8dc5da","observation_id":"58406958-4464-4b0b-b303-392159792d84","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Fine-tuning vision-language-action models: Optimizing speed and suc- cess.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:7b9207355f86bd91769b983344510ef23044dc3fa0afa04f1a6f3a234d37f4b7","observation_id":"9d933880-011b-4e0f-8b9d-55efc7c15496","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:d13c9bc392c209b73b9d8f3be9158bbabaf9e156cf6b8eef05fd2f8ed515a094","observation_id":"bf8d5aea-50d8-486a-82fe-684dbae0a8e8","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Jamba: Hybrid transformer-mamba language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:95a5a548516bbc0fa8f273718701e4ce2b6b03cfb1db84c5129fe5c06dd4a3f8","observation_id":"c2e2859a-ff26-4a12-af8d-69420f0655d8","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-08-13T08:34:05.764059Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Minimax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:ff904f1ea163012905f3149cfe1d6a3aff70df1fb20454e89e767c4cc1239cff","observation_id":"3e14401c-64c0-47bb-9163-d80145054659","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:a1ef633203bb996f8e46628157aebc4a61283f54d50fec3c7fda2895c61eab7f","observation_id":"50eb05b7-5b9b-474b-8925-ca0b2da177f0","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:20c43f0014a03d08eca35ec78f189c965372ad6aed06f418056f7874318102f8","observation_id":"409a72a8-48f6-4794-a38c-1fe3dec517d3","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Matvlm: Hybrid mamba-transformer for efficient vision-language modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:bccaf186376fc918cb4531d02bcce85ba3e820e40d07047ff8a3263076fbdecb","observation_id":"b436ce7e-b48f-4f5b-a85b-633f9c23e5df","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08052","last_updated":"2025-09-29T17:21:41Z","snapshot_observed_at":"2026-08-15T10:50:53.459374Z","submitted_at":"2025-06-09T03:14:04Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08052","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Recogdrive: A reinforced cognitive frame- work for end-to-end autonomous driving.arXiv preprint arXiv:2506.08052, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2506.08052","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:24771bb7b06b28aa5bd8625e1d79ba2453c457771cccc09e4b81c16f87a30638","observation_id":"5ff20684-4e38-4d1d-b018-e8b39c8bb9a9","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Jamba: A hybrid transformer-mamba language model.arXiv preprint arXiv:2403.19887, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:ecc709e333202dba294d3881fc898b52b14551c7ae335f9c8d01a9ca739a297e","observation_id":"21d1ab2d-32c1-4969-abed-9392123245db","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Rea- sonable effectiveness of random weighting: A litmus test for multi-task learning.Transactions on Machine Learning Re- search, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:379bfb209654a3a0b95c320593e56340113c9032257e0aa4093cfe725ec26f16","observation_id":"ff0ab2b0-d38b-426b-9294-f71cdfe9ccf7","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Mmfinereason: Closing the multimodal reason- ing gap via open data-centric methods.arXiv preprint arXiv:2601.21821, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:40c2aec1f133dc1bfbd4e6241e3894c7e416ada0aca8a9b899932325a034d3ff","observation_id":"3ad7d796-80f1-435c-b1fe-9c56bc6d637e","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19078","last_updated":"2024-07-23T10:46:28Z","snapshot_observed_at":"2026-08-16T14:14:11.699135Z","submitted_at":"2024-02-29T12:03:05Z","title":"Smooth Tchebycheff Scalarization for Multi-Objective Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19078","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Smooth tchebycheff scalar- ization for multi-objective optimization.arXiv preprint arXiv:2402.19078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2402.19078","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:cf952c716461edbb989990dfdc485221305e591decc29816f75411831d95cf86","observation_id":"457a882e-c583-4b32-97b6-675b3129c589","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:22b68dc2c845e47e778a6e05eeb8f1dd43b8e869e2edbd9415a20fd4fd20cdb3","observation_id":"cb31c01b-472c-403c-9978-9bd5d2b81647","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:94a907032cb896f5f6f89c8394b49ce70ae0c2b14dc95f406cdeffedbf13de81","observation_id":"2362dab7-8237-447b-af30-f14a5d2949a4","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in neural information processing systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:e372579e903e1bf056766cf3b13d091ff36c7fae75b4415032cfeb198b86c886","observation_id":"ff7e6e10-12a2-495d-8b98-b596a87cc98d","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Smolvlm: Redefining small and efficient multimodal models.arXiv preprint arXiv:2504.05299, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:03c654c2e33b00935fb358072dad40e34857432f58bd530cdec19f7bea063f97","observation_id":"242c0021-34cb-45aa-a11d-ed585846ad6e","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Chartqa: A benchmark for question answer- ing about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:8fc9476369adb906ba32fb14855f493efcc2b1387c26de49b985afbfb7536050","observation_id":"e43f924e-0b60-46b8-ad23-2ac55837fa02","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:13cc1afb01b49e41788798e418a273ed49ee955c2619a72fa48c2a66d6909fac","observation_id":"8e4253cf-c643-4a08-bb07-cfb0eb05af2d","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:e8d3d14dff30de507345eb3cfe4047efc4798502e219d85f65ac5a38c0eeda2c","observation_id":"9e565b46-33fa-4bde-a808-1bb90d99a7d4","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:8ede359e2321c812b306691dac4214b0dd9b749d907f5691d90946c708cd66f0","observation_id":"504477c8-4bd9-413c-8b6c-ae8d84d3af23","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-16T16:18:35.731432Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Olmo 3.arXiv preprint arXiv:2512.13961, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:cb0d2fa17f339c5ebdf5068930de1b645a2fa636f763f3d98f254e4c3b7cdbee","observation_id":"9cf6cbf3-2a65-4fc7-8be7-dfeb32d99b9e","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Sys- tems, 36:42748–42761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:5245d67b290304474683041abc9cc7c4adcb9ca11f36dc00fa057146b4a4f380","observation_id":"740d1109-001e-42c8-baa3-a6d3bd2acd2a","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:e7e1bffc50884f613e2f53faa61fb34eac2e9b4c5f12f38151425056b2a7f084","observation_id":"a7cd3402-e1b8-4612-89bb-e87d7184617f","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:7aade0b312129a5c11821f02793e375038364f58f0746fe7cda4230393ae7901","observation_id":"a052a071-aa40-4493-af71-529ee45d1c45","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14622","last_updated":"2024-07-19T18:38:25Z","snapshot_observed_at":"2026-08-20T11:04:16.969221Z","submitted_at":"2024-07-19T18:38:25Z","title":"BOND: Aligning LLMs with Best-of-N Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14622","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Bond: Aligning llms with best-of-n distillation.arXiv preprint arXiv:2407.14622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2407.14622","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:2f6d573a91f0fe54b2996b4b06952ef3ae3e2df272d1480731b4bd461fa36a1a","observation_id":"2de83db1-ff94-4a75-a2ac-32f6c971f8a2","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Hardware co-design scaling laws via roofline modelling for on-device llms.arXiv preprint arXiv:2602.10377, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:439b1c5dade3077dba7d8f42785ac33f1af78e1530cf96bd0de597dacd75396f","observation_id":"5fa75495-c68c-4416-997a-e156689547e2","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-18T21:18:20.077927Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:384693f4db08a2e4c4e08878fa229f649177ae980f5ddd6401fd5c40d9ef40be","observation_id":"6572c381-b2a1-4112-8f00-b81c1b6c547b","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Infinitevl: Synergizing linear and sparse attention for highly-efficient, unlimited-input vision-language models.arXiv preprint arXiv:2512.06450, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:c6d88bd5f1a95344bd7c836f0ea9896d2476af33190c819688ba154f817cce77","observation_id":"341ce738-5668-4f74-ad6b-d69550f80144","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Kimi linear: An expressive, efficient atten- tion architecture.arXiv preprint arXiv:2510.26692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:87200289eac62dcf8db8142d9510f115acb06eeaf97b85d60f7364e575d80aaa","observation_id":"67b185ac-4f92-45ff-9857-6e3e85f7ef35","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:5f67b63a86a8c37111ffb7b48f309629b0fa8ba3e08470371c67b9e3d9ac8533","observation_id":"a03e637a-439e-4d1d-a878-1b4137801d7f","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:647ce9e3c3682f75c3cd78cf3e3e14cce2fce390e2d8de53daa92977257fffe1","observation_id":"3338cf91-89dc-4eae-89c4-acfe82ef1b18","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"An empirical study of mamba-based language models.arXiv preprint arXiv:2406.07887, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:63045a37a14517115ca9aed1af0d6b4e40ba06ef7a7588e0b4e588d17faf57ff","observation_id":"f947e670-5a73-4fc9-90be-ec511304a901","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Hat: Hardware-aware transformers for efficient natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:954ffa33c098526b65d68e834fa6605905d886cedc2942a163a35cb258e8631b","observation_id":"c910fec7-2b33-4969-bf5a-f74f2509ec99","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:f0bd2c847e75caee7855a3b892d7ff25e9903f8223f6f5e7271574ccbc9ae43e","observation_id":"197f340a-74a4-46e4-9f13-7eb552dd365f","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Qwen-image technical report.arXiv preprint arXiv:2508.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:776537997d0eaf8d03698c65ad7250559ee76062a8b4539a0166ac34021d79fc","observation_id":"800dac3b-54e0-4329-a832-c2063eee09c1","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Rethinking kullback-leibler di- vergence in knowledge distillation for large language mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:fe51e25058033fec4b5a0a351b39bd44da9688940d20a4be65eaccbe8613bf91","observation_id":"a7c4b729-64aa-47bf-892c-d40285fb2ab7","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:e062c177eef5c0b06ef2618cf0677ee464f0607a8c72adbd61e899d424c7fbdc","observation_id":"185e10bb-8fa1-45f5-aee5-7ad9ca4eeac7","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-18T11:53:44.017837Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18960","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Ava- vla: Improving vision-language-action models with active visual attention.arXiv preprint arXiv:2511.18960, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2511.18960","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:74e40e68d2c2e083db149172de2bd0961554d0678ede8193908d3e388cbba0b2","observation_id":"fa74d903-dade-4543-ada5-8c9803c9867f","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01039","last_updated":"2025-01-02T03:41:32Z","snapshot_observed_at":"2026-08-15T18:03:19.320348Z","submitted_at":"2025-01-02T03:41:32Z","title":"MSWA: Refining Local Attention with Multi-ScaleWindow Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01039","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Mswa: Refining local attention with multi- scalewindow attention.arXiv preprint arXiv:2501.01039,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2501.01039","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:b20e211995acf36c4ae2259f64a72e5ee4858ae8fd8acf358ab39d1c6757a625","observation_id":"90157096-88ef-4b97-997c-190e3ba79fbe","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-14T21:08:22.323819Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Gated delta networks: Improving mamba2 with delta rule.arXiv preprint arXiv:2412.06464, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:cc431771f11968a2433201bfe1cd331a31cd7af812a68ddd6918ae237e29356f","observation_id":"e66ccf70-e69a-4c98-afef-33cde19855ef","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04670","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Cambrian-s: Towards spatial supersens- ing in video.arXiv preprint arXiv:2511.04670, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2511.04670","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:c74a654bd1ee279d8a67c39604f93c814881f0233f6953c7bd188f5d2e088dae","observation_id":"898056a2-a29f-46cd-86d0-d32bf6e58c0c","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Clevrer: Collision events for video representation and reasoning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:92124aaa9d39a63fd1ca24da8d0a7d87d95199687ed6db5fd5a7f08f304dab8b","observation_id":"4366df93-f0d2-42e9-b679-a4d3a808239a","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:016a31fc6386381be36607ee5f522dca8c26af60b04a949123c2208e4af7c49c","observation_id":"b365cb0f-aaf4-4d41-8680-88c596f2eb44","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01944","last_updated":"2026-04-17T07:58:14Z","snapshot_observed_at":"2026-08-15T01:04:23.538185Z","submitted_at":"2025-09-02T04:32:24Z","title":"AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01944","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Autodrive-r 2: Incentivizing reason- ing and self-reflection capacity for vla model in autonomous driving.arXiv preprint arXiv:2509.01944, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2509.01944","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:15c2168bb925f0f77c86b02c79ed7732d5741728de8df071f1cfe967e9f727a4","observation_id":"ce4a34a7-3a0c-434f-b97a-f5f862b54f52","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:27173cc7f9de643a7f7f03eb3fb7c91bbac629c4a940d7714285b83a3732795f","observation_id":"e39523aa-4920-493d-ba6c-3ea21ec9ddbc","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Hellaswag: Can a machine really finish your sentence? InProceedings of the 57th annual meeting of the association for computational linguistics, pages 4791–4800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:266627bdc05c87a7409325daa421d0e1046bbdfdcfad5ac16bc117632df9b773","observation_id":"c4dab63b-44ff-4d3e-9df7-aa8604d8904b","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Vision-language models for vision tasks: A survey.IEEE transactions on pattern analysis and machine intelligence, 46(8):5625–5644, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:7bd890b186b147de1bcb38782a7dd65f6201640001ef3f62015dd53eb2ed1bac","observation_id":"b3a9372c-2042-4926-bd51-fb250e82bc2d","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Dreamvla: a vision-language-action model dreamed with comprehensive world knowledge.arXiv preprint arXiv:2507.04447, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:5f218f31a9bc16fddcb36129ba51f18e48713cb2c7e9955194ca410e14e1aa18","observation_id":"3a0016f2-4689-447e-a60e-03f98088ac2e","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"A survey on multi-task learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:c8025d2d6d3517cdfd8a88d22b996f095eac1a6d4f7f08ac38c09c4370ea99da","observation_id":"ae02f27b-2313-4587-b4f1-eab942a93651","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Cobra: Extending mamba to multi-modal large language model for efficient inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:85b7a518bf0355af3214eb956f5e2f3176f934df0632f20de035ff96f23b1567","observation_id":"2a74f311-f049-4eb8-ac78-bf0cce34725d","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13757","last_updated":"2025-11-05T23:46:20Z","snapshot_observed_at":"2026-08-14T00:40:02.694887Z","submitted_at":"2025-06-16T17:58:50Z","title":"AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13757","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Autovla: A vision- language-action model for end-to-end autonomous driving with adaptive reasoning and reinforcement fine-tuning.arXiv preprint arXiv:2506.13757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2506.13757","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:cf14a493dc15dbb1a26b337db1b5d91bbb8c586c3edb85c5f76cf9357ecc5ac4","observation_id":"5acbdc77-61f1-4b51-8ccd-0e45ea3b79af","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06189","last_updated":"2024-07-08T17:59:42Z","snapshot_observed_at":"2026-08-19T16:47:18.962338Z","submitted_at":"2024-07-08T17:59:42Z","title":"Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06189","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Video-star: Self-training enables video instruction tuning with any supervision.arXiv preprint arXiv:2407.06189, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2407.06189","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:75f6ebeaefdff9aff0ac8a5a73957ed064549a8737917c4a7675effd093dab80","observation_id":"0e6c1eb6-3d0a-4e8f-8554-fd73f8a1d567","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T19:03:23.979792Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2607.09029."}