{"as_of":"2026-08-08T04:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6c371bc291da7bfc149f1e56b21d47dc98ff13519e3dc09f6aea429a3ae892a","coverage":[{"denominator":143,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:08:48.226962Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11515/citation-record","integrity":"/paper/2506.11515/integrity","json":"/paper/2506.11515/citation-record.json","paper":"/paper/2506.11515"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.096271Z","title":"ManagerTower: Aggregating the insights of uni-modal experts for vision-language representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.096271Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b26ac0fad838ccadb0a239f9b48448520ef489d5ad9e2351f5c202b2d0e2bc6f","observation_id":"b787420d-6acc-4f61-a52a-79299a9128bc","resolution":{"observed_at":"2026-08-07T04:08:33.096271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.202223Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.202223Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:53a680eb19b67b4a5c178ac0c566c5ac5c3ad57ca5bb1c70888c0ce53edfb78a","observation_id":"55f9426a-ef5c-4aa8-b023-99165f154c40","resolution":{"observed_at":"2026-08-07T04:08:33.202223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06706","last_updated":"2019-01-20T17:55:05Z","snapshot_observed_at":"2026-07-06T07:27:52.425939Z","submitted_at":"2019-01-20T17:55:05Z","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06706","snapshot_observed_at":"2026-08-07T04:08:33.416327Z","title":"Visual entailment: A novel task for fine-grained image understanding,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.416327Z"},"links":{"cited_paper":"/paper/1901.06706","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:651d90713bdc0bc89040a4f1da578274882921054ee8ccdde4654fb55661a21a","observation_id":"ebc1cac8-cde5-463f-b1a8-406c2422b85d","resolution":{"observed_at":"2026-08-07T04:08:33.416327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.710099Z","title":"A corpus for reasoning about natural language grounded in photographs,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.710099Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:442f5eb82b24af0b399e6bb1404d882bc90ece3867475300e0bdb07fc19316f2","observation_id":"3a06e115-c7a9-4c85-ab83-083584a3d28c","resolution":{"observed_at":"2026-08-07T04:08:33.710099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.832464Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.832464Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:3e61b417a1ebdb3a23baccd883858c4da0a1a105edc5327bc60542c335f86a8a","observation_id":"62e00204-edb0-4c9f-8b1e-48ec10634540","resolution":{"observed_at":"2026-08-07T04:08:33.832464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:33.933376Z","title":"An empirical study of training end-to-end vision-and-language transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:33.933376Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d997e41b3d0d1651c56defa91abc6210e310e7f353fdd6bebbec9e2cc22306ca","observation_id":"4deea2d7-3081-4629-977c-7375b2fc0ce8","resolution":{"observed_at":"2026-08-07T04:08:33.933376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.047268Z","title":"Bridgetower: Building bridges between encoders in vision-language representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.047268Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:e430929f1eee25e96dc7535d902f09e589dbf1260248ec60a09ddb7cabccd608","observation_id":"6b114773-63c4-4e72-bb35-62f12f64839e","resolution":{"observed_at":"2026-08-07T04:08:34.047268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.138970Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.138970Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:439785a5f7c0150f29278f5b1c1c9f91d8f5b3e3f5c563b5d0a3d155aa3b5439","observation_id":"f1d71738-f08d-4cd5-9398-f9bf73b4f60b","resolution":{"observed_at":"2026-08-07T04:08:34.138970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T04:08:34.269423Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.269423Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:4b071493cbc5a921696f3cd1aa4f97b9ae63f4243c28486a5cd5a3fe5663ba10","observation_id":"5a635d12-cd8e-4d0e-a1e3-a20123271c14","resolution":{"observed_at":"2026-08-07T04:08:34.269423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.396539Z","title":"Learning deep transformer models for machine translation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.396539Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:4e03e35ac30e14d36370fe0329aa42f0a279f6f0ad22b0f40c97f4e57211c11b","observation_id":"1497da84-d879-4b24-a45b-d1310f0bc138","resolution":{"observed_at":"2026-08-07T04:08:34.396539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T04:08:34.510959Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.510959Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:a35aff439354bacd8780d9b7e140a726a47b6247596549a769dcce34adbc4b6c","observation_id":"3f8768f4-df16-48b4-ae99-fd24685256d8","resolution":{"observed_at":"2026-08-07T04:08:34.510959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.681245Z","title":"Llava- next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.681245Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:edcd6b46a07eb1cd7d7d4db3161490ad6dfe602ab42697db0b68eee69db7c2b5","observation_id":"17f631e1-3a02-48f3-ad3c-0edf39ec72bb","resolution":{"observed_at":"2026-08-07T04:08:34.681245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:34.848451Z","title":"How much can CLIP benefit vision-and-language tasks?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:34.848451Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:5b996ada47fa46823ad6e2d06dbcecebfc522c8a8f2b854c3da847411c3d7579","observation_id":"2f78c9a6-e55e-4637-a4a3-8d5d209ae51f","resolution":{"observed_at":"2026-08-07T04:08:34.848451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.012205Z","title":"UNIMO-2: End-to-end unified vision-language grounded learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.012205Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:29932a506ec1e47d00fe73e623e16c1421b3782ceae2dae992528dbf3b53ff71","observation_id":"fe89ca05-e8d3-472f-ae87-bf3686995f4a","resolution":{"observed_at":"2026-08-07T04:08:35.012205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.146927Z","title":"Neural machine translation of rare words with subword units,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.146927Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:84e542ebb38903175f3aa1989911dee8ee9bfbe8e3ae191de7d9964db34ca3ff","observation_id":"83e54d8e-4a8a-4f7b-9af6-5cad87292bb6","resolution":{"observed_at":"2026-08-07T04:08:35.146927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.256696Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.256696Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:2d463edcc9b31f7a9edd7997d39ae4291d4e550c2bfed30d68001d716cc938ce","observation_id":"c02c04b3-7ca1-4bca-b887-8375e818dd1f","resolution":{"observed_at":"2026-08-07T04:08:35.256696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.432776Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.432776Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:4d6f8e8f18bd2313b7d579f7476e2dbe4a720c320f901c576321cd5747db4b6d","observation_id":"db02e517-fb23-4300-a9be-3426bf0d409d","resolution":{"observed_at":"2026-08-07T04:08:35.432776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.541595Z","title":"Vilbert: Pretraining task- agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.541595Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:c7e2c529c5dace65407a00a19da7caa89a8cbd9a2891c9a7902335630bc06165","observation_id":"2aa3a712-7ab3-44c4-a016-f21eb83b3039","resolution":{"observed_at":"2026-08-07T04:08:35.541595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.664720Z","title":"Multi-layer representation fusion for neural machine translation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.664720Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:1197d166a0c209f1a99fa31aa3c0c8c2ba9071b58eb5e354724bc5a70f63c5c1","observation_id":"127b0b7e-b728-4454-9243-9d426aeea31c","resolution":{"observed_at":"2026-08-07T04:08:35.664720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:35.819400Z","title":"Multiscale collaborative deep models for neural machine translation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.819400Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:c92a5b9fd667e3f9b3b0f899bb2921402f7a681092b79585419508fa87d0238d","observation_id":"6e228351-5890-459e-a8cb-e664beffcaa7","resolution":{"observed_at":"2026-08-07T04:08:35.819400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-07T04:08:35.926027Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:35.926027Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:7cede2cea487a5dc6d83407d082ae70fc204cf9742409c9acbdecac7a487a617","observation_id":"168de691-262c-4021-983a-4525d727306a","resolution":{"observed_at":"2026-08-07T04:08:35.926027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.069126Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.069126Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:43aed407b55cd4427d0058bcffcfc9ea57745857fcda4021d693feedfbaeef79","observation_id":"d3f72292-993e-42a2-8b69-78960073aa47","resolution":{"observed_at":"2026-08-07T04:08:36.069126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.245435Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.245435Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:5cce00113a21388c6c5f6073550435acb8426b6f1968e724124cdaf5d1a05786","observation_id":"a6364764-2666-4314-a977-3c149ba81cd8","resolution":{"observed_at":"2026-08-07T04:08:36.245435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.380900Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.380900Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:c06e7b8ed9de7d88ac808ae985d50b8e2f965e32718a79432d29492fd8e6b273","observation_id":"13501472-651d-4356-b2bc-8d4511f2f927","resolution":{"observed_at":"2026-08-07T04:08:36.380900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.538152Z","title":"Uniter: Universal image-text representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.538152Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f93e0a0b113dd8285baa42bec9d3da29ed5f514c65ebef425ba9b147a2b0e53f","observation_id":"a8d542ec-e519-46e3-a9d0-bbe5db76fa07","resolution":{"observed_at":"2026-08-07T04:08:36.538152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.679187Z","title":"UNIMO: Towards unified-modal understanding and generation via cross-modal contrastive learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.679187Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:c96502436d086b1bd06815a91c5123f7f4d17f43b3ca8cb861d2814be25a0a89","observation_id":"4559d4da-8f84-45c6-b95c-2d17fde19ed3","resolution":{"observed_at":"2026-08-07T04:08:36.679187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.787717Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.787717Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:424df3b1d53aa220c2b903d9cef9823a91c6bac84f06a18e3c01b4ad4f1eb238","observation_id":"6aa74da3-3b4e-460c-bd91-263168634441","resolution":{"observed_at":"2026-08-07T04:08:36.787717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:36.927145Z","title":"Vlmo: Unified vision-language pre- training with mixture-of-modality-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:36.927145Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:83956a189710544621f2414a7f49c6351c40cc091d402d6f67d1fad7f45ae3bb","observation_id":"40ec964d-4a3b-43ff-9eb0-ac8e6074e064","resolution":{"observed_at":"2026-08-07T04:08:36.927145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.043824Z","title":"Simvlm: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.043824Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:10c2d07194ebc8e3b6a7eb7b499fce05557bd48905f285d55a0c8ab49c100897","observation_id":"0e1b9acf-fcc9-438f-9f15-94e42948a820","resolution":{"observed_at":"2026-08-07T04:08:37.043824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.184911Z","title":"BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.184911Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d844312454d1141e92de34b5f444c3c4c0b4eb72b6cf850670b86eb261a012c0","observation_id":"9d31b259-9a5c-4d4e-97d5-8f750e5c074a","resolution":{"observed_at":"2026-08-07T04:08:37.184911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.280478Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.280478Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:400195efe0b31cd25f59713478da7bcee5905e838de0327712e0464f741d72b9","observation_id":"81f9cc6f-3c60-48a9-8c62-b536775451df","resolution":{"observed_at":"2026-08-07T04:08:37.280478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.369147Z","title":"Im2text: Describing images using 1 million captioned photographs,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.369147Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:79e39d81817cf281faf65037c0158754d711be7bb3678eca42ca30de661db399","observation_id":"ab0fd178-91fb-40f4-8f7b-13bfa4a7129b","resolution":{"observed_at":"2026-08-07T04:08:37.369147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T04:08:37.503386Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.503386Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:de570a55eb894370a2ab3c9874bc15c494a1d9fb3e5c846fec4e8df2d4a00599","observation_id":"16c6ed4c-a231-4626-9caf-a5e85204bc85","resolution":{"observed_at":"2026-08-07T04:08:37.503386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.643209Z","title":"Visual genome: Connect- ing language and vision using crowdsourced dense image annotations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.643209Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:2b72945788102c58ea7d781ee63f5c2a624ea1e7081e589509043feef7ab2c65","observation_id":"43234c42-5705-49f9-bb51-c0a6d5b9edd7","resolution":{"observed_at":"2026-08-07T04:08:37.643209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.753062Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.753062Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:12e25dd012d0e94087bfc80a72a25e2bbb0e0eb455e4662297aaf1e8528866ca","observation_id":"2559ceb1-fa12-4997-bc03-069586b28428","resolution":{"observed_at":"2026-08-07T04:08:37.753062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.870902Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.870902Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:937824a99339d8f28d5d18a68a4f263b97e677f9c4ee222889f073a1dbd6a28b","observation_id":"67f49981-e54c-4b78-a46e-cc375d64580f","resolution":{"observed_at":"2026-08-07T04:08:37.870902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:37.996940Z","title":"Docvqa: A dataset for vqa on document images,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:37.996940Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ccc0695776553794373bbf8e43448e906c1ac7a0ee9e0e7cdb062148b947f5a0","observation_id":"54ecea55-9c8f-4520-b022-d83c20fe3c04","resolution":{"observed_at":"2026-08-07T04:08:37.996940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-07T04:08:38.138298Z","title":"Ocrbench: On the hidden mystery of ocr in large multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.138298Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:7ec40d3f7d3d7e7f806769cd39577ab4b07345eef466952dc2526169366fe80a","observation_id":"537332fd-f14c-4b01-bebc-63fb4571fe5e","resolution":{"observed_at":"2026-08-07T04:08:38.138298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:38.349219Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.349219Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:4755f95e7aebdc929b8039a978ae0f09d9724dad89d0a0555152f08eeacad1a7","observation_id":"f0ed166f-4887-4415-ab39-a07af0c8721d","resolution":{"observed_at":"2026-08-07T04:08:38.349219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T04:08:38.535201Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.535201Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d3af61b9100f6424fb9f7b28486f548a2f4521c1d66aa0ada8be476cdfdcac4a","observation_id":"44a4699c-f096-4e34-83f5-f5e54cef2ca5","resolution":{"observed_at":"2026-08-07T04:08:38.535201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16527","last_updated":"2022-06-10T16:57:51Z","snapshot_observed_at":"2026-07-06T12:54:54.273968Z","submitted_at":"2022-03-30T17:58:23Z","title":"Exploring Plain Vision Transformer Backbones for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16527","snapshot_observed_at":"2026-08-07T04:08:38.678581Z","title":"Exploring plain vision transformer backbones for object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.678581Z"},"links":{"cited_paper":"/paper/2203.16527","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:39b99bb37acf34643e12a6fa6429cf59e1302e75cad34d9bc5c460dcdbe07689","observation_id":"9d5ec591-45c1-41cb-b6d8-244f741b30bb","resolution":{"observed_at":"2026-08-07T04:08:38.678581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T04:08:38.805151Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.805151Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:e1f582706ee4c626448e52b64a0a73cf0ffe20177188acd21ee22c284df7878e","observation_id":"9c6490ac-a365-4e03-a021-585cda9746f2","resolution":{"observed_at":"2026-08-07T04:08:38.805151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:38.963496Z","title":"OK-VQA: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:38.963496Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:9f125c27537b3a26d20b974ab65f4adf55685ffd18a435fb3a9c2ab4f3459e82","observation_id":"8158c46c-bef8-4e83-8312-21b3dc5bdd76","resolution":{"observed_at":"2026-08-07T04:08:38.963496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.071175Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.071175Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:096d38c9be756f8798e657aa688c23e7663c821f08c689995344d03456913f1d","observation_id":"d4c7b5df-bf1e-4fdf-a001-c90e39924fb9","resolution":{"observed_at":"2026-08-07T04:08:39.071175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.186859Z","title":"MM-vet: Evaluating large multimodal models for integrated capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.186859Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:2f4d7516ff60d304195e717fbcf5f773b0d3aa06768d8a4927877c58479d6f71","observation_id":"be1fb631-5e0e-400e-b7d2-6f4ae267f566","resolution":{"observed_at":"2026-08-07T04:08:39.186859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T04:08:39.324730Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.324730Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b425dea1cfd03ee1f262814464f836aecccc5fb2094f47d9c2f9887b568e08b3","observation_id":"0f6f0d9e-1324-4eec-b3ec-8182e7455207","resolution":{"observed_at":"2026-08-07T04:08:39.324730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.541834Z","title":"Grok-1.5 vision preview","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.541834Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:158e99861d1328910b841354059efb68d7bc617ee44e74d7fe477da6dc90261e","observation_id":"28546be3-8d16-4c27-8c88-47030076110e","resolution":{"observed_at":"2026-08-07T04:08:39.541834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.732658Z","title":"Towards VQA models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.732658Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d7f67c673910c52e32089ffdf50b08261980c5f94771b7fe86fb9154316e1707","observation_id":"db613073-00ff-4358-82df-5a1e2594cff4","resolution":{"observed_at":"2026-08-07T04:08:39.732658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:39.947386Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:39.947386Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b0357f298dd8ceaf38962c97a33d8dc5dba88b533dd70f69846ba5e8ea59931c","observation_id":"fd5ae75d-1c63-4d54-b5d4-335a3171eb90","resolution":{"observed_at":"2026-08-07T04:08:39.947386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.137978Z","title":"Infographicvqa,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.137978Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:91bf0ce406bd13b437ca1018c0ee233ac40aa7e58b4e7cf82622a5ed25e5ac0f","observation_id":"0d760691-3514-4c2a-896d-d4a8a8034796","resolution":{"observed_at":"2026-08-07T04:08:40.137978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.270291Z","title":"A diagram is worth a dozen images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.270291Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b27dd0598fccfe4a6aab83b80837f848c6c612663b39bf87780f637a8c8098b6","observation_id":"d1350f9c-11ba-457c-9adc-0a6cd3b1d957","resolution":{"observed_at":"2026-08-07T04:08:40.270291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.485663Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.485663Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:0f1c0e9395f3b28775b14aa6e88319c0c11b5d37d73dc8ceef7014109f1b7e5a","observation_id":"c9896961-3bb1-4c9c-bdeb-be0b8c47cb4f","resolution":{"observed_at":"2026-08-07T04:08:40.485663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.621152Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.621152Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:781cc465429e746d3ad0e78c43daf05ea5de77ad40817172d454139ae1ce3c32","observation_id":"86e7b22c-7d89-46c0-956b-294c214ac865","resolution":{"observed_at":"2026-08-07T04:08:40.621152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.791974Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.791974Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:0661c741a38b9e62f68c56a20a4e3248dd0007b4a07ed6f10e8ec82b29713492","observation_id":"2f75a396-e90c-4cb4-90c5-f2a010df1e03","resolution":{"observed_at":"2026-08-07T04:08:40.791974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:40.922650Z","title":"Llava-next: What else influences visual instruction tuning beyond data?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:40.922650Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:73468523fb239292c27a1980e9afe62f373c7ff9dbc8c9fc7fbe7d76d271e816","observation_id":"791fa363-476e-4220-b480-1297520c747b","resolution":{"observed_at":"2026-08-07T04:08:40.922650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T04:08:41.016343Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.016343Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b8968c87c1819a862132a14bfb95a1d7667467b20ba8f23a4ea831ff2d7f505e","observation_id":"1b0053e0-2ad7-40d6-9e37-341dea810c36","resolution":{"observed_at":"2026-08-07T04:08:41.016343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.133126Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.133126Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:aee788686d1f2786aa095a49ca3fa427c4579806f0e16933eca565ffb0d4ff79","observation_id":"ccfd809d-005b-4e6b-9e68-8651e9771796","resolution":{"observed_at":"2026-08-07T04:08:41.133126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.228490Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.228490Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:24961285ac84b65787cffb335f8d7bb275a1a25684a14d02041f6280bd44f31b","observation_id":"630611ec-21aa-4254-a63b-4364f039a30e","resolution":{"observed_at":"2026-08-07T04:08:41.228490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02034","last_updated":"2024-10-28T07:40:49Z","snapshot_observed_at":"2026-07-06T18:56:40.234434Z","submitted_at":"2024-08-04T13:55:58Z","title":"Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02034","snapshot_observed_at":"2026-08-07T04:08:41.334971Z","title":"Mini-monkey: Alleviating the semantic sawtooth effect for lightweight mllms via complementary image pyramid,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.334971Z"},"links":{"cited_paper":"/paper/2408.02034","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f2fd01907eb3b9cdd8fe50a48ba0cfcc51893af61a3fc0868e7bf9f305f2fb4a","observation_id":"7a46b53b-59b1-4e10-a856-f00b73567ab5","resolution":{"observed_at":"2026-08-07T04:08:41.334971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.454860Z","title":"Neural machine translation by jointly learning to align and translate,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.454860Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:8a83c5e39660b66d350566cb43417d052fc56e5f0d3849f54be7719de91f8052","observation_id":"1a13bfda-229f-4e88-b2f1-ff9484da7785","resolution":{"observed_at":"2026-08-07T04:08:41.454860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.599170Z","title":"Revealing the dark secrets of masked image modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.599170Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:e26420cca520c3d24e22b2aff9fcdfa699be8b7c0e8216b983cd17ca9eddb0df","observation_id":"78ea5f86-41b0-4a53-9cb8-04e90e66d748","resolution":{"observed_at":"2026-08-07T04:08:41.599170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.718447Z","title":"On information and sufficiency,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.718447Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:4f8b26d56c4b1345ba19631d3be29a8185b838388be89a2e8c4a773d19353b1a","observation_id":"50e4abef-6a5a-42c5-a7d4-42205f4297a5","resolution":{"observed_at":"2026-08-07T04:08:41.718447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.750278Z","title":"VL-BERT: pre-training of generic visual-linguistic representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.750278Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:1bdb07974e991956f4637cbb0398a91324408d0565ba00f421de6cfde60582d4","observation_id":"11507107-d0ac-4d9d-be1d-a4aa00ff6b15","resolution":{"observed_at":"2026-08-07T04:08:41.750278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.831669Z","title":"Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.831669Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:282aa8b6598e90df13ac4bec39af76e3ba3ef99cfb3a14360e1949b2e1af7154","observation_id":"c21d2ddb-66ff-4d8d-a3b1-8f6fe4d4b2db","resolution":{"observed_at":"2026-08-07T04:08:41.831669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:41.945825Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.945825Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f9eb345fe6db90c6147f9d42f63c3355e5d66b55e0460a4d792560f41cee1e21","observation_id":"9185042d-2240-4ff6-bab4-27b2067d0c14","resolution":{"observed_at":"2026-08-07T04:08:41.945825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03052","last_updated":"2022-06-01T09:24:35Z","snapshot_observed_at":"2026-07-06T12:35:06.017367Z","submitted_at":"2022-02-07T10:38:21Z","title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03052","snapshot_observed_at":"2026-08-07T04:08:42.037290Z","title":"Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:42.037290Z"},"links":{"cited_paper":"/paper/2202.03052","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:475adf97fe9bff2e0b093bf4dca676795ab21fcb5c7625d72397ec88be476a61","observation_id":"b0e88f0c-1d92-4bd9-9257-708632af24b9","resolution":{"observed_at":"2026-08-07T04:08:42.037290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-07-06T13:44:15.000595Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-07T04:08:42.307549Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:42.307549Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:51ca373ad6863a22331d28b6823411d45eecbc70a87f3bef5d8694f330ec65ee","observation_id":"4f4663b1-9867-4080-86a5-7bb1fd1cc08e","resolution":{"observed_at":"2026-08-07T04:08:42.307549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-07T04:08:43.340094Z","title":"Coca: Contrastive captioners are image-text foundation mod- els,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:43.340094Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:689da6157f7c8eac9afa443d5dbe7b65b6af35bcd70dcb351470e93f8998f612","observation_id":"1b21a005-6ee6-4ecf-9f2e-dfa787d4f2f0","resolution":{"observed_at":"2026-08-07T04:08:43.340094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:43.896751Z","title":"Exploring vision-language foundation model for novel object captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:43.896751Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:82603af52efdb56cd3a3e507d066775da14daf7b37aeee007a262e14173575b0","observation_id":"860a30ee-b50a-4881-90a6-4fac86b0df49","resolution":{"observed_at":"2026-08-07T04:08:43.896751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.003055Z","title":"Unsupervised domain adaption harnessing vision-language pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.003055Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b39a8fab8ca13c09c5ac7651874a5ff65e2ba24163d4ec2090d0503f02c11235","observation_id":"0d2e4955-30c7-4ba3-b795-3ef241e06712","resolution":{"observed_at":"2026-08-07T04:08:44.003055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.141844Z","title":"Do vision transformers see like convolutional neural networks?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.141844Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:b76ce3b4e149f3a36df2cc0fc5881a24dec689c7b8ef83d308eda51fd8ec0a73","observation_id":"9850c635-261e-4a42-996e-4a495732adf6","resolution":{"observed_at":"2026-08-07T04:08:44.141844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.267295Z","title":"Intriguing properties of vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.267295Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f21c0072214ced800f55f3e7ffa32262345b880e47dbd742f24926569e607848","observation_id":"4e491e1b-f238-4429-bc18-38adbcdc299f","resolution":{"observed_at":"2026-08-07T04:08:44.267295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.396287Z","title":"Dissecting contextual word embeddings: Architecture and representation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.396287Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:0fb5f4fca904290555acc6be0cf3ec921a2d828cbcd915c0647ff03efaaba961","observation_id":"20dc7104-e1f1-4a72-ade2-e2ddc88cbc52","resolution":{"observed_at":"2026-08-07T04:08:44.396287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.506110Z","title":"Linguistic knowledge and transferability of contextual representa- tions,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.506110Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:007b7ce1d727c61d4619fe27306691d80ca273bfa375b0e47374447895c417df","observation_id":"0937db5d-0aa4-47ad-872d-540f20f90442","resolution":{"observed_at":"2026-08-07T04:08:44.506110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.638326Z","title":"What does BERT learn about the structure of language?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.638326Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f362c7596818100c07ad136eb4176bb0801c7a35974750b3219914baf7727d10","observation_id":"0d159b50-7879-4346-a4b9-4b3d6b6049ed","resolution":{"observed_at":"2026-08-07T04:08:44.638326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.742392Z","title":"BERT: Pre- training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.742392Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ee9c97bf64a683b55bb213c5d8d75d13e4f45f284ed09fbacc847e0618845334","observation_id":"f7a40f94-b25b-4c85-be23-f6d1a752f0cd","resolution":{"observed_at":"2026-08-07T04:08:44.742392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:44.850613Z","title":"Feature pyramid networks for object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:44.850613Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d0a3ef9dbf24980ea845135cbc3c9019bdc0bfb3f45c321a6a80ad7c984179ba","observation_id":"82ead94a-b173-4027-b219-aa7e4f40108e","resolution":{"observed_at":"2026-08-07T04:08:44.850613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:08:45.304746Z","title":"Densely connected convolutional networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:45.304746Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:a702b24e07db322993151e7c61468bfe406dd1a55f89475fdaa4d26bb784cda2","observation_id":"5491a66c-cb13-49a4-befe-b504ac064462","resolution":{"observed_at":"2026-08-07T04:08:45.304746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:07.597114Z","title":"Deep layer aggregation,","venue":null,"work_id":"f05007ae-3067-42ef-91ce-26819fc6f528","year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:45.913961Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ceb2ec35062110510e24844af51b03dad298efc3ebc4df31ddc1ce205a1ca97d","observation_id":"4ddf0667-663a-41c7-8681-a534e57566c2","resolution":{"observed_at":"2026-08-07T04:09:07.716660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:07.280142Z","title":"Segformer: Simple and efficient design for semantic segmentation with transformers,","venue":null,"work_id":"7f1487d0-8a07-438a-94e5-68fb8b197cb8","year":2021},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.004678Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:5e333c685d0a89f3141aea3bff3b18c110fe4e62644a6fedc4ed06df69eedbc9","observation_id":"81b656ed-2771-43e3-85fb-4b7858b5b7c5","resolution":{"observed_at":"2026-08-07T04:09:07.489616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:07.076120Z","title":"Clsr: Cross-layer interaction pyramid super-resolution network,","venue":null,"work_id":"35bedcb3-603a-4abd-9775-663a6b6bd4fa","year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.141424Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:63e5ac4ad2045671b7cede7052e80d172d2f55409b2fad32181afc1b92c2ffd9","observation_id":"87038d9d-e3d1-497c-818f-f7eee285c3da","resolution":{"observed_at":"2026-08-07T04:09:07.169806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:06.811490Z","title":"Attention-based layer fusion and token masking for weakly supervised semantic segmentation,","venue":null,"work_id":"28b73589-3821-47a4-9a70-1e56ef16c775","year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.248925Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ebd4daee164c97cd9db35e6ed21a0331fbf2a6d112768157966d33e57e7430a8","observation_id":"8239b6d0-30e7-47e8-acc0-fd8a21ec2a71","resolution":{"observed_at":"2026-08-07T04:09:06.932055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:06.527493Z","title":"Artificial- spiking hierarchical networks for vision-language representation learn- ing,","venue":null,"work_id":"1c0fbd57-e7cf-4ada-8ed8-8e2f944b3ea6","year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.355704Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:198d80e5205de8b20b6a3591d475750ce63c64620a295dd72bf087dc4edb52ba","observation_id":"f0638c7e-7665-4b3a-bd03-f89a1ae50506","resolution":{"observed_at":"2026-08-07T04:09:06.661838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:06.218455Z","title":"Deep contextualized word representations,","venue":null,"work_id":"ebc7f37d-84f3-4caa-916e-e2a7a38b3439","year":2018},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.461060Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:7826d2d491b130026da5bcac1b577bfdefd5fe85a3826beb6073e84c881cd81f","observation_id":"b1667396-7ca9-447c-87c5-2d97a56a6271","resolution":{"observed_at":"2026-08-07T04:09:06.341513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:05.882801Z","title":"Coarse-to-fine vision-language pre-training with fusion in the backbone,","venue":null,"work_id":"7b8c1312-efa0-4e88-adca-9ea4243b08af","year":2022},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.583941Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:fb7e7f83e7e3b711f2d64ff0f309a25d611187fc736177c5691c0fe393808d9c","observation_id":"fc0fba08-fdf4-4305-a1d7-a34552aad9cd","resolution":{"observed_at":"2026-08-07T04:09:06.033250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13800","last_updated":"2024-11-14T23:53:05Z","snapshot_observed_at":"2026-07-06T18:18:03.254618Z","submitted_at":"2024-05-22T16:25:03Z","title":"Dense Connector for MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13800","snapshot_observed_at":"2026-08-07T04:08:46.709519Z","title":"Dense connector for mllms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.709519Z"},"links":{"cited_paper":"/paper/2405.13800","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:62b4a2ae588090ce9c16a6440d780ab66549bdb818776da2b796477b0d611141","observation_id":"9ea500f7-b2be-4f3c-a87b-5624dbf3905b","resolution":{"observed_at":"2026-08-07T04:08:46.709519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T04:08:46.824918Z","title":"Tokenpacker: Efficient visual projector for multimodal llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.824918Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:7dc6b9d10f5f74c8afe26c49f8440d4393b9a6045dfcde8db84c738a5594d9d6","observation_id":"c62664f3-9f31-4c76-a0de-2a28e1bfcca7","resolution":{"observed_at":"2026-08-07T04:08:46.824918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:05.629528Z","title":"Language models are few-shot learners,","venue":null,"work_id":"1c9f1c22-7d97-4dca-97cf-8461a60ff00a","year":2020},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.918627Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d146e01bc10f413f61fdacafcbb0824664a474e9fed7e4a095e62d306760d97d","observation_id":"2a35e3cd-6c1f-489a-9ae9-bbf020cf6cb9","resolution":{"observed_at":"2026-08-07T04:09:05.754466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T04:08:47.068817Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.068817Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:fb7d40e95a8790279e0e9e84ad21cbd4345ef7643e6528dfa488ebd2c7781154","observation_id":"3e4e945f-0795-4c44-a2fd-3049636038b5","resolution":{"observed_at":"2026-08-07T04:08:47.068817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12819","last_updated":"2025-08-25T02:35:43Z","snapshot_observed_at":"2026-07-06T18:17:21.217971Z","submitted_at":"2024-05-21T14:24:01Z","title":"Large Language Models Meet NLP: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12819","snapshot_observed_at":"2026-08-07T04:08:47.189430Z","title":"Large language models meet nlp: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.189430Z"},"links":{"cited_paper":"/paper/2405.12819","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:d0aa726ce7364d31afa0cb9f0bc028897f1db123873b56d115cebd63fc5f3ce0","observation_id":"5b98f0a0-33cd-4afc-b40b-2d8e3fbbd78e","resolution":{"observed_at":"2026-08-07T04:08:47.189430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:05.424135Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"49ac3230-3116-4f27-8cd7-0e559a4becc3","year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.273636Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:5bace24bd869b4abfa0f3cddbd003b8b41e24fce6bda7a02806b78b5cd53cb6a","observation_id":"33ec15ab-e7f7-4152-8e89-546a98610b0d","resolution":{"observed_at":"2026-08-07T04:09:05.526388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:05.180865Z","title":"Introducing our multimodal models,","venue":null,"work_id":"3f0d1d73-ae46-4c90-8184-0a14df6c7b5b","year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.359818Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:13da015a757b795eeb88d6b36e433984d02416ab7a997c7b04d5e3f7a562a38f","observation_id":"f50a89ec-fb71-4975-87dd-9660679b2255","resolution":{"observed_at":"2026-08-07T04:09:05.298926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T04:08:47.490864Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.490864Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:861c2a246d339d6c020482e8c100a0844b6d8e6a3e1f6db52bb747df86ff56bd","observation_id":"ffe0c48d-d30c-467d-9802-8039d28c4610","resolution":{"observed_at":"2026-08-07T04:08:47.490864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T04:08:47.591621Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.591621Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:0cc2434c895c5caa8ca727414b4721d046c8e8a591f7c84e0417284f95ec964b","observation_id":"0ed14fee-6450-4306-8821-431c65915b8a","resolution":{"observed_at":"2026-08-07T04:08:47.591621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T04:08:47.692121Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.692121Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:71267369d449e12eeef7647a0f81763bdbc8b0c344098ab86bb3a3b9c29176ae","observation_id":"f2c93c76-ca12-46eb-8d29-e800355ccd76","resolution":{"observed_at":"2026-08-07T04:08:47.692121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-07T04:08:47.795386Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.795386Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:065b4c70e481dec94457d9bb43ead3759f236cc02b09640d0021e7721e617ffa","observation_id":"30c172e8-53e3-4dc4-9254-b71a08b7a65e","resolution":{"observed_at":"2026-08-07T04:08:47.795386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:04.947452Z","title":"When do we not need larger vision models?","venue":null,"work_id":"3f6f1b5a-a17b-435b-b819-a3493e26d520","year":2025},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:47.882134Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:eb8c904519956fb8294bdbd5137f2c143612bae9dc9c80e2d3befee5a14f2961","observation_id":"fe259a9d-cf04-425f-93f8-ba3e61506701","resolution":{"observed_at":"2026-08-07T04:09:05.061995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-04T10:28:00.554323Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-07T04:08:48.010046Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:48.010046Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:ff503807b0c3a48dd6c3e3b5766e8bf1d82de9a2335b0da1c44c223f2917e0de","observation_id":"55ef876c-a123-4673-beb6-714e832d43db","resolution":{"observed_at":"2026-08-07T04:08:48.010046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:04.683879Z","title":"Honeybee: Locality-enhanced projector for multimodal llm,","venue":null,"work_id":"596a1d5b-56bc-4aac-9b5a-f7ac73f9dbca","year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:48.091130Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:acf6b82d4a12ad67b8b577f089d302991593738c2e1e6995edae5c18dbb96b06","observation_id":"3aac154c-821b-4d07-b583-e03cd288f6a1","resolution":{"observed_at":"2026-08-07T04:09:04.816456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:04.446262Z","title":"Unified language model pre-training for natural language understanding and generation,","venue":null,"work_id":"2e9a3434-addb-4c6b-9785-1a3fcef4e6c6","year":2019},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:48.226962Z"},"links":{"citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:8366b2f8401e98034e810483620c3a30031f131def13dd5103827036283d92eb","observation_id":"0815b0f9-2125-4277-8e8e-d6211aecd15d","resolution":{"observed_at":"2026-08-07T04:09:04.564950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":143},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 143 outbound references and 0 inbound Pith citation observations for arXiv:2506.11515."}