{"as_of":"2026-08-07T07:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb8484bfb740cd089e38594325c91348e86834d1a4e0107afc3107d7ac8c4b9d","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:53:10.367278Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.01643/citation-record","integrity":"/paper/2507.01643/integrity","json":"/paper/2507.01643/citation-record.json","paper":"/paper/2507.01643"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:00.174120Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:00.174120Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:bc792486d72bb816fbeb55770904bb9334ddd6483e2204c93ad9a7d301c11818","observation_id":"87a779a4-5d37-4ccc-9100-ca4a1055b45e","resolution":{"observed_at":"2026-08-06T20:53:00.174120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-07-06T07:56:54.143277Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-06T20:53:00.289384Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:00.289384Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:5e445d0cb1a5130e580fe426d6cd34e02f96c2f9c0540a1d17b4fff5a66bc93f","observation_id":"f3f8b829-d3b8-4c9e-b49c-7a2c08ed4b7a","resolution":{"observed_at":"2026-08-06T20:53:00.289384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T20:53:00.354949Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:00.354949Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:b1b96125337f45d3a250326e7675741414ab21696eb6eb9dc92beb5619e07084","observation_id":"53466165-6d22-4a61-b980-3bf3b80cc3d9","resolution":{"observed_at":"2026-08-06T20:53:00.354949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:53:00.473093Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:00.473093Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:d90a0a75d04250425dbef8a9727888185bf9f22b3f26199e943ba08ac4a0ea6d","observation_id":"50929551-2aa8-4e2f-ad9f-43148dab93d1","resolution":{"observed_at":"2026-08-06T20:53:00.473093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12985","last_updated":"2022-02-25T21:30:48Z","snapshot_observed_at":"2026-07-06T12:41:51.705464Z","submitted_at":"2022-02-25T21:30:48Z","title":"OCR-IDL: OCR Annotations for Industry Document Library Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12985","snapshot_observed_at":"2026-08-06T20:53:00.530268Z","title":"Ocr- idl: Ocr annotations for industry document library dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:00.530268Z"},"links":{"cited_paper":"/paper/2202.12985","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:03de2b2e0fee93d63dc9aec2f26e0777c1ed46d02f4aa26a4fee9a7fbfcfb892","observation_id":"4edcd2fc-7665-47a6-9aa1-72c48046aeb5","resolution":{"observed_at":"2026-08-06T20:53:00.530268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:00.606511Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:00.606511Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:0e46d11f9ca5e607da9fc3407a0494c891df78ee8d2aa8003883e1cb775268a0","observation_id":"c7f9a6f9-9427-4f31-81fb-2221bf4d07f5","resolution":{"observed_at":"2026-08-06T20:53:00.606511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11696","last_updated":"2023-02-01T07:16:40Z","snapshot_observed_at":"2026-07-06T14:34:00.492479Z","submitted_at":"2022-12-22T13:37:59Z","title":"Reversible Column Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.11696","snapshot_observed_at":"2026-08-06T20:53:00.746148Z","title":"Reversible column networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:00.746148Z"},"links":{"cited_paper":"/paper/2212.11696","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:9b2b6abd344f4c6523bb52a2b32b0269bfd717b74a3aaf6c8807a8e273533897","observation_id":"4efb48bd-318b-4f97-9e72-279d1f7ed98a","resolution":{"observed_at":"2026-08-06T20:53:00.746148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T20:53:00.890756Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:00.890756Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:55cfd9821d53f054c57e930203d9a82bdd4e801a07c3c04dbe42fdc1497590ca","observation_id":"df37130e-1b88-4449-b312-380fe9e3d592","resolution":{"observed_at":"2026-08-06T20:53:00.890756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:00.992903Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:00.992903Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:3f70a16397aa21cdc551f13fff01a076516c361ea21797d1819be35fbc7117c0","observation_id":"76b273cb-d5bd-4289-b241-8eed1c6b3670","resolution":{"observed_at":"2026-08-06T20:53:00.992903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:01.082433Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:01.082433Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:a0491b2e4f6e20997908c3aeebaeb1816e876ffb0038c066426b69086ef20ce7","observation_id":"6603d20d-9e99-4651-bdeb-78240a99980d","resolution":{"observed_at":"2026-08-06T20:53:01.082433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:01.202211Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:01.202211Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:f0da95328a2af3cf763c727b9c2a77dceed7193eace0a56709f527705d52a4ea","observation_id":"846e9db1-cacd-4b1a-ac71-bd61cb2742e9","resolution":{"observed_at":"2026-08-06T20:53:01.202211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T20:53:01.365902Z","title":"Are we on the right way for evaluating large vision- language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:01.365902Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:068f49c8945f3c946207819dd1d190ae191da122cbbf07f2821a52c07c5edf9d","observation_id":"36a94428-a52a-4253-9157-6208eaf65a54","resolution":{"observed_at":"2026-08-06T20:53:01.365902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.08534","last_updated":"2023-02-13T15:50:22Z","snapshot_observed_at":"2026-07-06T13:10:56.430851Z","submitted_at":"2022-05-17T17:59:11Z","title":"Vision Transformer Adapter for Dense Predictions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.08534","snapshot_observed_at":"2026-08-06T20:53:01.512069Z","title":"Vision transformer adapter for dense predictions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:01.512069Z"},"links":{"cited_paper":"/paper/2205.08534","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:c8df049c9f7aee330ad3436a519c8a273910f4dffc9474730cb78d7c0579dab5","observation_id":"190292f5-0b9c-450d-b19e-a5b00cc01660","resolution":{"observed_at":"2026-08-06T20:53:01.512069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T20:53:01.696027Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:01.696027Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:ecbf8ab7903eafb5d91b35c5fcc25fb9212b3c9d15906b324d677fa942a86e71","observation_id":"3e4e7dab-6dad-4dce-a34a-f5ccd4100a79","resolution":{"observed_at":"2026-08-06T20:53:01.696027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:01.828141Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:01.828141Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:3caefc81a99ca645ad01ba0ab120030b9e9019709d7366c164dc5a7072854d75","observation_id":"ebb95258-c348-46e4-bc7a-d19ec1053c73","resolution":{"observed_at":"2026-08-06T20:53:01.828141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:01.984634Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:01.984634Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:69cf26308c597acc6f73601397e24b46d2b87400885777151f65741356b10b4a","observation_id":"f3351db5-7b83-4ae9-a3f6-4568eec2f45a","resolution":{"observed_at":"2026-08-06T20:53:01.984634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:02.083800Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:02.083800Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:ff4d0cf167ddbe2bcc3cd09a9ffa2fdaa0e27ff2a35ae752acfbcef19cbb9788","observation_id":"2da8fe5c-44cd-4d40-8531-8ef120e6c04b","resolution":{"observed_at":"2026-08-06T20:53:02.083800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:02.213459Z","title":"Grok-1.5 vision preview: Connecting the digital and physicalworlds with our first multimodal model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:02.213459Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:9b4f18919e4005da3f120e6db32be983f400726ce486e971f72a6280a1911d81","observation_id":"61c2ff98-d663-461d-8d30-7431fc90918e","resolution":{"observed_at":"2026-08-06T20:53:02.213459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:02.382480Z","title":"Sharegpt-4o: Comprehensive multimodal annotations with gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:02.382480Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:d6e53d9188864500ce6597e41ac7b29552ae2f1bdfb5a56a7192e82d8570fe4b","observation_id":"ed114bc2-240a-41d7-81a9-833564627524","resolution":{"observed_at":"2026-08-06T20:53:02.382480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:02.460206Z","title":"Deformable convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:02.460206Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:2a6d923c2c81e44558994ce960fb08d322384f45ed94166c3f56911646edfbdb","observation_id":"c982de7d-2989-4d96-a4aa-8479303dc6d1","resolution":{"observed_at":"2026-08-06T20:53:02.460206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:02.556501Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:02.556501Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:2e1ac770a6ad87d8e777772f27b49c7d53ecaa267bbbbea63d1201bce73d6363","observation_id":"9942ddee-4829-4229-80b5-987fe6c51805","resolution":{"observed_at":"2026-08-06T20:53:02.556501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T20:53:02.653350Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision- language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:02.653350Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:05c5ce80b07cb9932043096be953da15d14b96bace6a0a6e55bacd43be379292","observation_id":"159447a5-105f-49d3-ae2b-f9316f254360","resolution":{"observed_at":"2026-08-06T20:53:02.653350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:02.781183Z","title":"Imagenet: A large- scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:02.781183Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:6fe9c051e55b75c3fe85697cb721a4c21c2e7c2b78034bf38ac1c4430f1c876f","observation_id":"04837be4-82b1-44a1-990f-3694e521845c","resolution":{"observed_at":"2026-08-06T20:53:02.781183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05952","last_updated":"2025-06-09T02:56:55Z","snapshot_observed_at":"2026-07-06T20:19:16.432397Z","submitted_at":"2025-01-10T13:27:04Z","title":"Scalable Vision Language Model Training via High Quality Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05952","snapshot_observed_at":"2026-08-06T20:53:02.977919Z","title":"Scalable vision language model training via high quality data curation.arXiv preprint arXiv:2501.05952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:02.977919Z"},"links":{"cited_paper":"/paper/2501.05952","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:7cf6ef3b3ef37695300a508412074cd20a5add696f94583348060ded09440f1a","observation_id":"bd0b9c54-068a-4ccd-8543-fb75e41684bd","resolution":{"observed_at":"2026-08-06T20:53:02.977919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-06T20:53:03.136534Z","title":"Benchmarking and improving detail image caption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:03.136534Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:388c54877ed44424f59898fdd019c721532c03fc69b5bae3b7fd5a8e0793c145","observation_id":"b9a8a1c8-dff9-438b-a88b-5f5ccc91fee6","resolution":{"observed_at":"2026-08-06T20:53:03.136534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.13274","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:11.730848Z","title":"Adalrs: Loss- guided adaptive learning rate search for efficient foundation model pretraining","venue":null,"work_id":"5d13492e-625d-4e1f-89fc-afd87e651b03","year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:03.306529Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:0ee54ebac03c1b39fce82b199272f26a3876a0480a5ad6e518e703f93a7e75d0","observation_id":"dc0f21b2-c60c-4755-8734-e486f0e811b7","resolution":{"observed_at":"2026-08-06T20:53:11.795734Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T20:53:03.510387Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:03.510387Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:cbea842e691e7464aeacd07228d6a8c61cf4d0a9da82b57cc64f3d97c6f1345e","observation_id":"de786191-9cd0-4b9f-ae4a-b2b735355d81","resolution":{"observed_at":"2026-08-06T20:53:03.510387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:03.669288Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:03.669288Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:d0fab482eb303f70688d0a2dd457d45c3cdb6bd664cabb573317b31188dac3be","observation_id":"de626c13-022e-4fee-8d32-926d2276b58d","resolution":{"observed_at":"2026-08-06T20:53:03.669288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08541","last_updated":"2024-01-16T18:03:37Z","snapshot_observed_at":"2026-07-06T17:16:17.240820Z","submitted_at":"2024-01-16T18:03:37Z","title":"Scalable Pre-training of Large Autoregressive Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08541","snapshot_observed_at":"2026-08-06T20:53:03.825159Z","title":"Scalable pre-training of large autoregressive image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:03.825159Z"},"links":{"cited_paper":"/paper/2401.08541","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:55dac2e81fda7379fd07e82fb3644c40d698c3cc803ef9c49b805b78bb3cc6bc","observation_id":"4d8ec47f-687d-4fea-ab49-a7e1a0a11765","resolution":{"observed_at":"2026-08-06T20:53:03.825159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01017","last_updated":"2025-04-01T17:59:15Z","snapshot_observed_at":"2026-08-03T20:04:29.599244Z","submitted_at":"2025-04-01T17:59:15Z","title":"Scaling Language-Free Visual Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01017","snapshot_observed_at":"2026-08-06T20:53:03.943429Z","title":"Scaling language-free visual representa- tion learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:03.943429Z"},"links":{"cited_paper":"/paper/2504.01017","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:6e5702ff4b86db0338c2ee89b15cbfd001c73d6a65325c131646329bd65a3d56","observation_id":"ece4340a-d08d-4993-894a-dab7d2cd9aaa","resolution":{"observed_at":"2026-08-06T20:53:03.943429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-06T20:53:04.057607Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.057607Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:6b7bbb856c25f7dd7bb17bc6991b9a78b5f9c3d2075b9fd0e483abab8b0f34e9","observation_id":"c8b7ce0f-21d6-4ae1-8aca-36773b1fb843","resolution":{"observed_at":"2026-08-06T20:53:04.057607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:04.154213Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.154213Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:19fd8fda13fc5b0ef0523915623256c25344f3067d43488d408ff267254a4ae6","observation_id":"da4f14f6-bca2-4478-8c1e-597d7811d6e1","resolution":{"observed_at":"2026-08-06T20:53:04.154213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-06T20:53:04.264739Z","title":"Multimodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.264739Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:c7718c05dbbd7574cd6020273927e1f61e9ca5debbaa469a7b333cfa554c5fe9","observation_id":"420672e1-1066-4026-9620-448ba0bb8c5f","resolution":{"observed_at":"2026-08-06T20:53:04.264739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:04.349270Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.349270Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:11ddee54c9b29823cb4b6d6903247e233d66c677b383a7b6e30fd162ad9de251","observation_id":"591ef97f-139f-478e-a5a2-38dfef806161","resolution":{"observed_at":"2026-08-06T20:53:04.349270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:04.453395Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.453395Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:3e6ec68ce2e46e1052a65ab873e05658f93ce60662efd1fdbb521a253ed2524f","observation_id":"974bae22-f802-40f6-a970-4f83a53ba6ec","resolution":{"observed_at":"2026-08-06T20:53:04.453395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-07-06T19:38:57.409491Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-06T20:53:04.556702Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.556702Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:d5f23c0a300c7702ba2b46222afe78233cb9dbbc46a0b24d4baf131c788ff9df","observation_id":"a1e2ecc9-2e50-4db3-95b5-b9ad56713b35","resolution":{"observed_at":"2026-08-06T20:53:04.556702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:04.659113Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.659113Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:5fdef093875a6a1c3c231234a50e7da092af98656bec44eb4283a24540aaadc5","observation_id":"6db352bb-2fd3-4d10-a4e3-c8c098c71fa6","resolution":{"observed_at":"2026-08-06T20:53:04.659113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:04.765807Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.765807Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:2c2ef28e84dec68e772220bf777db1eb036dbeb53360bbbbb1f391fadaf76978","observation_id":"d9cc9776-df00-41ae-a9bf-2412b3bcc69f","resolution":{"observed_at":"2026-08-06T20:53:04.765807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:04.889813Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.889813Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:c705afc1caa5631d6feaba853295f0f95638348f8ef32cc842b39a617fb562f1","observation_id":"c9578615-533c-4f5f-9c72-b3e17aa48214","resolution":{"observed_at":"2026-08-06T20:53:04.889813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:04.975078Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:04.975078Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:edab883edb9e4ea516db53c36df0d1ff6f663b374ff087839be423f968c3321a","observation_id":"7749181b-17cc-4cf8-844c-29f86273e8c5","resolution":{"observed_at":"2026-08-06T20:53:04.975078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:05.049397Z","title":"Natural adversarial examples, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.049397Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:92867f85b3bc7f23f050343bcf7387c2c58f13f1d0cccd77414ea856f3b9397e","observation_id":"fa1a1a87-8ac0-46cc-8df7-fc82cd529023","resolution":{"observed_at":"2026-08-06T20:53:05.049397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:05.144799Z","title":"Squeeze-and-excitation networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.144799Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:9e5def622e6c937406fa4df4c6426ec41b9e8d6ae2f9a60fd2fb5ae0b8280f45","observation_id":"f0de58a4-8897-4c39-adb4-2a867911ca71","resolution":{"observed_at":"2026-08-06T20:53:05.144799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02034","last_updated":"2024-10-28T07:40:49Z","snapshot_observed_at":"2026-07-06T18:56:40.234434Z","submitted_at":"2024-08-04T13:55:58Z","title":"Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02034","snapshot_observed_at":"2026-08-06T20:53:05.239887Z","title":"Mini-monkey: Alleviating the semantic sawtooth effect for lightweight mllms via complementary image pyramid","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.239887Z"},"links":{"cited_paper":"/paper/2408.02034","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:c2841a06926013fd0e804e31baf3b2032cdca1a1ebb4040b836589c57c5c850d","observation_id":"f611ea19-3a0c-48f2-88f7-795668443c75","resolution":{"observed_at":"2026-08-06T20:53:05.239887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:05.355096Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.355096Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:aa5fa3aba99e121e1a5b1588888535cef66a4f87af850606f0902323183a3aa5","observation_id":"51a87678-09b0-4b3d-83b4-a3a6103152c5","resolution":{"observed_at":"2026-08-06T20:53:05.355096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:05.440840Z","title":"Deep visual-semantic alignments for generating image de- scriptions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.440840Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:8b05731c3a5f5e13d13466a1b6ec7c05014fd14f7d93cc7eae0a371295483599","observation_id":"e5eab2a7-4141-450a-ad36-36ab8876a996","resolution":{"observed_at":"2026-08-06T20:53:05.440840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:16.896001Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"356c2821-1869-4bfa-b395-b456a8cd885b","year":2016},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.499872Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:c92f9c7243e872f3e78f48e0c84614e1f62f84396224ad9d6fa8fe0022219700","observation_id":"74f37a5d-2c5c-4385-b53d-f0865f2b4502","resolution":{"observed_at":"2026-08-06T20:53:16.976874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:16.735781Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"0ce1b127-7fda-4433-b5d7-3934a9fdfad6","year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.571684Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:2272863452e3c172190594da7efe2d9c7c4f58d212f8d4d60005475cfc381a44","observation_id":"1b36cab1-6f83-4bf8-8687-e77075edc616","resolution":{"observed_at":"2026-08-06T20:53:16.815444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:16.593209Z","title":"Building and better under- standing vision-language models: insights and future directions","venue":null,"work_id":"47d3abe8-7436-4cab-8cda-408591de0dab","year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.672563Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:958867607a70a5ba76d397a70e394946799d96f810c5789a234d86b0dfcbb51b","observation_id":"827c4573-8d18-4ff2-bb34-487ed97466f8","resolution":{"observed_at":"2026-08-06T20:53:16.676412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:16.452311Z","title":"What matters when building vision-language models? Advances in Neural Information Processing Systems, 37:87874– 87907, 2024","venue":null,"work_id":"008ba2a1-f28e-418f-a3f4-65a8f530c39f","year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.761968Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:467f72b21a3effc8efa1d2ecbf690f99ff35dc7ef369f04c1dad97de85797fe4","observation_id":"0044f049-24e4-4e83-863d-0ba8b5f52189","resolution":{"observed_at":"2026-08-06T20:53:16.515187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10462","last_updated":"2025-04-14T17:50:20Z","snapshot_observed_at":"2026-07-06T21:09:11.849712Z","submitted_at":"2025-04-14T17:50:20Z","title":"The Scalability of Simplicity: Empirical Analysis of Vision-Language Learning with a Single Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10462","snapshot_observed_at":"2026-08-06T20:53:05.867758Z","title":"The scalability of simplicity: Empirical analysis of vision-language learning with a single transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.867758Z"},"links":{"cited_paper":"/paper/2504.10462","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:ae5b81dad8234db2fcaf6267f286e0e77f480bff0812dfaf01ba344fa20d48ac","observation_id":"8e3d7bf0-8038-4b4e-9817-32ed004715e8","resolution":{"observed_at":"2026-08-06T20:53:05.867758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T20:53:05.966643Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:05.966643Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:81baefc8651540bb8dc2cc8722376a520e8e93fd14ffc0f03b67d86fe9b90ba5","observation_id":"fd89d39e-9699-41a9-9007-b31e3cb67f5c","resolution":{"observed_at":"2026-08-06T20:53:05.966643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T20:53:06.041336Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.041336Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:9b9c37994bce875fa37a53aa0f66bb44dde9b7dc9b911ad45b5cad7df049bb41","observation_id":"8edbc22b-7bf8-4438-9569-05985e23b1d5","resolution":{"observed_at":"2026-08-06T20:53:06.041336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:16.269367Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":"72cf9d3c-7886-4db7-8ea9-b1140c303ab4","year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.099402Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:826857203327eb5bb0b941b52436ba8a0c09aa58969cb5fa6fdb70bed848cbc0","observation_id":"59f4a2d1-fba9-48e7-99af-b69dbd5588ce","resolution":{"observed_at":"2026-08-06T20:53:16.332980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T20:53:06.204273Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.204273Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:1c95ffe2f2c0f5a809d04a837d4678a67d06255064ea34608526190f4b8fff2c","observation_id":"ebfdf35a-1998-4dcc-9cef-7e50202a6687","resolution":{"observed_at":"2026-08-06T20:53:06.204273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T20:53:06.310118Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.310118Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:3c9c67a3ac2c531c57e2810ff0b68dd8d4cc16e7427b04d55e014e3cb264fa78","observation_id":"333b4891-09aa-4b17-bf68-fae1118550be","resolution":{"observed_at":"2026-08-06T20:53:06.310118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:16.087064Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"7d82d4f6-0142-41d9-8703-daac761ac99b","year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.413431Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:0a7df55884159ec6cef7ee4a57848b6fa849187f39af2d2925c7c7f00a102201","observation_id":"0283545d-c372-412b-b1ce-0e4581157c35","resolution":{"observed_at":"2026-08-06T20:53:16.185468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:15.848655Z","title":"Visual instruction tuning","venue":null,"work_id":"e6e7a835-4251-40e7-b6c9-be09d94f3dcc","year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.494248Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:a77c5da14ce7f5d99da92ec3788ec817a54dc7005338fd2777bded8c7f22132f","observation_id":"4a2fe0a4-b236-4c80-8df4-5eaf3dd23463","resolution":{"observed_at":"2026-08-06T20:53:15.961535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-06T20:53:06.548354Z","title":"Muon is scalable for llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.548354Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:bcdf640dbfd911df07e88d42e0f21f76fd95a89c7d698aabb761581d9055c17d","observation_id":"a5a01265-787c-40d3-adc5-597f0b495cdd","resolution":{"observed_at":"2026-08-06T20:53:06.548354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:15.677708Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":"a11ed67f-15ae-4a33-945a-5d7a0ecc5983","year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.649180Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:45fa69eb774525452357b0f23bdcd3d740e058cfa3afb5422a1d16557085c799","observation_id":"ae89d1a8-3bec-4090-ba17-80b3218be92e","resolution":{"observed_at":"2026-08-06T20:53:15.741340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:15.469173Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"b70c6933-776c-419f-9db2-bd450c5ead64","year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.750645Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:73f2c1ef5269c9d09f57b6ee0d98cd3e995304d17b9f02477a512a5f9f022a2e","observation_id":"345b18e4-314a-4e36-8430-5d72da46ed77","resolution":{"observed_at":"2026-08-06T20:53:15.552804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T20:53:06.868876Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.868876Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:f4431ac20a5bb7d460d684b2f60d2f3edaf49044b69d19f70bfdfdc37d65ac7a","observation_id":"2df5e4c3-e566-4e69-b955-7148d92b9383","resolution":{"observed_at":"2026-08-06T20:53:06.868876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-06T20:53:06.917722Z","title":"Deepseek-vl: towards real-world vision-language under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:06.917722Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:d4fb0e67ffd228ba6bf46f0bdb8baf12d417645bcb201daaba4ebc7971a3d3de","observation_id":"e37a86bd-b7da-4470-9ad4-db79d3c5e662","resolution":{"observed_at":"2026-08-06T20:53:06.917722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T20:53:07.020742Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.020742Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:3c6cb97703ac1e88ce8b72434857aa45ae197d802222c87c6eedae5894cb1c26","observation_id":"a29d00c8-d994-499b-a20e-78726d285db5","resolution":{"observed_at":"2026-08-06T20:53:07.020742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:15.307010Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"e3ceed45-6490-43ef-aeb7-e246bc520eeb","year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.120075Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:b72380bbab825e22fbc01de15e25234e2c5afa5dbae7e6c03bc0855f3559c96c","observation_id":"bbbcbdee-0cf1-4a78-ac00-b63f7b284021","resolution":{"observed_at":"2026-08-06T20:53:15.393314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-06T10:47:13.078840Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T20:53:07.221154Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.221154Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:f499757f2556c8f9be7206ee1090ea56d786219ef13877d747ce7369ef23c2db","observation_id":"ed625676-9ef6-457f-8452-fdcc4955ba73","resolution":{"observed_at":"2026-08-06T20:53:07.221154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T20:53:07.312239Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.312239Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:440bd495fb1f42535d52ceff005aeb4e26abe8bd0c36d7e938951294a751a71d","observation_id":"aea5201b-43bc-4e53-925d-97fcc6f8ebe8","resolution":{"observed_at":"2026-08-06T20:53:07.312239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:15.153038Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"e760a71c-6ae9-4bab-95af-6cee5b97ae2a","year":2019},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.419963Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:e94f19a46a9e9ea8177e1c169c534ed84b4c6bcb35a410bcf93c81ddc3190fae","observation_id":"831dbd81-8405-4b6e-8b64-aefbf16eef2b","resolution":{"observed_at":"2026-08-06T20:53:15.233277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T20:53:07.511190Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.511190Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:8b2cead4d78292b7671d3e48f4119d379dfcc47ebbcde5bb730e083d3d43a184","observation_id":"63e2f7dd-ad86-4244-a702-b01fb1db3d3a","resolution":{"observed_at":"2026-08-06T20:53:07.511190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:14.980940Z","title":"Infographicvqa","venue":null,"work_id":"fd56ee0c-b7a7-4e2a-aefa-1e7fe50c622e","year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.611803Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:c4464b712e52b161eb3a1c7288e605666c15ddd2cdf77c018bbaaea56658e991","observation_id":"fde217ee-d772-4282-b2c7-64e7d15c94d0","resolution":{"observed_at":"2026-08-06T20:53:15.058601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:14.793927Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"537bca71-d32b-4d66-899c-2e3a2557551a","year":2021},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.684217Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:8296e13cd272eac0015be2de1e52dde64b6f08cd503f77f9d2c5ce5a56d171e6","observation_id":"01ba0488-e905-41f9-87f4-b2895e1b06cd","resolution":{"observed_at":"2026-08-06T20:53:14.878279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:14.595587Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"df736aef-b817-415a-83c8-55d4b1d2cd3c","year":2019},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.797962Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:6713bd7807394dfb3e1bbc096750131425a69a02f85a492d5e8e4d0596c3ee89","observation_id":"1afdc95a-9888-4be3-a8da-0751921568e7","resolution":{"observed_at":"2026-08-06T20:53:14.694685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:14.422480Z","title":"Introducing chatgpt, 2022","venue":null,"work_id":"eaccec92-1e37-42d0-b7a4-248271d6d55f","year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.848469Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:1130398de9fe5b5cd8ddd9ecbb76e4ab1485c8a073e556000ed369a5c10b98f6","observation_id":"d7e7995f-9a97-4699-b4fa-2833ed44db52","resolution":{"observed_at":"2026-08-06T20:53:14.509068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:14.272167Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"09183b53-9559-472e-ba14-3c3217ca7dbc","year":2021},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.959684Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:d5e05e4ac5631dbc8778064154688be825bc518ddba19afb66c4f91c7e035df9","observation_id":"65d44a07-4e93-4451-bfc2-fb2aad7ba817","resolution":{"observed_at":"2026-08-06T20:53:14.329003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:14.129902Z","title":"Zero: Memory opti- mizations toward training trillion parameter models","venue":null,"work_id":"caf6c782-8ed7-4c6f-a1bf-eb01fd7adef6","year":2020},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.067283Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:a5f115b81dd7732f77848085da0d7a392faafbdae73233a6aadd140e550ffe23","observation_id":"b61bca55-9d38-466c-a543-7801a7c5a1d9","resolution":{"observed_at":"2026-08-06T20:53:14.195330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:13.933534Z","title":"Do imagenet classifiers generalize to imagenet?, 2019","venue":null,"work_id":"b3e2a6cc-c3f8-4dc7-b742-3ec0b58fb772","year":2019},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.176323Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:ade7c4496f18956d6ac1302acc4c0a55bb7bfb6e000a848534f7b2d04389fb5f","observation_id":"cbcbd198-0e40-451d-bb14-ea29fa46ad0a","resolution":{"observed_at":"2026-08-06T20:53:14.040246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-04T00:41:59.024387Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-06T20:53:08.277308Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.277308Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:cc8ce6ed592b33a5e5ffd07eb86a2d5c42978f96f03260cf67074c2d1a8a0b80","observation_id":"67b0689a-37ba-48e2-97be-68b05328c0e7","resolution":{"observed_at":"2026-08-06T20:53:08.277308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17493","last_updated":"2024-04-14T05:20:10Z","snapshot_observed_at":"2026-08-05T16:03:40.517679Z","submitted_at":"2023-05-27T15:10:41Z","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17493","snapshot_observed_at":"2026-08-06T20:53:08.389462Z","title":"The curse of recursion: Training on generated data makes models forget","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.389462Z"},"links":{"cited_paper":"/paper/2305.17493","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:ba37bc29c00d69585e588d205c0b3aa2ab31f5f4f31b9546abffe92fe3ad37e0","observation_id":"9f4b5191-474d-4218-a490-47ba5b5a4763","resolution":{"observed_at":"2026-08-06T20:53:08.389462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:13.748284Z","title":"Hollywood in homes: Crowdsourcing data collection for activity understanding","venue":null,"work_id":"2d2af018-e150-4690-84b2-31b10e6f686a","year":2016},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.498441Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:b2bf97eb14807994349b0bc8abf9531d8789f2414259aa316d796954689a3d95","observation_id":"129c05bc-c99d-480f-9f80-c2b7fbf1fc79","resolution":{"observed_at":"2026-08-06T20:53:13.840234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:13.615761Z","title":"Towards vqa models that can read","venue":null,"work_id":"d381cf99-dacf-457c-a413-f53b012504b6","year":2019},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.610364Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:12e3575c69769fc00b6036d742ce0d92f52c0653ade2606dbe9db193b110a664","observation_id":"d499bfdf-0ff9-40e4-b799-59f07d5dab77","resolution":{"observed_at":"2026-08-06T20:53:13.673354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-06T20:53:08.679854Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.679854Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:4f979a5e27bc7eaa27c84369cb046d37cda49c13abad21c496b417104610a9f4","observation_id":"446b6f94-7e19-4f2a-bf2f-8b0c05c62892","resolution":{"observed_at":"2026-08-06T20:53:08.679854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:13.504993Z","title":"Qwen3, April 2025","venue":null,"work_id":"f8cd3701-4252-4e85-892a-754e1e62e64f","year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.740655Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:a30b6728b74d42cd5a3e715bbb4c9b062124ab06c5e0b8cc0405914cb76637f6","observation_id":"e03a2961-db65-42c8-b3da-05e24ef9ad89","resolution":{"observed_at":"2026-08-06T20:53:13.554335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:08.830124Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.830124Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:472ead1285f2ee1fdd87c397fe8a5ec91335227c4383ade93f25e373c952b1d0","observation_id":"fcb05f98-913a-4806-b5f8-fbd495febd22","resolution":{"observed_at":"2026-08-06T20:53:08.830124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:13.331165Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"c8c17fc6-4304-4881-8b17-30f3cd71bced","year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:08.912731Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:84a066a216b5816a42acbc42f0b9efcb843cb06c2929f548c9e0006a502a6e3b","observation_id":"366e44a7-412d-4023-a12b-e1e04d53176d","resolution":{"observed_at":"2026-08-06T20:53:13.392724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T20:53:09.011049Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.011049Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:2d08fe6ca5fdeb00e49ac588b7b8753656f8289d32b236a1abc47e77fa98810c","observation_id":"01b2c095-0adc-41bd-b71b-925321588093","resolution":{"observed_at":"2026-08-06T20:53:09.011049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-02T17:00:42.491243Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11991","snapshot_observed_at":"2026-08-06T20:53:09.114205Z","title":"Vgr: Visual grounded reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.114205Z"},"links":{"cited_paper":"/paper/2506.11991","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:1740b2f5edf3a673043dffc8fff3548d3beebf394cbb7fc17f95c95492fee95d","observation_id":"84feef7a-bfbd-46ec-adaa-a9571bf3c6ae","resolution":{"observed_at":"2026-08-06T20:53:09.114205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20424","last_updated":"2024-09-30T15:49:54Z","snapshot_observed_at":"2026-07-06T19:24:39.402031Z","submitted_at":"2024-09-30T15:49:54Z","title":"World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and Filtering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20424","snapshot_observed_at":"2026-08-06T20:53:09.193598Z","title":"World to code: Multi-modal data generation via self-instructed compositional captioning and filtering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.193598Z"},"links":{"cited_paper":"/paper/2409.20424","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:21331a282c7ee29d5a8238bbcafb869dacad0545623e38587b8cde7e44ddf5f2","observation_id":"68de02d4-03e1-4ab7-b0da-48d7c9ffbfc4","resolution":{"observed_at":"2026-08-06T20:53:09.193598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T20:53:09.284570Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.284570Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:38bc357446912459d8f8091d9fe2de43ff3d8c3f486c77f55fa9b50003d2973b","observation_id":"99cb87b7-ae69-4d36-a51b-54a0499edfd3","resolution":{"observed_at":"2026-08-06T20:53:09.284570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:13.154151Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"309cfbc7-1035-44ed-87b6-0057814c2092","year":2022},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.384776Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:3c0c4bdd55dcece0b826aa62700e1820d62ec1f8680aab7271425226ad499d3f","observation_id":"34bcd4d3-5a97-49c0-87ce-d15e2db08641","resolution":{"observed_at":"2026-08-06T20:53:13.252292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10529","last_updated":"2024-01-25T04:11:57Z","snapshot_observed_at":"2026-07-06T17:17:44.177514Z","submitted_at":"2024-01-19T07:10:13Z","title":"Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10529","snapshot_observed_at":"2026-08-06T20:53:09.464295Z","title":"Mementos: A comprehensive bench- mark for multimodal large language model reasoning over image sequences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.464295Z"},"links":{"cited_paper":"/paper/2401.10529","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:f1029e4d8b99e07bd8fd47a0575190e401f715b9ec03058f062a92ba85bb152d","observation_id":"275553a3-2d36-4427-becc-762e4e7daf42","resolution":{"observed_at":"2026-08-06T20:53:09.464295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11685","last_updated":"2020-10-15T08:54:17Z","snapshot_observed_at":"2026-08-04T01:40:32.686540Z","submitted_at":"2020-10-15T08:54:17Z","title":"DocStruct: A Multimodal Method to Extract Hierarchy Structure in Document for General Form Understanding","version":1},"cited_work":{"arxiv_id":"2010.11685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.11685","snapshot_observed_at":"2026-08-06T20:53:11.081241Z","title":"DocStruct: A Multimodal Method to Extract Hierarchy Structure in Document for General Form Understanding","venue":"cs.CV","work_id":"1b7d0bf8-b76a-4054-8620-3881b049f6a3","year":2020},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.562208Z"},"links":{"cited_paper":"/paper/2010.11685","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:4ad9da4f190c427ef06bd1679c0e7d641f9c96db227fe71ecdb85dfd6d1bc9b4","observation_id":"df4f8766-c159-4818-9a53-645cf33e705d","resolution":{"observed_at":"2026-08-06T20:53:11.128260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17913","last_updated":"2026-07-21T05:30:48Z","snapshot_observed_at":"2026-08-06T23:21:13.844829Z","submitted_at":"2025-06-22T06:30:52Z","title":"Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents","version":2},"cited_work":{"arxiv_id":"2506.17913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17913","snapshot_observed_at":"2026-08-06T20:53:10.979544Z","title":"Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents","venue":"cs.AI","work_id":"151eeeca-5ea3-4b90-92fd-adbfcc931772","year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.643301Z"},"links":{"cited_paper":"/paper/2506.17913","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:00f1b778471a3abd2374150a846b018634bcb75e6a0efe8c1a22d9d0444c77f7","observation_id":"42533c59-304e-48d5-b8b2-58c198e861a9","resolution":{"observed_at":"2026-08-06T20:53:11.031292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:12.998036Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"987bbe92-1dd5-410f-aab3-d1400b9b6fce","year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.735785Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:abd8df57b68328eaabc67fce336c3ce2712ab44a2cd183be9409e6a12483767e","observation_id":"21a80b97-285b-427d-8e2a-9042d2fba491","resolution":{"observed_at":"2026-08-06T20:53:13.058543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:12.808872Z","title":"Seeing the image: Prioritizing visual correlation by contrastive alignment","venue":null,"work_id":"9bb4f6e5-159f-4072-8342-e47ca939f6c4","year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.815315Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:db90b3cf0fc1d3555691166b96af8497727e8aa2f84ff9a02b36b966c2f15714","observation_id":"665e9818-9536-480e-a7e3-16e73fe9a998","resolution":{"observed_at":"2026-08-06T20:53:12.875815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:12.648908Z","title":"Aggregated residual transformations for deep neural networks","venue":null,"work_id":"50033077-6f53-4749-ac42-fec9a03b7086","year":2017},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.911243Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:b57bf8c1e8a88918ef481d0b845394019450d1adb5ae43ed7a9801ef7164fd86","observation_id":"6e00b62d-a9a6-4216-aa41-1eb5feb23ef1","resolution":{"observed_at":"2026-08-06T20:53:12.734487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-06T20:53:09.990394Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:09.990394Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:69a54ed3ac9d2ff3ef963f40145d3b9895dfa484d503ea68074ba5249c81725c","observation_id":"3da9d2ac-8853-4031-9f32-69a7b568ddd4","resolution":{"observed_at":"2026-08-06T20:53:09.990394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T20:53:10.097531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:10.097531Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:8052b653a97618ef658ad07a66d16c7908c5a27d83ef5903ade770891754f88d","observation_id":"b775d07d-d57c-4e11-ac09-ae766d755e34","resolution":{"observed_at":"2026-08-06T20:53:10.097531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:12.505750Z","title":"Pediatricsgpt: Large language models as chinese medical assistants for pediatric applications","venue":null,"work_id":"031cd9d9-fbf3-4ba5-b2b3-e609a27ca3c7","year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:10.152994Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:9a96d7a1f30d7064eef6c9212557370633ec222c5ee6fd2b74cc293f4e7b7cc6","observation_id":"7de236ae-333d-48c8-ab3d-74acdbdccaac","resolution":{"observed_at":"2026-08-06T20:53:12.585192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:12.374858Z","title":"Improving factuality in large language models via decoding-time hallucinatory and truthful comparators","venue":null,"work_id":"b55f5a3f-7761-4a34-a2ff-b515fa67e899","year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:10.220443Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:1103c079d1879b77f4b73c02a99226a257f452f6f19b602dd76f013358a7fe76","observation_id":"431a2d12-4355-440a-81a5-9cd058174da8","resolution":{"observed_at":"2026-08-06T20:53:12.432758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T20:53:10.285746Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabili- ties","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:10.285746Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:1955b310b99bf96c9f10d30cb92d56aaef65af935df88fc4c2b9c08a126a0806","observation_id":"841289a6-f86c-493d-9105-fad874f1c0bb","resolution":{"observed_at":"2026-08-06T20:53:10.285746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:12.208363Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"d0edff71-bc9e-475e-b477-549486d50b78","year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:10.367278Z"},"links":{"citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:84d3e23762906ac16081b60c3c9ec7c2f102e78c869ab0fc4ad31f16e8b9604c","observation_id":"559193a3-2037-4663-b025-4d310ebbb974","resolution":{"observed_at":"2026-08-06T20:53:12.313580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:44:05.101436Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":3,"verified_fuzzy":29},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 0 inbound Pith citation observations for arXiv:2507.01643."}