{"as_of":"2026-08-13T02:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:895cd05748d3c46bb1df27df0f89ee99e85465e53effab44498800eb03946cec","coverage":[{"denominator":136,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:49:08.294410Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.16158/citation-record","integrity":"/paper/2412.16158/integrity","json":"/paper/2412.16158/citation-record.json","paper":"/paper/2412.16158"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T10:49:07.905038Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.905038Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:e8d7eb5a77c3e279bf523bf8f8f1957d51ad58de9955a4fe869253db84d845a9","observation_id":"cd6c5f04-9712-41e3-be0f-31ceb933e1b2","resolution":{"observed_at":"2026-08-11T10:49:07.905038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T10:49:07.909674Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.909674Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:b8e1e8e86bc26142c56e28ea6310d1e2a55a05d5d192679cb6b4d0a60e0049e8","observation_id":"5ba4b669-ff7f-467a-a2a1-414704687d86","resolution":{"observed_at":"2026-08-11T10:49:07.909674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-08-10T18:39:13.771066Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-11T10:49:07.913530Z","title":"Mathqa: Towards interpretable math word problem solv- ing with operation-based formalisms","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.913530Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:629b3c8961ee65c0e6fa463c044408c1b0b9aa95e1d676df3fee1e54d08426f3","observation_id":"0a5bb838-0f25-4d62-b1c5-f868ddb95507","resolution":{"observed_at":"2026-08-11T10:49:07.913530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.917951Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.917951Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:63bee8c2d780a934e182be184af2a2f76af3df6b430d8c3793380b241bf1e7e2","observation_id":"d71830f1-b684-4fb7-ac77-5feae7eb21f5","resolution":{"observed_at":"2026-08-11T10:49:07.917951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T10:49:07.922761Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.922761Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:6acf2847c4d229dc3b5ea68515825343d20decad82241f166c795f9989d9fbee","observation_id":"219df7c9-9f6a-4c83-aee1-bc117e7de5eb","resolution":{"observed_at":"2026-08-11T10:49:07.922761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.927736Z","title":"Introducing our multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.927736Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:859201079db923d897e187db9a8b7c434de4acabe7cff009080579f476a88e3d","observation_id":"c79ec08e-c8a9-4a92-aa7a-5a39306077c5","resolution":{"observed_at":"2026-08-11T10:49:07.927736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.932167Z","title":"Vqa-med: Overview of the medical visual question answering task at imageclef 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.932167Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:4e21c8d01ce092b4b6ad4a4b58ee0fee6fca433b5b5a91362984530d922807af","observation_id":"3084111e-c871-446c-8d82-fbb750e5f9cb","resolution":{"observed_at":"2026-08-11T10:49:07.932167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-11T10:49:07.936839Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.936839Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:3f7c40082d245098376ed4c86f8bd3bbac44cdd943f1f33e39c863e1e07f1823","observation_id":"4a365c0e-44d3-4631-8276-f6568993093e","resolution":{"observed_at":"2026-08-11T10:49:07.936839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.941064Z","title":"Scene text visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.941064Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:9eaf14af643d53e401c7735779f59605bc6269e1e131285e14154cccf61a72df","observation_id":"f20bedfa-9a3a-4066-a5d7-cfb43aac0a9d","resolution":{"observed_at":"2026-08-11T10:49:07.941064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.944784Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.944784Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:8bdf1195a0d7d4a8566ea6ca1f8cc649570f6239c0b853848f1d02d9d0e3e7eb","observation_id":"3764b123-8dc2-4337-b946-525af5df5b4b","resolution":{"observed_at":"2026-08-11T10:49:07.944784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-11T10:49:07.948584Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.948584Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:80f01269dbf81aeb33b43e0f89014597e4c766119bd53ae297a25ab08b3e91e7","observation_id":"7496fd43-beee-455c-b42b-bcf3dacea6c2","resolution":{"observed_at":"2026-08-11T10:49:07.948584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.953251Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.953251Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:533432fc81a8e7763797a07ca83e1443562178c305624d7ddf4da56bcbbd4aa2","observation_id":"6ab6b2d0-258b-4220-9d72-5ac19bca1a47","resolution":{"observed_at":"2026-08-11T10:49:07.953251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.956769Z","title":"Textocr-gpt4v","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.956769Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:74349a07df5dca3246f50ec78524a30401d9e06321a117852bbd26d9ed72c3ef","observation_id":"4ebc1937-cb48-4f23-8e8a-2ba54d57d6e3","resolution":{"observed_at":"2026-08-11T10:49:07.956769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-08-09T22:32:24.524992Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-08-11T10:49:07.960195Z","title":"Mapqa: A dataset for question answering on choropleth maps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.960195Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:3baffade29dfa60233c778770f78d413b55c512a74807d19c2eb9b1216ba608e","observation_id":"553352aa-705f-41c3-a5af-9da1daecb769","resolution":{"observed_at":"2026-08-11T10:49:07.960195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-11T10:49:07.964031Z","title":"Allava: Harness- ing gpt4v-synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.964031Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:c784653d8bf3f72300f579217ad244a3b824516c08ce263d05c3a9dea9d7687c","observation_id":"2903dba2-41f0-4bf7-b35d-9574f3f3fa5d","resolution":{"observed_at":"2026-08-11T10:49:07.964031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-06T05:59:54.593795Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-08-11T10:49:07.967954Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.967954Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:044efdf6b8ef402e2b84f2a184bf4f6bc7031eebf2bb3ce007b07380545f2e6c","observation_id":"a08d26df-b966-4971-bc91-a8c4295d12c0","resolution":{"observed_at":"2026-08-11T10:49:07.967954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-11T10:49:07.971952Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.971952Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:e227618b172c8904302c3519deb4367a8cbebb434d3c4492d235129fc40a87cf","observation_id":"4d90f477-d841-46ea-a979-e7e2bc1a52c2","resolution":{"observed_at":"2026-08-11T10:49:07.971952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-12T23:26:17.661596Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-11T10:49:07.975874Z","title":"A single transformer for scalable vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.975874Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:1c39d7ba0f57bd05e5a253d5c50fb95ea7801a42891b79276e47487c3fe17759","observation_id":"3b1b00db-8e89-435d-aa31-4194798f1758","resolution":{"observed_at":"2026-08-11T10:49:07.975874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T10:49:07.980271Z","title":"How far are we to gpt-4v? clos- ing the gap to commercial multimodal models with open- source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.980271Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:686ffa8715e4a2080a27bdea6fcffa5ca9ab8cbbdc3a8333125968a5ecabd1ca","observation_id":"bb26d3d4-69e5-474e-9828-6aec5db85a51","resolution":{"observed_at":"2026-08-11T10:49:07.980271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.984241Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.984241Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:cc16b15723f48003489a4d2bf596abbe83f0d7249723c12ea3f81675a89e9565","observation_id":"c9b53d88-4422-42c2-a76f-5ee0b18f2c88","resolution":{"observed_at":"2026-08-11T10:49:07.984241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.988105Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.988105Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:75b97fb1b16d442a1b747d875c63673df08bf0b26a389f830be6d39754386aab","observation_id":"16c46b68-bfd5-4e09-91ae-f253d8fe9984","resolution":{"observed_at":"2026-08-11T10:49:07.988105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04729","last_updated":"2019-08-28T16:24:53Z","snapshot_observed_at":"2026-08-10T12:14:32.877990Z","submitted_at":"2019-08-13T16:47:08Z","title":"Complicated Table Structure Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04729","snapshot_observed_at":"2026-08-11T10:49:07.992386Z","title":"Complicated table structure recognition","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.992386Z"},"links":{"cited_paper":"/paper/1908.04729","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:f5d0cbbb9c78cf73f8b0f27d83d6d2d5de1bc85eef6236c92dd5987e4cd8ef28","observation_id":"2be1e6d9-7317-492a-96cb-b4d5d3814ce7","resolution":{"observed_at":"2026-08-11T10:49:07.992386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.996407Z","title":"Icdar2019 robust read- ing challenge on arbitrary-shaped text-rrc-art","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:07.996407Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:c213f7c2e9b4eb030397b42c0d16216a4cc4f81ed3f1d98c7aa24dbdcc81fa76","observation_id":"950614fd-409f-4756-900a-3ae088d9d0ce","resolution":{"observed_at":"2026-08-11T10:49:07.996407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10723","last_updated":"2017-11-07T18:55:35Z","snapshot_observed_at":"2026-08-09T13:36:00.102461Z","submitted_at":"2017-10-29T23:47:49Z","title":"Simple and Effective Multi-Paragraph Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10723","snapshot_observed_at":"2026-08-11T10:49:08.000495Z","title":"Simple and effective multi-paragraph reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.000495Z"},"links":{"cited_paper":"/paper/1710.10723","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:5d2084cd75279481a06d3732468287c932d1a8cb6ebe1c87566b6fab0abc3997","observation_id":"6e3b402d-5f3c-4763-b0f0-70d90ec52b27","resolution":{"observed_at":"2026-08-11T10:49:08.000495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.004724Z","title":"Deep visual template-free form parsing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.004724Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:b5c64db89eab4968215f9461285aad8b46ab54d75766b17e777f7250aee702d6","observation_id":"70e0a205-5cea-4259-94c7-09066d0dad3e","resolution":{"observed_at":"2026-08-11T10:49:08.004724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T10:49:08.009009Z","title":"Unveiling encoder-free 13 vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.009009Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:92d3370c0687fc505364dbc8293880f2d71aa22b3bbc3b6f7654b3c1b3020525","observation_id":"09609b9d-e3e4-4981-bc3b-3ab8bd6810fa","resolution":{"observed_at":"2026-08-11T10:49:08.009009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.013547Z","title":"Compressing visual- linguistic model via knowledge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.013547Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:6b5531f161b8ffccf7254d99e284cf3fe8671344c8db568389a25feda81c5b1d","observation_id":"ec215a64-3e95-45c2-9d6d-ca8bca9819be","resolution":{"observed_at":"2026-08-11T10:49:08.013547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T10:49:08.017524Z","title":"Mme: A comprehensive evalu- ation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.017524Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:ce001176443bef75f475ceb532262299e73f6c6f22f5a8a98d3d7b549f1cff43","observation_id":"27dc2e1d-83fc-48c1-8f66-d62f52bf04a6","resolution":{"observed_at":"2026-08-11T10:49:08.017524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.021980Z","title":"Making the v in vqa matter: El- evating the role of image understanding in visual ques- tion answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.021980Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:076d08b22744e77f10dfcf0d60191135f503465376e6dc30ffc59ca20f945dbe","observation_id":"efe9e84f-84b3-4cce-9b1d-4a249d151906","resolution":{"observed_at":"2026-08-11T10:49:08.021980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.025990Z","title":"Wukong: A 100 million large-scale chinese cross-modal pre-training benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.025990Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:5aa60456c057db77d85f813fa43a3a3e865abdb239f91721b20666d10342476c","observation_id":"08586c5c-0b64-44b9-8ad0-57e846085f2d","resolution":{"observed_at":"2026-08-11T10:49:08.025990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-11T10:49:08.030191Z","title":"Hallusionbench: An advanced diagnostic suite for entangled language halluci- nation and visual illusion in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.030191Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:853618eaa57b8a81596f46c4eb2a0fa7a569f0ae63efacc700cf7b79e6bedfa0","observation_id":"bd9afb9a-37d4-4826-b452-1dd5b6af07a7","resolution":{"observed_at":"2026-08-11T10:49:08.030191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.035321Z","title":"Eaten: Entity-aware attention for sin- gle shot visual text extraction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.035321Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:59cd87dd853122d9ce7e4b2f84750d163979ccad9b0e30c7f30c932c14fe9e52","observation_id":"c35905a8-7175-4d19-b240-07edb1c118f7","resolution":{"observed_at":"2026-08-11T10:49:08.035321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.039338Z","title":"Don’t stop pretraining: Adapt language models to domains and tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.039338Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:7353019012013353ea93e90ed9f1562b56df6fd13b3a491701b2398322208d09","observation_id":"91afe247-306f-45d8-aeb2-ef2c6d29aee4","resolution":{"observed_at":"2026-08-11T10:49:08.039338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.043425Z","title":"Icpr2018 contest on robust read- ing for multi-type web images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.043425Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:2e11e410e1e1f108f7e46a1aa907d4ba24f11a48951a7215ac4c8329b1581e2b","observation_id":"7b16ef0f-983d-4d5c-bf77-819bfe5c5843","resolution":{"observed_at":"2026-08-11T10:49:08.043425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-11T10:49:08.047377Z","title":"Pathvqa: 30000+ questions for medical vi- sual question answering","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.047377Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:9d429be340e9aef839b88af09608b35cc931e9602c2b5a8bd48366d3d52a7c42","observation_id":"318b72b3-a1c7-4c86-a704-5608702eef7b","resolution":{"observed_at":"2026-08-11T10:49:08.047377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.051867Z","title":"Koniq-10k: An ecologically valid database for deep learning of blind image quality assessment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.051867Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:6496fe26077ebf54da6a521fb28595bba0edef70be63b82888e0e5b655e84e45","observation_id":"db154994-c89b-4c6e-9c64-cd612c122987","resolution":{"observed_at":"2026-08-11T10:49:08.051867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-13T00:50:09.852948Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-11T10:49:08.055871Z","title":"mplug-docowl 1.5: Unified structure learn- ing for ocr-free document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.055871Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:ba31135c403e7d5191acad15517c7f046c84e2232cc167201c6a953ba4af0595","observation_id":"151511c6-132e-47b9-a5c9-77aed2643d2e","resolution":{"observed_at":"2026-08-11T10:49:08.055871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.059932Z","title":"Medical-diff-vqa: a large-scale medical dataset for difference visual question answering on chest x-ray images, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.059932Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:2c258e4268fbcde616bc6221cf0f98c2757a87e3e02e53330600a3dd2be7827e","observation_id":"ebf20f45-12ad-4ab3-87a8-d9b266e788b7","resolution":{"observed_at":"2026-08-11T10:49:08.059932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.063333Z","title":"Visual program distillation: Distill- ing tools and programmatic reasoning into vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.063333Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:47d2da395ca1af1f02666da91c570b68d8d72d901b569f430b7ccd840a4e7d8d","observation_id":"68dde9d3-8582-44e4-99fe-dfb9e84cf9a7","resolution":{"observed_at":"2026-08-11T10:49:08.063333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.066809Z","title":"Movienet: A holistic dataset for movie under- standing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.066809Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:08b725fd44e11341984c8a032388024a9357ae890674590dab1480bfff2298da","observation_id":"7796b487-7650-45e4-96c9-996c021f5c68","resolution":{"observed_at":"2026-08-11T10:49:08.066809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.070041Z","title":"Hires-llava: Restor- ing fragmentation input in high-resolution large vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.070041Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:c97ac2df13e99869a38dabe92b588f132616d05fb90537699729c038b81fbcb8","observation_id":"3b13cf06-d12d-429b-8c5a-50b5583407e0","resolution":{"observed_at":"2026-08-11T10:49:08.070041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.073191Z","title":"Icdar2019 com- petition on scanned receipt ocr and information extraction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.073191Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:bec8dabd84f62399163abab79c6747a8d1894fb09268b4149c4494822dca6e31","observation_id":"30cc1899-fe7f-4b2e-a7a2-03cd107798c6","resolution":{"observed_at":"2026-08-11T10:49:08.073191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.076253Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.076253Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:7c1e70ff5611a22338c2175120eb8da5afaa9155e83befb535cfb063e6798144","observation_id":"cbe1ef73-4e59-4946-9d6a-b0194e53a2bc","resolution":{"observed_at":"2026-08-11T10:49:08.076253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.079486Z","title":"Egotaskqa: Understanding human tasks in ego- centric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.079486Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:c91caf63b88398d678c7804d93386b081ca10e2420e48495f302c57f7cce61a4","observation_id":"e6984120-16ce-4e69-a01b-f1b273bf083a","resolution":{"observed_at":"2026-08-11T10:49:08.079486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.082744Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.082744Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:68391e4afc318c217303be4c9304528e378e7296e8372348cdb35807f2418fed","observation_id":"cfa1c8fa-d7c2-4353-a39a-2bf1d5c572d1","resolution":{"observed_at":"2026-08-11T10:49:08.082744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.085944Z","title":"Dvqa: Understanding data visualizations via ques- tion answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.085944Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:b1d92bb0f3f5af67ea06d617d84b6bec0617c19daf1fa54d43c9795ccd31c11c","observation_id":"28620bdf-2340-4720-9ac1-79731b88a07e","resolution":{"observed_at":"2026-08-11T10:49:08.085944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-11T10:49:08.089410Z","title":"Fig- ureqa: An annotated figure dataset for visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.089410Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:8bcf8909a0d87e8492b3e213416d0e41fb835e66c12ddf8f7bcd24cf0edfe775","observation_id":"03c1d237-a189-48b7-8da5-92294ca0421a","resolution":{"observed_at":"2026-08-11T10:49:08.089410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06486","last_updated":"2022-04-14T15:41:15Z","snapshot_observed_at":"2026-08-10T15:03:18.498813Z","submitted_at":"2022-03-12T17:01:38Z","title":"Chart-to-Text: A Large-Scale Benchmark for Chart Summarization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06486","snapshot_observed_at":"2026-08-11T10:49:08.093786Z","title":"Chart-to-text: A large-scale benchmark for chart sum- marization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.093786Z"},"links":{"cited_paper":"/paper/2203.06486","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:27dac8dcaf8801dcaba2755a119c3b561a6d68236a65183fe56f2e3351df7315","observation_id":"c0d0f8f9-24b0-4182-a9ae-f39dc7c599cf","resolution":{"observed_at":"2026-08-11T10:49:08.093786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.097976Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.097976Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:d67a1c917657d3fc82db4ee77a46ccc2d98d451c651d520964e996ae39ae6830","observation_id":"80283ccd-36bc-4554-87e9-a114ef6a3331","resolution":{"observed_at":"2026-08-11T10:49:08.097976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.102029Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.102029Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:5db8789af48ed261e783e5642237d8d9a94635dde3e15f35762e270fd5f710fd","observation_id":"0a0f73ef-57e7-4010-8415-a8e8d1f296c7","resolution":{"observed_at":"2026-08-11T10:49:08.102029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.105666Z","title":"Are you smarter than a sixth grader? textbook question answer- ing for multimodal machine comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.105666Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:f85b5120272259342eb3993419c35b58dc7fa388c91a907647faf2767f7b9fa4","observation_id":"c279f269-b582-41e2-b927-1c78e92357e1","resolution":{"observed_at":"2026-08-11T10:49:08.105666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.109365Z","title":"Visual in- formation extraction in the wild: practical dataset and end- to-end solution","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.109365Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:194f7c94839f654fdba9a48158a3b174870b34c217e97c0c0f863a0e66a809db","observation_id":"7134f05b-beec-48a2-a185-691bae37b15e","resolution":{"observed_at":"2026-08-11T10:49:08.109365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.113186Z","title":"Laion-gpt4v dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.113186Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:de2aa4a94aeb84a6bfa16a98058fa1952fc7ca9f64f7de3bc324320b3522adb2","observation_id":"eaf396a2-b074-45ee-84c9-f8a36123baee","resolution":{"observed_at":"2026-08-11T10:49:08.113186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.116964Z","title":"A dataset of clinically generated visual questions and answers about radiology images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.116964Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:8cab109d7fcb63caf445ba157bd33b9d31f999f43128038dba19bb28a9feb2c5","observation_id":"18371d88-e852-4c69-aaf9-b2848e659812","resolution":{"observed_at":"2026-08-11T10:49:08.116964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.120859Z","title":"Viquae, a dataset for knowledge-based visual question answering about named entities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.120859Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:98b427ef76f25ea6dd313eb02a8ee87fa2a14188d5f295ca841db5ed5f83e761","observation_id":"5346708f-c4c5-40d2-a45c-d12753262f82","resolution":{"observed_at":"2026-08-11T10:49:08.120859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T10:49:08.125301Z","title":"Seed-bench: Bench- marking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.125301Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:35cd1251741a92abeed906bb566e070b3e5c5e5a3b14c8568ce47a9149f25288","observation_id":"7ed100a3-649d-4370-a71d-7b87ffceba10","resolution":{"observed_at":"2026-08-11T10:49:08.125301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.129667Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.129667Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:5d3078c44f8ffaad0d4b6f8e8df33d0a085540441df20a4893e68f7c4c933c03","observation_id":"4151d93a-f332-46eb-9cb1-a6363bf78675","resolution":{"observed_at":"2026-08-11T10:49:08.129667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.133784Z","title":"Chemvlm: Exploring the power of multimodal large language models in chemistry area","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.133784Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:6ec65dbfcd7b2a8f2f6f170b4f1005714c2eb9e65dd5d323bc1a4628fa52d3cd","observation_id":"cbe43d26-fab1-471d-9190-0aa7d4622402","resolution":{"observed_at":"2026-08-11T10:49:08.133784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.137546Z","title":"Mvbench: A comprehensive multi-modal video under- standing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.137546Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:a03234fb18956c712c84facb54fdc8507bc68892e006fab4201221c4cce72ad8","observation_id":"2a2d965d-ccce-46bb-a5ad-b58730986555","resolution":{"observed_at":"2026-08-11T10:49:08.137546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.141261Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.141261Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:5398639de1bd4e150a1951451e1dc88d89c8819687217d4276d9c216113ae6f4","observation_id":"e671cbb1-0f09-43cf-a571-468d9ffa7b2a","resolution":{"observed_at":"2026-08-11T10:49:08.141261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.145017Z","title":"Super-clevr: A virtual benchmark to diagnose do- main robustness in visual reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.145017Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:762af05955c7493708477b420aa79b86199997f8cfb62ee840ec849f006e0511","observation_id":"c4ac0e4e-d25d-4e78-946b-ab047510633d","resolution":{"observed_at":"2026-08-11T10:49:08.145017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.148587Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.148587Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:d6f049ce8d18b06df3721d0680b2dc9de0646410ba28d2ee9777d60edfea5b9c","observation_id":"010c99f5-cc3b-4171-80de-94cc76d4e775","resolution":{"observed_at":"2026-08-11T10:49:08.148587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.152181Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.152181Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:fe8983952369d25fafc994e1a9cab3ab37190bd4a827dd56193f732b722994bc","observation_id":"9cf66104-80da-49c7-b15d-24469907c359","resolution":{"observed_at":"2026-08-11T10:49:08.152181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.155842Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.155842Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:117e62aff72dfa96c005e38183fd716189ee762f89fe85972b5d3d47a79e3324","observation_id":"bda4c47d-4915-4028-8d63-e6bd1a850253","resolution":{"observed_at":"2026-08-11T10:49:08.155842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.159415Z","title":"Slake: A semantically-labeled knowledge- enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.159415Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:8e129cb6c87ec7b063cbb5c22a82a5d6e0bd891f6ecefd38507309b30e0059d6","observation_id":"5fc4dfd6-c238-4b8c-86b9-44ddf1e760a5","resolution":{"observed_at":"2026-08-11T10:49:08.159415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.162971Z","title":"Casia online and offline chinese handwriting databases","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.162971Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:27af0e717651ef9714c37c20640c02413a0b00758ef063b8669bd06b6fd9ae97","observation_id":"1a2ccfc3-e863-4ee6-99ce-b02541c4840e","resolution":{"observed_at":"2026-08-11T10:49:08.162971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.166664Z","title":"Visual spa- tial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.166664Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:cb8aa1bb193b05a94ec82dd743f8022b62f57d579786d17bef2ce0b051577249","observation_id":"69b4cebf-8ad5-4755-94e7-8ea27cb25f13","resolution":{"observed_at":"2026-08-11T10:49:08.166664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.170195Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.170195Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:fd34d7840743a9c643c0287e26e76fdce6eba63baabbfdbe579ded6f0b163c2a","observation_id":"9987486b-b6cd-4533-b172-f59f88e1e569","resolution":{"observed_at":"2026-08-11T10:49:08.170195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10774","last_updated":"2024-04-15T15:48:48Z","snapshot_observed_at":"2026-08-12T22:57:34.049906Z","submitted_at":"2023-11-15T23:36:42Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10774","snapshot_observed_at":"2026-08-11T10:49:08.173803Z","title":"Mmc: Advancing multimodal chart understand- ing with large-scale instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.173803Z"},"links":{"cited_paper":"/paper/2311.10774","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:3634b593928217b52853bfbdfc5246f2fba5aedccd599002c83682b0a46354f0","observation_id":"8e398f10-bccb-4d5f-82ac-6275bcb36b51","resolution":{"observed_at":"2026-08-11T10:49:08.173803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.177610Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.177610Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:3f5a8a19ab62e64651d0a21d6f5e1e908153a1d6f0617653c6aa5ea7207e1a4c","observation_id":"d04af017-bdcf-41d4-b039-4eceb8be0b54","resolution":{"observed_at":"2026-08-11T10:49:08.177610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.181331Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.181331Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:e24887dfd200306fa72f0f3d4391b4d6c30c0dfac0ee7efdae37bfb326182c9b","observation_id":"0cbafedf-256f-41ba-8c7b-458a19ad09aa","resolution":{"observed_at":"2026-08-11T10:49:08.181331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.185186Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.185186Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:f7a311f1ed8addb1cefda98ce75b2b6bc43616e96c55ccd5227662bf2141e86b","observation_id":"f119e9d5-9757-463c-b564-0e4f31c35e43","resolution":{"observed_at":"2026-08-11T10:49:08.185186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-11T10:49:08.188971Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.188971Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:5252759f8d0d5e34c527c54d3e34313fa2c6ce2dd92d0c93352e37ce70988b8a","observation_id":"4da4d5f6-e510-4afe-8194-14131a1f0c54","resolution":{"observed_at":"2026-08-11T10:49:08.188971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.192881Z","title":"Mmbench: Is your multi- modal model an all-around player? In ECCV, pages 216–","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.192881Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:7be04a1e3a87093aebf273848c8c8829cc74ad500eeb91970b2da22ebab854f4","observation_id":"db7d8205-78c7-41da-91a1-0ced09a51ec2","resolution":{"observed_at":"2026-08-11T10:49:08.192881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11833","last_updated":"2024-10-29T12:34:11Z","snapshot_observed_at":"2026-08-12T23:40:46.601423Z","submitted_at":"2024-06-17T17:59:47Z","title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11833","snapshot_observed_at":"2026-08-11T10:49:08.199448Z","title":"Mmdu: A multi-turn multi-image dialog un- derstanding benchmark and instruction-tuning dataset for lvlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.199448Z"},"links":{"cited_paper":"/paper/2406.11833","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:31d7099083fc986b80febe95b120b85beb06c98f1e61dc7bbe4836cf5bc0d7e2","observation_id":"9c9b2023-4620-4bd9-958a-e7b2eaacdf17","resolution":{"observed_at":"2026-08-11T10:49:08.199448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T10:49:08.202823Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.202823Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:a33f8a3b898d234954be8ab1c9022998e4b7e908c2cccb43a20c027e1698c2ab","observation_id":"224d0ffb-4d93-4b43-bedf-6d21db74f05f","resolution":{"observed_at":"2026-08-11T10:49:08.202823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-11T10:49:08.206505Z","title":"Inter-gps: In- terpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.206505Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:4d6f45cacaaea3f9273c5cc6fc44fd27cab02572b3af4755d563e422a706291d","observation_id":"95b58660-03a8-4f0c-b686-16b5209b814b","resolution":{"observed_at":"2026-08-11T10:49:08.206505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.210595Z","title":"Learn to explain: Multimodal reason- ing via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.210595Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:8472c8c9f1b25a8da3bb770e790f49b21f8a680c211df492bf6f8ba7f50602d7","observation_id":"40d830c6-af17-45df-b644-0eff71ae5228","resolution":{"observed_at":"2026-08-11T10:49:08.210595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-08T00:29:35.147198Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-11T10:49:08.214747Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.214747Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:31b4670b404574bf00d9be812ef3aa6415452a3da6a6045fa723d6be4222bc36","observation_id":"f716cc29-6023-4004-ac70-5c53ffd6d5bd","resolution":{"observed_at":"2026-08-11T10:49:08.214747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-12T23:43:17.035818Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-11T10:49:08.218792Z","title":"Videogpt+: Integrating image and video en- coders for enhanced video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.218792Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:cb891d87383cb47d957d301673253a88088b643374700b8ef1654bbe5da57d26","observation_id":"b48b5cc7-0962-44ff-ab5f-e4054d78f056","resolution":{"observed_at":"2026-08-11T10:49:08.218792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.223013Z","title":"Deepart: Learning joint representations of visual arts","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.223013Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:abd49b7fcd2a5159ecfa2ce82cb1ef29b2143b59efc1755318d7cd840cd197c0","observation_id":"2a39fe23-80c4-4757-9ee0-5017b9b623e0","resolution":{"observed_at":"2026-08-11T10:49:08.223013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.226714Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.226714Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:43bb5b2d89dc2c1348b198fa1b4ef84c346f771edb68e19f8c4b3fca7a4b17cf","observation_id":"2982c736-06af-4659-b210-ceb0321ed8fc","resolution":{"observed_at":"2026-08-11T10:49:08.226714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.230195Z","title":"The iam-database: an english sentence database for offline handwriting recognition","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.230195Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:2811f1f8fc167cc9c93603bf22d7939fc0124ce8dcf10292a1f6dcdf3a9b85c9","observation_id":"e44e2131-99da-4a84-aa6a-7e5a6b5fbb1d","resolution":{"observed_at":"2026-08-11T10:49:08.230195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T10:49:08.233888Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.233888Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:fa59d1371c5652938ac6e8fafc66911510f4101c32ca4aded8b9550922913ce9","observation_id":"23bbdee0-b510-4ad9-8d1d-5ce6f722210a","resolution":{"observed_at":"2026-08-11T10:49:08.233888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14761","last_updated":"2023-10-10T23:39:25Z","snapshot_observed_at":"2026-08-12T14:45:42.764543Z","submitted_at":"2023-05-24T06:11:17Z","title":"UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14761","snapshot_observed_at":"2026-08-11T10:49:08.238683Z","title":"Unichart: A universal vision- language pretrained model for chart comprehension and reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.238683Z"},"links":{"cited_paper":"/paper/2305.14761","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:104dfe769249c07cb01ad11c150074831b76de414a267a3207fce509429e902f","observation_id":"65e13ded-6c39-4d97-9faa-2e78de22ff4f","resolution":{"observed_at":"2026-08-11T10:49:08.238683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.243283Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.243283Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:665a21c4c24eb5856f4501817744e8a01b216aaa808d81e6434a9c1b72c62080","observation_id":"af3059cb-c264-425a-b98c-2fef2c7f4691","resolution":{"observed_at":"2026-08-11T10:49:08.243283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.247064Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.247064Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:77cf674a67aa8fee66e7122a8d197911f2ce56ebcbf1dffb80787bd4af5555c9","observation_id":"b5dd9c2f-9d21-4bac-a888-6e7203069433","resolution":{"observed_at":"2026-08-11T10:49:08.247064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-11T10:49:08.250605Z","title":"Mm1: Meth- ods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.250605Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:45a5682c40a9af9c279ae067651eb82a17f59ff08e311b7d969c0c5ffa2f2afd","observation_id":"fcda2877-eaa5-4991-bc3a-709b18ed9086","resolution":{"observed_at":"2026-08-11T10:49:08.250605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:08.254401Z","title":"Plotqa: Reasoning over scientific plots","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.254401Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:7dd8a5baca5c6a6a95df68497b77d956ca44280e6e258476787c550d20709024","observation_id":"3f5dba71-6c98-455c-9d5f-7e7985cf1ea8","resolution":{"observed_at":"2026-08-11T10:49:08.254401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.614444Z","title":"Localized sym- bolic knowledge distillation for visual commonsense mod- els","venue":null,"work_id":"0b9487b7-3810-455b-b7a8-be016c12b0ce","year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.257990Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:aee631115e7ff5022616dd6033189f6366ca684e9dc3c3bee0f0576ff3e607e2","observation_id":"90f291d5-e8bf-4899-9895-3c61536d3e8d","resolution":{"observed_at":"2026-08-11T10:49:09.618290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-11T10:49:08.261497Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.261497Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:162989fead46da8752ed068883f3cf957ad25b00b5f6d4cd5a4bcf4209972cd1","observation_id":"6df6201a-e410-43c9-b86e-7f74c9d7bb18","resolution":{"observed_at":"2026-08-11T10:49:08.261497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.603247Z","title":"Efficiently scaling trans- former inference","venue":null,"work_id":"3b856017-c5be-4fe4-b015-31da35b32777","year":2023},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.265314Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:b5afeb19dd636e5a2788337efd3c84cb5c30fd842f0c05f9f23a64fe8725a114","observation_id":"7fa6a765-a7d3-421e-8900-87353103a565","resolution":{"observed_at":"2026-08-11T10:49:09.607182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.591858Z","title":"A dataset for movie description","venue":null,"work_id":"2e62fa48-1437-48a1-9bcd-2dc1fd379b2a","year":2015},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.268871Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:b52e200a1329189bac93d7ae5862930f83ba4c20f75b71b9e1a5bb66dd6e2549","observation_id":"81d33351-6e77-4c06-afa7-296895af5ae3","resolution":{"observed_at":"2026-08-11T10:49:09.595623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.579695Z","title":"Laion-5b: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"159f75e0-2c8e-4b72-b3c6-494aa391b7cd","year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.272406Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:82f0ce5ab28453fdb723e6beee460429ac24598468f209930b32573eb8ea7a43","observation_id":"317103cd-3ba8-4db8-817e-448820126bac","resolution":{"observed_at":"2026-08-11T10:49:09.584080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.567499Z","title":"Laion coco: 600m synthetic captions from laion2b-en","venue":null,"work_id":"d2b8c35a-0f41-4f2f-9d46-7d33b59df6d7","year":2022},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.276344Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:5b712c0133a08bd985bc563911cf26a65cf7d2001ee6cf971b4f5e3281bfbe02","observation_id":"304cc45e-0549-4418-ae66-886a56839fbd","resolution":{"observed_at":"2026-08-11T10:49:09.571488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.556710Z","title":"Solving geometry problems: Combining text and diagram interpretation","venue":null,"work_id":"2b474dd0-d8a4-420c-b943-23932716eaec","year":2015},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.279893Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:cb577380ba0026869aaae69c1fc653a6dcb9cdb907230af871d2302a5e354776","observation_id":"ee3c7c9c-d14c-4a16-a9a2-810b9ada4996","resolution":{"observed_at":"2026-08-11T10:49:09.560158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.545974Z","title":"Kvqa: Knowledge-aware visual question answering","venue":null,"work_id":"160617c5-b8d6-4fa4-b5cf-ff59c347f2d4","year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.283532Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:471a57d95141c52b67b0f94e6b7da35dc30816eddc0fe973c032473a78eeaf4d","observation_id":"58617fa4-785f-4792-b157-0b563d1883a8","resolution":{"observed_at":"2026-08-11T10:49:09.549517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.534646Z","title":"Ntu rgb+d: A large scale dataset for 3d human activity anal- ysis","venue":null,"work_id":"9d7a9fd2-053e-41bd-8586-71f2004e33fa","year":2016},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.287136Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:fe7f46bb181ae0018c3d4de56cc725e15776f377fd1e1db6941ec53fb0c08692","observation_id":"a3859706-8d68-47a4-83d7-113ab49bce50","resolution":{"observed_at":"2026-08-11T10:49:09.538809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.523129Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"295f4ac0-9abf-4bc2-a6fb-25212d96446b","year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.290745Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:afc31a36f3fe3b5a6ea50c9cd5b5f9e43cfbfaa66389e15ce732bde3b79ffefe","observation_id":"72537121-778e-4cd3-bf3c-1b233fa6f39a","resolution":{"observed_at":"2026-08-11T10:49:09.527193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:09.510937Z","title":"Towards vqa models that can read","venue":null,"work_id":"a28d404f-e272-4431-b4ee-ffb521f51e58","year":2019},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.294410Z"},"links":{"citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:3b25d956c6fe2ccd278b5df16944117b748f4d5eaef9dbc21f708227a56ed950","observation_id":"cd7ca002-83ff-4c81-9a90-310725577f72","resolution":{"observed_at":"2026-08-11T10:49:09.515161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:57:43.700740Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":90,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":136},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 136 outbound references and 0 inbound Pith citation observations for arXiv:2412.16158."}