{"as_of":"2026-08-19T06:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b447d921b49396ccbbdb24c1d591580578887ab4804d29d11e63ad2e84f73227","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":90,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:26.552528Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:50:10.268440Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T11:35:25.894465Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.10440"},"observation_digest":"sha256:e4494bf390a139e618bc7676ca2ff08bc22cde3bbd56c953fd44b1970ae6aa37","observation_id":"82093b3b-5904-4d0a-9070-69f69e35f8bf","resolution":{"observed_at":"2026-05-16T11:35:25.922253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T15:39:32.605366Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14062","last_updated":"2025-03-08T10:27:55Z","snapshot_observed_at":"2026-08-14T05:35:07.124561Z","submitted_at":"2024-11-21T12:16:16Z","title":"MMGenBench: Fully Automatically Evaluating LMMs from the Text-to-Image Generation Perspective","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:39:32.605366Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.14062"},"observation_digest":"sha256:33be63ee5bf393d8fae8a3ff9b5fa253b9e5efaa4658082304ab87cdb16beaac","observation_id":"1fefffe4-841f-4476-ad1b-aab72a973087","resolution":{"observed_at":"2026-08-12T15:39:32.605366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T15:33:29.453481Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14137","last_updated":"2025-08-25T18:38:17Z","snapshot_observed_at":"2026-08-17T15:31:36.164023Z","submitted_at":"2024-11-21T14:01:42Z","title":"VAGUE: Visual Contexts Clarify Ambiguous Expressions","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:33:29.453481Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.14137"},"observation_digest":"sha256:298f79b92868e929153f8922eac611b7780c439b60aa8a53fd0af5d9ee8ad76a","observation_id":"4a30158a-bbd4-454f-a035-56074b10d43a","resolution":{"observed_at":"2026-08-12T15:33:29.453481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T15:17:06.869007Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-17T16:49:55.394145Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:06.869007Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.14432"},"observation_digest":"sha256:5853d13f24dc690743221c2f762cbd33cee53c9b13a80044cec09ce1443ff3c4","observation_id":"02504af0-6a21-40c6-8cd6-918760059e41","resolution":{"observed_at":"2026-08-12T15:17:06.869007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T15:03:24.301248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-16T05:08:51.624496Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:24.301248Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:8e516ea62110e6e8161d26dbf2b7ba91da3f41b5297c300957405d904c1be0b4","observation_id":"2599b4e7-255d-4427-bf93-cc868e3785a3","resolution":{"observed_at":"2026-08-12T15:03:24.301248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T14:03:27.913396Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16749","last_updated":"2024-12-02T04:05:34Z","snapshot_observed_at":"2026-08-17T19:02:43.303027Z","submitted_at":"2024-11-24T04:49:07Z","title":"AnySynth: Harnessing the Power of Image Synthetic Data Generation for Generalized Vision-Language Tasks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:03:27.913396Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2411.16749"},"observation_digest":"sha256:ab275710188683383f7877677116a100abe928da2922b169c8341c644be66036","observation_id":"92301f46-ef64-48b7-b9d5-80f8c10b6a9f","resolution":{"observed_at":"2026-08-12T14:03:27.913396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-12T10:24:06.750576Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00142","last_updated":"2025-06-09T17:01:06Z","snapshot_observed_at":"2026-08-15T06:49:05.052533Z","submitted_at":"2024-11-28T18:55:41Z","title":"Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T10:24:06.750576Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2412.00142"},"observation_digest":"sha256:8dff9c4e70c00a535e016621f8946d9e32f08924c55444e42f66db4b9a7d2a3e","observation_id":"10691041-26b8-4e48-b5e5-e17e4edce9ba","resolution":{"observed_at":"2026-08-12T10:24:06.750576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:f415e2bf13cf939eccbf6f2507d07f64ce034b6684c5a1dadb79ba8cadd76d1e","observation_id":"4edee02f-3b63-410e-bc20-a9cd18be64e9","resolution":{"observed_at":"2026-05-10T13:23:57.792749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-11T20:13:47.617136Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05983","last_updated":"2025-07-26T14:45:01Z","snapshot_observed_at":"2026-08-14T09:40:33.773143Z","submitted_at":"2024-12-08T16:10:42Z","title":"Chimera: Improving Generalist Model with Domain-Specific Experts","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:13:47.617136Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2412.05983"},"observation_digest":"sha256:c3b8190ee7651ef9041b53b69323c4a908be7b3ebf5506064aa4f15d2469971d","observation_id":"a8fbda6f-fa91-4fa9-b3d8-097936025f9a","resolution":{"observed_at":"2026-08-11T20:13:47.617136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-11T17:53:35.992520Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-16T23:34:44.456187Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.992520Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:558d090baaed194f9209986ca384633526e65921d025680a1b8aa39b1787c766","observation_id":"e226fb37-2f60-4d15-a93c-75819721536c","resolution":{"observed_at":"2026-08-11T17:53:35.992520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-11T18:10:44.715962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10435","last_updated":"2025-07-02T21:50:59Z","snapshot_observed_at":"2026-08-19T03:24:37.868924Z","submitted_at":"2024-12-11T08:10:32Z","title":"COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:10:44.715962Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2412.10435"},"observation_digest":"sha256:6b5ca10252c51e16a52a8c5e0c70047bcb9e1314f3c1b20c411820edaf74ab88","observation_id":"33171c3b-2af3-44ee-89cc-a1671fa3703a","resolution":{"observed_at":"2026-08-11T18:10:44.715962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:fca84d1ba411d19b3e6d6f1cbd78d8604c94331c8488a674db0d835be0ec7ec0","observation_id":"b0878f72-9289-411e-b773-26e5a6ef4bc4","resolution":{"observed_at":"2026-05-17T20:33:26.826379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-10T22:45:10.984594Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00874","last_updated":"2025-05-07T18:16:42Z","snapshot_observed_at":"2026-08-14T08:12:29.739555Z","submitted_at":"2025-01-01T15:43:07Z","title":"LUSIFER: Language Universal Space Integration for Enhanced Multilingual Embeddings with Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:45:10.984594Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.00874"},"observation_digest":"sha256:3f0af1aa14daf16d11c82fc661ca456948873625c08ad889b539c35aa15533a7","observation_id":"87e98038-a2f1-4336-a8f9-7a6806ca83a3","resolution":{"observed_at":"2026-08-10T22:45:10.984594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-15T09:15:43.841019Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:2f0d6a7259ef19e4dc3fe18659ac0b1aea163d02d033f87f95cd806ab1f96c5e","observation_id":"2df41e0f-89b4-4108-a781-7705033c0986","resolution":{"observed_at":"2026-05-17T21:08:19.727652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-10T21:31:16.176720Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-14T03:18:34.834807Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:31:16.176720Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.04670"},"observation_digest":"sha256:a974c084d6507aa6e1c92b918639a33ca641154a1f23cd600a8b7a65a3260612","observation_id":"dfb87a1a-2332-4769-8d31-8c1dc71dc8c7","resolution":{"observed_at":"2026-08-10T21:31:16.176720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-10T21:10:19.086305Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.086305Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:eb7a0a7fca496db26152b40253d7a631ccb3373b520d2e515fced95a665cb725","observation_id":"faf8283a-7e18-46ca-a27c-1f8a2aeb734b","resolution":{"observed_at":"2026-08-10T21:10:19.086305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-10T20:17:26.551329Z","title":"Ovis: Structural embedding alignment for multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08983","last_updated":"2025-09-01T12:11:42Z","snapshot_observed_at":"2026-08-16T14:38:59.722048Z","submitted_at":"2025-01-15T17:59:56Z","title":"Compositional Generative Model of Unbounded 4D Cities","version":4},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-10T20:17:26.551329Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.08983"},"observation_digest":"sha256:a581d4e9937bab43ea7447fd3e98d1f2d01a2209cbd1ec86e44f217652958fbd","observation_id":"ac100909-eebd-449f-a3ac-de9c8ccd516b","resolution":{"observed_at":"2026-08-10T20:17:26.551329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-10T15:18:49.974575Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.974575Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:578644984f4afc4b90b999491aadf47dafc03a312d5cf3a3570cb5a2c4dce384","observation_id":"5fc3821e-0ff2-44bb-84c7-380649c8191e","resolution":{"observed_at":"2026-08-10T15:18:49.974575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-09T21:10:05.920921Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19164","last_updated":"2025-02-21T04:25:31Z","snapshot_observed_at":"2026-08-16T19:32:18.567418Z","submitted_at":"2025-01-31T14:31:00Z","title":"Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T21:10:05.920921Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.19164"},"observation_digest":"sha256:5e6138e92279be28a0c6141c876811ea7729222110a913b86700374f112626da","observation_id":"b4186bfa-ba20-4805-b984-86377a61e97d","resolution":{"observed_at":"2026-08-09T21:10:05.920921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-09T10:29:38.525159Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02982","last_updated":"2025-05-20T07:03:02Z","snapshot_observed_at":"2026-08-14T02:16:13.702439Z","submitted_at":"2025-02-05T08:26:17Z","title":"MobileA3gent: Training Mobile GUI Agents Using Decentralized Self-Sourced Data from Diverse Users","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T10:29:38.525159Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2502.02982"},"observation_digest":"sha256:8ee0f925b65aa3c0127e09ed1896ab5e68bf4bb7a5228a2798814ac9897097d2","observation_id":"c57eab0a-b3ea-448c-9325-a90e0a335d38","resolution":{"observed_at":"2026-08-09T10:29:38.525159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:889725aae617f3caf71745d29bc00c826b453c305e468fd7bf7d6b762cf304d7","observation_id":"f4566433-df2b-4547-be0c-63e97c43124e","resolution":{"observed_at":"2026-05-10T13:41:08.046852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-16T12:40:26.552528Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12018","last_updated":"2025-04-16T12:21:49Z","snapshot_observed_at":"2026-08-18T10:41:09.205775Z","submitted_at":"2025-04-16T12:21:49Z","title":"Instruction-augmented Multimodal Alignment for Image-Text and Element Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:26.552528Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2504.12018"},"observation_digest":"sha256:b61d85fb08e576f71f4cf2a1ca167fab68e8c44c6e923055c0bfe2776334c834","observation_id":"4cef6bf6-12ac-4b35-b56b-21fb16ccee8a","resolution":{"observed_at":"2026-08-16T12:40:26.552528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-16T11:33:47.223722Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-18T11:09:01.459046Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:33:47.223722Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2504.15279"},"observation_digest":"sha256:c4b8ced258e741d42811f84d29f7bdd41f24bfff2aaf2922612848666ea5c984","observation_id":"5f564e75-13ed-4af2-a92e-1d7985f7c840","resolution":{"observed_at":"2026-08-16T11:33:47.223722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-16T11:32:17.438888Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15280","last_updated":"2025-04-27T00:11:00Z","snapshot_observed_at":"2026-08-17T01:59:32.260988Z","submitted_at":"2025-04-21T17:59:53Z","title":"Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:32:17.438888Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2504.15280"},"observation_digest":"sha256:50384c1d1696eb765ab218bebdbf24034a909ddbf387fb67e5c4a9c01484a290","observation_id":"e38f2089-40de-436e-890c-ef9043706c2c","resolution":{"observed_at":"2026-08-16T11:32:17.438888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-16T11:22:34.522788Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15707","last_updated":"2025-04-22T08:47:59Z","snapshot_observed_at":"2026-08-17T02:14:29.219099Z","submitted_at":"2025-04-22T08:47:59Z","title":"RePOPE: Impact of Annotation Errors on the POPE Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:22:34.522788Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2504.15707"},"observation_digest":"sha256:8f6ecb425247caaef522e802e2074671de598dfe33712203f83cdf19009a7717","observation_id":"b0d3637f-053d-4f92-8518-2f05c4747acb","resolution":{"observed_at":"2026-08-16T11:22:34.522788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-15T21:02:41.877246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11015","last_updated":"2025-05-27T08:00:24Z","snapshot_observed_at":"2026-08-16T22:24:17.930161Z","submitted_at":"2025-05-16T09:09:46Z","title":"WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:41.877246Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2505.11015"},"observation_digest":"sha256:9454db88a5bb50e4f1b6fca0fd42d0d745b66d90aeaa762aaa123a5d489cdb90","observation_id":"bed95706-12aa-4353-b922-d6ced562f7f0","resolution":{"observed_at":"2026-08-15T21:02:41.877246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T15:09:47.031949Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16314","last_updated":"2025-05-22T07:12:36Z","snapshot_observed_at":"2026-08-18T03:22:25.137553Z","submitted_at":"2025-05-22T07:12:36Z","title":"NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:47.031949Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2505.16314"},"observation_digest":"sha256:5e1e880499b1657c9389c45665753625da883a8ba40b27d8273686243e73aa49","observation_id":"8d565fb3-4a9a-4d30-9dc0-c791df6aad28","resolution":{"observed_at":"2026-08-07T15:09:47.031949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-08-18T01:34:54.748158Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:dcf03c48dc4468997030d5e33b3bfe7b11ccf1937a0507a3e1e2a074301c737a","observation_id":"76420bee-e81f-491f-86c1-0dd85a6789b6","resolution":{"observed_at":"2026-05-22T14:21:39.788591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T13:40:22.917151Z","title":"Ovis: Structural embedding alignment for multimodal large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-15T07:49:04.403413Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:22.917151Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:6037d5480c08ae0bc4aa47555f0e7dbe0ad9b5079254e2eda157e1280ef9eb5e","observation_id":"66051f3d-87e3-4bc9-be8c-dd4563c51b30","resolution":{"observed_at":"2026-08-07T13:40:22.917151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T12:42:25.374172Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24073","last_updated":"2025-08-26T16:42:37Z","snapshot_observed_at":"2026-08-17T13:14:58.451971Z","submitted_at":"2025-05-29T23:32:03Z","title":"mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:42:25.374172Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2505.24073"},"observation_digest":"sha256:c50f864a2865014bcf1b797ef05cf770bf5f809c9ea33fc02d9898e537da0138","observation_id":"49dbe8c7-b28d-4ddf-b0db-d885e34f02f6","resolution":{"observed_at":"2026-08-07T12:42:25.374172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T12:01:04.167429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00855","last_updated":"2025-06-01T06:28:36Z","snapshot_observed_at":"2026-08-16T02:03:31.506594Z","submitted_at":"2025-06-01T06:28:36Z","title":"MedBookVQA: A Systematic and Comprehensive Medical Benchmark Derived from Open-Access Book","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.167429Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.00855"},"observation_digest":"sha256:4bd57f396dea76ff756c66d19eabd88087447e6b85acc7cdc91e5fe978208827","observation_id":"464bd6fb-d219-47f4-bb85-680b63386024","resolution":{"observed_at":"2026-08-07T12:01:04.167429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T11:59:54.201377Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00893","last_updated":"2025-08-02T10:06:31Z","snapshot_observed_at":"2026-08-15T04:24:22.889365Z","submitted_at":"2025-06-01T08:26:34Z","title":"Affordance Benchmark for MLLMs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:54.201377Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.00893"},"observation_digest":"sha256:4bfe1ccdfac75c76fcd7c0f70ae76c71c509aa0f7b1c010b8a66e133fd1e0db4","observation_id":"3f99d2ac-6ad3-429a-b55a-21d3195c5188","resolution":{"observed_at":"2026-08-07T11:59:54.201377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T11:55:13.202412Z","title":"Ovis: Structural embedding alignment for multimodal large language model.arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-17T06:45:11.512822Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:13.202412Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:eae8c2d79659c2e3a1c42f7940163ccf3991f281b9e51acec41c6bf662569238","observation_id":"f3ea50c4-9b66-4532-954b-befd96fe0118","resolution":{"observed_at":"2026-08-07T11:55:13.202412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T10:54:00.675957Z","title":"Ovis: Structural embedding alignment for multimodal large language model.arXiv preprint arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04088","last_updated":"2025-06-04T15:46:30Z","snapshot_observed_at":"2026-08-14T20:54:08.365995Z","submitted_at":"2025-06-04T15:46:30Z","title":"Multimodal Tabular Reasoning with Privileged Structured Information","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:54:00.675957Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.04088"},"observation_digest":"sha256:e7eacb879f4f5a63b2cb963986675f342a808ba281d0c7ee602a9d8de49ead73","observation_id":"e591ffba-6bbc-4c1d-97ef-c3745c0836c4","resolution":{"observed_at":"2026-08-07T10:54:00.675957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T10:27:08.565388Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-17T12:09:47.821225Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.565388Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:eee288ed252c4541ddd836ffd4d12bf968f1a8493ba679cb95a088bec05610c1","observation_id":"9e4548a8-5541-4013-8f38-477bf4129879","resolution":{"observed_at":"2026-08-07T10:27:08.565388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T06:05:39.512287Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06231","last_updated":"2025-08-16T20:27:12Z","snapshot_observed_at":"2026-08-16T18:17:39.275824Z","submitted_at":"2025-06-06T16:50:37Z","title":"Towards an Explainable Comparison and Alignment of Feature Embeddings","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:39.512287Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.06231"},"observation_digest":"sha256:cb41b6726782ef1af05d16ed0740bd59f0c99387074dff441ced4db39b036b31","observation_id":"6e33b33c-1f92-4ff7-b52d-f59fb216fe01","resolution":{"observed_at":"2026-08-07T06:05:39.512287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T06:00:56.920387Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model.arXiv e-prints, art","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06275","last_updated":"2025-06-06T17:58:36Z","snapshot_observed_at":"2026-08-17T10:00:49.433347Z","submitted_at":"2025-06-06T17:58:36Z","title":"Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:56.920387Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.06275"},"observation_digest":"sha256:d0896625652966147b211154afe38ed25746f350bc7806a3ac7ddd739f9c0d39","observation_id":"e7ea8119-c001-4313-b8b4-2dd6293465b7","resolution":{"observed_at":"2026-08-07T06:00:56.920387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T05:27:50.136340Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07818","last_updated":"2025-06-09T14:46:02Z","snapshot_observed_at":"2026-08-14T06:57:48.098611Z","submitted_at":"2025-06-09T14:46:02Z","title":"WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.136340Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.07818"},"observation_digest":"sha256:eacd2917bdfaebe0b2237c1c9d8e1bacd95d3cf719d29c57fc3c3b7a80f6fdef","observation_id":"1f4d212c-0e72-4016-a0dd-0c62c367eb1e","resolution":{"observed_at":"2026-08-07T05:27:50.136340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2506.09373","last_updated":"2026-04-21T11:50:18Z","snapshot_observed_at":"2026-08-10T21:23:31.060977Z","submitted_at":"2025-06-11T03:43:30Z","title":"LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T09:45:55.674155Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.09373"},"observation_digest":"sha256:a7e85bbee65c937af9d08ee69555631ae7c1c15b035eb74db0bf5a71244aea7c","observation_id":"7a3e6cea-898e-40e9-91fe-c3d3a86793f0","resolution":{"observed_at":"2026-05-19T09:47:13.940530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2506.09522","last_updated":"2026-05-13T05:18:27Z","snapshot_observed_at":"2026-08-15T02:52:27.913060Z","submitted_at":"2025-06-11T08:46:55Z","title":"Revisit What You See: Revealing Visual Semantics in Vision Tokens to Guide LVLM Decoding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T09:42:14.171289Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.09522"},"observation_digest":"sha256:bf74cd00e17188583bfa1895db533b32671ac17a3add39a32bafd0aec46a612f","observation_id":"cc074f68-bcd9-4daa-901a-fa301cb8dd23","resolution":{"observed_at":"2026-05-19T09:43:02.189331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-07T04:41:07.869503Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09993","last_updated":"2025-07-03T06:39:43Z","snapshot_observed_at":"2026-08-16T18:24:17.636140Z","submitted_at":"2025-06-11T17:59:46Z","title":"Text-Aware Image Restoration with Diffusion Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:41:07.869503Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.09993"},"observation_digest":"sha256:66884bf641f114dde1f2fc49216704108b81d94ea4b8b783416b82cbd53c3066","observation_id":"2eb594c4-84b6-4122-868d-e00f4d52204c","resolution":{"observed_at":"2026-08-07T04:41:07.869503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T23:57:24.586499Z","title":"arXiv:2405.20797 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:24.586499Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:2c46c57e9ccfb55e5a7b8beb760e7c40735a208604b75823b7d2095508a4d953","observation_id":"20fd1c83-8f59-442d-a989-204ca7a10f17","resolution":{"observed_at":"2026-08-06T23:57:24.586499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-15T19:10:13.859150Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17589","last_updated":"2025-08-25T08:46:29Z","snapshot_observed_at":"2026-08-18T02:13:34.687437Z","submitted_at":"2025-06-21T05:01:02Z","title":"Taming the Untamed: Graph-Based Knowledge Retrieval and Reasoning for MLLMs to Conquer the Unknown","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:13.859150Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.17589"},"observation_digest":"sha256:2294c9f275bee767a7918c30d5e2d799fb91915475a36ff978901313f2a4ec92","observation_id":"b9fd3091-8793-423c-a21f-8becf134416e","resolution":{"observed_at":"2026-08-15T19:10:13.859150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T23:01:49.723984Z","title":"Ovis: Structural embedding alignment for multimodal large language model.arXiv preprint arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20214","last_updated":"2025-07-08T07:46:39Z","snapshot_observed_at":"2026-08-09T16:18:48.711928Z","submitted_at":"2025-06-25T07:57:09Z","title":"UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:49.723984Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.20214"},"observation_digest":"sha256:82adfb4aa638ef95a38499f31b5210f787945f9c99d1833640b7429890597324","observation_id":"b9e15661-e791-481c-8847-73d935275cfd","resolution":{"observed_at":"2026-08-06T23:01:49.723984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T22:53:13.548511Z","title":"arXiv preprint arXiv:2405.20797 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20449","last_updated":"2025-06-25T13:56:48Z","snapshot_observed_at":"2026-08-07T21:48:06.227537Z","submitted_at":"2025-06-25T13:56:48Z","title":"Med-Art: Diffusion Transformer for 2D Medical Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:13.548511Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.20449"},"observation_digest":"sha256:866a698b325e0f547d5a8ddd5284a2e40f55811e527cbc2786de6b2dbe76ef68","observation_id":"9249863c-eb5c-4438-82bb-b1938613a098","resolution":{"observed_at":"2026-08-06T22:53:13.548511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T22:01:20.362999Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:20.362999Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:d8a6ff5e797365c2486cef370d6f116375c97c84b0e9773645e00fafae66b128","observation_id":"2aad56e1-aa05-4038-b813-07d979938afa","resolution":{"observed_at":"2026-08-06T22:01:20.362999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T20:53:07.221154Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-17T05:41:16.319289Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:07.221154Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:ce0b0f30ec9a5c3c8c2147266cb5931b76022f1308d4ceb3c207c5929ffe889b","observation_id":"ed625676-9ef6-457f-8452-fdcc4955ba73","resolution":{"observed_at":"2026-08-06T20:53:07.221154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T16:51:25.555322Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-16T10:17:21.932019Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:25.555322Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:61adc9ffbff1f090b0cc90ed4a28afd185cab9d8f3967c9b5c191716e0c5d374","observation_id":"f4713053-4307-437d-9fb0-c1d5bf82f1c1","resolution":{"observed_at":"2026-08-06T16:51:25.555322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T15:43:16.151049Z","title":"Ovis: Structural embedding alignment for multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15285","last_updated":"2025-07-21T06:35:46Z","snapshot_observed_at":"2026-08-14T12:08:56.529441Z","submitted_at":"2025-07-21T06:35:46Z","title":"In-context Learning of Vision Language Models for Detection of Physical and Digital Attacks against Face Recognition Systems","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:43:16.151049Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2507.15285"},"observation_digest":"sha256:ab39382c07ff9196e3ba631d923757f2569c6226e95525b108972b8ba0d24b5a","observation_id":"37af84cf-e2e8-4547-a004-8aab72ea8307","resolution":{"observed_at":"2026-08-06T15:43:16.151049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-06T13:20:35.862491Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20804","last_updated":"2026-07-18T05:33:43Z","snapshot_observed_at":"2026-08-17T05:14:56.012925Z","submitted_at":"2025-07-28T13:16:23Z","title":"MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:20:35.862491Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2507.20804"},"observation_digest":"sha256:e52e345b4bd2f47e74d5afbd1ef267711aa642b074025cce6bc04bd79633b9af","observation_id":"73c5e2f0-5c99-4a30-8ff4-cb2338632a10","resolution":{"observed_at":"2026-08-06T13:20:35.862491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-05T23:17:30.234395Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05580","last_updated":"2025-08-07T17:12:54Z","snapshot_observed_at":"2026-08-14T07:42:18.323855Z","submitted_at":"2025-08-07T17:12:54Z","title":"Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:30.234395Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2508.05580"},"observation_digest":"sha256:e9dd33e1df70a81cb974340cd322734dd418a13b0f311106c4bbfb2ba1e3fdee","observation_id":"71701df6-149d-4416-8faa-27b3e2ccb689","resolution":{"observed_at":"2026-08-05T23:17:30.234395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-15T17:24:08.347677Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12680","last_updated":"2025-08-18T07:24:33Z","snapshot_observed_at":"2026-08-18T01:37:24.516846Z","submitted_at":"2025-08-18T07:24:33Z","title":"Vision-G1: Towards General Vision Language Reasoning with Multi-Domain Data Curation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T17:24:08.347677Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2508.12680"},"observation_digest":"sha256:0b2c11a3499331d728913723d080458d75131b29c08c6300463afd88812fc008","observation_id":"72f64ce5-8e37-4f3a-b84e-f3d780d1ae00","resolution":{"observed_at":"2026-08-15T17:24:08.347677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:c280590da819157e75adbc00f9e0918e0698e5b6fd0a933cbbb3739d099586c8","observation_id":"a8543d23-cf53-4291-9d69-f9b6bb28ff82","resolution":{"observed_at":"2026-05-10T11:58:59.194870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-05T15:23:53.395808Z","title":"arXiv preprint arXiv:2405.20797","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.395808Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:5c4626789b6560636857960b9ba1fd35bceae7c69666b84ba3611ceeaf9fb79b","observation_id":"adb73585-05b2-45da-8192-0ca009ca97cf","resolution":{"observed_at":"2026-08-05T15:23:53.395808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-04T19:27:40.738360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09254","last_updated":"2025-09-11T08:39:08Z","snapshot_observed_at":"2026-08-16T17:44:52.264664Z","submitted_at":"2025-09-11T08:39:08Z","title":"Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:40.738360Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2509.09254"},"observation_digest":"sha256:e717e7ff4e7b05a09e2f286972517d4d36d786ccf0ca19cf352d552301c145ad","observation_id":"d4cd68da-f164-4e7f-8d36-51d711937cea","resolution":{"observed_at":"2026-08-04T19:27:40.738360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-04T18:49:39.216124Z","title":"arXiv preprint arXiv:2405.20797 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09658","last_updated":"2026-05-25T08:56:37Z","snapshot_observed_at":"2026-08-19T01:08:52.430878Z","submitted_at":"2025-09-11T17:54:00Z","title":"Measuring Epistemic Humility in Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:49:39.216124Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2509.09658"},"observation_digest":"sha256:02f874e88cd09490534f6d4016ff4015f374deee07454c3b45af4404a5b264c8","observation_id":"53aec416-a58f-4094-8e9d-41da5ae12f38","resolution":{"observed_at":"2026-08-04T18:49:39.216124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-03T22:36:09.874162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.10055","last_updated":"2026-06-02T09:56:13Z","snapshot_observed_at":"2026-08-15T10:07:37.505761Z","submitted_at":"2025-11-13T07:57:10Z","title":"Physical Plausibility Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T22:36:09.874162Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2511.10055"},"observation_digest":"sha256:d9586062084ad7694b5e55390a750beeae5a375aabf06779c6886cf17f7d7fff","observation_id":"fa648e32-13c7-4ed4-be3f-195e6326d6d0","resolution":{"observed_at":"2026-08-03T22:36:09.874162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-03T20:41:50.695776Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19032","last_updated":"2026-07-09T04:07:40Z","snapshot_observed_at":"2026-08-16T06:03:41.986353Z","submitted_at":"2025-11-24T12:07:56Z","title":"Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:41:50.695776Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2511.19032"},"observation_digest":"sha256:a04f310e582f34b9029fb127ae2b35b7f9b154d0e9c88b58bb70cd6be60f26ec","observation_id":"55144bd6-3362-419a-9d27-1e85742fc5c8","resolution":{"observed_at":"2026-08-03T20:41:50.695776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-03T20:24:00.699557Z","title":"Ovis: Structural em- bedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20274","last_updated":"2026-07-02T15:14:44Z","snapshot_observed_at":"2026-08-10T17:27:31.438947Z","submitted_at":"2025-11-25T12:59:31Z","title":"SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:24:00.699557Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2511.20274"},"observation_digest":"sha256:75d5d67476763e1c618e0f201323895e7228154c939f27469aa024e41dba63a2","observation_id":"d87c5108-92ad-47a2-8078-87dce0dddb10","resolution":{"observed_at":"2026-08-03T20:24:00.699557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-03T18:15:06.083870Z","title":"Ovis: Structural embed- ding alignment for multimodal large language model.arXiv preprint arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-15T01:13:36.123242Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:06.083870Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:fb2238c87bcfd0749f9a871f2eb982e3c4f7857d3c70d025db96b0dacf86b80e","observation_id":"d081467a-fba5-47ed-8fed-6128430195bb","resolution":{"observed_at":"2026-08-03T18:15:06.083870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2512.10554","last_updated":"2026-04-02T03:14:28Z","snapshot_observed_at":"2026-08-11T12:33:58.665102Z","submitted_at":"2025-12-11T11:38:50Z","title":"Grounding Everything in Tokens for Multimodal Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T23:31:05.422935Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2512.10554"},"observation_digest":"sha256:da5dd15679c51bd365b59dd2ab8a6f002ddb35d106cea949ddf9cda7772d3d02","observation_id":"afc7c333-08f8-428a-9dd9-e77e1b97476e","resolution":{"observed_at":"2026-05-16T23:31:21.863850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2512.14044","last_updated":"2026-04-30T14:06:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-16T03:19:28Z","title":"OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T22:34:00.895252Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2512.14044"},"observation_digest":"sha256:f815d64f618cb2d17dc6acfef8946218f9279642be3a5bcc40a49ca4954efc3a","observation_id":"f2ec3220-6993-45e7-afe4-3c0d2f6efae1","resolution":{"observed_at":"2026-05-16T22:38:37.851700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2602.00181","last_updated":"2026-04-14T16:44:13Z","snapshot_observed_at":"2026-08-15T21:28:05.921564Z","submitted_at":"2026-01-30T04:45:43Z","title":"CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T10:02:20.477517Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2602.00181"},"observation_digest":"sha256:0ad678fa616aaa12a6c10de6a5d1a933e9970664e9968e4cb07b6b5e876c0c36","observation_id":"405b0bd7-b878-4b6b-80e6-77fb86d9fd85","resolution":{"observed_at":"2026-05-16T10:02:42.549876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2602.04802","last_updated":"2026-07-22T16:08:20Z","snapshot_observed_at":"2026-08-03T04:31:17.019218Z","submitted_at":"2026-02-04T17:48:55Z","title":"VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T13:36:28.844714Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2602.04802"},"observation_digest":"sha256:d601830973bbcbbe67ac28267fabe290be65208699e889de1e41334012f5a35f","observation_id":"8055677a-4504-4f9f-aeb7-9700d90d47ed","resolution":{"observed_at":"2026-05-21T13:40:12.519458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-03T04:31:21.095784Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04802","last_updated":"2026-07-22T16:08:20Z","snapshot_observed_at":"2026-08-03T04:31:17.019218Z","submitted_at":"2026-02-04T17:48:55Z","title":"VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:31:21.095784Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2602.04802"},"observation_digest":"sha256:6214e9259bac3bbe7d0b8d8efa9de0cf5b89d181fac8cd4924f7f776bfd65c3d","observation_id":"383e7ce0-1622-4682-b2ce-6b40bb973922","resolution":{"observed_at":"2026-08-03T04:31:21.095784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2602.08392","last_updated":"2026-04-04T07:19:18Z","snapshot_observed_at":"2026-08-09T04:39:04.658750Z","submitted_at":"2026-02-09T08:47:14Z","title":"ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T06:00:02.043029Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2602.08392"},"observation_digest":"sha256:21ce6e140f804a8f06a8016c6838c25bd4cc5d0b27cfc0b3bb4db6b40a206b2f","observation_id":"2a0ef8d2-a537-406a-a6e0-7c2c54522585","resolution":{"observed_at":"2026-05-16T06:00:40.614819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-02T17:05:14.221995Z","title":"arXiv:2405.20797 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29759","last_updated":"2026-07-16T04:13:36Z","snapshot_observed_at":"2026-08-16T05:41:37.761393Z","submitted_at":"2026-03-31T14:00:10Z","title":"TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T17:05:14.221995Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2603.29759"},"observation_digest":"sha256:4029af6c3c63fb4245b5e45bd05f07900b025f4f12d55224443da7beb485d260","observation_id":"d68a784c-ddc3-4120-ad0c-919370ae5623","resolution":{"observed_at":"2026-08-02T17:05:14.221995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2604.05900","last_updated":"2026-04-07T14:05:17Z","snapshot_observed_at":"2026-08-11T11:00:13.923794Z","submitted_at":"2026-04-07T14:05:17Z","title":"AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-10T19:22:08.306946Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2604.05900"},"observation_digest":"sha256:8bf6f6e7eb95e0a602c9c19cfb56ab1da0e4548dd1117a9c6686fa06d61aa430","observation_id":"c24cc6b2-a876-4c11-a939-82b8a62d6942","resolution":{"observed_at":"2026-05-10T23:05:48.191772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-13T10:27:03.396626Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:02.559108Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2604.06777"},"observation_digest":"sha256:2dea59068b8171978fb8c913cc401e3c5d687b0b5f525956cb3d0fc72f362174","observation_id":"c5a2c74d-25d1-474d-85cf-87a7b22718e4","resolution":{"observed_at":"2026-05-11T00:45:50.076778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2604.25477","last_updated":"2026-04-28T10:30:01Z","snapshot_observed_at":"2026-08-11T13:12:13.526089Z","submitted_at":"2026-04-28T10:30:01Z","title":"DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-07T16:44:23.162726Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2604.25477"},"observation_digest":"sha256:a07511c13f6bc26d9af7dd4ada2085be8410ee7e3f2989a104f76711103e517c","observation_id":"a6b4084a-6e5c-4be7-b4d8-b60f0d7ccc78","resolution":{"observed_at":"2026-05-11T23:36:14.874224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2605.10576","last_updated":"2026-05-11T13:48:57Z","snapshot_observed_at":"2026-08-11T14:23:02.628499Z","submitted_at":"2026-05-11T13:48:57Z","title":"SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T04:00:50.940530Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2605.10576"},"observation_digest":"sha256:44d2bcf9f38d3bb5fe3327bbcb0a80cc40cdbfec9d3e08ad6e9a77c79de58a01","observation_id":"1dde09a9-7fce-4a46-b732-8dc915e1c2b5","resolution":{"observed_at":"2026-05-12T06:46:34.976766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2605.11651","last_updated":"2026-05-26T04:36:02Z","snapshot_observed_at":"2026-08-14T07:15:23.412799Z","submitted_at":"2026-05-12T07:14:04Z","title":"Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:35:09.568623Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2605.11651"},"observation_digest":"sha256:a56fb1d75d9a3788840d4241309596968fc822bfd2baa860185293f67ef168da","observation_id":"f549e748-2bac-4aa8-b48a-289107c1c9d5","resolution":{"observed_at":"2026-05-13T01:37:03.536685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2605.11651","last_updated":"2026-05-26T04:36:02Z","snapshot_observed_at":"2026-08-14T07:15:23.412799Z","submitted_at":"2026-05-12T07:14:04Z","title":"Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T21:10:49.059686Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2605.11651"},"observation_digest":"sha256:2505aa0dc84bcbdfdd33161682bafe29cdd091f35eb2a1bd1d04c054d2bc77f2","observation_id":"0018550c-f79e-4a6e-8bba-94f75c0d394f","resolution":{"observed_at":"2026-05-14T21:18:00.096827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2605.11651","last_updated":"2026-05-26T04:36:02Z","snapshot_observed_at":"2026-08-14T07:15:23.412799Z","submitted_at":"2026-05-12T07:14:04Z","title":"Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:55.817334Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2605.11651"},"observation_digest":"sha256:a05634f98741190cbe3e9f27f47270c41cb7bcdb78959661b52a28cf4bf0912d","observation_id":"d9f9bc5f-8391-455c-8134-3286b2c01be5","resolution":{"observed_at":"2026-05-19T17:02:40.601291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2605.11651","last_updated":"2026-05-26T04:36:02Z","snapshot_observed_at":"2026-08-14T07:15:23.412799Z","submitted_at":"2026-05-12T07:14:04Z","title":"Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T22:41:13.164195Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2605.11651"},"observation_digest":"sha256:d9dcf0067699fd2de8d5a4a20341464a7b38c6edff3e71d0eba703d6fda93e22","observation_id":"614f2864-8cd5-4007-b080-24761b762d57","resolution":{"observed_at":"2026-07-01T13:45:46.453550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2605.17823","last_updated":"2026-05-18T03:55:28Z","snapshot_observed_at":"2026-08-15T06:46:32.875928Z","submitted_at":"2026-05-18T03:55:28Z","title":"Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T12:24:47.111809Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2605.17823"},"observation_digest":"sha256:95f5b113f0da80730fb03c049290f25090b63476cb7e43f4234cce00bb6e7196","observation_id":"d201d336-c9fa-445d-9f65-12ab9b1d7268","resolution":{"observed_at":"2026-05-20T12:28:17.150176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2606.03264","last_updated":"2026-06-02T07:27:03Z","snapshot_observed_at":"2026-08-16T07:12:09.561259Z","submitted_at":"2026-06-02T07:27:03Z","title":"PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T10:39:14.444486Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2606.03264"},"observation_digest":"sha256:af5d0c721ba250e7ac33a9c6c9754cd735bcf367a77788aaa49a0d8d22125102","observation_id":"faa0fa58-f5bf-4400-a2d3-40f4c955cfc0","resolution":{"observed_at":"2026-07-02T02:46:28.874283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2606.07801","last_updated":"2026-06-05T19:32:23Z","snapshot_observed_at":"2026-07-06T23:47:24.424525Z","submitted_at":"2026-06-05T19:32:23Z","title":"Improving Multimodal Reasoning via Worst Dimension Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:55:57.691185Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2606.07801"},"observation_digest":"sha256:ef1632e2071699dbcaf8a9163929ee412ea3825471a226503f55ab992dafe86d","observation_id":"758b02c2-9bbd-4c5b-96f8-58ff6ff3930e","resolution":{"observed_at":"2026-07-02T17:37:14.785734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2606.08034","last_updated":"2026-06-06T07:51:52Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:51:52Z","title":"Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T20:11:02.445626Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2606.08034"},"observation_digest":"sha256:464068a50a959e46f36464a2f63197cf0f1921e667a8ce89f79762af388ca853","observation_id":"55bd621e-e782-4ba8-816a-259ff541926e","resolution":{"observed_at":"2026-07-02T20:47:22.877488Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2606.09132","last_updated":"2026-06-08T07:30:20Z","snapshot_observed_at":"2026-08-14T20:11:57.993629Z","submitted_at":"2026-06-08T07:30:20Z","title":"Vision Language Model Helps Private Information De-Identification in Vision Data","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T16:29:33.294960Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2606.09132"},"observation_digest":"sha256:925d9c3945e2e75ac8063660e006f053d0ce8d37bc571fc7df1c6b63865f7785","observation_id":"04329fb6-cc2c-49bc-bb8d-c18d94ef6f20","resolution":{"observed_at":"2026-07-03T01:27:31.571951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2606.22437","last_updated":"2026-06-25T12:10:03Z","snapshot_observed_at":"2026-08-14T07:50:04.090458Z","submitted_at":"2026-06-21T10:57:43Z","title":"MMGist: A Comprehensive Multimodal Benchmark for 2027","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T11:05:14.573386Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2606.22437"},"observation_digest":"sha256:9d9ad4bb0fd36834449ba0babb823e44709aeb7e806d5b86bea0a9986f78be78","observation_id":"bda50666-f002-45bb-93eb-488050348969","resolution":{"observed_at":"2026-07-04T08:49:41.624746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2606.25634","last_updated":"2026-06-24T09:38:27Z","snapshot_observed_at":"2026-08-15T05:32:19.948965Z","submitted_at":"2026-06-24T09:38:27Z","title":"SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-25T21:02:44.441202Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2606.25634"},"observation_digest":"sha256:a243792c3b01f326e21edfe1e4aaacb78a7cec27d79db0a469cd78aa5418be55","observation_id":"1d106ec9-fef4-475b-81b4-adb180e853be","resolution":{"observed_at":"2026-07-04T19:50:10.269996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2606.31187","last_updated":"2026-06-30T06:16:17Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T06:16:17Z","title":"Learning to Deny: Action Denial in Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-01T06:21:09.996386Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2606.31187"},"observation_digest":"sha256:9108aee9a624a47167d1d076ce6e4829e1f60027f6fce07e6cefc6e15d25b4d7","observation_id":"49bfc17c-8e25-4814-b5a0-0d1bdc7b8123","resolution":{"observed_at":"2026-07-01T09:45:39.575996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2405.20797 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":169,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:cc7b9f5f37195bde067ed4ba72f5e9493ff8cc5951cc491f2513915f644af125","observation_id":"0a7e38af-4132-4b7f-8c47-ce4f2a0758e6","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-11T21:09:01.431209Z","title":"arXiv preprint arXiv:2405.20797 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04179","last_updated":"2026-07-05T08:51:47Z","snapshot_observed_at":"2026-08-13T14:23:34.664037Z","submitted_at":"2026-07-05T08:51:47Z","title":"CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T21:09:01.431209Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2607.04179"},"observation_digest":"sha256:ed43692cdad7bb1a5f68ba38d710cc02e912d78faed4987588709340ebcfd26f","observation_id":"3cfa9f04-8c0d-42f4-9872-845e2e18b834","resolution":{"observed_at":"2026-07-11T21:09:01.431209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-02T06:14:00.278259Z","title":"Ovis: Structural embedding alignment for multimodal large language model.arXiv preprint arXiv:2405.20797, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:00.278259Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:99f1097fcf84e69b63a13bc143fcca25e454dbfddc8cf401762a322a2d6ffe6a","observation_id":"e7c78af9-1734-4328-8a70-714b749a41ad","resolution":{"observed_at":"2026-08-02T06:14:00.278259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-05T04:16:08.332153Z","title":"arXiv preprint arXiv:2405.20797 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04010","last_updated":"2026-08-04T17:59:58Z","snapshot_observed_at":"2026-08-15T09:45:02.472901Z","submitted_at":"2026-08-04T17:59:58Z","title":"ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T04:16:08.332153Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2608.04010"},"observation_digest":"sha256:9c53a732082497a1074d46b1d5595ab852b66f9b528f61c83144a5d6f525c0d2","observation_id":"34d2f83b-6417-421b-976b-1456d15465a3","resolution":{"observed_at":"2026-08-05T04:16:08.332153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-14T04:35:15.914749Z","title":"arXiv:2405.20797 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08630","last_updated":"2026-08-09T10:31:03Z","snapshot_observed_at":"2026-08-17T00:02:01.135216Z","submitted_at":"2026-08-09T10:31:03Z","title":"VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:15.914749Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2608.08630"},"observation_digest":"sha256:0054016b9408bf4f6e195f9215a3c078b2618f045b9663606f9804a79198dcfa","observation_id":"1836c33e-29ea-4d80-8e5c-30e8cb31dd43","resolution":{"observed_at":"2026-08-14T04:35:15.914749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-16T00:29:57.236863Z","title":"arXiv preprint arXiv:2405.20797 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11847","last_updated":"2026-08-12T09:40:21Z","snapshot_observed_at":"2026-08-19T01:13:11.423324Z","submitted_at":"2026-08-12T09:40:21Z","title":"LookBack: Where and How to Score LVLM Responses via Visual Reference Usage","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:29:57.236863Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2608.11847"},"observation_digest":"sha256:3f8c14152e0757368b6cf9be6c256d7aef8706b45e344b26ce5866ec578acaae","observation_id":"99db7e44-8e9e-4f4c-94de-25f2a8a3cad7","resolution":{"observed_at":"2026-08-16T00:29:57.236863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-15T21:04:29.967519Z","title":"Ovis: Structural embedding alignment for multimodal large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12898","last_updated":"2026-08-18T06:14:21Z","snapshot_observed_at":"2026-08-19T06:20:03.706419Z","submitted_at":"2026-08-13T07:34:21Z","title":"NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T21:04:29.967519Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2608.12898"},"observation_digest":"sha256:ca4b8153772bc85081fa305ecbcd0b51bba032a41b88f8358a539f51c621485b","observation_id":"41a3d6da-d642-43e6-9e99-291332c9eaba","resolution":{"observed_at":"2026-08-15T21:04:29.967519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.20797/citation-record","integrity":"/paper/2405.20797/integrity","json":"/paper/2405.20797/citation-record.json","paper":"/paper/2405.20797"},"outbound":[],"paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 90 inbound Pith citation observations for arXiv:2405.20797."}