{"as_of":"2026-08-07T17:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d945900942c6445830a7b222b8b8edde10627156af14fc87e1eca3d98e4bf6f","coverage":[{"denominator":137,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:50:05.568237Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:12:37.339084Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T05:17:18.750827Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.12566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12566","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mono-internvl-1.5: Towards cheaper and faster monolithic multimodal large language models","venue":null,"work_id":"c454767e-76df-46b9-af2d-e54cf575b057","year":2025},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2507.12566","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:014eea322dceb0e8f7183e6241e5c9eba90697888701deb40a3d279fcf163a4d","observation_id":"fe67a2ae-8c0f-4042-abb3-5246f5c6fee4","resolution":{"observed_at":"2026-05-10T11:58:59.202761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.12566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12566","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mono-internvl-1.5: Towards cheaper and faster monolithic multimodal large language models","venue":null,"work_id":"c454767e-76df-46b9-af2d-e54cf575b057","year":2025},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2507.12566","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:e0ec923e5f7b9633e169ec3b416b63358df82fdda42808268d33a6fc0577af5f","observation_id":"85ce1315-55db-4859-9f18-b28e63813223","resolution":{"observed_at":"2026-05-13T05:17:18.752838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12566/citation-record","integrity":"/paper/2507.12566/integrity","json":"/paper/2507.12566/citation-record.json","paper":"/paper/2507.12566"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T16:49:55.260899Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.260899Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:362b57ec5018ba58d04eec2ac9dc635b546a723aa308405f49b46d92dc7a5362","observation_id":"235b395d-36c4-4a87-86a8-8c3e66eb72d8","resolution":{"observed_at":"2026-08-06T16:49:55.260899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T16:49:55.431651Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.431651Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:7611f5b883bf7134301c4c4ae00ca746a617cf5477cf2843fa48fc449de24783","observation_id":"d9774078-184d-4460-83d9-23b4956496b9","resolution":{"observed_at":"2026-08-06T16:49:55.431651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T16:49:55.597995Z","title":"Internlm2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.597995Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:950085ee050ff2a4f3256f085edb80923314aa2c12ec8d1cd0c4d37088067674","observation_id":"b0b86d26-1227-476b-8a16-ea8ab9088e16","resolution":{"observed_at":"2026-08-06T16:49:55.597995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:55.726783Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.726783Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:47cadf0b4d7cffc4a69ced89aaf265ca44dde0182c91734218812031e09f52b6","observation_id":"c183d979-6b75-4a40-bd9a-0dafa73d6666","resolution":{"observed_at":"2026-08-06T16:49:55.726783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:55.834849Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.834849Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:20dd8e5bb00990665ca82bca56c9698ac644f62b1cf9655161a679a19488eaad","observation_id":"e0901f71-40b2-4641-908e-c290254308de","resolution":{"observed_at":"2026-08-06T16:49:55.834849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T16:49:55.905181Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.905181Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:b12fa10777d9eff82c6c75c38a15b19e311126a39e0ccad26549896e1a9da2c0","observation_id":"3ae42cdb-16e2-4436-966e-725c985a3d53","resolution":{"observed_at":"2026-08-06T16:49:55.905181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.005313Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.005313Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:5d2b3eb75e8a24dcd45158533cb280f5081a2580262c733b91eb2123b0fc9f1d","observation_id":"ac57a490-84dc-4135-9514-b86f724a33e8","resolution":{"observed_at":"2026-08-06T16:49:56.005313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.084702Z","title":"Introducing our multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.084702Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:2317c7583e6a08a459fe0d9f4f895bfdce5e84853e80348e9a89d514bc7ece7d","observation_id":"9c7033a1-d62d-4e9a-9189-9f5e541158b9","resolution":{"observed_at":"2026-08-06T16:49:56.084702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T16:49:56.218152Z","title":"Unveiling encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.218152Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:02906f58232096847ba349dbd92486683f7f797779887bd0ca733b1b5d5d80db","observation_id":"31e4b70e-3842-4761-9ffd-58b30ea63fba","resolution":{"observed_at":"2026-08-06T16:49:56.218152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-07-06T18:43:22.614883Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":"2407.06438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-06T16:50:10.233691Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","venue":"cs.CV","work_id":"502d8ac0-31a5-40d6-838e-82597f85a7ea","year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.373596Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c2a539a4df2a0c9e94f079a45c6e13e9f71a19d8e6682a1c63ac37a248ce1c5d","observation_id":"1c525bd1-5ec4-4b4f-9005-06ab4929f066","resolution":{"observed_at":"2026-08-06T16:50:10.351624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.460558Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.460558Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:9f8f9dde54c0fe41c1fd2370fedd77a640ab93875bfd672867aaf57f18625d23","observation_id":"23b62d2c-270b-4f8c-8d6d-96db9f90abcd","resolution":{"observed_at":"2026-08-06T16:49:56.460558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T16:49:56.572596Z","title":"Chameleon: Mixed-modal early-fusion foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.572596Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:4fb8c116f50893daeed4674137d05279b3b80e9d150ca288cc7813c75274882d","observation_id":"d4dfeccd-4672-44a9-8db0-229275532d35","resolution":{"observed_at":"2026-08-06T16:49:56.572596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10313","last_updated":"2023-12-05T08:59:33Z","snapshot_observed_at":"2026-07-06T16:20:21.258653Z","submitted_at":"2023-09-19T04:51:13Z","title":"Investigating the Catastrophic Forgetting in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10313","snapshot_observed_at":"2026-08-06T16:49:56.665670Z","title":"Investigating the catastrophic forgetting in multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.665670Z"},"links":{"cited_paper":"/paper/2309.10313","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:f5950c858eb60cf67f7ee6b154778a043810ec1bcb26fcd1c54935cb3a3bd22c","observation_id":"df089f74-f30b-44f3-a10f-2de6df635cdf","resolution":{"observed_at":"2026-08-06T16:49:56.665670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06904","last_updated":"2022-03-15T01:22:04Z","snapshot_observed_at":"2026-08-04T10:39:03.604973Z","submitted_at":"2022-03-14T07:56:32Z","title":"Delta Tuning: A Comprehensive Study of Parameter Efficient Methods for Pre-trained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06904","snapshot_observed_at":"2026-08-06T16:49:56.785510Z","title":"Delta tuning: A comprehensive study of parameter efficient methods for pre-trained language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.785510Z"},"links":{"cited_paper":"/paper/2203.06904","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3aeee1f50b87055634c7b4aa7be94dd781ab4c5fd87d5466f2553674e7e0935d","observation_id":"2cffd4b2-6780-4103-aa7f-85eca601f8e6","resolution":{"observed_at":"2026-08-06T16:49:56.785510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T16:49:56.896912Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.896912Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3d124ce9b776c01a5e2c6fbe71c84f057e051129478e13647ceee4d0c24fed6a","observation_id":"73aee5ed-f683-4926-a808-79f3ecb4aa9b","resolution":{"observed_at":"2026-08-06T16:49:56.896912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.999030Z","title":"Lima: Less is more for alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.999030Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:0a3f32af3a44ee022b62597a61ce11eb66e3e92e296f4397fe2205e977bcc1f5","observation_id":"93868ee2-dba0-452c-8fd9-2d19ae9d9976","resolution":{"observed_at":"2026-08-06T16:49:56.999030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T16:49:57.069428Z","title":"Emu3: Next-token prediction is all you need,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.069428Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3fc175ea5e0b83f65861ca850c1fd7369bffc4758c961e0c8c698de82589a68b","observation_id":"27ad4242-fc85-46d9-a397-83c596813eed","resolution":{"observed_at":"2026-08-06T16:49:57.069428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-06T16:49:57.153253Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.153253Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:a413b21c2ecbfbb7bd444798ac41e0db92f8a8cdfcec10ed398a1c57d3b4de67","observation_id":"901c8ced-76a7-47a9-93e0-abdc860ade0e","resolution":{"observed_at":"2026-08-06T16:49:57.153253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T16:49:57.248846Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.248846Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8b3f15cc63fd1fb78ae267cc8f695d5fc1f0b50382a1248de01e3704766dd2c3","observation_id":"4c338e29-89b5-40fe-980e-4969d4907720","resolution":{"observed_at":"2026-08-06T16:49:57.248846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T16:49:57.353167Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.353167Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:62969d5afac06207681856e019227032737d9c9bf915457d0b559b258bad4b47","observation_id":"220026a1-5a60-44c4-8099-462afadca072","resolution":{"observed_at":"2026-08-06T16:49:57.353167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T16:49:57.463091Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.463091Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:f0824d1c35c0ebe627b2882ca8753b8428c00bc465f26471eeca38253172214d","observation_id":"0f625dc8-cdfc-42c1-9448-9668a4a65cfd","resolution":{"observed_at":"2026-08-06T16:49:57.463091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07783","last_updated":"2025-01-14T01:57:41Z","snapshot_observed_at":"2026-07-06T20:20:42.084970Z","submitted_at":"2025-01-14T01:57:41Z","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","version":1},"cited_work":{"arxiv_id":"2501.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.07783","snapshot_observed_at":"2026-08-06T16:50:09.964594Z","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","venue":"cs.CV","work_id":"aaeefb6d-84e6-4a1a-9fdf-f3d93d52d694","year":2025},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.683627Z"},"links":{"cited_paper":"/paper/2501.07783","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:88008221288b63e7777d93f0b7dc3d9a83a536f5c48dd5cf543609b9c978d62c","observation_id":"cc75399e-c724-46e9-8338-dbd706c97401","resolution":{"observed_at":"2026-08-06T16:50:10.051759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-05T15:59:28.924210Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-06T16:49:57.751825Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.751825Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:9afab051b10c54511f687bd947ddd843cb5bfd600175f78b0ad2f8ea41bbf97d","observation_id":"718b4b77-42d6-4f16-baa8-b702afb4b3c8","resolution":{"observed_at":"2026-08-06T16:49:57.751825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:57.862972Z","title":"BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.862972Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:5b25162807f65c03a3ed5521abd199744fb22fa672f18df6a32c739d4b56b78c","observation_id":"f5a625a0-61af-40c6-b69e-ed10033673fa","resolution":{"observed_at":"2026-08-06T16:49:57.862972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:57.985266Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.985266Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8467b8dec5d63cac0753539ed4328f9ea93263953efe1a695c50ab6faa2c0105","observation_id":"b6ab71c8-d911-40a6-8d89-4ef5fba23175","resolution":{"observed_at":"2026-08-06T16:49:57.985266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.074139Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.074139Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:202d64e290f3c8f24064b4204e9b473ae071ebea1cc51c03623918dcbf5e7f8b","observation_id":"dab453f1-892f-41b9-9259-186e59988c55","resolution":{"observed_at":"2026-08-06T16:49:58.074139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T16:49:58.168347Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.168347Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c50289270edd2a98fa10de6d184100ae2dbe98d22474a92efa4b11b91b466492","observation_id":"f68fdac2-7f06-4dfa-a0b8-6f5c56f104dd","resolution":{"observed_at":"2026-08-06T16:49:58.168347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T16:49:58.311277Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.311277Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ac9791658a1f5ba4d78da01fe79ca5e5c855b3be442271d31b618710d5d821ec","observation_id":"df391df8-6293-45c1-b131-2b8d35f1e3a7","resolution":{"observed_at":"2026-08-06T16:49:58.311277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T16:49:58.390094Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.390094Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:a3f924b5fae97d584060c5666257c00eda7a86a66b335bfd6cee2ff08f05735b","observation_id":"202f1580-fc12-439a-8af0-3029d2195b70","resolution":{"observed_at":"2026-08-06T16:49:58.390094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-06T16:49:58.597304Z","title":"Enhancing the reasoning ability of multimodal MONO-INTERNVL-1.5 14 large language models via mixed preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.597304Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:df857cde1fdf8c143ee2ece021abb13c2c78cf58335d2c6edf2ca0242e2f771d","observation_id":"871361c5-bde1-4422-8f1b-ebb842a6a0b1","resolution":{"observed_at":"2026-08-06T16:49:58.597304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.697634Z","title":"Mini-internvl: a flexible-transfer pocket multi-modal model with 5% parameters and 90% performance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.697634Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:db6529866ad7f46827bcb026967a313c6b32c6863ba4c793f11d31b61b94fd82","observation_id":"8eba6607-61ef-454b-a467-b2be0c2d9381","resolution":{"observed_at":"2026-08-06T16:49:58.697634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T16:49:58.800042Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.800042Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c2cb40510b1d14f9e1267cdf76947eaf1b8a9e55838cf535df9547f79cf9c125","observation_id":"63a1e2a6-3313-4851-9e28-bdd64ec2e4a3","resolution":{"observed_at":"2026-08-06T16:49:58.800042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T16:49:58.881346Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.881346Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:27d392dc47936a0a51b1e5f0d2a90885640ff820292bdb531a6c05ecf471415d","observation_id":"730f0235-ff65-47e0-b3e4-822e238e42da","resolution":{"observed_at":"2026-08-06T16:49:58.881346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.977983Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.977983Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ce15c728dbea8916bdcd195e85d386215a4da52551d9f2223bdcfec8e045dd32","observation_id":"0244e7a9-46d2-49e3-86a4-682e461f0b46","resolution":{"observed_at":"2026-08-06T16:49:58.977983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T16:49:59.055806Z","title":"Show-o: One single transformer to unify multimodal understanding and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.055806Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:148a4a0341658b3d0fa10641c33d59172ce695298be47f3222494fad32d477b0","observation_id":"7e7d78cb-6aef-4d4a-8d55-1fea0f4b1312","resolution":{"observed_at":"2026-08-06T16:49:59.055806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-06T16:49:59.135515Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.135515Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:9cc4ed6b721f8b914d792ec144279b2bb46b88021e0eeda33723f21cee49bdb1","observation_id":"bed0b7ad-391e-4c43-bca4-ac6c35dda569","resolution":{"observed_at":"2026-08-06T16:49:59.135515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.224871Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.224871Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:59e247996f59a31ca50a9a817326c2bfb0cc774af26cb10baf0b25e6f9519414","observation_id":"2dde65db-d26c-4439-b13c-a083fc6b3b8d","resolution":{"observed_at":"2026-08-06T16:49:59.224871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-07-06T13:44:15.000595Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-06T16:49:59.336128Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.336128Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:7362a72390baca00f9cdf6095b73ec711fda62260d732b021a5df86cb68e9228","observation_id":"1fe92c26-84cd-40aa-97f4-5e7386379e26","resolution":{"observed_at":"2026-08-06T16:49:59.336128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07226","last_updated":"2023-03-13T16:00:31Z","snapshot_observed_at":"2026-07-06T15:02:40.704180Z","submitted_at":"2023-03-13T16:00:31Z","title":"Scaling Vision-Language Models with Sparse Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07226","snapshot_observed_at":"2026-08-06T16:49:59.424967Z","title":"Scaling vision-language models with sparse mixture of experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.424967Z"},"links":{"cited_paper":"/paper/2303.07226","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c8e88ab932badfb9afa2959e6a76cddf6cf370f0f15200e407df728afdc364d0","observation_id":"3e3f5af5-d0c2-4d93-89e5-8a1fe41310a5","resolution":{"observed_at":"2026-08-06T16:49:59.424967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.548683Z","title":"Twenty years of mixture of experts,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.548683Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3c7c6ce2620c26488a3ace42244cb7c785e9226e741eb9abd8c4247a26e45a4c","observation_id":"f5284dae-5a57-4d0b-9d5d-eb743de78905","resolution":{"observed_at":"2026-08-06T16:49:59.548683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21770","last_updated":"2024-08-12T16:20:37Z","snapshot_observed_at":"2026-08-05T03:21:07.285265Z","submitted_at":"2024-07-31T17:46:51Z","title":"MoMa: Efficient Early-Fusion Pre-training with Mixture of Modality-Aware Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21770","snapshot_observed_at":"2026-08-06T16:49:59.656307Z","title":"Moma: Efficient early-fusion pre-training with mixture of modality-aware experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.656307Z"},"links":{"cited_paper":"/paper/2407.21770","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:e1799cc1ec7160dbbde84e71e7fb850907593c33cf6c3a63dd163f6c27b60a7e","observation_id":"0a5d6262-037d-431e-83b5-cee3b08144d0","resolution":{"observed_at":"2026-08-06T16:49:59.656307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-06T16:49:59.760100Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.760100Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:07cb482e77023cb4632800cf00f25ec81e151d77b18526cb90ed0c3612416f5c","observation_id":"fc70db5e-76e7-4e1b-af06-22a874c99c41","resolution":{"observed_at":"2026-08-06T16:49:59.760100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T16:49:59.827141Z","title":"Aria: An open multimodal native mixture-of- experts model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.827141Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ee9dc8d8ac8fc77590d22f60cd6d3ba4b2f88c7778498c036ad7aed25a17074b","observation_id":"5512c647-879c-48fd-b611-5cd6e6d1ced4","resolution":{"observed_at":"2026-08-06T16:49:59.827141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.936912Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.936912Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:6f14a7c3f6522f3ecd7c6c3fce23546ecc328dc5133ee0b849995724a7caabf0","observation_id":"855a26ff-2ca3-4c63-a529-07a4d654281f","resolution":{"observed_at":"2026-08-06T16:49:59.936912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.080685Z","title":"Root mean square layer normalization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.080685Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3d260df1711690475d2c6fb8b1b82d5b2650053bf65acb8856b5ee7c966d3de9","observation_id":"eb7f29c9-3b3a-430d-98aa-32245d0eae88","resolution":{"observed_at":"2026-08-06T16:50:00.080685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.195147Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.195147Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:849e5c0cd5337a8341b8a8a148209e9520f41758daff5737981790bda05d59d1","observation_id":"3cec4baf-2c06-4943-b6c5-51583007169e","resolution":{"observed_at":"2026-08-06T16:50:00.195147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.302668Z","title":"Coyo-700m: Image-text pair dataset,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.302668Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:6c4a8ad761b6901097ca2529a8dfc3b8fb9e6303831f251a93d7c5a0b7ca40f6","observation_id":"7cdd1300-3cee-46af-9e71-46005c45e6b0","resolution":{"observed_at":"2026-08-06T16:50:00.302668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T16:50:00.388194Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.388194Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:0d5924d2ec4f320a589a1614216fe0ffc2037aae0c1237e0b6282fa8436b6085","observation_id":"55bf65fe-a0b4-424d-a3f3-aa0da6d66bbf","resolution":{"observed_at":"2026-08-06T16:50:00.388194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T16:50:00.517198Z","title":"Kosmos-2: Grounding multimodal large language models to the world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.517198Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:78289d83688429e52fb2f499ba300c91c8af51b647ac5b35cfa7e9f13922f5f2","observation_id":"b8d07cf3-fba4-4f8d-9360-55cb2ec9d4a8","resolution":{"observed_at":"2026-08-06T16:50:00.517198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T16:50:00.619189Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.619189Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8a1bc6abbb1181593924d2d542039a13ac609f2e76704b222ee72714438e26df","observation_id":"ffe36186-4645-44ad-8511-f3eb6f815ab9","resolution":{"observed_at":"2026-08-06T16:50:00.619189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.734000Z","title":"Textcaps: A dataset for image captioning with reading comprehension,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.734000Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:cd436668494a4275498d215aee47eac3aee1ade646404275a49d9a99972cbfcf","observation_id":"712be2aa-2719-4a1b-b345-2678d7220474","resolution":{"observed_at":"2026-08-06T16:50:00.734000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.805492Z","title":"Objects365: A large-scale, high-quality dataset for object detection,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.805492Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:a1b21d8a45243d1f80b02c6443ffa2983a3b0b983867eacb6a343c758e1b8871","observation_id":"86908a5d-546f-45a5-9e28-ddc473bd2a39","resolution":{"observed_at":"2026-08-06T16:50:00.805492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.874286Z","title":"The all-seeing project: Towards panoptic visual recognition and understanding of the open world,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.874286Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:052b06ad0273c58bf0a11c5050b6a08f57eba2529bc0258a0aecf595c0ee1411","observation_id":"776abb4f-f5de-465b-9e53-745ae1e26aa0","resolution":{"observed_at":"2026-08-06T16:50:00.874286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.947847Z","title":"Wukong: A 100 million large-scale chinese cross-modal pre-training benchmark,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.947847Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:281069267600190dac77c45f42a34cdb36008cd7398bbb7869f3f44c0959ca12","observation_id":"ba30b0f4-3e61-476c-b798-e2e44d305b27","resolution":{"observed_at":"2026-08-06T16:50:00.947847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.031594Z","title":"Laion coco: 600m synthetic captions from laion2b-en","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.031594Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3c5828067b7ee12a900108a4264066b8c0a7cbc403f3cc6f77c22d6c41bbc058","observation_id":"a0b97b9e-f3a1-473d-bb14-7c57e43644a3","resolution":{"observed_at":"2026-08-06T16:50:01.031594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10774","last_updated":"2024-04-15T15:48:48Z","snapshot_observed_at":"2026-07-06T16:49:13.099946Z","submitted_at":"2023-11-15T23:36:42Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10774","snapshot_observed_at":"2026-08-06T16:50:01.162563Z","title":"Mmc: Advancing multimodal chart understanding with large- scale instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.162563Z"},"links":{"cited_paper":"/paper/2311.10774","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:b8f551e935abd933e15be1e7619a9d653e2e6546ee95b385d55004b5d0648b2d","observation_id":"4ea5e301-bf72-41f3-ab76-9789c6925236","resolution":{"observed_at":"2026-08-06T16:50:01.162563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.240559Z","title":"Icdar 2019 competition on large-scale street view text with partial labeling-rrc-lsvt,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.240559Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:46cea1cae8d1e5bc2de7b836dfa157372eb0bde590cf6c07df89eccb30fea029","observation_id":"d2e3ed08-d8f3-43f3-a7ca-f6d5c4d79193","resolution":{"observed_at":"2026-08-06T16:50:01.240559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.315416Z","title":"Scene text visual question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.315416Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d23e455edcca229f4d81e2567bf0e91c5f196cca193169d8a4c3a78d4e5e56a5","observation_id":"4912a34c-18da-4fa0-97a8-d82f53569c69","resolution":{"observed_at":"2026-08-06T16:50:01.315416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.390445Z","title":"Icdar2017 competition on reading chinese text in the wild (rctw-17),","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.390445Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3ba796eff7925e6417804a2ae1187c2009b279ad03cbd3df344d8699715101ac","observation_id":"c7493250-004c-4ba9-b345-df73855b3bcb","resolution":{"observed_at":"2026-08-06T16:50:01.390445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.495683Z","title":"Icdar 2019 robust reading challenge on reading chinese text on signboard,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.495683Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:4a2851695fc0ad95513cb57565341e10aa55659ca1b72bfb9beb7ad1fe7b8ac2","observation_id":"66f3aa88-0aee-4f2e-bd2b-d4dffbf4ddec","resolution":{"observed_at":"2026-08-06T16:50:01.495683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.578838Z","title":"Icdar2019 robust reading challenge on arbitrary- shaped text-rrc-art,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.578838Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:6289ec04e1718be51f1ae36aca18a45d6db8f6ad95068d0f1f208389d6611f50","observation_id":"b330ee7f-0072-4b50-895e-b9ee0691b6ea","resolution":{"observed_at":"2026-08-06T16:50:01.578838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.712181Z","title":"Ocr-free document understanding transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.712181Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ed14a4035a68b2af5a2b3e65db15a47ca5f5fc384e0105bef94615294a3709ce","observation_id":"3756c26d-5fd7-4b25-929a-db601c9dbe4f","resolution":{"observed_at":"2026-08-06T16:50:01.712181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-06T16:50:01.817911Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.817911Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:7616711d520ec6edb9370f2c634cefc391675b62998e360f142038b5de84fc1d","observation_id":"0ec19cce-6c0a-4f41-be1e-fd52bd161f61","resolution":{"observed_at":"2026-08-06T16:50:01.817911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.924520Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.924520Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:aa53af5dcdcb0af2cf42562b17ff35db0276487cee90a6a75c4164af2db35d2f","observation_id":"7c8d6861-01c7-4da6-9a3c-1890fc2068bc","resolution":{"observed_at":"2026-08-06T16:50:01.924520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.002148Z","title":"A large chinese text dataset in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.002148Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:efb779830b48e8b78fb95614ceed11484beedfa313ce9c47fcf60d0d758fc59f","observation_id":"61e6366c-974c-407f-8fcb-4b8263ade4fe","resolution":{"observed_at":"2026-08-06T16:50:02.002148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.099560Z","title":"Simple and effective multi-paragraph reading comprehension,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.099560Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:30ce9c1f2f1dabcb0504c9eb653dde9697fc3ea98e09dd9b512cfa0115970b4a","observation_id":"d043d554-ecdf-429c-88da-cf42cc6088d7","resolution":{"observed_at":"2026-08-06T16:50:02.099560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.203648Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.203648Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ffdc25f80b34a3b2776826bf0314504f88cc74bdc281f0df64f9a03a3cf70c4a","observation_id":"0b0c7140-c968-45e5-a601-f6060c883f63","resolution":{"observed_at":"2026-08-06T16:50:02.203648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.320729Z","title":"Plotqa: Reasoning over scientific plots,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.320729Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:6644c5853cd3d89163f14ec9a66f5fb2961e9374edfec73e681bbe7f7ba07bf3","observation_id":"07cde5a0-af22-42d9-a8cd-9c43ab5f7c76","resolution":{"observed_at":"2026-08-06T16:50:02.320729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.423626Z","title":"Infographicvqa,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.423626Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:e32ed482c9af1e85e8131921fedf9f2fce16ee78afb50f64fcda6424d30a17ce","observation_id":"c83be487-e7ae-427b-bf7a-9f520ec9f738","resolution":{"observed_at":"2026-08-06T16:50:02.423626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.536884Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.536884Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8cb383358a8d651bcb96b5d54a7151fc1394020fd63bf4b0c108ea857a819add","observation_id":"66675f87-dc47-41fa-b6ab-4ab661215fed","resolution":{"observed_at":"2026-08-06T16:50:02.536884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.641238Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.641238Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d0da97d1e1d78ca4f78db8f8c7acafd363273bfea409c97fb168a24a83db620d","observation_id":"546425af-4490-472f-8619-4c156080f53f","resolution":{"observed_at":"2026-08-06T16:50:02.641238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.746998Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.746998Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:0fc4f609d0d5963c3e0b568bbc3d720e52c9fbdee209cd18a94a9989231dfc27","observation_id":"f900c643-6726-47c9-aa9f-549eb9f80e8f","resolution":{"observed_at":"2026-08-06T16:50:02.746998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.852857Z","title":"Visual spatial reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.852857Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:a905a3dd84aecd945f484ae2e7ca485a2db9d1d1f99e2aac430e6a419d3c5678","observation_id":"2bc39bd7-4222-4de2-9972-5cd6c418f854","resolution":{"observed_at":"2026-08-06T16:50:02.852857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.963424Z","title":"Visual dialog,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.963424Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:416745494c1c5fd139b5e26f91dcac0d86041de350857a1d44ab3f02597dc655","observation_id":"d9264504-9076-436e-8b1e-bc1716e767a3","resolution":{"observed_at":"2026-08-06T16:50:02.963424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.027579Z","title":"A diagram is worth a dozen images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.027579Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:60486c40c9b9beaebbfd2e7f9f8b7df42bea3e0e617217a64a1889d9f6dc39a5","observation_id":"eeba70c5-126f-4a87-bc5f-c70595bee6fd","resolution":{"observed_at":"2026-08-06T16:50:03.027579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.153797Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.153797Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:7cd7dd6d1b321edd7446a9ca87c700f7daa15490f4f60a831daaca0ff104bd89","observation_id":"c19cef38-137e-4204-beaa-d73fa8976722","resolution":{"observed_at":"2026-08-06T16:50:03.153797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.236776Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.236776Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:974ea35b812c2dc8da2d7e67eb7a22b9ad34ffe7b570c5a682139965d3279af9","observation_id":"4b270660-b3fa-4df9-b4fd-4cbb7a7e6ffd","resolution":{"observed_at":"2026-08-06T16:50:03.236776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.384359Z","title":"Dvqa: Understanding data visualizations via question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.384359Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:30cd50e87e184a1ad462031127788e4cbd2c236f570baaa9478b4c38f02a978c","observation_id":"28539a3e-357e-43f1-a2e4-1a229e7f10a5","resolution":{"observed_at":"2026-08-06T16:50:03.384359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-06T16:50:03.529613Z","title":"Aligning large multi-modal model with robust instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.529613Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:839f837a14f7bb6e62b79aabd77be3609d52c9921410de2c57549c7811831324","observation_id":"3f8cb091-aeeb-40d2-97cc-477d8c8b0a9f","resolution":{"observed_at":"2026-08-06T16:50:03.529613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.654147Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.654147Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:b6c957cbde62888f3e4f1d3c2375ba0f2f2eef71feb49796f962eb00caf60edf","observation_id":"7382f2c5-4d5a-431e-bb17-b95211031b07","resolution":{"observed_at":"2026-08-06T16:50:03.654147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-07T02:52:46.435647Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-06T16:50:03.783517Z","title":"Dynamic prompt learning via policy gradient for semi- structured mathematical reasoning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.783517Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ce4d27c0b64f6f9cd29c7f5017b36e62424d590dbee95d8924a25fbdca0c2541","observation_id":"f8b413f7-7d5a-45e3-8655-2a7e0c828785","resolution":{"observed_at":"2026-08-06T16:50:03.783517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-06T16:50:03.926291Z","title":"Metamath: Bootstrap your own mathematical questions for large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.926291Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d58a586c3252c863f53ee1acde55d4bfd151d5fd66ac7e10829d249384c7d727","observation_id":"33c867b7-c587-4172-a55b-d3a85925e403","resolution":{"observed_at":"2026-08-06T16:50:03.926291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-07-06T13:40:38.776164Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-06T16:50:04.072385Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.072385Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:38a06fdbc6701e1c4e99947c0524261c87a62fb01265866a63c99ef96381985c","observation_id":"65f50570-1ed8-4434-a038-0a613d7da31b","resolution":{"observed_at":"2026-08-06T16:50:04.072385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.211430Z","title":"Super-clevr: A virtual benchmark to diagnose domain robustness in visual reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.211430Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:eca29babcdcb44d0721c8c6696c430559c6ebb217ffb02fda1717c786774e25c","observation_id":"26aebb84-91f1-4696-a69d-57638124a7e8","resolution":{"observed_at":"2026-08-06T16:50:04.211430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-06T16:50:04.330336Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.330336Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:57248f4001c0c63b8b7efe6e40238d0a069745f84bcd564f3d5fa71acfdb81c2","observation_id":"3eaa7f89-402a-4e8d-bff3-c1d1320a9647","resolution":{"observed_at":"2026-08-06T16:50:04.330336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.443260Z","title":"Kvqa: Knowledge- aware visual question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.443260Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:b2483a9e7151a1378566c66ac0be734073f49a5ce1f0c83c3adca4166b6e637d","observation_id":"9408ddf6-13f9-46d8-9640-f0bca390a041","resolution":{"observed_at":"2026-08-06T16:50:04.443260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.560616Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.560616Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:e4707d5371dd6c2ce2aaa338d63037de0bcb1caceeff8cd26fcc5e0e84deb324","observation_id":"e2063723-1016-463b-a2ca-3d5ac2691921","resolution":{"observed_at":"2026-08-06T16:50:04.560616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.660448Z","title":"Viquae, a dataset for knowledge- based visual question answering about named entities,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.660448Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:f0332073cb9ef19b55ca82ce62022853b5ce8c8016af0974e7ab9cc9490ce88e","observation_id":"197b7174-653d-4cb5-9496-32b7ee46a3a6","resolution":{"observed_at":"2026-08-06T16:50:04.660448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10755","last_updated":"2023-09-15T09:52:14Z","snapshot_observed_at":"2026-07-06T16:08:33.160103Z","submitted_at":"2023-08-21T14:40:48Z","title":"WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10755","snapshot_observed_at":"2026-08-06T16:50:04.722409Z","title":"Wanjuan: A comprehensive multimodal dataset for advancing english and chinese large models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.722409Z"},"links":{"cited_paper":"/paper/2308.10755","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:5aa9409a46b67e9f866c6743afac335b3f7419835267ed9e25575d515bf1cfef","observation_id":"3d17bb68-d896-410f-921f-b62d7d2c94aa","resolution":{"observed_at":"2026-08-06T16:50:04.722409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.785021Z","title":"Ocr-vqa: Visual question answering by reading text in images,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.785021Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:caef25dc15f1659e03ad7de6dcf028958b9a0349997ae559a4d41ec1754d1a40","observation_id":"7cb3cda1-178f-4ead-a61f-9f8600364ab3","resolution":{"observed_at":"2026-08-06T16:50:04.785021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.861787Z","title":"Towards VQA models that can read,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.861787Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:83e602e5b770dc9986ecda480cabe8e958be6a090d51bdd39376002af3e140c0","observation_id":"b50417c2-8ed8-42df-b13a-983ad4fd2128","resolution":{"observed_at":"2026-08-06T16:50:04.861787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.943013Z","title":"Modeling context in referring expressions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.943013Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:6e61bc9c420a5f715db80c0e82f019f08ce471156353c084b89eb5cf87f06cdd","observation_id":"581d54b1-e307-452a-bfe9-6335283eaa70","resolution":{"observed_at":"2026-08-06T16:50:04.943013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.027353Z","title":"Generation and comprehension of unambiguous object descriptions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.027353Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c514f9f57e231c0f6be4745ea27fee6afd62235a608bf38fb04ed3b22f26e85f","observation_id":"8f850fd4-aafe-4cb7-9acd-c1616efcf848","resolution":{"observed_at":"2026-08-06T16:50:05.027353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.105073Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.105073Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:59bd20bfe2ca2108630113ea881f7908bcbdf639ba51fbbcaf674ead231667f3","observation_id":"ed4402f5-07e4-43c4-bc10-7c2124596bd3","resolution":{"observed_at":"2026-08-06T16:50:05.105073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-06T16:50:05.174737Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.174737Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:e6d1f952acb0bf616f2c2b6c1090b08b0598dc96c2c77087b9aaa032f04b6a73","observation_id":"b970ecbc-9311-4a1b-bd3c-f83feadd74b4","resolution":{"observed_at":"2026-08-06T16:50:05.174737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T16:50:05.268162Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.268162Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:05bab3a984b03198d007f0a818c15cc1c53ecb7b7e8573378d7c16b111031206","observation_id":"244696a9-e355-4869-9b6a-18fa1cf73075","resolution":{"observed_at":"2026-08-06T16:50:05.268162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.335533Z","title":"Gpt-4v dataset,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.335533Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:cff8d937997c532bee0d0553764a06fc84446f2a24620a8e2ad5d368972c282d","observation_id":"65664252-de60-4c8d-b58a-736bf1bdcfb6","resolution":{"observed_at":"2026-08-06T16:50:05.335533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.406294Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.406294Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8c377cae19ab80dd2a454a3488353479b78f9e5004ac9db3c5da619ee9b12419","observation_id":"6d38fdb5-0f7b-4210-b379-69b149ae4558","resolution":{"observed_at":"2026-08-06T16:50:05.406294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-06T16:50:05.494156Z","title":"SVIT: scaling up visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.494156Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8c2cad6626c8020495a4e551e47f5fb284b90b4e1b64df67b758e5a3fbaa95c2","observation_id":"d86c7702-3db9-44f1-ab53-65377a19e076","resolution":{"observed_at":"2026-08-06T16:50:05.494156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.568237Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.568237Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c194f17f0351d7a44b76e80cdb341079504d7e1b9c5c7995bf7d6390a1d1acaf","observation_id":"24e6065c-6e91-4ccd-ade8-cada6d4633bf","resolution":{"observed_at":"2026-08-06T16:50:05.568237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T02:53:11.371837Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":137},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 137 outbound references and 2 inbound Pith citation observations for arXiv:2507.12566."}