{"as_of":"2026-08-18T08:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e73c2ff7de24720d904028094ed086c996c4a367b2a4b10fe7a53e1bcfbed1ff","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:10:19.297675Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:46:40.770467Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T09:45:39.600613Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":"2501.05901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-07-01T09:45:39.600613Z","title":"arXiv preprint arXiv:2501.05901 , year=","venue":null,"work_id":"cfe7ad7b-06b2-4b4c-bda0-2f18a886c151","year":2025},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:b76e9946c1c360e53619cbcb7f8f30f0a6ed6d5742f7d01b3b6472fc5faca664","observation_id":"e1190d8e-f3dd-4f60-b6ae-010722314397","resolution":{"observed_at":"2026-05-11T01:20:00.119265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-16T11:46:40.770467Z","title":"Valley2: Exploring multimodal models with scalable vision-language design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14693","last_updated":"2025-05-02T22:30:26Z","snapshot_observed_at":"2026-08-18T02:26:00.733954Z","submitted_at":"2025-04-20T17:58:46Z","title":"Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark","version":2},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-08-16T11:46:40.770467Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2504.14693"},"observation_digest":"sha256:ac5f284026e2d99d6688c324cd97109d7bd07d665e59ec051564d76aef51719a","observation_id":"5a16af12-89a8-4a63-b999-feeecd9dd16e","resolution":{"observed_at":"2026-08-16T11:46:40.770467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-16T05:12:18.597250Z","title":"arXiv preprint arXiv:2501.05901 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21277","last_updated":"2025-05-21T06:08:31Z","snapshot_observed_at":"2026-08-16T05:05:38.872147Z","submitted_at":"2025-04-30T03:14:28Z","title":"Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models","version":2},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-16T05:12:18.597250Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2504.21277"},"observation_digest":"sha256:620b4a1cd6ba05f2f767df10c53f9238dcb6cd5918ded378d6e13a04dca4525f","observation_id":"8ea8ea45-ee51-4ca6-b8c8-5614187626ea","resolution":{"observed_at":"2026-08-16T05:12:18.597250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-07T15:01:33.718044Z","title":"Valley2: Exploring multimodal models with scalable vision-language design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-14T06:35:02.186457Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:33.718044Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2505.16673"},"observation_digest":"sha256:316049de6fec4c9d640bfc15cfa18c83e59d535bf8a8eb5321d6d66880d5e87b","observation_id":"bf167009-ab5c-4182-90d0-627fb751f613","resolution":{"observed_at":"2026-08-07T15:01:33.718044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-07T11:55:14.123082Z","title":"Valley2: Exploring multimodal models with scalable vision-language design.arXiv preprint arXiv:2501.05901, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-17T06:45:11.512822Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.123082Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:450823bc64d14e1121a4b170e47904302660f0ede035b6f865b6c2c0787abc82","observation_id":"f7ffcbb5-699a-45e6-a7b4-69e78ef5f9e6","resolution":{"observed_at":"2026-08-07T11:55:14.123082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-07T04:07:34.362773Z","title":"Valley2: Exploring multimodal models with scalable vision-language design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-14T21:22:01.870216Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.362773Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:92e824a5050f54aeec1787c55715928bf49e09725c9e4a12108db84b0bfdb922","observation_id":"1165e788-0faf-4ce7-b2d3-b886ed25850a","resolution":{"observed_at":"2026-08-07T04:07:34.362773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-06T13:57:07.467028Z","title":"Valley2: Exploring multimodal models with scalable vision- language design","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19891","last_updated":"2025-07-30T04:47:07Z","snapshot_observed_at":"2026-08-13T01:18:54.619286Z","submitted_at":"2025-07-26T09:43:09Z","title":"Interpretable Open-Vocabulary Referring Object Detection with Reverse Contrast Attention","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:07.467028Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2507.19891"},"observation_digest":"sha256:39ec06a8f73ede8cbc7f170a303580f71351f85a102e317450152f365ff8d139","observation_id":"baa7f74c-5f0a-411f-8950-4950baa3dbff","resolution":{"observed_at":"2026-08-06T13:57:07.467028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-03T05:06:46.616733Z","title":"Valley2: Exploring multimodal models with scalable vision-language design","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-16T18:19:41.283950Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:46.616733Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:1e6f135b3bec5cada86428645eaf65b70189b81225b94bfb1f071c1e303e03e7","observation_id":"a8d4a86e-227e-4eb6-b32a-43cb1ac76d0b","resolution":{"observed_at":"2026-08-03T05:06:46.616733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":"2501.05901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-07-01T09:45:39.600613Z","title":"arXiv preprint arXiv:2501.05901 , year=","venue":null,"work_id":"cfe7ad7b-06b2-4b4c-bda0-2f18a886c151","year":2025},"citing_paper":{"arxiv_id":"2605.01278","last_updated":"2026-05-06T13:38:25Z","snapshot_observed_at":"2026-08-16T12:21:05.912110Z","submitted_at":"2026-05-02T06:25:48Z","title":"Valley3: Scaling Omni Foundation Models for E-commerce","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-09T14:53:55.160230Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2605.01278"},"observation_digest":"sha256:ce075c74b2bd7bbf549da5b955b267601edb0269e54fce878cb6ca5f5548eff6","observation_id":"81c2255b-4e49-474f-8c34-793f6145de02","resolution":{"observed_at":"2026-05-11T16:51:06.067123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":"2501.05901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-07-01T09:45:39.600613Z","title":"arXiv preprint arXiv:2501.05901 , year=","venue":null,"work_id":"cfe7ad7b-06b2-4b4c-bda0-2f18a886c151","year":2025},"citing_paper":{"arxiv_id":"2606.31187","last_updated":"2026-06-30T06:16:17Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T06:16:17Z","title":"Learning to Deny: Action Denial in Multimodal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-01T06:21:09.996386Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2606.31187"},"observation_digest":"sha256:8b148526e70407f4a3c3f3d5f71a69054b81065ae48d54aa62052fa8c7736e1b","observation_id":"8097c691-8871-4976-a9d6-5017b52998cc","resolution":{"observed_at":"2026-07-01T09:45:39.602043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05901","snapshot_observed_at":"2026-08-14T04:35:49.025460Z","title":"arXiv preprint arXiv:2501.05901 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08622","last_updated":"2026-08-09T10:09:11Z","snapshot_observed_at":"2026-08-17T08:04:08.294971Z","submitted_at":"2026-08-09T10:09:11Z","title":"VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-08-14T04:35:49.025460Z"},"links":{"cited_paper":"/paper/2501.05901","citing_paper":"/paper/2608.08622"},"observation_digest":"sha256:1cb5bc671ae03b6e784f0738ce83b15e4e619b143a94f88f2aaad1c5bfd0da15","observation_id":"de51de91-1470-4da0-9212-b98ff718d6b0","resolution":{"observed_at":"2026-08-14T04:35:49.025460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05901/citation-record","integrity":"/paper/2501.05901/integrity","json":"/paper/2501.05901/citation-record.json","paper":"/paper/2501.05901"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.12440","last_updated":"2018-10-31T18:32:07Z","snapshot_observed_at":"2026-08-14T18:07:28.357002Z","submitted_at":"2018-10-29T22:29:45Z","title":"TallyQA: Answering Complex Counting Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12440","snapshot_observed_at":"2026-08-10T21:10:18.841141Z","title":"Tallyqa: Answering complex counting questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.841141Z"},"links":{"cited_paper":"/paper/1810.12440","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:f69c30dbf041660a658c30768bb931b8381b040c49504f52afd5c7e207ec583d","observation_id":"ab615871-4096-4225-9695-e5944592ab1c","resolution":{"observed_at":"2026-08-10T21:10:18.841141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T21:10:18.847175Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.847175Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:ad0f103c548ab6d98ee90d2a8efe1626cb1312ed7a08eb531c7f76bd44d554aa","observation_id":"b513fdf7-c303-4b95-a45f-7b65ffcb9363","resolution":{"observed_at":"2026-08-10T21:10:18.847175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.852430Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.852430Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:014427c293d8fd819986087157a8902f8c33877e112ca36b0edbf9b77ddd77fe","observation_id":"bb92b421-f6c2-4d8e-8ddc-7ed51b510a0c","resolution":{"observed_at":"2026-08-10T21:10:18.852430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.857075Z","title":"Scene text visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.857075Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:0c2570a3ce8b7753f1bb45541b84f5fa22bd24d29f3faf40eb5cef78b6894e3d","observation_id":"1c76ed4c-db84-4feb-96d8-59e7373d7fd5","resolution":{"observed_at":"2026-08-10T21:10:18.857075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.861346Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.861346Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:7ec628f44f2a4181aa4b111d8f967a431d4de6ebd142377c282fc712f81607b2","observation_id":"47a88cda-d9bb-4064-8d9e-08f2f87d76a3","resolution":{"observed_at":"2026-08-10T21:10:18.861346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.865508Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.865508Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:289e94651f4b6161ae8952e8f69556a13bb4f3a76cc6bc6beb81f96e87815a10","observation_id":"2cb0df00-067f-40a6-a5ae-22a1db441e83","resolution":{"observed_at":"2026-08-10T21:10:18.865508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-10T21:10:18.869750Z","title":"Allava: Harnessing gpt4v- synthesized data for a lite vision-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.869750Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:3fc99304de5188bc3af33c18449514645239f3e54b681d19f80aa49f5e86d1f8","observation_id":"4025de86-5d9a-4f13-9045-c08470052d69","resolution":{"observed_at":"2026-08-10T21:10:18.869750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-10T21:10:18.874649Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.874649Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:fc6661bfa6b4c2e651c47af10ce13b60375a0b2c27b13733ff272078c988f627","observation_id":"5838efec-a0a4-4e7a-ba76-66ff2d3f4d26","resolution":{"observed_at":"2026-08-10T21:10:18.874649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-10T21:10:18.878895Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.878895Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:55a9304ef43495da2a05b1b6b1d37853c839df314098b790a59774aad23a2757","observation_id":"0718d30d-9be4-45d4-b632-f34df5dbe19a","resolution":{"observed_at":"2026-08-10T21:10:18.878895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T21:10:18.883573Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.883573Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:7e672a0b5070e86394d703baf1a83168c7541c14ecb160c2aef83f05689104a2","observation_id":"07d3c61f-97c8-43a9-b894-6fb073d2041b","resolution":{"observed_at":"2026-08-10T21:10:18.883573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.888636Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.888636Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:9f477bc2c6948a47e69effc4d8609b7aeb07bd7246744e836db94c653fefad4e","observation_id":"676dc6fd-a459-41f3-8e90-34323d5397fa","resolution":{"observed_at":"2026-08-10T21:10:18.888636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.893598Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.893598Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:e25829642523500c33841c19adc7cee2f0d72db125f7327f5c5a1c7b9323f58a","observation_id":"ea6a8da3-dac3-42e3-bd6c-0278617b14c8","resolution":{"observed_at":"2026-08-10T21:10:18.893598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.897609Z","title":"Patch n’ pack: Navit, a vision transformer for any aspect ratio and resolution, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.897609Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:13f658c7c7a0cc1da683c6103146f557f47b2a3a78e7470370ff93f611b31051","observation_id":"62681333-18af-40fa-993f-ddc558937b75","resolution":{"observed_at":"2026-08-10T21:10:18.897609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-17T16:49:55.394145Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-10T21:10:18.901451Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.901451Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:43df9913241b013865cfdb407d763d3a74754339e2a899b3de668030ec72b514","observation_id":"91e0312c-25d2-4e9b-a0f7-87227ae4c170","resolution":{"observed_at":"2026-08-10T21:10:18.901451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-10T21:10:18.905756Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.905756Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:dfce75077a47ed78ba6375eef1bea914d68105f4de6a5342cb19fd25d155ef7f","observation_id":"80de881f-3042-42e5-b01f-be3b710af1ef","resolution":{"observed_at":"2026-08-10T21:10:18.905756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.910490Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.910490Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:5209bee72b19c665d196269b7eec1a7bf5bf4808110ac74814ffeee5b5366dc4","observation_id":"c899680f-fee7-4c7d-b750-e7abf6e1a6df","resolution":{"observed_at":"2026-08-10T21:10:18.910490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-08-16T13:06:21.193431Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-10T21:10:18.919339Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.919339Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:c1e84cda3cf8c59fd565a046719f496d8a294401e58fb8026ad48db233424d8d","observation_id":"c03a9b22-2881-4bda-b7ae-883bbcd2a9d4","resolution":{"observed_at":"2026-08-10T21:10:18.919339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-08-12T12:16:58.791696Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-10T21:10:18.923630Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.923630Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:5db0682139002047c70286192262624c44e2e50225cce4de89f87fd34b46a100","observation_id":"d0c2b559-7bc1-484e-828f-9242f9ac77a8","resolution":{"observed_at":"2026-08-10T21:10:18.923630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.927686Z","title":"Hallusion- bench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.927686Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:d96a65aecafbebd311cf20938da75897b8eff2739dd3871d6cf8513529213109","observation_id":"1462fed2-711d-4345-b0c5-c3e3e9323149","resolution":{"observed_at":"2026-08-10T21:10:18.927686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.931724Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.931724Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:67ffb65c4640d19665318a7aa9ec129c1e2cbe0e81e070bc8ba4ea37379addee","observation_id":"ef12b89d-8900-4283-9f0e-12db7ea473fd","resolution":{"observed_at":"2026-08-10T21:10:18.931724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.936887Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.936887Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:c942c1a11da8d0063955d57ba37ebd3440ecb962acba90ee72bb55607f4e4cf8","observation_id":"556e9947-1be6-4c92-84f4-4eb8b01a1400","resolution":{"observed_at":"2026-08-10T21:10:18.936887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-10T21:10:18.941965Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.941965Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:abd93668caaefc184e1018822f95ef517467c398a08e4fa4a20f27494ac5cf77","observation_id":"c1e5d2a2-3bff-4857-900b-05d99ab4b647","resolution":{"observed_at":"2026-08-10T21:10:18.941965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:18.946148Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.946148Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:ab211f45ebcd1e8ec3d07824b987613ec38927c7413be3591e13167a7613305c","observation_id":"bbfef737-4be6-48b7-aa95-f7505d2cda4a","resolution":{"observed_at":"2026-08-10T21:10:18.946148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.521083Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"2fb3f2e3-637d-4748-a8c5-6a26eb130f60","year":2017},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.950270Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:1ad1e74f9cec7c260c3ea0cf88be6c717c298ed9d429a4bb6a6219c94fcbc6dc","observation_id":"4cc1d556-df5e-4abc-b41f-386a1af80e37","resolution":{"observed_at":"2026-08-10T21:10:20.525148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.508891Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"8ee1459e-c06f-4105-bb68-7a3851c29ae8","year":2016},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.954354Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:bf416de01db5351076ea0e9396bbf6b330f70c1efd597c7e5945c576c6a0e99e","observation_id":"2b36f082-0491-46cc-8bf8-dd42e72110e0","resolution":{"observed_at":"2026-08-10T21:10:20.512612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.497086Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":"404b7f0a-5d15-4489-a527-478cfab15965","year":2020},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.958752Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:6379d3b02c9d452a6893a36ad13e2efc3d06404485a196ccbad4d0ffe80c1069","observation_id":"97bdcc57-f5c3-4628-896f-39c3de00308c","resolution":{"observed_at":"2026-08-10T21:10:20.500901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.486089Z","title":null,"venue":null,"work_id":"a477188b-851c-4c1d-96f0-dced4bbd394a","year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.962818Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:a7edf56d1d470ae5dc389423da300bfc00c0c4fc71b88e300a21f7f38e4af8b0","observation_id":"5a668c09-d27c-4093-bd22-12d86d265cb8","resolution":{"observed_at":"2026-08-10T21:10:20.489501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.471775Z","title":"Shamma, Michael S","venue":null,"work_id":"e8b207ab-639d-458a-86eb-d29d1e36586f","year":2017},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.967044Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:79f1a1d771aec2d4894bb6b277baa7d66df7fcff2606825c95735c9c8db3e91a","observation_id":"ed5e63c8-1221-44fd-9269-ba4a2db78de3","resolution":{"observed_at":"2026-08-10T21:10:20.478120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.460157Z","title":"Vqa-rad: Visual question answering dataset for radiology","venue":null,"work_id":"5746720b-c394-4ece-aef0-ab2e81d667a3","year":2018},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.972717Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:92838d3dc64662bb5683ab8841e40d44a04a583b27b367fabb01c8fed59f5455","observation_id":"5e680620-55fa-4e52-a03c-cf52f6ab3c64","resolution":{"observed_at":"2026-08-10T21:10:20.464301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.447485Z","title":"Super-clevr: A virtual benchmark to diagnose domain robustness in visual reasoning","venue":null,"work_id":"f74f3c46-c54f-42af-a348-5554d3a3baea","year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.982673Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:320746ea3f0a916198f2ef95c81fc3612b59f8627c3efcdbeda1b068bba03f11","observation_id":"a06cd701-f672-4ff1-82ef-f0dc6354bcfc","resolution":{"observed_at":"2026-08-10T21:10:20.451654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.434366Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"bc62a4a6-32ba-46df-ba7a-99d41fc7f4d6","year":2014},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.987614Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:3faa8ec08f35262565c96d8d2b433402d47c08f6272d39a0594bc99907a007dd","observation_id":"279fc10f-a3e4-4be4-8b7f-5214dc8d0fa3","resolution":{"observed_at":"2026-08-10T21:10:20.438500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-16T16:39:58.404449Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-10T21:10:18.992036Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.992036Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:5ac1e8bbf43dc3387f539dca6543557d3803eb0312fd419fe373230525e61daf","observation_id":"1f34d0e7-f572-4820-a25a-e8b8903f9628","resolution":{"observed_at":"2026-08-10T21:10:18.992036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00363","last_updated":"2023-03-22T15:42:50Z","snapshot_observed_at":"2026-08-16T17:03:26.678147Z","submitted_at":"2022-04-30T23:03:49Z","title":"Visual Spatial Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00363","snapshot_observed_at":"2026-08-10T21:10:18.996958Z","title":"Visual spatial reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.996958Z"},"links":{"cited_paper":"/paper/2205.00363","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:a76b4a925fd9614172be891df3cfff5041f06241113d14d21ce65da9bf01672a","observation_id":"b87fee95-0856-495a-8e22-3c68b60d4298","resolution":{"observed_at":"2026-08-10T21:10:18.996958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:10:19.001752Z","title":"Aligning large multi-modal model with robust instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.001752Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:47cab89fff9c17ebb4394f8a523962f97de8bc5582bdc5b8e4a04a9036247848","observation_id":"7fdb3330-8930-43c6-945b-ef2c112488e4","resolution":{"observed_at":"2026-08-10T21:10:19.001752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-10T21:10:19.010663Z","title":"Llava: Large language and vision assistant","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.010663Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:fd11320a4e2ab82c00d457b92609196d6988148683025624dffce1242f4ba772","observation_id":"43688fbe-a495-494e-b536-0252f7f4a1ea","resolution":{"observed_at":"2026-08-10T21:10:19.010663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.015439Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.015439Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:64c13f44d20eef5610a5f2195dde18b7fcf7bfa61958ca930fea97b9a14f3049","observation_id":"74c3b448-56bd-4900-a086-dbf51ec653b1","resolution":{"observed_at":"2026-08-10T21:10:19.015439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.415041Z","title":"Visual instruction tuning.Advances in neural information processing systems , 36, 2024","venue":null,"work_id":"6a41e1d9-6c19-4841-8b02-3bf3d378f17c","year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.019537Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:c390ccb1f36b6bd2ec0eeaa7cdafa1c58f326965044adf2ba2f281f20e231642","observation_id":"c45c1d61-fafc-4bf1-a8d3-e6399630810f","resolution":{"observed_at":"2026-08-10T21:10:20.419011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07895","last_updated":"2024-06-24T14:22:58Z","snapshot_observed_at":"2026-08-16T13:53:06.238750Z","submitted_at":"2024-05-13T16:31:53Z","title":"Optimal Transmitter Design and Pilot Spacing in MIMO Non-Stationary Aging Channels","version":2},"cited_work":{"arxiv_id":"2405.07895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.07895","snapshot_observed_at":"2026-08-10T21:10:19.694382Z","title":"Optimal Transmitter Design and Pilot Spacing in MIMO Non-Stationary Aging Channels","venue":"eess.SP","work_id":"4031d3d0-b9e4-4522-b186-7b7b47b5e210","year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.023914Z"},"links":{"cited_paper":"/paper/2405.07895","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:d556ff9d9e37b43c18a0a9243c907bef4a97cdc288a25aed98c044d5cc26f924","observation_id":"e4b6a11d-b402-4600-874f-fca0a5ed8fbf","resolution":{"observed_at":"2026-08-10T21:10:19.700408Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-16T13:23:18.747171Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-10T21:10:19.028341Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.028341Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:3be4dc403d323e547b58314c8254d02e9bae4c372f3ac6a37bdf78176c1ef884","observation_id":"8ddac59e-487a-4567-8482-dfe89c57a8dd","resolution":{"observed_at":"2026-08-10T21:10:19.028341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-16T23:34:44.456187Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08443","snapshot_observed_at":"2026-08-10T21:10:19.033317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.033317Z"},"links":{"cited_paper":"/paper/2412.08443","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:ac0f00adf101400123cade21106bd3ecc343f1ead32febb067ed94e7e76602d3","observation_id":"d6fcd753-8a4f-4a5f-ad9b-50ec0fa983de","resolution":{"observed_at":"2026-08-10T21:10:19.033317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.038904Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.038904Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:99a87e71e80bab37a5e929024a082e61482ac60bb0ee898b002e81fe8f62f7b1","observation_id":"cea65a07-8ace-4636-8444-dec67b24ff45","resolution":{"observed_at":"2026-08-10T21:10:19.038904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.045966Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.045966Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:c624f82468e0deaedcb335380a08c0f394a9a4a9dc87509ceadf601d624edea3","observation_id":"fbd25527-43aa-4167-a237-e0ec800df1cd","resolution":{"observed_at":"2026-08-10T21:10:19.045966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.394986Z","title":null,"venue":null,"work_id":"0ff16d1b-4a13-4361-beea-f7d0d49daa26","year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.051761Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:f4f454d125b7a016822d10e567fbaef511d4723e0b14f6a58046ec6dc9a84be3","observation_id":"426dea57-00aa-48a3-98fc-486b2eb1b324","resolution":{"observed_at":"2026-08-10T21:10:20.398456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-16T14:31:06.725017Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-10T21:10:19.060895Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.060895Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:aae6952bc52331576d95a91e448282c9bd4aae70e683f524ee4db9d4c2c3a95b","observation_id":"51954eab-9ef7-4b15-87e6-d813b9c6c99d","resolution":{"observed_at":"2026-08-10T21:10:19.060895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05014","last_updated":"2022-09-14T04:01:50Z","snapshot_observed_at":"2026-08-16T17:57:28.592900Z","submitted_at":"2021-09-10T17:51:06Z","title":"An Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05014","snapshot_observed_at":"2026-08-10T21:10:19.065456Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning.arXiv preprint arXiv:2109.05014, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.065456Z"},"links":{"cited_paper":"/paper/2109.05014","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:a73d71aa5582aa323edf417025fc04e2a8f890a926a5109058e1e29ac02d69fa","observation_id":"1a99e5ca-649b-463b-a91a-dee72ac159ea","resolution":{"observed_at":"2026-08-10T21:10:19.065456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-10T21:10:19.071219Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.071219Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:b6f14f11b5eeb8d050864bba400b011aa375fba4277b52e636b4d3b29e68374d","observation_id":"602a996e-fd75-43f3-ae7e-7f3003a15456","resolution":{"observed_at":"2026-08-10T21:10:19.071219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.382778Z","title":"Scienceqa: A challenging dataset for multi-modal reasoning","venue":null,"work_id":"57d5f617-889a-43ab-90c2-48d99c796fcf","year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.076081Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:a49a64385b9f3ef4a74c6d64a41a006635f5760dbeead8c28fcb438e36d358ed","observation_id":"5afb215e-1594-4a62-a25a-5249612787c4","resolution":{"observed_at":"2026-08-10T21:10:20.387378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.080916Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.080916Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:4afbbaf9ceb9d5197704c8a691c2f089bf3ffbaf6054037d344642f540a64c17","observation_id":"9b315588-3a12-4fba-b859-fd49e30458d6","resolution":{"observed_at":"2026-08-10T21:10:19.080916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-10T21:10:19.086305Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.086305Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:eb7a0a7fca496db26152b40253d7a631ccb3373b520d2e515fced95a665cb725","observation_id":"faf8283a-7e18-46ca-a27c-1f8a2aeb734b","resolution":{"observed_at":"2026-08-10T21:10:19.086305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10640","last_updated":"2024-11-16T00:14:51Z","snapshot_observed_at":"2026-08-17T21:54:44.695295Z","submitted_at":"2024-11-16T00:14:51Z","title":"BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10640","snapshot_observed_at":"2026-08-10T21:10:19.092613Z","title":"Bluelm-v-3b: Algorithm and system co-design for multimodal large language models on mobile devices","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.092613Z"},"links":{"cited_paper":"/paper/2411.10640","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:1dd5242e8dce4efca0fb66c22a2de29f5ca76d70e76ad9b48afc0af896992f5c","observation_id":"df0713eb-5b23-46cd-b0e5-07f2bdd4e536","resolution":{"observed_at":"2026-08-10T21:10:19.092613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-16T15:24:32.944943Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-10T21:10:19.097996Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.097996Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:370a828c623b09c0778cb9e91b0cf5e735ffb09ffd249b07c471e68584cee279","observation_id":"2c3bb458-c345-4ce0-8ed2-259c8fcd3909","resolution":{"observed_at":"2026-08-10T21:10:19.097996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.352064Z","title":"Ok-vqa: A benchmark for visual question answering using external knowledge","venue":null,"work_id":"c63472b9-6a9a-421f-b884-8bedb2e9039b","year":2019},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.102417Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:8701b2d755fe043c6342ef64ba56e08cc2dd0b54c046bd5fe8550327739f774e","observation_id":"1eab67f3-c535-4a24-865d-b4530561e025","resolution":{"observed_at":"2026-08-10T21:10:20.358350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.335528Z","title":"Ok-vqa: A benchmark for visual question answering using external knowledge","venue":null,"work_id":"f61e5857-4976-4070-ad17-dcf26dec3353","year":2021},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.106298Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:5932e65add1e11f75b52e4aa4949d67a7323f0878cbef69d113ed80b6e935a8d","observation_id":"353656bd-fe9b-4c6f-92e1-1b81dbff3304","resolution":{"observed_at":"2026-08-10T21:10:20.340532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.320569Z","title":"Marti and H","venue":null,"work_id":"21b9343f-59b9-4a19-aaae-780df9e1f526","year":2002},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.110900Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:fa2811feb2520c8cee7ffeb46e3620b9668ffaf37230e9eb83889de95a24c6b8","observation_id":"adf12f67-ea75-4759-a1a2-07e94e91a30d","resolution":{"observed_at":"2026-08-10T21:10:20.324986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.307707Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"7c0966e2-5914-4a61-9c7b-c21b72e723a6","year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.115965Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:1b92e8cee3117698cacdeaaca9f2f9ac26f8b20f4d8909c5d800b36221d59d7f","observation_id":"44b7547d-f58e-47a4-a323-65634818ad0d","resolution":{"observed_at":"2026-08-10T21:10:20.311658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.294192Z","title":"Mishra, K","venue":null,"work_id":"11d2db32-d04a-430a-b9bb-f86e12b1f347","year":2012},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.124809Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:c682168b5caff95e1f2ec48fc3b1fb197c7cf30aa69f0ee0e8ebfa2b9de79343","observation_id":"3d2831b3-79aa-4907-bb89-0af2b5b1282f","resolution":{"observed_at":"2026-08-10T21:10:20.298661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.281489Z","title":"Icdar 2019 crohme + tfd: Competition on recognition of handwritten mathematical expressions and typeset formula detection","venue":null,"work_id":"885605d6-a629-4762-994f-1bb3334759db","year":2019},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.128725Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:1a2b8746bdc1e8efbcf1e2675a07dee049b5b59f5f04ae25d6001941f056e2a4","observation_id":"6346ee5f-5605-4fa1-890f-aaa2178c0369","resolution":{"observed_at":"2026-08-10T21:10:20.285723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.132849Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.132849Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:a7a21445f2fb4ac7af28d2bcb0c8d2a26744370df0a57d131d6e3f198ec849aa","observation_id":"01413134-19ca-472f-b889-74e24ce34bea","resolution":{"observed_at":"2026-08-10T21:10:19.132849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07502","last_updated":"2024-06-11T17:37:45Z","snapshot_observed_at":"2026-08-16T13:44:04.481701Z","submitted_at":"2024-06-11T17:37:45Z","title":"Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07502","snapshot_observed_at":"2026-08-10T21:10:19.136628Z","title":"Image textualization: An automatic framework for creating accurate and detailed image descrip- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.136628Z"},"links":{"cited_paper":"/paper/2406.07502","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:88c8d19eb798f6909e821c286d60b658d1a6712b8df5b1a09a870df0a215bd20","observation_id":"eb015d12-fe9b-48bf-b82d-eab90ac5e640","resolution":{"observed_at":"2026-08-10T21:10:19.136628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.141439Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.141439Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:fc8244f1cae5ed11a963f6b534c2a014e19087eca1a5c95e0d3bf02d68e5d657","observation_id":"8b479804-6008-4cb5-a524-caa13ed7ffe9","resolution":{"observed_at":"2026-08-10T21:10:19.141439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.146845Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.146845Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:2b17509c002d01061cfb4fa9ee2127ee503f42393cf682600ea503e87bed09dc","observation_id":"3b9be37e-c212-4e78-a38c-db1e56f6187e","resolution":{"observed_at":"2026-08-10T21:10:19.146845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.236664Z","title":null,"venue":null,"work_id":"dd5c1ca0-99ad-4ffa-9694-3a1a6d8339d9","year":2019},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.151179Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:3780f9fa40f6b64413ca790c90f6ae09d5268516f49018628e11584c3aea2c80","observation_id":"54e21e84-9802-4b97-b19f-a4cd5e5b978a","resolution":{"observed_at":"2026-08-10T21:10:20.240517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-16T13:23:07.170488Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-10T21:10:19.156640Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.156640Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:282395eb15d15bef959d0c9be5d9b3c07fa30c7d4ca664eb99bc4efeebe27bf2","observation_id":"8c1421ce-8e09-4402-ad0f-3d0f91432404","resolution":{"observed_at":"2026-08-10T21:10:19.156640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.224956Z","title":"Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network","venue":null,"work_id":"0900aae9-19e4-4ebb-b22d-ea48609a2539","year":2016},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.162085Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:e9c0c77505fe31d6f26224b01be52b4b66e58b922aefa6c1bd2a0e12e1724c43","observation_id":"f2d48494-a77d-44dd-a784-1cdc906d3bd9","resolution":{"observed_at":"2026-08-10T21:10:20.228777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12462","last_updated":"2020-08-04T04:08:02Z","snapshot_observed_at":"2026-08-08T19:19:16.384370Z","submitted_at":"2020-03-24T02:38:35Z","title":"TextCaps: a Dataset for Image Captioning with Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12462","snapshot_observed_at":"2026-08-10T21:10:19.166540Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.166540Z"},"links":{"cited_paper":"/paper/2003.12462","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:07c664855bc8fdfabeb94f71d8d353cdea42460109fb2b78ebb7292c373146aa","observation_id":"ec2e600a-074d-4f2f-bf64-3a83eefd9069","resolution":{"observed_at":"2026-08-10T21:10:19.166540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.213216Z","title":"Singh, V","venue":null,"work_id":"4b5c1353-5e83-4acf-b21d-9399b222854d","year":2019},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.170656Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:fdd67274ae64af52640d26beec24389a84cfa09f24a496cfe78207bce1c236d2","observation_id":"0e8077b3-2988-41c0-b4e8-8e1c72a91eb9","resolution":{"observed_at":"2026-08-10T21:10:20.216740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.198846Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":"f474b244-c857-4357-823b-bcf9f3adf64b","year":2021},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.175230Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:a8e3c58d1fba8dd31aab254c3c5367fa49553a122cec1bdc41b9907ceab7e115","observation_id":"09241061-7e7a-45df-aff4-784762ba2d61","resolution":{"observed_at":"2026-08-10T21:10:20.204075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.180364Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.180364Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:cb54cedeea03db446d6689d301bfd3894f0e3d4031c8d0eb564841843b399d38","observation_id":"ca5a63c9-7208-4835-95c2-001239932aa2","resolution":{"observed_at":"2026-08-10T21:10:19.180364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.178452Z","title":"Bluelm: An open multilingual 7b language model","venue":null,"work_id":"7566e4f2-e28b-4c1f-9544-a7291ea98edf","year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.188306Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:2df7cfd5a00443a6d7738ab3a6707794a31c266c73f3bf414b58b4343d930a9a","observation_id":"ca662c2d-b219-4774-af37-dde5ac2468f8","resolution":{"observed_at":"2026-08-10T21:10:20.182778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.164145Z","title":"G-llava: Solving geometric problem with multi-modal large language model","venue":null,"work_id":"86b19d39-f2b7-48d6-bc7f-ebc09e01e76f","year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.193069Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:fe720b89109a25ea64bac23b39d3a18ff724093fa57c65a3809b5a2c877c4e74","observation_id":"73800cdf-9925-4ec7-a495-d7b0270492c1","resolution":{"observed_at":"2026-08-10T21:10:20.170288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T21:10:19.197628Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.197628Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:5af13f9a1d6505597a6e98e83da41ddc384dbef5d012e26cb98d96ac33f3e2e4","observation_id":"88552b8c-acd1-4b67-955c-0707907b8ffa","resolution":{"observed_at":"2026-08-10T21:10:19.197628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-10T21:10:19.202065Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.202065Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:df85f9425353d4aadb32c19bbb6a6a62e77b1ff860d611ada13afe52538ce1f4","observation_id":"a0252062-f4ca-48f6-b1a4-fecbe6d33d66","resolution":{"observed_at":"2026-08-10T21:10:19.202065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-10T21:10:19.208549Z","title":"Llava-cot: Let vision language models reason step-by-step, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.208549Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:33882e5f53526fe6980de511e81d89235662dc5248221009bd02dc4d7c0e86a8","observation_id":"57530a53-239c-4ace-8891-15428ad7a436","resolution":{"observed_at":"2026-08-10T21:10:19.208549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11690","last_updated":"2024-02-18T19:38:44Z","snapshot_observed_at":"2026-08-16T14:17:33.847507Z","submitted_at":"2024-02-18T19:38:44Z","title":"Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11690","snapshot_observed_at":"2026-08-10T21:10:19.215334Z","title":"Vision-flan: Scaling human-labeled tasks in visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.215334Z"},"links":{"cited_paper":"/paper/2402.11690","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:191794c6002faae56380dc8ac17072fc8e88f5b546fc160a78ca5a976dfee08d","observation_id":"97af1f60-fa2e-47f0-9ea1-036141f5622b","resolution":{"observed_at":"2026-08-10T21:10:19.215334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.150945Z","title":"xgen-mm(blip-3): A family of open large multimodal models","venue":null,"work_id":"e06946b1-1ef8-4bb9-89a8-0b131e648b55","year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.220050Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:63dba3f99af8914cdb5b8a839def2f916e5a0507ebd80e9ea6395709a7df121e","observation_id":"7c2defd8-7458-410c-a61a-b57c4d6dd806","resolution":{"observed_at":"2026-08-10T21:10:20.155096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-10T21:10:19.224500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.224500Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:b28891923bf5764bfa716d575d957ddf901b206eb2be66e80b7169386a603822","observation_id":"e3d56420-b439-47f2-a7a7-6d73f7f31fff","resolution":{"observed_at":"2026-08-10T21:10:19.224500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T21:10:19.228951Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.228951Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:0424cc54b094be8a94cf2cbfa2bcca7cd935a7b75f5f8a9a015c21babdc48f77","observation_id":"de5346b8-f4ac-4498-8ad4-89cf841e88fb","resolution":{"observed_at":"2026-08-10T21:10:19.228951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.138535Z","title":"Modeling context in referring expressions","venue":null,"work_id":"dd94ad47-fe88-4acd-a66c-c224c6e98f01","year":2016},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.233265Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:fd85bc1932bc146bdac96ab27b7d2d86182f192934b4d71d1e50153f611061fd","observation_id":"c9fdfd70-3e8f-4ca7-8e13-458658167b38","resolution":{"observed_at":"2026-08-10T21:10:20.142272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.237553Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.237553Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:db3dd8507789872add43cea83d314acacf11fbc1bede4221c7bfcd606e85599a","observation_id":"1806a7ff-388d-4c4b-9707-0687db3b66f6","resolution":{"observed_at":"2026-08-10T21:10:19.237553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.117065Z","title":"Syntax-aware network for handwritten mathematical expression recognition","venue":null,"work_id":"516699b6-a69f-4a4d-a5fa-cc3885632a79","year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.242436Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:f52b3d1a2c40acd682b7c53366997fb55d593b482083d57436b60fa94944fdbc","observation_id":"343f21ad-1e5f-4a60-b8f4-2c44f6368eac","resolution":{"observed_at":"2026-08-10T21:10:20.121985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.247526Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.247526Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:f155147a2df0f621377e3ec0de1e4e56f2e7efdec1752393712b053f74047a36","observation_id":"267b1168-795c-44e7-954c-d4d5fe374a13","resolution":{"observed_at":"2026-08-10T21:10:19.247526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.252682Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.252682Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:59d2cab9e796fcd2e9740bddcc08ed7ecd3ee1afbeee136c272ee2d74d7fea11","observation_id":"a3d01ea9-d201-4c7d-982f-76d57e889848","resolution":{"observed_at":"2026-08-10T21:10:19.252682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.085044Z","title":"Raven: A dataset for relational and analogical visual reasoning","venue":null,"work_id":"52e16c9d-5d7f-48c9-9a70-d13657cb1ccd","year":2019},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.256873Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:48e5d5c6dece9cc5af2e5815d180e642a5804b0347f2568a7dd3a2b2c1a900a9","observation_id":"c2886988-a028-45f1-b81f-d218cc139a4b","resolution":{"observed_at":"2026-08-10T21:10:20.088977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.071698Z","title":"Unimath: A foundational and multimodal mathematical reasoner","venue":null,"work_id":"2d038087-1983-4677-8dac-d65788bc066e","year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.261072Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:5d6c6d2b91aa5aaa208ca65912977b19116ddffe9c6a67f3d32707160dbf2d21","observation_id":"168265e7-b8c0-42a8-a794-7549f0767f37","resolution":{"observed_at":"2026-08-10T21:10:20.076146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07089","last_updated":"2024-08-09T08:18:20Z","snapshot_observed_at":"2026-08-16T17:29:37.240440Z","submitted_at":"2024-08-09T08:18:20Z","title":"InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2408.07089","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.07089","snapshot_observed_at":"2026-08-10T21:10:19.419953Z","title":"InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning","venue":"cs.LG","work_id":"2f5a6cab-bd85-4f4f-93d8-38c1b6d048ab","year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.273158Z"},"links":{"cited_paper":"/paper/2408.07089","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:6a8f27766aa7a516bc5abc1d481132e6c2fb61b3a716a4cd4cfe42b392d96ed6","observation_id":"bdcd38c5-f79f-4057-a19b-7d0a72bfd90a","resolution":{"observed_at":"2026-08-10T21:10:19.427271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-10T21:10:19.279181Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.279181Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:a7ad0f695cf553c102ea56e88b579083f14d5c084b48f46e9ec3056a68eaf65f","observation_id":"f81bbf74-28f4-490b-832b-344e24487c5f","resolution":{"observed_at":"2026-08-10T21:10:19.279181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08739","last_updated":"2024-11-01T22:14:24Z","snapshot_observed_at":"2026-08-16T13:34:58.849974Z","submitted_at":"2024-07-11T17:59:47Z","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08739","snapshot_observed_at":"2026-08-10T21:10:19.283464Z","title":"Mavis: Mathematical visual instruction tuning with an automatic data engine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.283464Z"},"links":{"cited_paper":"/paper/2407.08739","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:195fb5ce60e78ef5c87310dcf26d95e7390a600fd6333163514f514bf177c5a5","observation_id":"6e36f441-a28e-497c-9b40-36cd2d2faff2","resolution":{"observed_at":"2026-08-10T21:10:19.283464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-16T13:07:19.184083Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-10T21:10:19.288710Z","title":"Improve vision language model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.288710Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:ddf3c1afd898b2a1b8ab9249aa8edf40c6cfb65d4853671a6067515adef77be0","observation_id":"73c457fe-6a3c-4da4-a64d-2612acffd3cb","resolution":{"observed_at":"2026-08-10T21:10:19.288710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06939","last_updated":"2023-10-28T04:19:41Z","snapshot_observed_at":"2026-08-17T01:21:02.889451Z","submitted_at":"2023-04-14T06:17:46Z","title":"Multimodal C4: An Open, Billion-scale Corpus of Images Interleaved with Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06939","snapshot_observed_at":"2026-08-10T21:10:19.293396Z","title":"Multimodal C4: An open, billion-scale corpus of images interleaved with text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.293396Z"},"links":{"cited_paper":"/paper/2304.06939","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:587a948b958d5d6535e67fadafa3dbbf99136f1963c21028f0fde969188735db","observation_id":"0489dc65-fdfd-472b-9299-b388e7b33607","resolution":{"observed_at":"2026-08-10T21:10:19.293396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.045700Z","title":"Visual7w: Grounded question answering in images","venue":null,"work_id":"5d826421-e933-4779-89fc-a1f5f61986ef","year":2016},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.297675Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:32bfc5b4f76f736abb742c8a5888773c383778e2083d48856801e3a682904d35","observation_id":"9de82201-187f-4980-a1ad-680eb986fd42","resolution":{"observed_at":"2026-08-10T21:10:20.049394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:19.120428Z","title":"doi: 10.18653/v1/2022.findings-acl.177","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.120428Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:d47526d6242c6b6c109dabf082be88569f25793c19829a0abd1da443f7b1a805","observation_id":"ce148f0c-2014-4bcd-ac11-1879993774e0","resolution":{"observed_at":"2026-08-10T21:10:19.120428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:10:20.058432Z","title":null,"venue":null,"work_id":"f5da6b6b-4a3c-4465-9c6c-ed18bf3ffb0f","year":2023},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.267832Z"},"links":{"citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:1a015f10c235c0cdc1811c33e3d7fc74d090c73341ba56a03d0ff45ed6b6737b","observation_id":"a06ac0d2-14e8-4317-87d0-8bd78ffc564d","resolution":{"observed_at":"2026-08-10T21:10:20.062689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":64,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 11 inbound Pith citation observations for arXiv:2501.05901."}