{"as_of":"2026-08-18T00:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6cc872163de54341cecb8cef3e73220e6f34b10b2a267ea1ce8069baa036fd7","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:45:10.619719Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:43:52.914738Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T06:34:41.887069Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-07T04:22:56.004930Z","title":"Kwai keye-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-17T19:14:29.958482Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.004930Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:b656a0ccdc67d8aec554b1ce963e00ef0a848ff9b25b1ea2cff620b7bc42ec33","observation_id":"574deb97-d5bb-408c-a6d8-0403b5d74e9d","resolution":{"observed_at":"2026-08-07T04:22:56.004930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-06T13:12:40.675805Z","title":"Kwai keye-vl technical report.arXiv preprint arXiv:2507.01949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-17T16:27:32.729269Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:40.675805Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:e9cd546b100e89795b34de66f3166ecd31814f686949e57b522f5b7a44e46df6","observation_id":"36e2cfcd-788a-4d8c-85b5-7d2114fb4bea","resolution":{"observed_at":"2026-08-06T13:12:40.675805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-06T11:35:16.696524Z","title":"Kwai keye-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-13T02:58:31.453226Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T11:35:16.696524Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2507.22607"},"observation_digest":"sha256:56ad0ae8c5ebe362764685985e5d91015fd8b931d26a8481199687daa48f530d","observation_id":"1053a9d7-4770-40b1-bef5-dad6792d701f","resolution":{"observed_at":"2026-08-06T11:35:16.696524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-05T23:03:10.118939Z","title":"K.; Yang, B.; Wen, B.; Liu, C.; Chu, C.; Song, C.; Rao, C.; Yi, C.; Li, D.; Zang, D.; et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06009","last_updated":"2025-08-08T04:39:16Z","snapshot_observed_at":"2026-08-17T15:18:27.850836Z","submitted_at":"2025-08-08T04:39:16Z","title":"MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T23:03:10.118939Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2508.06009"},"observation_digest":"sha256:ee6932defe1a2a1892c34e717f5567d828b0373a494dbce55e7a2a07ca29d358","observation_id":"1e0d2528-1958-4e3f-b77f-1efc4f76eaf6","resolution":{"observed_at":"2026-08-05T23:03:10.118939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-05T22:10:51.210312Z","title":"Also known as","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07414","last_updated":"2025-08-12T05:39:35Z","snapshot_observed_at":"2026-08-16T06:22:27.553649Z","submitted_at":"2025-08-10T16:24:11Z","title":"Grounding Multilingual Multimodal LLMs With Cultural Knowledge","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:51.210312Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2508.07414"},"observation_digest":"sha256:6da63eac88b3a5c2e009ac1a9102eb96b3e5ab64460276f7e8d7e4ddb2418234","observation_id":"0bd1f391-b638-4c21-87cd-1a87b6ef29b1","resolution":{"observed_at":"2026-08-05T22:10:51.210312Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2508.09521","last_updated":"2026-04-09T12:13:05Z","snapshot_observed_at":"2026-07-06T22:12:12.166886Z","submitted_at":"2025-08-13T06:09:32Z","title":"PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T23:16:13.165715Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2508.09521"},"observation_digest":"sha256:eb32bb2c9bb76e2147ab767c9a445af699a726be23462c95810054792882d3fb","observation_id":"b63dcac3-964e-4c56-b3bb-68c9f5b1a2a2","resolution":{"observed_at":"2026-05-18T23:16:53.778625Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:7f38dc59cd2bb6450c620a7fe09fa84540a96812232a177f81a50f546962978a","observation_id":"b15dedef-a39d-4731-a99c-989ebb43ac39","resolution":{"observed_at":"2026-05-10T11:58:58.805001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-05T14:42:21.099214Z","title":"Kwai keye-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21113","last_updated":"2025-09-02T13:37:38Z","snapshot_observed_at":"2026-08-05T14:42:19.666014Z","submitted_at":"2025-08-28T17:48:19Z","title":"R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T14:42:21.099214Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2508.21113"},"observation_digest":"sha256:e84ec70d35d69b67ab07b946af627830166cc0311eff58bd2420953e8a2d3666","observation_id":"6c6c3555-0a03-4eba-adc3-da888b32384c","resolution":{"observed_at":"2026-08-05T14:42:21.099214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2509.22378","last_updated":"2026-04-16T08:15:21Z","snapshot_observed_at":"2026-08-15T17:07:31.760364Z","submitted_at":"2025-09-26T14:07:29Z","title":"Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T12:39:56.396231Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2509.22378"},"observation_digest":"sha256:d6518352a81bc66b333ce099e8c958a7d31fe9ccb1bb49114a3019428635262d","observation_id":"92fdacf7-f999-4184-8d6f-32b1d1fb72b0","resolution":{"observed_at":"2026-05-18T12:41:22.649654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-14T23:22:13.847876Z","title":"Kwai keye-vl technical report.arXiv preprint arXiv:2507.01949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10757","last_updated":"2026-06-20T10:12:15Z","snapshot_observed_at":"2026-08-13T21:01:04.544839Z","submitted_at":"2026-03-11T13:32:58Z","title":"CodePercept: Code-Grounded Visual STEM Perception for MLLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T23:22:13.847876Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2603.10757"},"observation_digest":"sha256:dc8bea36504cb45ae37b4d1816cec311681a8167b868498e7f2cba0d0a4d4205","observation_id":"6eda1611-25b6-45d4-8231-261136b9ec68","resolution":{"observed_at":"2026-07-14T23:22:13.847876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2603.24326","last_updated":"2026-04-03T06:49:01Z","snapshot_observed_at":"2026-07-06T22:50:28.640006Z","submitted_at":"2026-03-25T14:08:56Z","title":"Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T00:25:19.782732Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2603.24326"},"observation_digest":"sha256:57bb1ea2b4528fd1d40bf4b2800a72f6e9592c52bace79211b1bf4dc22986935","observation_id":"6d38d343-5adc-45cf-91d4-2f39702ba63f","resolution":{"observed_at":"2026-05-15T00:28:23.543654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-13T10:27:03.396626Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:02.559108Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2604.06777"},"observation_digest":"sha256:868aee27a2ef92387017dcd45c9c60180b581e62da9db3ca62647164682da884","observation_id":"14d5b53b-7dab-4662-a12b-6e333a1b4f5e","resolution":{"observed_at":"2026-05-11T00:45:50.095758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-15T14:01:34.813286Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:a85c296d0434d638d4f27866b9385da0ffc961472ed8d82a0f6fc93e14ecb1c8","observation_id":"a97d56bc-32f5-4899-830a-8043487d9530","resolution":{"observed_at":"2026-05-11T13:46:03.311855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2605.01882","last_updated":"2026-05-03T13:57:23Z","snapshot_observed_at":"2026-08-17T15:59:19.277214Z","submitted_at":"2026-05-03T13:57:23Z","title":"Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T16:08:15.393476Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2605.01882"},"observation_digest":"sha256:120fdbcd76e8559d08b924e0505e650340d3188b4fd5502d3118143560eecf06","observation_id":"45a011ee-1423-40a9-b718-111bf788ccd6","resolution":{"observed_at":"2026-05-11T09:16:02.841158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2605.22104","last_updated":"2026-05-21T07:40:25Z","snapshot_observed_at":"2026-08-06T19:20:14.897862Z","submitted_at":"2026-05-21T07:40:25Z","title":"OPERA: An Agent for Image Restoration with End-to-End Joint Planning-Execution Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T07:19:57.063802Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2605.22104"},"observation_digest":"sha256:4fc0f83013ed832c7a83b6f17674f4e375dc4c08b9990b98bcb13803a87f4437","observation_id":"6368d297-4abc-4852-a53d-fb2764703461","resolution":{"observed_at":"2026-05-22T07:21:12.756346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2605.22678","last_updated":"2026-05-21T16:20:31Z","snapshot_observed_at":"2026-08-16T13:54:15.621351Z","submitted_at":"2026-05-21T16:20:31Z","title":"Swift Sampling: Selecting Temporal Surprises via Taylor Series","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T05:55:23.479344Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2605.22678"},"observation_digest":"sha256:d6caa9802d4812d9bc7c862fef47ff0a9100015275c21b55eb449a3a17fb450d","observation_id":"d2d63b6b-68f5-43d4-b9c8-a755bfa8d64a","resolution":{"observed_at":"2026-05-22T05:56:07.868280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2605.24562","last_updated":"2026-05-23T12:56:44Z","snapshot_observed_at":"2026-08-15T00:39:58.953115Z","submitted_at":"2026-05-23T12:56:44Z","title":"PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T13:25:04.053283Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2605.24562"},"observation_digest":"sha256:fd07603fc023489565c65df54bc0454ed7435f801ec4dd8d5ee1027126f41ea9","observation_id":"b7ae43e5-0197-46aa-8c87-c70a43fe5a4b","resolution":{"observed_at":"2026-06-30T13:34:40.928968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:b819c967789c540142f91b3ebf4e3df1f5a73acf42cc456f837a4a2a3f897ddc","observation_id":"9b595bd2-1395-4842-ae56-7f9724efadc4","resolution":{"observed_at":"2026-07-03T04:27:37.036364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2507.01949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":278,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:b3653860f4d294c34eb634551e1c2b5103b332917981d37b40b82157bf255ded","observation_id":"52563904-d40b-4292-b9d6-3d1ef6285ac4","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2507.01949","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-08T06:34:41.887069Z","title":"Kwai keye-vl technical report","venue":"cs.CV","work_id":"fed210bf-996d-4575-8d81-8a68e02c9d03","year":2025},"citing_paper":{"arxiv_id":"2607.06420","last_updated":"2026-07-07T15:48:57Z","snapshot_observed_at":"2026-08-12T18:38:06.386310Z","submitted_at":"2026-07-07T15:48:57Z","title":"HoloCount: A Holistic Visual Counting Benchmark for MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-08T06:26:22.635106Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2607.06420"},"observation_digest":"sha256:73f1f20fcfecf829588bb72ea9149764f8cebddaad8f7adf79be3a734e8d4d72","observation_id":"8b83f04a-2d77-4d8d-af95-6ebbfa54e923","resolution":{"observed_at":"2026-07-08T06:34:41.888370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-14T04:45:32.682508Z","title":"Kwai keye-vl technical report.arXiv preprint arXiv:2507.01949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11562","last_updated":"2026-07-13T13:43:39Z","snapshot_observed_at":"2026-08-14T02:36:48.545869Z","submitted_at":"2026-07-13T13:43:39Z","title":"MonkeyOCRv2: A Visual-Text Foundation Model for Document AI","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-14T04:45:32.682508Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2607.11562"},"observation_digest":"sha256:13c333d2563150c7565a95c1d01a494e603f44fee8668e86114ac4bbee61b0d1","observation_id":"bf371730-be48-44f0-93b4-d31f8282461e","resolution":{"observed_at":"2026-07-14T04:45:32.682508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-01T22:38:42.344173Z","title":"arXiv preprint arXiv:2507.01949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-15T02:51:45.155150Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.344173Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:84c5c4e724c03433878c6d5bec019fefcf2b3af45431ae9171b6e12ae5326e14","observation_id":"b75f4b92-3907-478c-bcfe-b74fa1f47dc4","resolution":{"observed_at":"2026-08-01T22:38:42.344173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-31T00:41:43.585577Z","title":"arXiv preprint arXiv:2507.01949 (2025) 18 C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25125","last_updated":"2026-07-27T22:36:33Z","snapshot_observed_at":"2026-08-14T22:34:03.735449Z","submitted_at":"2026-07-27T22:36:33Z","title":"LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T00:41:43.585577Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2607.25125"},"observation_digest":"sha256:af18363fcc4c8e395b4d95d9761831d541378f21f63673fe205f27379e2487a8","observation_id":"02027fe2-c7a0-44ef-895c-b3b3600d5672","resolution":{"observed_at":"2026-07-31T00:41:43.585577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-07-31T14:08:11.220405Z","title":"Kwai keye-vl technical report.arXiv preprint arXiv:2507.01949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28225","last_updated":"2026-07-30T13:58:08Z","snapshot_observed_at":"2026-08-16T06:16:38.513496Z","submitted_at":"2026-07-30T13:58:08Z","title":"FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T14:08:11.220405Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2607.28225"},"observation_digest":"sha256:767a97d20da4d757eb9dc5ae4182051202d08a78fb466928a9ad8256f79caf63","observation_id":"673afc8b-8945-4379-ab7e-8b4a898275e2","resolution":{"observed_at":"2026-07-31T14:08:11.220405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-12T20:43:52.914738Z","title":"arXiv:2507.01949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-14T23:10:59.215042Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.914738Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:b091b395d8e00e3b07f973004be137c25ebdebde9ad45f96183d1806333c0b14","observation_id":"853230a5-6d66-4020-abd8-1d0f9c3354fd","resolution":{"observed_at":"2026-08-12T20:43:52.914738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01949/citation-record","integrity":"/paper/2507.01949/integrity","json":"/paper/2507.01949/citation-record.json","paper":"/paper/2507.01949"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T20:45:06.006947Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.006947Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:8ab4078a48be09d70577f97455eeacbeac884ba97acb6fa1515294cd028c8c03","observation_id":"fa035023-0b60-4337-812d-97d4bfb14777","resolution":{"observed_at":"2026-08-06T20:45:06.006947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11245","last_updated":"2021-02-22T18:30:15Z","snapshot_observed_at":"2026-08-16T18:43:49.783954Z","submitted_at":"2021-02-22T18:30:15Z","title":"Silent Data Corruptions at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.11245","snapshot_observed_at":"2026-08-06T20:45:06.525781Z","title":"Silent data corruptions at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.525781Z"},"links":{"cited_paper":"/paper/2102.11245","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:829f1a0cd1fb704423c40ebdfe1a07626f8250e39c5fdcf766dec4db4cfd5167","observation_id":"00049c26-0138-46dd-b2b8-e54e677f408a","resolution":{"observed_at":"2026-08-06T20:45:06.525781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T20:45:06.643045Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.643045Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:137db9170bb5e1cb3ffbdb043a2f099e875435d435f655da5f0328450bb903a9","observation_id":"716d0469-a98c-4a3e-bcc1-54772dad37b5","resolution":{"observed_at":"2026-08-06T20:45:06.643045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01282","last_updated":"2026-06-02T02:45:47Z","snapshot_observed_at":"2026-08-16T05:39:37.807645Z","submitted_at":"2024-12-02T08:55:19Z","title":"Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01282","snapshot_observed_at":"2026-08-06T20:45:06.817314Z","title":"Align-kd: Distilling cross-modal alignment knowledge for mobile vision-language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.817314Z"},"links":{"cited_paper":"/paper/2412.01282","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:08f97a6960f1ee66c85ed61d0f0261704effb0c597fd840624111d865e829a72","observation_id":"d02b21c7-e89c-4c32-8c30-562d73b9d075","resolution":{"observed_at":"2026-08-06T20:45:06.817314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-15T09:15:43.841019Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-06T20:45:06.935971Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.935971Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:91e7e0c9bf2e9b4ff9ad450af65c75083ca23ce94c77711b6ec4b61ba5cf8831","observation_id":"3e894e23-6a02-4cc3-b213-d15f08c5d49d","resolution":{"observed_at":"2026-08-06T20:45:06.935971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T20:45:07.043474Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.043474Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:736a4e8bf7e2b5f52ff16cd4e43fcf6432993204b9f90a1cd1f0eefc188840b9","observation_id":"8194bf4b-eb1b-4054-9f14-338be4474a75","resolution":{"observed_at":"2026-08-06T20:45:07.043474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-08-16T13:06:21.193431Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-06T20:45:07.165354Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.165354Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:7c98d0a63ca7dbbba7c7ba1c8fa433bac1076660a67143bde6befbc5b626b841","observation_id":"aa497178-df82-495f-98b7-c896c5ffffa8","resolution":{"observed_at":"2026-08-06T20:45:07.165354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:45:07.272357Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.272357Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:bc38d39a19e221b628383a4ee72d8ae8f4649e97c158c5df3358de407941ca4c","observation_id":"ac710382-fece-46a8-8d34-9745e74abd7e","resolution":{"observed_at":"2026-08-06T20:45:07.272357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-06T20:45:07.401157Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.401157Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:d66a421322724357587edcd532b9dbe41ef9b1a1d59495c8b587985b8267b6c7","observation_id":"f0949158-1432-48a1-8008-fccfa2df428c","resolution":{"observed_at":"2026-08-06T20:45:07.401157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T20:45:07.512122Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.512122Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:b4d4c22b8c81ba2550ed65ca60b12350a62882cf13fc908371ca6f53f3bc4a60","observation_id":"68fb6e9b-cda6-458a-b94e-7628f175970b","resolution":{"observed_at":"2026-08-06T20:45:07.512122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:45:07.601283Z","title":"ReferItGame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.601283Z"},"links":{"citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:ff0dba52afd8b2163f391082d46cfb222f47ee4fa0b2abaede5fdd56330de225","observation_id":"46baefde-b270-4f83-bc5e-a32daa32ac28","resolution":{"observed_at":"2026-08-06T20:45:07.601283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T20:45:07.955283Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.955283Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:cf77bc9ef3d80dc4a5fab09be66beb09a64f1f784ccb7e847bd4582886ea4c12","observation_id":"e21e9a31-6b36-4a6f-90ac-6cc483401ae9","resolution":{"observed_at":"2026-08-06T20:45:07.955283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-08-06T20:45:08.054292Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.054292Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:5c609807954e5d5724d8336655715ed44865102e500cad8871bd874a0028d1db","observation_id":"6acbc47d-b25b-403a-95df-24f4be8505bb","resolution":{"observed_at":"2026-08-06T20:45:08.054292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-08-15T20:39:05.998045Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-08-06T20:45:08.181516Z","title":"Model merging in pre-training of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.181516Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:f6177f266303dbc05dcb5ecce1812712a0a3398bfbc3b4ba9d2ebadf1d6c3e96","observation_id":"04dde608-7a4e-4db6-9a65-e5d8367a23ee","resolution":{"observed_at":"2026-08-06T20:45:08.181516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:45:11.668891Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"404ef602-1f3d-4daa-808b-72c1f75a6900","year":2014},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.311935Z"},"links":{"citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:1fe0ea35ad4e24b441384e9221302f92077c1662102190cec7c6dd83df0b14ef","observation_id":"65153693-4adc-4351-a78e-412e08ebf6d2","resolution":{"observed_at":"2026-08-06T20:45:11.727828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:45:08.421413Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.421413Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:8a7f4595bfc5358572d6b8dc21906d116201357228b0981d32df6c8f31fd5953","observation_id":"1b6e616f-8bed-4505-b16b-a1568f75d97a","resolution":{"observed_at":"2026-08-06T20:45:08.421413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14904","last_updated":"2025-04-21T07:20:19Z","snapshot_observed_at":"2026-08-17T22:13:31.073990Z","submitted_at":"2025-04-21T07:20:19Z","title":"VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14904","snapshot_observed_at":"2026-08-06T20:45:08.488038Z","title":"Vlm as policy: Common-law content moderation framework for short video platform","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.488038Z"},"links":{"cited_paper":"/paper/2504.14904","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:6e55190cfb42fc9088ad2eb7fbb88ced75a9dab0e72d61e19d6cff3b10404716","observation_id":"34afaad0-0b3f-4547-a0ae-8aa6e5659f28","resolution":{"observed_at":"2026-08-06T20:45:08.488038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-16T14:12:38.033838Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T20:45:08.557208Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.557208Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:2e88acc08cd231bd2495b8f962c39da68cf5ebcb0bd1c799e9f3a2d7c7a233e8","observation_id":"3ff3c3d0-80d0-40bb-9d61-d79f4b14c792","resolution":{"observed_at":"2026-08-06T20:45:08.557208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T20:45:08.608342Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.608342Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:5e4a74d666ca349516e33a075300d5049056a533e70a0712e968fe3e772ba235","observation_id":"4a2bbe7d-61f3-4cca-97ff-014e3b93bda0","resolution":{"observed_at":"2026-08-06T20:45:08.608342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23144","last_updated":"2024-10-30T15:59:05Z","snapshot_observed_at":"2026-08-16T13:04:29.721564Z","submitted_at":"2024-10-30T15:59:05Z","title":"Public Domain 12M: A Highly Aesthetic Image-Text Dataset with Novel Governance Mechanisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23144","snapshot_observed_at":"2026-08-06T20:45:08.709183Z","title":"Public domain 12m: A highly aesthetic image-text dataset with novel governance mechanisms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.709183Z"},"links":{"cited_paper":"/paper/2410.23144","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:940f5c7967fd33dfafa0c882f76b22472ee32292ac085ccd9513e0e15a9f7edf","observation_id":"f9098439-5a61-4d74-aec9-75f4fab69c10","resolution":{"observed_at":"2026-08-06T20:45:08.709183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-08-12T06:11:26.786967Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-06T20:45:08.799775Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.799775Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:1f3615b07d4cd0cb78d5a2fe9ecf7b633a0af96fa331f591879f161c16e34949","observation_id":"cb6d1d28-9ee8-4bd0-a9c1-13e33cb6de4b","resolution":{"observed_at":"2026-08-06T20:45:08.799775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-15T16:05:00.957009Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-06T20:45:08.961173Z","title":"Zerobench: An impossible visual benchmark for contemporary large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.961173Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:4525021ab4e70559f15479478347e566e7ca92794ad4a57cdf3c1d94632951c7","observation_id":"f374187d-769d-4084-8ca9-cceac74b5a30","resolution":{"observed_at":"2026-08-06T20:45:08.961173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:45:09.052688Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.052688Z"},"links":{"citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:e33b9fa3ea865966cf482950d2f5811a9fb9551e2dde577c5d6cde04ab4456d7","observation_id":"f3969843-e511-4422-85a7-14803d4a5744","resolution":{"observed_at":"2026-08-06T20:45:09.052688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T20:45:09.105293Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.105293Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:44eb65641c9c61148b057c69ef5ce484eae4f68769afa1c66d1aab552a19bad9","observation_id":"74984ca9-6330-4310-8652-e903a9c7d26f","resolution":{"observed_at":"2026-08-06T20:45:09.105293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:45:09.227497Z","title":"Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.227497Z"},"links":{"citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:5264c939a359082495d3381098295263231a5bd3e6e7c99cc9ebcf03b5cd9ffc","observation_id":"1907430b-df54-483a-a628-d402608b8833","resolution":{"observed_at":"2026-08-06T20:45:09.227497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-06T20:45:09.310019Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.310019Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:954a82b41fdfb9221c314431b312a004f3474176e5a02f445e33949002c58a07","observation_id":"a7851bc2-5050-40d9-b16a-82833ddc17b7","resolution":{"observed_at":"2026-08-06T20:45:09.310019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T20:45:09.382354Z","title":"Robobrain 2.0 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.382354Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:142a091c6b012c929b4b584d0117af41907ed7d3049b78980297a8ae17cfd859","observation_id":"100de4f0-9f26-4ac2-aa83-2cf668567b9b","resolution":{"observed_at":"2026-08-06T20:45:09.382354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-06T20:45:09.477913Z","title":"Gemini robotics: Bringing ai into the physical world","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.477913Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:208e27773e81c170134c62d545d6804a30982df6649653d00493ea429be57c71","observation_id":"1bafcd25-29f8-4585-bf20-6b413f5803a5","resolution":{"observed_at":"2026-08-06T20:45:09.477913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-16T14:56:49.068587Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-08-06T20:45:09.544304Z","title":"Toloka visual question answering benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.544304Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:ac2f0388f042210a750742c6d3d9d9a69ac799e2ca6cb2ffd459d0079a5dd172","observation_id":"d3b30d42-d9b3-4dd6-9872-dddba4b0effe","resolution":{"observed_at":"2026-08-06T20:45:09.544304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-06T20:45:09.636302Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.636302Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:e6a5bf64be00909af39b03d97e96ba98324ab32a4feb92a30657c59982d8ac31","observation_id":"e1c53f9e-2649-4dfc-86f2-095298371dd6","resolution":{"observed_at":"2026-08-06T20:45:09.636302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-06T20:45:09.744728Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.744728Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:6088b07a4cde36703a0b8df4b3807d158e065e036721cf7b16d5c1b98f3a4634","observation_id":"9dacee50-f4b9-4936-9f49-36f001a0265f","resolution":{"observed_at":"2026-08-06T20:45:09.744728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-17T02:54:42.660830Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-06T20:45:09.848642Z","title":"Jin Xu, Zhifang Guo, Jinzheng He, Hangrui Hu, Ting He, Shuai Bai, Keqin Chen, Jialin Wang, Yang Fan, Kai Dang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.848642Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:5ee28d455b2e95ed9193af1a73e3b31100ac304c175885a78e067deda3635bd4","observation_id":"b2c8541a-7675-4cd5-9fc8-2cb2f4bb202a","resolution":{"observed_at":"2026-08-06T20:45:09.848642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T20:45:10.040837Z","title":"Chun-Hsiao Yeh, Chenyu Wang, Shengbang Tong, Ta-Ying Cheng, Ruoyu Wang, Tianzhe Chu, Yuexiang Zhai, Yubei Chen, Shenghua Gao, and Yi Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.040837Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:2fabbf22527eb879f78efa2f5c38e49c1d051befc21a1b90f83d3a480bf4895d","observation_id":"a2c4812d-0371-429d-bf7f-9cc53426813c","resolution":{"observed_at":"2026-08-06T20:45:10.040837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-17T15:18:36.149300Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-06T20:45:10.093677Z","title":"Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.093677Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:0734ec875fdacab821d08a74364b24e492ea74664f013dcad52553a19bad54d1","observation_id":"a136efc8-662b-450c-90c5-22835e454eb3","resolution":{"observed_at":"2026-08-06T20:45:10.093677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09968","last_updated":"2024-11-15T05:51:29Z","snapshot_observed_at":"2026-08-13T01:32:02.986809Z","submitted_at":"2024-11-15T05:51:29Z","title":"Seeing Clearly by Layer Two: Enhancing Attention Heads to Alleviate Hallucination in LVLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09968","snapshot_observed_at":"2026-08-06T20:45:10.173386Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.173386Z"},"links":{"cited_paper":"/paper/2411.09968","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:adf9607878447d70bd73ecc4d478183bd1cf4d93b166d7c7753e4d3226d3c986","observation_id":"39613d2d-a4c9-482a-b3a3-f5002c3b70f0","resolution":{"observed_at":"2026-08-06T20:45:10.173386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-06T20:45:10.261769Z","title":"thinking with images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.261769Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:b21d7402ed092630bf91c327b3bf8a46bc8028d0c4316c504e174f8eefaf65de","observation_id":"5f6ba017-1eab-41ca-a6ef-395dada80f49","resolution":{"observed_at":"2026-08-06T20:45:10.261769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:45:10.352461Z","title":"Onerec technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.352461Z"},"links":{"citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:8aa4e08fbb422f0997b511d3ea771297702095eb65d8c77c915bfa543e8e9519","observation_id":"f229ab41-a038-40bc-8d33-c8e51bbdda16","resolution":{"observed_at":"2026-08-06T20:45:10.352461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:45:10.445998Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.445998Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:16d9257449e90c15072e66726ada94b64d4539caa7db1f21381c5e615ddb495b","observation_id":"0999d1ab-1d5a-4155-9634-3b779e585c12","resolution":{"observed_at":"2026-08-06T20:45:10.445998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-08-16T13:04:52.250937Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-06T20:45:10.546613Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.546613Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:4d0a72d05c88555e3ed2b068e13b870b29681dee4aea740db5c5a723986808c9","observation_id":"9da45d34-702a-41cc-9fa9-a0241d60580d","resolution":{"observed_at":"2026-08-06T20:45:10.546613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:45:11.517561Z","title":"likes\" a video receives within a specific timeframe after being uploaded. Using a predetermined threshold, we classify videos into two categories:","venue":null,"work_id":"242f4138-a24b-467a-ac56-a6bcd7b32bd3","year":2024},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.619719Z"},"links":{"citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:47466388461099fe4a9415761ce5c9d222438d0b1d9443a684c76f430a426da3","observation_id":"8a1206d2-9301-4662-ba78-b61db910c575","resolution":{"observed_at":"2026-08-06T20:45:11.561478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:45:07.721860Z","title":"doi: 10.3115/v1/D14-1086","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.721860Z"},"links":{"citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:0babbf0a5b4b2cf7c8ab14ed29ae5a059e2a2a739cf40066fd3ca64c156d6a69","observation_id":"f494b009-3de5-49a9-838b-72a05811c8fe","resolution":{"observed_at":"2026-08-06T20:45:07.721860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:45:07.833490Z","title":"URL https://doi.org/10.1007/ s11263-016-0981-7","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.833490Z"},"links":{"citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:17f4a8947252b2aedb920d8b9c032a3b519a9f4b1ce4241b97a7dd4fa13419a8","observation_id":"60df3888-994a-4b31-af8a-eeda25178d8f","resolution":{"observed_at":"2026-08-06T20:45:07.833490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-17T18:00:27.329541Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-06T20:45:08.886712Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.886712Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:bae8686c7ca08a9f35357d9142cb0543b054e599d36b1471a1274f1200dcccdf","observation_id":"2ba8ed5f-3bb5-4fc0-a0b3-d68040702d1a","resolution":{"observed_at":"2026-08-06T20:45:08.886712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-08-14T20:00:18.744689Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09925","snapshot_observed_at":"2026-08-06T20:45:06.207778Z","title":"Taskgalaxy: Scaling multi-modal instruction fine-tuning with tens of thousands vision task types","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.207778Z"},"links":{"cited_paper":"/paper/2502.09925","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:d1b396b39db32b573a68338db392f1d0d3edcbc3a43d3418d39b40368519f4fd","observation_id":"87b4da9b-480f-4490-9f66-1bc60373c293","resolution":{"observed_at":"2026-08-06T20:45:06.207778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T20:45:08.654026Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:08.654026Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:f8d145955b0c1a243356c19cfaf001ebf297c4a62626f441724f19363b73dc17","observation_id":"6ee409d9-1a98-41f7-9cf8-738df6aa7406","resolution":{"observed_at":"2026-08-06T20:45:08.654026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T20:45:06.380141Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.380141Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:aa8ab00683d3becefe5ecc7e5754556c00942809f715090301ec8baec75666d0","observation_id":"8a2f78a4-44eb-401e-b382-cd342e824503","resolution":{"observed_at":"2026-08-06T20:45:06.380141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:45:06.065307Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.065307Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:25da45c62f828ad1ff5abd25094a1630a850f9f4b30aff4a924fc8cf4d101222","observation_id":"7762f938-92ce-4402-8d56-14b7a3f31c8a","resolution":{"observed_at":"2026-08-06T20:45:06.065307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T20:45:06.295016Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:06.295016Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:33b5e9876cfba4a2629e8bde90ca4e8628176bcd7d3690841aa73226ee61b9b7","observation_id":"9a8ab2c4-d19b-4943-8a45-02d4599946b5","resolution":{"observed_at":"2026-08-06T20:45:06.295016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T04:50:52.862197Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 25 inbound Pith citation observations for arXiv:2507.01949."}