{"as_of":"2026-08-06T03:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:490a443113817753097733272f8c1c4def7522e4bc25ebf218d4384fd67a69c8","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:28:32.039808Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:46:40.944996Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"reference_index":267,"source":"pdf_text","source_observed_at":"2026-05-17T22:16:04.386706Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2408.07666"},"observation_digest":"sha256:e8dc8ea2030b0c39b2d7b651653359cb62b87fb0881c130f449bdcfa80828fb1","observation_id":"76ef0aff-0b87-426a-ba9d-0f3b9bf419c5","resolution":{"observed_at":"2026-05-17T22:16:04.811876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-03T14:16:50.869222Z","title":"Kwai keye-vl 1.5 technical report.arXivpreprintarXiv:2509.01563, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21095","last_updated":"2026-07-11T09:04:48Z","snapshot_observed_at":"2026-08-03T14:16:48.399963Z","submitted_at":"2025-12-24T10:35:21Z","title":"UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T14:16:50.869222Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2512.21095"},"observation_digest":"sha256:9c6d40617e18d6715ed75fcad940a95f4a3d0d890e158cfd73a46236dd6350f0","observation_id":"55bb90cd-8b5d-4e9f-b10a-f6b3d1cfef1f","resolution":{"observed_at":"2026-08-03T14:16:50.869222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2512.21334","last_updated":"2026-04-10T15:00:46Z","snapshot_observed_at":"2026-08-03T08:10:30.527963Z","submitted_at":"2025-12-24T18:59:36Z","title":"Streaming Video Instruction Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T19:44:11.032898Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2512.21334"},"observation_digest":"sha256:978d8a216c4c08b81884c63839cad28f87a0a3dcb9fba2f6954291d9f78711b7","observation_id":"f384bfee-91f9-47ca-a7db-8196c89d3bf8","resolution":{"observed_at":"2026-05-16T19:48:21.834586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-16T04:21:29.526008Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2601.10611"},"observation_digest":"sha256:784e38453c96c53d7b45ba2630a1de7b3d77c92c868fb28a9ec3e6d895c5d4dd","observation_id":"e452badf-0ea2-40e1-ba99-80313943525a","resolution":{"observed_at":"2026-05-16T04:21:29.819348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-03T03:37:50.225051Z","title":"Yao, S., Yu, D., Zhao, J., Shafran, I., Griffiths, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07533","last_updated":"2026-06-26T15:22:02Z","snapshot_observed_at":"2026-08-03T03:37:49.338075Z","submitted_at":"2026-02-07T13:09:41Z","title":"Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:37:50.225051Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2602.07533"},"observation_digest":"sha256:250c452a2ea79f6ed106a829a8b863f44e0f7e701f406c9871cdb015cf7da1a0","observation_id":"64fa5fcd-4120-429e-9e3b-143122edb5e3","resolution":{"observed_at":"2026-08-03T03:37:50.225051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:32.778695Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.05015"},"observation_digest":"sha256:c502394a2b2dc4b5c90dcb3587261dab3d42e2a0b142a0f0e8d241012b128554","observation_id":"6175d828-74e7-46f4-b61b-64de26e54434","resolution":{"observed_at":"2026-05-10T23:55:51.308252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.07772","last_updated":"2026-04-09T03:51:14Z","snapshot_observed_at":"2026-07-31T19:42:42.310290Z","submitted_at":"2026-04-09T03:51:14Z","title":"ESOM: Efficiently Understanding Streaming Video Anomalies with Open-world Dynamic Definitions","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T17:55:32.945721Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.07772"},"observation_digest":"sha256:ce3445ba378270eba135c4b343cfb275f1c60ea0f6f7ba5f1c878352eb012f3e","observation_id":"b131c060-de44-4390-8e58-9b6d8e67149d","resolution":{"observed_at":"2026-05-11T05:51:03.556398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:b22d5fcb7fc22585ef7ca9c5b2261de1a2d9f82a88adc95502a3ca0e789fd167","observation_id":"3305d732-3469-4c84-8933-0d60cff64d7a","resolution":{"observed_at":"2026-05-11T10:41:04.304928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:52.980881Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.13029"},"observation_digest":"sha256:efe4ba8ebf8beccf69a4e8555d63b68e5d45be861dbe8aa105e0f67fb2c402ce","observation_id":"fb2752e8-e3f4-4f53-aa8e-34eb48ed1454","resolution":{"observed_at":"2026-05-11T09:56:00.979167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:72c4c927c31793249b636da1271a5485e3b2d4c60352e9f3ae9c5ea2ef833bef","observation_id":"41e5262b-1c59-46c4-a7c8-f586ef0ccd47","resolution":{"observed_at":"2026-05-11T13:46:04.503586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.00444","last_updated":"2026-05-01T06:24:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:24:40Z","title":"Scaling Video Understanding via Compact Latent Multi-Agent Collaboration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T20:11:11.410051Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.00444"},"observation_digest":"sha256:14934defa8c2a5a69e06f2f504ca5283782ed1e4562876442cbfb874a8b161c7","observation_id":"3e9fdb62-85af-4771-8bce-e8c01f4fac48","resolution":{"observed_at":"2026-05-11T15:21:09.428567Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.09422","last_updated":"2026-05-10T08:48:58Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T08:48:58Z","title":"Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T03:57:57.791351Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.09422"},"observation_digest":"sha256:039c726054cfee7d4fa99b5cb573ea3d26ca2fd3b5a6143dc0185c5cef00812c","observation_id":"e1be7009-35e8-44c4-8976-5aa3fe49df56","resolution":{"observed_at":"2026-05-12T06:46:52.779669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.10187","last_updated":"2026-05-13T02:10:21Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:38:22Z","title":"SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-12T03:53:46.809307Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.10187"},"observation_digest":"sha256:f39c24b38d94ab9cba0661ff6faa7eb0271a9fdbf68fa9c12f12594cccdda791","observation_id":"8e4e4b6a-0863-407c-bf3c-7af9e46783e8","resolution":{"observed_at":"2026-05-12T06:51:28.432591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.10187","last_updated":"2026-05-13T02:10:21Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:38:22Z","title":"SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-14T21:52:08.637283Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.10187"},"observation_digest":"sha256:b13be798aec3949e6ed4041194da0a61d4af3edef877b100ebec3dd2bbc6d044","observation_id":"fa9b594c-bbee-4731-b213-66cc62c908f1","resolution":{"observed_at":"2026-05-14T21:53:02.218280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.25364","last_updated":"2026-05-25T02:41:50Z","snapshot_observed_at":"2026-08-04T01:05:16.038519Z","submitted_at":"2026-05-25T02:41:50Z","title":"Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:44:59.860225Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.25364"},"observation_digest":"sha256:86c8843534df2b63b8bf08a32950aff5f8d53fb81b715566daf1c895cbc10bd2","observation_id":"30606730-05cd-4942-b98e-cc2c166a7426","resolution":{"observed_at":"2026-06-29T22:54:01.479148Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.25706","last_updated":"2026-07-04T04:01:13Z","snapshot_observed_at":"2026-07-31T08:07:43.069382Z","submitted_at":"2026-05-25T11:05:37Z","title":"Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:02.455554Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.25706"},"observation_digest":"sha256:ce5a330076ed2fcd4c85d246f331626172c27e9e509b35147213a764393617aa","observation_id":"4d38d9c6-94fa-423b-aac2-bcab6e55ed0d","resolution":{"observed_at":"2026-06-29T23:24:02.133497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:24fe7bd90d3793666f434f5314f140bcaee50e6e4a169058498a44512000bc21","observation_id":"5b48ea6b-4a0b-444a-a5ff-4f6ef7bdb83c","resolution":{"observed_at":"2026-06-29T22:13:59.514435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.27074","last_updated":"2026-05-26T14:23:25Z","snapshot_observed_at":"2026-08-02T20:44:04.329111Z","submitted_at":"2026-05-26T14:23:25Z","title":"IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T18:24:57.881644Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.27074"},"observation_digest":"sha256:c02ea1dceb82f2dc411c50988540d221458d1a83d0c6eb4ec292323e04d1bc7f","observation_id":"2fda1bbc-b5ac-491f-a4a9-9cf40d4ef74c","resolution":{"observed_at":"2026-06-29T18:33:51.038683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2605.27365","last_updated":"2026-05-27T02:30:49Z","snapshot_observed_at":"2026-08-06T02:59:09.668446Z","submitted_at":"2026-05-26T17:59:12Z","title":"LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T17:52:59.346637Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2605.27365"},"observation_digest":"sha256:c47ac535a2726bf0bde609309e8d2646a3757ba71a2e2a0bd29f207f6db0e505","observation_id":"4e4d2b64-a9b1-4fb5-ae5e-bf1688a568fb","resolution":{"observed_at":"2026-06-29T17:53:46.753893Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.02522","last_updated":"2026-06-01T17:32:20Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T17:32:20Z","title":"Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T14:50:02.159411Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.02522"},"observation_digest":"sha256:57dcdfd65ab5cf350a71d27e4e4f4800e6484250c4846f88e0a6ee03c1027dfa","observation_id":"b2f52786-ada2-4b3a-8b12-92cb7ab9a5ab","resolution":{"observed_at":"2026-07-01T22:56:20.836897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.02569","last_updated":"2026-06-01T17:56:35Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:56:35Z","title":"AdaCodec: A Predictive Visual Code for Video MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T15:20:48.248576Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.02569"},"observation_digest":"sha256:97f51588478c361e24c2e25df1a4bc4008f5979f59f00426852fe43d033eeda9","observation_id":"32456377-9743-448f-aad7-5c34295d1fde","resolution":{"observed_at":"2026-06-28T15:22:19.505199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":216,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:a84f6922b4d648982c1bac157d6a9d97e9793d3e3477ad039e5939628ddcbb74","observation_id":"2d3b4783-77b5-4c33-8d97-49711e774cd4","resolution":{"observed_at":"2026-07-02T17:27:15.720322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:cd4efcbcd035b478e369127ac2541feb0755735a9d8c31e5b8fbc1f78cc87e03","observation_id":"9a79df8c-72fd-42e8-8823-f3234311aa4f","resolution":{"observed_at":"2026-07-03T04:27:37.037810Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:007c3727ec5334da048fca99e5fd6aecfc4fe16b3155ab77d4e3e6f94877d133","observation_id":"3520b587-a9e9-4f67-800a-215826e6ea14","resolution":{"observed_at":"2026-07-03T10:48:02.945834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.24602","last_updated":"2026-06-23T14:03:56Z","snapshot_observed_at":"2026-07-06T23:59:08.580746Z","submitted_at":"2026-06-23T14:03:56Z","title":"ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T00:24:20.208132Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.24602"},"observation_digest":"sha256:8c6514e2e54f31970943ef01d3bbbd74b53354e8b1b490c19e3f8e74b6509f0c","observation_id":"ef9a48c3-39ad-43a9-b2df-7f1179c7e568","resolution":{"observed_at":"2026-07-04T16:39:57.603559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.01563","doi":"10.48550/arxiv.2509.01563","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kwai keye-vl 1.5 technical report","venue":"arXiv (Cornell University)","work_id":"87836623-1e5f-4d18-babd-0613eddc4b6e","year":2025},"citing_paper":{"arxiv_id":"2606.30026","last_updated":"2026-06-29T09:27:02Z","snapshot_observed_at":"2026-08-05T16:53:44.108925Z","submitted_at":"2026-06-29T09:27:02Z","title":"MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T06:25:38.593423Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2606.30026"},"observation_digest":"sha256:3548d6b59ceda839e032f7d375c69abffaebf67c9e28870bb2208b531288c8ba","observation_id":"e260f3e2-c21d-4845-9da8-2f498738f837","resolution":{"observed_at":"2026-06-30T06:34:19.457791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-07-31T06:20:13.600830Z","title":"Kwai keye-vl 1.5 technical report.arXiv:2509.01563, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-01T00:03:26.264908Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:13.600830Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:1da75b4110c6b3bf03b0a614e3b7d92b23ed4169b51b79ce9c8851766ee64e66","observation_id":"32b845a2-5f39-41b7-b819-87ae2d8710fc","resolution":{"observed_at":"2026-07-31T06:20:13.600830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-07-31T05:08:20.137192Z","title":"Kwai Keye-VL 1.5 technical report.arXiv preprint arXiv:2509.01563, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-03T15:13:30.086781Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.137192Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:783a9aec9a9f7c9ea4707ac70b66b0e6053d9d729346ab61fe5abf48851e9c0f","observation_id":"e7d57d85-9cea-4001-bb59-f7aac00a37b4","resolution":{"observed_at":"2026-07-31T05:08:20.137192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-08-05T00:46:40.944996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00536","last_updated":"2026-08-01T08:45:41Z","snapshot_observed_at":"2026-08-06T02:14:16.913231Z","submitted_at":"2026-08-01T08:45:41Z","title":"DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T00:46:40.944996Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2608.00536"},"observation_digest":"sha256:c352e37f4a81ac5ba0662d2f0969afd72ff38c518eedf8e6dc3dd865cc23684f","observation_id":"24489f74-013c-4643-89e9-eff675abf1c1","resolution":{"observed_at":"2026-08-05T00:46:40.944996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01563/citation-record","integrity":"/paper/2509.01563/integrity","json":"/paper/2509.01563/citation-record.json","paper":"/paper/2509.01563"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T12:28:24.911132Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:24.911132Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:886d2a74633fecaeb821845ab91bac5e898ebbcb48a5eedc571490bfefcbf83d","observation_id":"96155cd7-0c6c-4024-82aa-e5c64c3c9243","resolution":{"observed_at":"2026-08-05T12:28:24.911132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T12:28:25.288692Z","title":"Ernie 4.5 technical report, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.288692Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:5b00b17de70834a3df97e7759d0c65fc3a440b467557217ff1c713f7976833c9","observation_id":"54891770-a499-44b3-9f06-783853d26b34","resolution":{"observed_at":"2026-08-05T12:28:25.288692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:25.600786Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.600786Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:945fc2dbdf8b2ea4f6c95b4da3c8b51c2b352d8ab889e4bd371cf68416af8a10","observation_id":"d0ad010b-53b9-48b2-bc88-156d9c6f71aa","resolution":{"observed_at":"2026-08-05T12:28:25.600786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T12:28:25.798334Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.798334Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:8c7d461ad52eb05e44747322bf1f3ddc9063f859280dc21f93f8dda5558c7f8a","observation_id":"dd942ec4-2f9a-403f-8681-a1c98494e426","resolution":{"observed_at":"2026-08-05T12:28:25.798334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T12:28:25.940572Z","title":"Mmict: Boosting multi-modal fine-tuning with in-context examples.ACM Transactions on Multimedia Computing, Communications and Applications, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.940572Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:b6d8ad78f6749ee4b39b8eeb4faf37cb7d24397a24959ea12ffb6e6962333094","observation_id":"8fb37b12-9d52-4f8e-bb8a-47334319bc4f","resolution":{"observed_at":"2026-08-05T12:28:25.940572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-05T12:28:26.070670Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.070670Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:a0d6a7d7e0c722f79457585c9597d1465711fc8f914203eff6b0bfd5affc695d","observation_id":"542b9c3b-94ea-4e45-8c62-8379f0fe64b0","resolution":{"observed_at":"2026-08-05T12:28:26.070670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-05T12:28:26.227633Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.227633Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:2108b962c5d0753aa8e44b059f5d8674e052947490e3d3432eafd59cb270d80b","observation_id":"c2adc5cd-ff45-4554-9c9a-f5ecbf6f407d","resolution":{"observed_at":"2026-08-05T12:28:26.227633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07124","last_updated":"2023-10-09T03:34:01Z","snapshot_observed_at":"2026-07-06T16:18:06.415304Z","submitted_at":"2023-09-13T17:59:09Z","title":"RAIN: Your Language Models Can Align Themselves without Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07124","snapshot_observed_at":"2026-08-05T12:28:26.384522Z","title":"Rain: Your language models can align themselves without finetuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.384522Z"},"links":{"cited_paper":"/paper/2309.07124","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:00ad479216387bc578900d9522c242de42e71b7b4ad707423e078ed98035a613","observation_id":"9af9e927-2ea1-4b3b-b5c2-312c6ead1120","resolution":{"observed_at":"2026-08-05T12:28:26.384522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-05T12:28:26.680272Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.680272Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:98b375f5f8c293781719ac7264f35af2c739aa8b36c9a8d6260f6db62b1639d8","observation_id":"4a4d3bcf-c754-407e-90e5-db416ee141c3","resolution":{"observed_at":"2026-08-05T12:28:26.680272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-07-06T21:49:56.788040Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.24102","snapshot_observed_at":"2026-08-05T12:28:26.818295Z","title":"Denseworld-1m: Towards detailed dense grounded caption in the real world, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.818295Z"},"links":{"cited_paper":"/paper/2506.24102","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:1c1fd63f9080154f6caddac52d1ad3f39b6ab42f406dae34ff7013e3b273e7b6","observation_id":"7ca2ec95-3991-4fe6-8abb-0740c4141272","resolution":{"observed_at":"2026-08-05T12:28:26.818295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20502","last_updated":"2025-03-30T03:54:36Z","snapshot_observed_at":"2026-07-06T20:59:00.415760Z","submitted_at":"2025-03-26T12:42:37Z","title":"MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20502","snapshot_observed_at":"2026-08-05T12:28:26.968895Z","title":"Mllm-selector: Necessity and diversity-driven high-value data selection for enhanced visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.968895Z"},"links":{"cited_paper":"/paper/2503.20502","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:8a9b26d238568abf8d64fd00567923778b6f6f6d6d9422e6fb08b29be6cec521","observation_id":"5d978ab4-d259-45df-8b6f-e2b7bfb53809","resolution":{"observed_at":"2026-08-05T12:28:26.968895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-07-06T21:23:19.117703Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-08-05T12:28:27.117812Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.117812Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:fdf11e2c833bf44cca0c0dc83595f75fa25a301f21f1d7b1e8ff4fd5fd4256f9","observation_id":"87bf0350-663b-4f0c-9efb-884c8ddf2137","resolution":{"observed_at":"2026-08-05T12:28:27.117812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T12:28:27.256289Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.256289Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:eb613be70a9efcf327c54ec2ce6160f088a73325ed43bcdfaae47acffd8d85d8","observation_id":"b3f71dca-5c40-40b1-b45d-d5f9da73f9e4","resolution":{"observed_at":"2026-08-05T12:28:27.256289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T12:28:27.379864Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.379864Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:2b47c3635c068648a6105495823cd1fd9c36d23bf99753f562b0d20d185d23e2","observation_id":"0d1a1c19-d362-4e8a-ad93-90968ce2a127","resolution":{"observed_at":"2026-08-05T12:28:27.379864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:27.513986Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.513986Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:323ae1b4a1d678c70c26b97dea9a578d9b669a0020996fb4dc9d0c1e1f30035d","observation_id":"495ff408-8c7d-4691-8774-7c4a7e2be882","resolution":{"observed_at":"2026-08-05T12:28:27.513986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-05T12:28:27.854438Z","title":"Samir Yitzhak Gadre, Gabriel Ilharco, Alex Fang, Jonathan Hayase, Georgios Smyrnis, Thao Nguyen, Ryan Marten, Mitchell Wortsman, Dhruba Ghosh, Jieyu Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:27.854438Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:2374a98149b15ffb10483dc2d8b0c6c6d61b99a808ff01e88ce2571df62fc34b","observation_id":"a12813f4-2c92-43ff-8589-3e99cc7e1263","resolution":{"observed_at":"2026-08-05T12:28:27.854438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23144","last_updated":"2024-10-30T15:59:05Z","snapshot_observed_at":"2026-07-06T19:42:21.306600Z","submitted_at":"2024-10-30T15:59:05Z","title":"Public Domain 12M: A Highly Aesthetic Image-Text Dataset with Novel Governance Mechanisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23144","snapshot_observed_at":"2026-08-05T12:28:28.020884Z","title":"Public domain 12m: A highly aesthetic image-text dataset with novel governance mechanisms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.020884Z"},"links":{"cited_paper":"/paper/2410.23144","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:720070ce778feb55d1a137aaa2dcf159a954fbc9bb6ec046008f6fcc794afa6f","observation_id":"57b1d7c1-320c-41fe-a077-90b401a1b58d","resolution":{"observed_at":"2026-08-05T12:28:28.020884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:33.632595Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"b2b3c8ca-8e1c-46ad-95ab-f22522c0423f","year":2014},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.159724Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:56d5571fc4cf36347e19f1c9df7b1ef2c9cfbea062f1df48779b02631e2697f6","observation_id":"7ba892cb-0d2e-4f90-8022-f7fd4d9b9606","resolution":{"observed_at":"2026-08-05T12:28:33.756086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-07-06T20:20:47.146343Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-05T12:28:28.452005Z","title":"Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, Katie Millican, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.452005Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:4b42649cc26d52b3012e6f5fb534b287867b5856e8077ff80a00148afbec1a5c","observation_id":"5672ce2c-f641-4552-ba1f-88334ca51faf","resolution":{"observed_at":"2026-08-05T12:28:28.452005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:33.294062Z","title":"ReferItGame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"8124e0ee-22b9-41cd-8e70-42227232f929","year":2014},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.609733Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:314b10290f09e429ad5230e65ac695aa9cc7ae628ba8ef8e74728d5a5462d050","observation_id":"93cc01e1-b660-4105-bb4e-3443d681fd57","resolution":{"observed_at":"2026-08-05T12:28:33.428166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:28.751688Z","title":"doi: 10.3115/v1/D14-1086","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.751688Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:74ac404e64551fe7b879102c62506fbc794cc96ce65019d712394bf0a8d4fdbe","observation_id":"751aa989-2eba-4ed7-8995-5076ca6ec675","resolution":{"observed_at":"2026-08-05T12:28:28.751688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T12:28:29.027544Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.027544Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:1545730d33418441d68669c1ae4732438f7f432d4a50e323f8645b39b5658f1d","observation_id":"f696242a-dd65-4674-8dfc-64c84568f856","resolution":{"observed_at":"2026-08-05T12:28:29.027544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01583","last_updated":"2025-05-02T21:00:17Z","snapshot_observed_at":"2026-08-01T18:50:37.685905Z","submitted_at":"2025-05-02T21:00:17Z","title":"TEMPURA: Temporal Event Masked Prediction and Understanding for Reasoning in Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01583","snapshot_observed_at":"2026-08-05T12:28:29.153701Z","title":"Tempura: Temporal event masked prediction and understanding for reasoning in action","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.153701Z"},"links":{"cited_paper":"/paper/2505.01583","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:eebfc2886daac9c6f28e91a0b62b5cba5811ee048c715fdc09c0ad64b3b2118c","observation_id":"80ed4ea1-fdac-4d1f-bec0-38616d15cd1c","resolution":{"observed_at":"2026-08-05T12:28:29.153701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09925","last_updated":"2025-02-14T05:32:46Z","snapshot_observed_at":"2026-07-31T06:39:37.350366Z","submitted_at":"2025-02-14T05:32:46Z","title":"TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09925","snapshot_observed_at":"2026-08-05T12:28:29.290584Z","title":"Taskgalaxy: Scaling multi-modal instruction fine-tuning with tens of thousands vision task types","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.290584Z"},"links":{"cited_paper":"/paper/2502.09925","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:28ff787ae5de5ffc480603030cdf6f2d88f3d46dce1b35c0dd7df3a404bf669e","observation_id":"97dacf39-386f-42ba-af0c-d2a9fb255764","resolution":{"observed_at":"2026-08-05T12:28:29.290584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-05T12:28:29.437795Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.437795Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:363417e913898d15cd1486a2fc624857cc496eb90aa960064e4cfe18c2d6d234","observation_id":"6fde1ffd-faba-4cd4-8962-df6e18b2316f","resolution":{"observed_at":"2026-08-05T12:28:29.437795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:29.577683Z","title":"Chujie Zheng, Shixuan Liu, Mingze Li, Xiong-Hui Chen, Bowen Yu, Chang Gao, Kai Dang, Yuqiong Liu, Rui Men, An Yang, Jingren Zhou, and Junyang Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.577683Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:6d8ecd04c8c48c81bd493bf527929b8858fade899b3be5fbf82a8ea5902d5794","observation_id":"e2b8380a-fb52-4083-9e45-b8b32077d12d","resolution":{"observed_at":"2026-08-05T12:28:29.577683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T12:28:29.805435Z","title":"OpenCompass Contributors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:29.805435Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:47ca9f21558f4656304d1a56d0318e45b5417632507b32abb40eff54be9e3c2a","observation_id":"31760e6e-13f5-4ec2-b006-15d6d3dab6df","resolution":{"observed_at":"2026-08-05T12:28:29.805435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:28:33.040609Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"f579c1e4-c345-4b93-b976-9749f201cca7","year":2016},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.019944Z"},"links":{"citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:7f08e3ba62473eaa613049be3a5993764d49f7fcb9e65929eabf9f5d3e3c7abb","observation_id":"eae75902-24bb-42eb-aeec-b53e992d336c","resolution":{"observed_at":"2026-08-05T12:28:33.150695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-03T11:27:21.448208Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-08-05T12:28:30.182788Z","title":"Zerobench: An impossible visual benchmark for contemporary large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.182788Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:10f91973ecfb215592522fa3281a8ad06e597e542a1d1473012c842203033b71","observation_id":"13a4d9b5-34ab-4d86-b96c-42772aa0706f","resolution":{"observed_at":"2026-08-05T12:28:30.182788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-04T21:46:45.619744Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-05T12:28:30.391028Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.391028Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:904ec6fd0338a2d5d8505946af7e30215db774a4a5eeb6d5fe86f8677189e10e","observation_id":"650cbf96-a3be-4115-b2a4-b1a6341e933c","resolution":{"observed_at":"2026-08-05T12:28:30.391028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13059","last_updated":"2025-02-18T17:04:26Z","snapshot_observed_at":"2026-08-04T04:38:31.488502Z","submitted_at":"2025-02-18T17:04:26Z","title":"SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13059","snapshot_observed_at":"2026-08-05T12:28:30.556672Z","title":"Simplevqa: Multimodal factuality evaluation for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.556672Z"},"links":{"cited_paper":"/paper/2502.13059","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:1cc8a606242b797071f84b4e155959021573e9368ae4ebe8a864527e97291979","observation_id":"50d5d9c7-9092-4a04-8155-352b8c3cffe7","resolution":{"observed_at":"2026-08-05T12:28:30.556672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T12:28:30.702457Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.702457Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:73c11a5d2ce5dc06894b0054aa833043bd66382cc53eca29dada57efe5d03dc7","observation_id":"58847d44-65cc-47b0-83c6-4c87767cd765","resolution":{"observed_at":"2026-08-05T12:28:30.702457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T12:28:30.929404Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:30.929404Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:72f242f75979c0e6b13ef8ebbedd7fc8f43c51ea8462811fe1b186ab68107329","observation_id":"a420801f-3fd4-4250-95f7-555073a1599a","resolution":{"observed_at":"2026-08-05T12:28:30.929404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T12:28:31.083905Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.083905Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:6a61665c5478a6bb266babf28281e4908bbf744e8dff9ecd49badd63c075d46f","observation_id":"d3495f12-f1a7-4bd8-bcb5-7dea6e2e3846","resolution":{"observed_at":"2026-08-05T12:28:31.083905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T12:28:31.248879Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning? arXiv preprint arXiv:2407.01284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.248879Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:8e852ddd50535143cbe3a3d6450328da6bbfbb764f45ab0595eff659d7b39400","observation_id":"eb1c9eea-f679-4bcb-9227-7c8d10cc2ad9","resolution":{"observed_at":"2026-08-05T12:28:31.248879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-05T12:28:31.473440Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.473440Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:31b4ffe1998fc0f033d1bfaff7fc04af4408a62d0e838add6613ac6acbbe8c1b","observation_id":"f331c613-383a-4f77-8aab-df3e5cebe440","resolution":{"observed_at":"2026-08-05T12:28:31.473440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-05T12:28:31.683925Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.683925Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:d23fea344c880d583d263e6555d641b2275c3706963d9fdb24a1c7f3f70da650","observation_id":"2a76cfdb-d8cb-4be2-b25b-a98ce65010b4","resolution":{"observed_at":"2026-08-05T12:28:31.683925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T12:28:31.824685Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:31.824685Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:c307f81cecfbb820c088413b8b3980256d019d1ba8db917f65fa893461d06247","observation_id":"c366044e-c563-4ae0-bc80-11aa6d5e7e6e","resolution":{"observed_at":"2026-08-05T12:28:31.824685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-03T18:18:56.117009Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T12:28:32.039808Z","title":"dad\") lightly bites the little dog’s ear as a way of correcting the little dog’s improper behavior. This gentle bite is a common","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:32.039808Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:6a27ae61831c518e59539393c8d3d97bd59764db391057732340c2693ea12ea6","observation_id":"83f477d4-a0ee-4e46-b838-1ef3770b3e50","resolution":{"observed_at":"2026-08-05T12:28:32.039808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11245","last_updated":"2021-02-22T18:30:15Z","snapshot_observed_at":"2026-07-06T10:43:36.832191Z","submitted_at":"2021-02-22T18:30:15Z","title":"Silent Data Corruptions at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.11245","snapshot_observed_at":"2026-08-05T12:28:28.302233Z","title":"Silent data corruptions at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.302233Z"},"links":{"cited_paper":"/paper/2102.11245","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:8104d58593c4113143cbbbf9d2223c9c85e3f28dde0765cdb50c0b909b420de3","observation_id":"67a1da38-4632-40f3-b0b5-40118ad57f57","resolution":{"observed_at":"2026-08-05T12:28:28.302233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16511","last_updated":"2023-09-28T15:18:35Z","snapshot_observed_at":"2026-08-05T15:44:37.116619Z","submitted_at":"2023-09-28T15:18:35Z","title":"Toloka Visual Question Answering Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16511","snapshot_observed_at":"2026-08-05T12:28:28.888144Z","title":"URL https://doi.org/10.1007/ s11263-016-0981-7","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:28.888144Z"},"links":{"cited_paper":"/paper/2309.16511","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:ee017dadcfef01a59c20e12bc21bc0e6c69da40bfa4c9847a2ffec742d75c054","observation_id":"6f5049e9-a1c7-4e0d-8a87-9c585e5be49e","resolution":{"observed_at":"2026-08-05T12:28:28.888144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T12:28:26.527163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.527163Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:df6f65d780511371fdb5c34d1786a19a88b21c780b394322afbc88e4afde1625","observation_id":"af8abafb-9638-4e7b-b7ad-0ef1fd8de52c","resolution":{"observed_at":"2026-08-05T12:28:26.527163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T12:28:25.063652Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.063652Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:669a322d453247da188c67583741fc21f2848e38abba27cb9c734fa969c79bb2","observation_id":"f2e98c2b-beef-44a4-a370-49cc3bf06313","resolution":{"observed_at":"2026-08-05T12:28:25.063652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T12:28:25.449452Z","title":"Robobrain 2.0 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:25.449452Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:66cfb3f3cf82c96767e29966d9b07487adc1365ec593dc402f905a53d7a07715","observation_id":"29e69062-42d1-44e4-90bb-5dbe94c70ed8","resolution":{"observed_at":"2026-08-05T12:28:25.449452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T12:28:23.636619Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 29 inbound Pith citation observations for arXiv:2509.01563."}