{"as_of":"2026-08-04T22:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54a16c2666e6a94175eac70bb9b7bc126d7c37fee892ce3ff5bc595d2111abea","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":186,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:58:25.467092Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T06:34:41.884360Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T20:25:33.854923Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2306.13394"},"observation_digest":"sha256:70bea1a70dd8ac595fbe5d9ed6f452298a6f077459ba2d935378ef81c995111a","observation_id":"55779ed8-40cf-4c77-9c59-708f0a491d66","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:17b2b2dccfec13603d04e15f331a9592032bb0d170295ce2d5aa03dc80105270","observation_id":"4d03bda5-c45e-47a9-8b8c-6b989d066cfd","resolution":{"observed_at":"2026-05-17T20:33:26.936643Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:6e060266678a668b4729b0c8996beba90e2e3006fe2fac0ec3695832c85adaaa","observation_id":"f93d5bae-3de3-40f4-9fa5-a20bb918df81","resolution":{"observed_at":"2026-05-19T06:59:03.266803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T15:18:43.724432Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2504.01805"},"observation_digest":"sha256:11acf05826434402df1418ab1db035f32f79688fdf1a917821583efd18988ebb","observation_id":"2339702a-3672-4d47-83e6-3c371489d463","resolution":{"observed_at":"2026-05-15T15:18:43.820420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2504.14239","last_updated":"2025-04-19T09:25:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-19T09:25:55Z","title":"InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T13:54:44.011048Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2504.14239"},"observation_digest":"sha256:9ba8b13663b759e36e0f2cfdaed27c46fdd9d49ace6e676557b9b845717cf634","observation_id":"65203e92-b1e1-48c1-af8a-f5a14bacb9ba","resolution":{"observed_at":"2026-05-18T13:54:44.166120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:acb4ce2e8af20ab90867cf55172b74247bb8c4f8c72772e2182ecbfb58cb6d97","observation_id":"95c2cca8-0b97-4cd3-96cd-a6608d91a571","resolution":{"observed_at":"2026-05-11T05:26:05.528482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:67578bb1069e72e5fc7edc4f1cee0054c52ddf28ef2607913ef81aa993fe5d22","observation_id":"43fb7d13-7bce-4a2f-836d-933acc57486c","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2505.17012","last_updated":"2026-04-13T12:33:41Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:03Z","title":"SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-22T13:07:11.548885Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.17012"},"observation_digest":"sha256:79cf246f7328ac61cc1d9857f7e35cc645c9e44297354d50a3ad6825e9638f9b","observation_id":"d5a84dc6-6683-4aa7-a25a-2c590443bfc5","resolution":{"observed_at":"2026-05-22T13:11:35.700108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-01T16:24:28.120659Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T05:40:55.944288Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.21374"},"observation_digest":"sha256:32a7034cec669bbb8118bd48ff891c5c2406d25690e35ace4588536c196bfdb9","observation_id":"e00a243f-4920-475c-b18c-07329bf16a9f","resolution":{"observed_at":"2026-05-17T05:40:56.025955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:c05aff19ce7d3fbeeb0ffd6aa57b73966489871162a72b234fc39c30c8925d4a","observation_id":"297854d3-26f4-4e7e-b3b7-7d2a5aebcd13","resolution":{"observed_at":"2026-05-22T01:05:51.891067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2506.06211","last_updated":"2026-04-21T03:40:06Z","snapshot_observed_at":"2026-08-03T01:28:16.465454Z","submitted_at":"2025-06-06T16:17:09Z","title":"PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T10:43:02.601014Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.06211"},"observation_digest":"sha256:b4a76f59d2af7d7b703aebca356af5b99812fd66a50cc9b465c3578f44bb5ddb","observation_id":"9afad529-973b-4530-9c32-f0f0ef0dd51d","resolution":{"observed_at":"2026-05-19T10:47:15.155684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T15:27:04.228144Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.20670"},"observation_digest":"sha256:9e283ce8616bb1e5dbfe0c8aa65248c654a8c4bd9972ca0ffffbe1ea02f43e7e","observation_id":"9556cc53-a69b-4904-92f2-650f750ec813","resolution":{"observed_at":"2026-05-16T15:27:04.310839Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2507.05920","last_updated":"2026-04-20T01:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T12:05:05Z","title":"High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T06:10:57.219445Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2507.05920"},"observation_digest":"sha256:92a0a6825ea4564481262640c93a4892705dabd3bcb3c1620b9f3fb7ee9f7496","observation_id":"2e5864fe-54cc-4b85-b577-67c86d72d40b","resolution":{"observed_at":"2026-05-19T06:12:07.007047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2508.11196","last_updated":"2026-05-06T08:41:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-15T04:06:40Z","title":"UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T22:17:41.758059Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2508.11196"},"observation_digest":"sha256:0bcbca4c75b997428bcd93619d7acf1f0b236a82b92116b1a2272e46d9c45196","observation_id":"cf55cf4f-b851-4170-b693-177f4ad91a9c","resolution":{"observed_at":"2026-05-18T22:21:53.252865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:0d2218fe17d29182cc884cd40019570bd1e75bf14f351fa76f5988e08793a0d1","observation_id":"e6701644-17ca-449c-afab-0e4c9da3fa28","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-04T20:58:25.467092Z","title":"bbox_2d\": [100, 253, 194, 437],","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08266","last_updated":"2025-09-10T03:49:40Z","snapshot_observed_at":"2026-08-04T20:58:23.977765Z","submitted_at":"2025-09-10T03:49:40Z","title":"Examining Vision Language Models through Multi-dimensional Experiments with Vision and Text Features","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:58:25.467092Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2509.08266"},"observation_digest":"sha256:95da3a6256ba8cd9c067d9c3b2b825d9ae3eda44646df3f0c694463497bb2fdd","observation_id":"0d57f32d-4e42-4dd6-a132-2d26bd3076d7","resolution":{"observed_at":"2026-08-04T20:58:25.467092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-04T19:27:40.781701Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09254","last_updated":"2025-09-11T08:39:08Z","snapshot_observed_at":"2026-08-04T19:27:38.196956Z","submitted_at":"2025-09-11T08:39:08Z","title":"Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:40.781701Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2509.09254"},"observation_digest":"sha256:ef370562e2b53680b0bee6ad29ce2b7d49c4a9feb4aa8f09377b79df75003c85","observation_id":"5e2cfb3b-5c33-4389-aaa5-10228b0cfa34","resolution":{"observed_at":"2026-08-04T19:27:40.781701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-04T18:17:17.568652Z","title":"arXiv preprint arXiv:2504.07491","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10059","last_updated":"2025-09-12T08:46:49Z","snapshot_observed_at":"2026-08-04T18:17:15.149681Z","submitted_at":"2025-09-12T08:46:49Z","title":"Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:17:17.568652Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2509.10059"},"observation_digest":"sha256:e7a49b67a6c9abccd43db56632e8888b555ab180a10cce3b7b15df7febe4c967","observation_id":"0709c628-21b7-4af1-8f8e-f4cacba41191","resolution":{"observed_at":"2026-08-04T18:17:17.568652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2510.17932","last_updated":"2026-04-18T11:50:51Z","snapshot_observed_at":"2026-08-02T22:11:21.544733Z","submitted_at":"2025-10-20T15:11:56Z","title":"From Charts to Code: A Hierarchical Benchmark for Multimodal Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2510.17932"},"observation_digest":"sha256:c304ae2caa1ef59121acb44543f50feffc73152d608ead5324eeef78e7e8f606","observation_id":"3d3e06c0-d74d-46b7-9b6b-e3fcd231fe75","resolution":{"observed_at":"2026-05-18T06:10:57.783014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-04T07:02:43.587509Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27266","last_updated":"2026-05-27T02:32:58Z","snapshot_observed_at":"2026-08-04T07:02:38.694383Z","submitted_at":"2025-10-31T08:07:02Z","title":"Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T07:02:43.587509Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2510.27266"},"observation_digest":"sha256:ce0e98470380eb72ce91b7aff3926695682a4a7a12f9ebe0a02ba7d557443b25","observation_id":"ab9d455c-f058-420f-9c91-3be7a5cae8a0","resolution":{"observed_at":"2026-08-04T07:02:43.587509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-03T23:06:04.886225Z","title":"Kimi-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.886225Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:19074f2557b11c6ac8654a034029f0e786e6e827afd5f72ef0e4fcfbb5988f34","observation_id":"ebf26015-b100-4edf-b917-5bb22bcb914e","resolution":{"observed_at":"2026-08-03T23:06:04.886225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-03T23:08:49.425505Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:49.425505Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:2302d9580203c4132fef1db541949e57f81ac88da996db48b547f794e9c55b88","observation_id":"f4106c95-603e-4526-b91a-3109f8fdc443","resolution":{"observed_at":"2026-08-03T23:08:49.425505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T19:51:04.983299Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:7cccd46beacd84a8efe5b8d7e7dd1869b9d1e41e35dc91e5cceadbb80ce1ccb7","observation_id":"a5cad98f-d99c-48b3-8804-b6d80881b188","resolution":{"observed_at":"2026-05-21T19:54:20.195365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-03T21:44:02.104425Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T21:44:02.104425Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:69460c0d0b0a7b6ab3dc2f0eaaa0cce6af4dbf3ab0df7ade973ee01d3816f271","observation_id":"3259e867-3b33-4db2-ace3-fe0b8d1b766f","resolution":{"observed_at":"2026-08-03T21:44:02.104425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-07-31T08:04:43.452255Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:37.418493Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2511.14582"},"observation_digest":"sha256:7ae3d5298f9e646683a3aba6902f29f28441e3d2cacfa24723ccee7383e1922c","observation_id":"2a7b7d8d-67ee-4f80-8e10-e28e67b5abfe","resolution":{"observed_at":"2026-05-17T20:50:15.080914Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2511.18085","last_updated":"2026-05-08T04:30:23Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T15:00:08Z","title":"Continually Evolving Skill Knowledge in Vision Language Action Model","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T06:02:31.638120Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2511.18085"},"observation_digest":"sha256:435fa4f55300fa78b09be739c34029d2f2f6f462a4cd56b796707867fcbf916c","observation_id":"2e0875c6-fdbf-4465-a492-8569bf22967a","resolution":{"observed_at":"2026-05-17T06:04:09.178208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-03T20:41:51.622305Z","title":"Kimi-vl techni- cal report.CoRR, abs/2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19032","last_updated":"2026-07-09T04:07:40Z","snapshot_observed_at":"2026-08-03T20:41:47.305603Z","submitted_at":"2025-11-24T12:07:56Z","title":"Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:41:51.622305Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2511.19032"},"observation_digest":"sha256:200178272caf06e6b6adf7a5086ed26d57e630d3596fc8230dbc45ce7dd8f9ac","observation_id":"c68224d0-4ad7-4081-a6b7-44ce98252ea2","resolution":{"observed_at":"2026-08-03T20:41:51.622305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2512.03479","last_updated":"2026-05-08T15:07:43Z","snapshot_observed_at":"2026-07-06T22:37:41.555068Z","submitted_at":"2025-12-03T06:14:26Z","title":"ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T03:05:42.773193Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2512.03479"},"observation_digest":"sha256:06702d0a579a61c50f3877192bd382facc4a434471c2b66e213d0ca2c7bcd75c","observation_id":"acdfc20d-93b7-4397-a17f-edbafef311f4","resolution":{"observed_at":"2026-05-17T03:08:56.583164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-03T14:16:50.839790Z","title":"Kimi-vl technical report.arXivpreprintarXiv:2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21095","last_updated":"2026-07-11T09:04:48Z","snapshot_observed_at":"2026-08-03T14:16:48.399963Z","submitted_at":"2025-12-24T10:35:21Z","title":"UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T14:16:50.839790Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2512.21095"},"observation_digest":"sha256:d433ac9c398beea9f6d0481681cfa94ba2e696a95f646f39ff69a25386ac80fb","observation_id":"84a80519-a6b0-4f5d-a9a4-f08b08442d62","resolution":{"observed_at":"2026-08-03T14:16:50.839790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2601.14044","last_updated":"2026-01-20T15:00:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-20T15:00:15Z","title":"Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T12:36:23.661583Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2601.14044"},"observation_digest":"sha256:a35b611795b7eca845f74d3a4752025ccdaf13b4df4b549c8a08ca19e4452889","observation_id":"db78e159-c9e5-4d5a-b7be-ba64ded36bda","resolution":{"observed_at":"2026-05-16T12:37:53.067665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:961740f05f18a3083cf8b3aae010e970aeb9d005e81726bbc61454d8fd7893f8","observation_id":"60f25c16-e848-4c3e-ba7f-83f8a5fe2ba9","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2602.04802","last_updated":"2026-07-22T16:08:20Z","snapshot_observed_at":"2026-08-03T04:31:17.019218Z","submitted_at":"2026-02-04T17:48:55Z","title":"VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T13:36:28.844714Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2602.04802"},"observation_digest":"sha256:9a7dd2cd656492841c3f8c2185fdf3cc836977811f6a4b7545b8b37701b36f7b","observation_id":"0105c6cb-8537-4c49-ae5d-384c59aa0c56","resolution":{"observed_at":"2026-05-21T13:40:12.554830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-03T04:31:21.357882Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04802","last_updated":"2026-07-22T16:08:20Z","snapshot_observed_at":"2026-08-03T04:31:17.019218Z","submitted_at":"2026-02-04T17:48:55Z","title":"VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T04:31:21.357882Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2602.04802"},"observation_digest":"sha256:11e51b992fc3643065a980f39d96f938b31e2859672ba6a566177f09e92e9ebd","observation_id":"8d9669c1-4a0b-4094-acb6-4f00d770d1d9","resolution":{"observed_at":"2026-08-03T04:31:21.357882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-03T02:57:45.980403Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09431","last_updated":"2026-05-24T12:21:22Z","snapshot_observed_at":"2026-08-03T02:56:43.461670Z","submitted_at":"2026-02-10T05:51:02Z","title":"Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T02:57:45.980403Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2602.09431"},"observation_digest":"sha256:05d37e950ec032c89c20e38975380848ffc891b21943803d2310f54c3335a451","observation_id":"5c82d91f-46ef-414b-b25b-f9b160fed38d","resolution":{"observed_at":"2026-08-03T02:57:45.980403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T20:12:46.385646Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:193686c0c0f5a9e7f8b527b854d9b162c10530be4d2119dfa9fa4faa23b04ed5","observation_id":"76438f37-5a28-4ff7-b9d0-5233ad183ec3","resolution":{"observed_at":"2026-05-15T20:16:34.519578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-22T10:30:06.829915Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:74b0ad8a6dc8c05d459f3e02487a99838501c56f4de2fc8b234bcbc8ac8a3c32","observation_id":"055bd07d-91a0-4474-a9d2-e17016b4c4ce","resolution":{"observed_at":"2026-05-22T10:31:25.304135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-02T22:00:09.601701Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:09.601701Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:0e6033d7a3f97ebd6c4a70109c1f82db243c158e14c510ae1c6bb10434135059","observation_id":"3d042823-38ec-4a82-96de-2a6eeda89d5d","resolution":{"observed_at":"2026-08-02T22:00:09.601701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2602.21545","last_updated":"2026-05-14T00:38:30Z","snapshot_observed_at":"2026-08-04T04:29:45.131716Z","submitted_at":"2026-02-25T04:04:00Z","title":"MUON+: Towards More Effective Muon via One Additional Normalization Step for LLM Pre-training","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T19:24:22.699712Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2602.21545"},"observation_digest":"sha256:69ef0b3f56700ba26507d7f9dc53341078a5cfdf050475d6de68e522c6f57211","observation_id":"ff69048e-71cd-4460-a2e1-18f8d04d9a29","resolution":{"observed_at":"2026-05-15T19:26:31.388717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-14T23:22:13.847876Z","title":"Kimi-vl technical report.arXiv preprint arXiv:2504.07491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10757","last_updated":"2026-06-20T10:12:15Z","snapshot_observed_at":"2026-08-01T20:46:30.571720Z","submitted_at":"2026-03-11T13:32:58Z","title":"CodePercept: Code-Grounded Visual STEM Perception for MLLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T23:22:13.847876Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2603.10757"},"observation_digest":"sha256:e6a5ee262894972d15d16fbc133433a302b9788e4b2f09f0b2943fbe9cbe4039","observation_id":"9009df79-bb90-43c7-b0eb-7db5a41098fb","resolution":{"observed_at":"2026-07-14T23:22:13.847876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-04T05:50:27.244335Z","title":"arXiv preprint arXiv:2504.07491 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12147","last_updated":"2026-08-03T09:43:55Z","snapshot_observed_at":"2026-08-04T21:44:15.521326Z","submitted_at":"2026-03-12T16:46:01Z","title":"EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T05:50:27.244335Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2603.12147"},"observation_digest":"sha256:19e625c36a557831e51fae5fa0220aeb12d674ec2fa59cac7a66869af3a1460a","observation_id":"6cb78262-1f02-45ed-b11d-712a227bc1d5","resolution":{"observed_at":"2026-08-04T05:50:27.244335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2603.27064","last_updated":"2026-04-14T20:08:27Z","snapshot_observed_at":"2026-07-06T22:50:50.593464Z","submitted_at":"2026-03-28T00:45:05Z","title":"ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T22:39:06.113655Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2603.27064"},"observation_digest":"sha256:6a56aa64c938958623e982ec81a7f291e3cd80fd5169686e170d9b35cca7de51","observation_id":"ffd491ef-fa29-43c1-a66a-58ee5588d094","resolution":{"observed_at":"2026-05-14T22:39:32.946024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:fc982bb1f00e7abb0380ecaba32a601974549b131b4618592d8e7071592c9df1","observation_id":"852a61a8-ef38-42ca-8b8c-1ff165f2f52c","resolution":{"observed_at":"2026-05-14T22:08:04.276718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.02505","last_updated":"2026-04-02T21:02:10Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T21:02:10Z","title":"Optimal Projection-Free Adaptive SGD for Matrix Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T20:56:41.466669Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.02505"},"observation_digest":"sha256:75c32557a2310850a726d4c387f38de32bab16e1900e017bf29c9682fede2869","observation_id":"0f9777ea-4649-4051-8c43-e588ba82ee54","resolution":{"observed_at":"2026-05-13T20:58:15.749456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.02870","last_updated":"2026-04-03T08:37:08Z","snapshot_observed_at":"2026-08-01T03:43:05.117795Z","submitted_at":"2026-04-03T08:37:08Z","title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:55.062113Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.02870"},"observation_digest":"sha256:371dd874cf08d097beacf2e9ae2b096d045a154e12c8aa15018c38a7af9c7315","observation_id":"d2d870cd-bd50-40b1-be9a-5953943306ca","resolution":{"observed_at":"2026-05-13T21:08:17.289912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.04475","last_updated":"2026-04-06T06:57:08Z","snapshot_observed_at":"2026-07-06T22:53:29.118925Z","submitted_at":"2026-04-06T06:57:08Z","title":"Discrete Prototypical Memories for Federated Time Series Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:59:18.819953Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.04475"},"observation_digest":"sha256:d49fc711f48bc73df96c1f48ebd9f30c898eb2a02a86fc97c9926f418b5d65f1","observation_id":"be5414fa-f4ba-49be-a3d3-a87196db679e","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:32.778695Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.05015"},"observation_digest":"sha256:7b4e64e1e4e5cba88e75641debe9218e5a18a31d5ac0568b32a7d3e0517aebb5","observation_id":"0f89481f-bca4-46bf-a9c0-d6c1bf413243","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.07296","last_updated":"2026-04-09T09:04:20Z","snapshot_observed_at":"2026-07-06T22:55:33.502756Z","submitted_at":"2026-04-08T17:03:02Z","title":"OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T17:41:31.544716Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.07296"},"observation_digest":"sha256:73412a896219c45fc97b39fbe20e4d12383e2a01ac158d68b6693b291bf57b82","observation_id":"ff2e63ab-bbc6-438b-be97-c7efc1c984e5","resolution":{"observed_at":"2026-05-11T06:20:56.623575Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.07753","last_updated":"2026-06-27T04:43:13Z","snapshot_observed_at":"2026-07-13T00:15:55.253944Z","submitted_at":"2026-04-09T03:19:26Z","title":"Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:17.872120Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.07753"},"observation_digest":"sha256:2fb7934b1d759584dfb4c5c1b3f8c2c91764772491e52e22d280582eed0be2ce","observation_id":"c3fd5b0d-0524-49f8-8bf7-2ffe0449a1e9","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.08120","last_updated":"2026-04-09T11:40:25Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:40:25Z","title":"Small Vision-Language Models are Smart Compressors for Long Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:38:49.654073Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.08120"},"observation_digest":"sha256:b69db4b42a16b29ade9f21a48769b83bb6679a9158acd4f04a2b7e9802fcbda8","observation_id":"272b9161-9183-4ac1-86ec-d7f8351168c3","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.08541","last_updated":"2026-04-09T17:59:44Z","snapshot_observed_at":"2026-07-31T11:38:01.169765Z","submitted_at":"2026-04-09T17:59:44Z","title":"Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:03:13.911088Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.08541"},"observation_digest":"sha256:afbede691b71d1f91ed29bd43f364cab7caaf2111cfe8c9884e46a62efee1e0b","observation_id":"7800a3c8-c310-42dd-8eaa-cc6b5a8455bf","resolution":{"observed_at":"2026-05-11T07:41:00.571757Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.08884","last_updated":"2026-04-10T02:47:32Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T02:47:32Z","title":"HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:49.114269Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.08884"},"observation_digest":"sha256:a6a50b8a6a0d015e2bd77e0ea705d0cd57f0964d981bf2ebd9b381b3b99acf9d","observation_id":"9d575264-c386-48eb-9efb-7bf23cef0413","resolution":{"observed_at":"2026-05-11T05:30:57.733616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.09967","last_updated":"2026-06-05T21:42:21Z","snapshot_observed_at":"2026-08-01T20:47:26.868945Z","submitted_at":"2026-04-11T00:27:40Z","title":"Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:00:53.682217Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.09967"},"observation_digest":"sha256:551753f3212bb39a8257cec8cd607761a792129ec48def9b1f122db5d1ad4c8a","observation_id":"92ce7279-8e24-4644-9123-9ea32d23c8ca","resolution":{"observed_at":"2026-05-11T07:41:01.624156Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.10666","last_updated":"2026-04-12T14:47:41Z","snapshot_observed_at":"2026-08-03T00:41:31.043018Z","submitted_at":"2026-04-12T14:47:41Z","title":"Omnimodal Dataset Distillation via High-order Proxy Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:15:46.835576Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.10666"},"observation_digest":"sha256:48820a422bc709dfef95280270dbe4dc23264452d2945e3bc89e27515608a72b","observation_id":"4f5cf572-9618-4155-bd6f-47e414bb41f1","resolution":{"observed_at":"2026-05-11T09:05:59.633360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:0ce138dce9159b164b1d041bd63be170d0a09cb11d7125c984f1dc107eeb3378","observation_id":"6875ff6c-b4e0-43b9-8754-ddd2f43fe59d","resolution":{"observed_at":"2026-05-11T10:41:03.867263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.12358","last_updated":"2026-04-15T17:43:53Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:48:31Z","title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:37.022338Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.12358"},"observation_digest":"sha256:7cb642757f8564ec899614a8eae84f3497fc06dd6e5f1a262f94fa150f2cfce0","observation_id":"ce46f2f9-95b5-4755-b1ac-f921006d1639","resolution":{"observed_at":"2026-05-11T11:31:01.314372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.13488","last_updated":"2026-04-15T05:23:04Z","snapshot_observed_at":"2026-08-02T15:35:18.284449Z","submitted_at":"2026-04-15T05:23:04Z","title":"Towards Scalable Lightweight GUI Agents via Multi-role Orchestration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:45:17.686098Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.13488"},"observation_digest":"sha256:aa66863630cc7a407a292b79c94afaf2f8888e4c448a99449d3f0df8af3503e6","observation_id":"ded5dacf-80c2-4e36-8c2c-4d918bbd7462","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-02T16:18:18.484070Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T13:09:24.304696Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:79f8a63b5b3409aa69e9613f941b902537dc43d709febc960ed0a3e65743651e","observation_id":"69bac594-d3a6-4c8e-8be4-259563a5fd3f","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-02T16:18:24.048781Z","title":"arXiv preprint arXiv:2504.07491 (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-02T16:18:18.484070Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:24.048781Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:4a3538e1422285af88440203f8d1fd6c09f3429830d5a2d6546594759e486b60","observation_id":"8acf0d45-7092-4679-8faf-46fd139958f2","resolution":{"observed_at":"2026-08-02T16:18:24.048781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:b110ad4b8c291f39c21a1a69f4da5d760f07fe174a7fb6d4bdea7109ae7683cf","observation_id":"e85b1f34-676a-4e5c-a11e-9b42ba5eaf4e","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.16893","last_updated":"2026-04-18T07:56:32Z","snapshot_observed_at":"2026-07-06T23:04:05.813982Z","submitted_at":"2026-04-18T07:56:32Z","title":"EasyVideoR1: Easier RL for Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T07:41:27.231098Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.16893"},"observation_digest":"sha256:39377ef521163963b919ac51a83aed1b8235d907ed03b4f3a5419bc5102cccc4","observation_id":"aff05f45-09d0-4abe-baaa-de789768a30f","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.17472","last_updated":"2026-04-19T14:53:38Z","snapshot_observed_at":"2026-07-06T23:04:32.734175Z","submitted_at":"2026-04-19T14:53:38Z","title":"UniMesh: Unifying 3D Mesh Understanding and Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:42.679323Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.17472"},"observation_digest":"sha256:15bc0dab10e24a1d1ee18053f959acd9714ea3aed8dfee44bfb494b94bfc31cf","observation_id":"4e557216-bc91-4672-b8f6-963f6d8c9e27","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.18076","last_updated":"2026-04-20T10:46:41Z","snapshot_observed_at":"2026-07-06T23:04:59.629739Z","submitted_at":"2026-04-20T10:46:41Z","title":"Class-specific diffusion models improve military object detection in a low-data domain","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T04:34:29.790101Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.18076"},"observation_digest":"sha256:bcc5f97ad17855e6676145de4417d011400cd2d5f0014f5a6e4ca50b5676902f","observation_id":"e20c7f5c-ca36-4a5a-9b29-196b4022684f","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.18788","last_updated":"2026-04-20T19:52:56Z","snapshot_observed_at":"2026-07-31T18:40:43.182032Z","submitted_at":"2026-04-20T19:52:56Z","title":"Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T05:31:25.826205Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.18788"},"observation_digest":"sha256:cbc01d351f365746fee7ba87a8fba3c1a2edcf8b016ae71c8af1b0b56d240631","observation_id":"d9e07943-8640-41be-8e92-0c9d796e0a08","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-02T21:32:46.195325Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:940a6f49176c219ffd343fa141ef2f68485235d5617203e7c667ed343e0d5362","observation_id":"1cc4c9cd-31a2-4e2f-9f28-1cd4dd94b57f","resolution":{"observed_at":"2026-05-11T13:46:03.196041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.20878","last_updated":"2026-04-11T09:38:45Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-11T09:38:45Z","title":"AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:32.154619Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.20878"},"observation_digest":"sha256:0fedb33bfd510f5f3374c1bb2d26fcbd9c323b48a1cb7ef468ff12fd22ab228e","observation_id":"90311577-66e0-4f69-a77c-51dd9ff15b44","resolution":{"observed_at":"2026-05-11T09:16:00.217783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:8ac2e5328b182f780cdafdb64c14c3a77a0f20e0594296edf9898dbdb9e21015","observation_id":"c8f3be58-bc35-47d5-bb88-b618a19a1f0e","resolution":{"observed_at":"2026-05-11T14:16:06.002603Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.22884","last_updated":"2026-04-24T08:13:19Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-24T08:13:19Z","title":"Can Multimodal Large Language Models Truly Understand Small Objects?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T12:49:53.645987Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.22884"},"observation_digest":"sha256:ab4f0d0093abba7d062397935beb012b1f7d67b8882230f01b5ad5f56d235870","observation_id":"e4506c0b-26e3-4342-9f6d-67390857b338","resolution":{"observed_at":"2026-05-11T19:01:19.432151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.23996","last_updated":"2026-04-27T03:23:19Z","snapshot_observed_at":"2026-07-06T23:10:07.178566Z","submitted_at":"2026-04-27T03:23:19Z","title":"SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T04:41:52.098355Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.23996"},"observation_digest":"sha256:35207c3473097da51f721dd2578906239b7b807e6bbd55dc233e5c79662be8eb","observation_id":"50affc38-1529-484a-a1c5-8fb34d30ef20","resolution":{"observed_at":"2026-05-11T21:41:13.660981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.25185","last_updated":"2026-06-18T03:00:25Z","snapshot_observed_at":"2026-07-06T23:11:07.254460Z","submitted_at":"2026-04-28T03:43:53Z","title":"The category of Whittaker modules over the Cartan Type Lie algebra $\\bar{S}_2$","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T09:08:06.592577Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.25185"},"observation_digest":"sha256:3ca88abe882bde003b813eabb3983976c1d4be6b37f2444da343b157b4571a33","observation_id":"ed11a268-f0c8-4ac5-905e-ef92496eb14d","resolution":{"observed_at":"2026-07-01T09:25:40.494402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.25186","last_updated":"2026-04-30T03:30:43Z","snapshot_observed_at":"2026-07-06T23:11:07.254460Z","submitted_at":"2026-04-28T03:45:09Z","title":"FCMBench-Video: Benchmarking Document Video Intelligence","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T17:14:19.186123Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.25186"},"observation_digest":"sha256:3be5ac317f80fdc62086f55e0584ae3edb3c9106389f2ddcc71f960ded731030","observation_id":"ed0422f9-8741-40da-9316-9ee88988cc23","resolution":{"observed_at":"2026-05-11T23:21:41.296487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.25884","last_updated":"2026-04-28T17:28:33Z","snapshot_observed_at":"2026-08-03T15:40:02.849060Z","submitted_at":"2026-04-28T17:28:33Z","title":"QCalEval: Benchmarking Vision-Language Models for Quantum Calibration Plot Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-07T16:22:12.446406Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.25884"},"observation_digest":"sha256:87ba640a76c1476c10d8f831afe62d08e23001cab600fc503ee83a5f5c9783a1","observation_id":"6dd2b337-08df-4c83-a4bd-9e7b2726aa17","resolution":{"observed_at":"2026-05-11T23:46:26.715698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-02T08:22:53.063329Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-09T18:56:51.627714Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:30edc1f5b45c7e59f91d7cdd20b1d990a2185a68a27f70b0959832df188ecb96","observation_id":"58639a19-deb9-40d5-a6bb-c7c8caa849ca","resolution":{"observed_at":"2026-05-11T16:01:11.335758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.00809","last_updated":"2026-06-09T13:08:44Z","snapshot_observed_at":"2026-08-02T08:22:53.063329Z","submitted_at":"2026-05-01T17:51:38Z","title":"Let ViT Speak: Generative Language-Image Pre-training","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-01T07:35:07.825460Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.00809"},"observation_digest":"sha256:5453d33c950da602f484857ea65c89eefa04e9ef94bbdfd271d1880540bfa99a","observation_id":"944ba6da-b60f-4260-a002-7c7f43d851b4","resolution":{"observed_at":"2026-07-01T07:35:28.739389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-09T18:53:06.494640Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:be0caf80417f66bf4c0ec8d916e91fbf36177537a6f7b1a1bc0c440b5a146a0c","observation_id":"44864580-5ae5-4ff7-88d0-26ecb75c141b","resolution":{"observed_at":"2026-05-11T16:01:22.615220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:15.136031Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:548846cfc1ccc9b1ebdd63b6d403ecbc9e9a5e348be93a304d4987ec95f0889e","observation_id":"dc9dfde6-5282-4a23-938b-f37f6b6758d2","resolution":{"observed_at":"2026-05-11T01:50:51.647475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.02730","last_updated":"2026-05-04T15:31:11Z","snapshot_observed_at":"2026-08-02T14:48:33.210016Z","submitted_at":"2026-05-04T15:31:11Z","title":"Perceptual Flow Network for Visually Grounded Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T18:40:55.753827Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.02730"},"observation_digest":"sha256:3ad6f010d8b198a3f5af5b7e45a07daee1120ac8feae2cfec6b82485176fea34","observation_id":"143290ce-9240-42f3-8932-36e849ee8ca6","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.02946","last_updated":"2026-05-01T11:54:55Z","snapshot_observed_at":"2026-07-31T02:35:59.178763Z","submitted_at":"2026-05-01T11:54:55Z","title":"RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-09T19:22:00.217729Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.02946"},"observation_digest":"sha256:b3852a2b5b0ef5f8e66ec882c31adc26183e40c9b82d8a151f933086a0893b41","observation_id":"519b8b23-d68c-4d19-98a7-c5f6c4829e94","resolution":{"observed_at":"2026-05-11T15:46:17.330355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.04952","last_updated":"2026-05-06T14:15:10Z","snapshot_observed_at":"2026-07-06T23:17:38.226365Z","submitted_at":"2026-05-06T14:15:10Z","title":"Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T17:58:10.323354Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.04952"},"observation_digest":"sha256:fcb2840525039f0504c6e61c521aeff5baafdf1fffab943ae5bb17285b02ef86","observation_id":"f4079c6e-4bc2-4c78-99f2-a13b59b81248","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-02T06:50:35.896043Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T06:47:25.155437Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:8138133ac2161cf6892f026e98cb483690dffe349d296ff78caffa355e5a91d5","observation_id":"81e106a4-0252-4c02-b40c-6dde3db2cc46","resolution":{"observed_at":"2026-05-11T01:06:31.748869Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-02T06:50:35.896043Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T01:29:26.298131Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:21be172d6da3c6f6d9535bffe621f9e3a9ce456917a6d3bf5ee0d1beb47bb4dc","observation_id":"ebfafc57-1960-43aa-a73b-f0267bca95a0","resolution":{"observed_at":"2026-05-11T01:45:52.113756Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.06121","last_updated":"2026-05-07T12:30:02Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:30:02Z","title":"Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T14:02:29.480442Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.06121"},"observation_digest":"sha256:b2346de73dc78026c38ee1d9eb0496218a6a9c1cbaab184319d79d0ff0291c01","observation_id":"e585d113-8417-4a7b-a537-96be0a90b489","resolution":{"observed_at":"2026-05-11T18:46:09.414376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.07251","last_updated":"2026-05-08T05:19:59Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:19:59Z","title":"Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T01:29:47.384341Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.07251"},"observation_digest":"sha256:c33be2c1668c7cb433cc53568bbc63c8c9b76ee53602d17805b9f01c594beb7f","observation_id":"06c72520-bd69-4a5f-a3c0-d13b3844838a","resolution":{"observed_at":"2026-05-11T01:45:51.805531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.07505","last_updated":"2026-05-08T09:38:29Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:38:29Z","title":"LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-11T02:18:57.917353Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.07505"},"observation_digest":"sha256:53bee8944fe634381c17c80c7e6080d4dc5168c9ed2adf3cbe62bf04799ff3f5","observation_id":"1d024309-8fee-40c4-b3b7-cd40d590e0f9","resolution":{"observed_at":"2026-05-11T03:45:57.935347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.07593","last_updated":"2026-05-08T11:06:43Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:06:43Z","title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:01.939765Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.07593"},"observation_digest":"sha256:a6d9f63aa5ffb31c0d3ebc4ea3956685feafb466bdec3bf9e504ec1c349a887d","observation_id":"c8b7d24c-e20a-45b2-a407-a24adb0b967f","resolution":{"observed_at":"2026-05-11T04:15:55.952698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.08747","last_updated":"2026-05-14T03:36:04Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T07:24:07Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T01:23:37.488121Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.08747"},"observation_digest":"sha256:edfa5dad6968c390c756bb97356238d4c701755522b093447af51826cae8a2ec","observation_id":"89a52820-41d9-43c5-b413-02b7bfa3c68b","resolution":{"observed_at":"2026-05-12T08:01:29.289741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.08747","last_updated":"2026-05-14T03:36:04Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T07:24:07Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T01:03:30.995808Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.08747"},"observation_digest":"sha256:343c0ad488e96011b6a1a9edf1a31c832972f01e593f55b5dd25bc85e1c4203f","observation_id":"9bd34d24-beb3-4142-801a-5db5382fec4d","resolution":{"observed_at":"2026-05-13T01:07:00.414633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.08747","last_updated":"2026-05-14T03:36:04Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T07:24:07Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T06:25:15.510083Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.08747"},"observation_digest":"sha256:1aaed4356af124c0c4b1e6570e5a5954ba7ce97e0a19d14a4ce2bbc56866fb52","observation_id":"f63da5b3-c95e-4e3c-9ef0-06db2e7d397f","resolution":{"observed_at":"2026-05-15T06:29:49.799179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.08985","last_updated":"2026-05-09T15:10:26Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T15:10:26Z","title":"LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T02:06:45.858231Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.08985"},"observation_digest":"sha256:f0e8397fbcae712672d3974fb298fb8dfe0db37f8c00826ff25708537afedf04","observation_id":"75c478d7-5255-4e2e-89e0-e06041dbd440","resolution":{"observed_at":"2026-05-12T07:42:07.786299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.09146","last_updated":"2026-05-09T20:10:53Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:10:53Z","title":"Beyond Thinking: Imagining in 360$^\\circ$ for Humanoid Visual Search","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T02:58:46.728868Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.09146"},"observation_digest":"sha256:141f6780d885c6fe6018e20bc43b00d11d79b891e5ff3a0a4b7993b54719b902","observation_id":"7fa43a1f-9e9b-4fb4-b746-cd98dd54ced6","resolution":{"observed_at":"2026-05-12T03:01:18.316815Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.09331","last_updated":"2026-05-10T05:06:07Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T05:06:07Z","title":"Dimension-Free Saddle-Point Escape in Muon","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:38:25.480020Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.09331"},"observation_digest":"sha256:08312b2ac529b2690546c231011fdde5b2daeed71ebdd59589548c8e781802af","observation_id":"44c20eae-566d-41b6-a340-09f19488e962","resolution":{"observed_at":"2026-05-12T06:01:26.439415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.09449","last_updated":"2026-05-10T10:01:57Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T10:01:57Z","title":"SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T04:43:51.900721Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.09449"},"observation_digest":"sha256:ffe1452eabe28eff4fcafcf4400fd615eb175e5596c9182f9c35f1a802609fd2","observation_id":"5fc7e60e-ac09-43a2-b9d3-790bff6e4f49","resolution":{"observed_at":"2026-05-12T05:56:44.903344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.09614","last_updated":"2026-05-10T15:53:11Z","snapshot_observed_at":"2026-07-31T22:46:33.839024Z","submitted_at":"2026-05-10T15:53:11Z","title":"Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T02:24:12.349405Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.09614"},"observation_digest":"sha256:04122f2228c91aa88cfde3ec86dddca498146dca3fea112d5123e8ae6665b76d","observation_id":"ef612a3b-b402-47e2-81c5-d3f09adf6cac","resolution":{"observed_at":"2026-05-12T07:41:25.948392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.10576","last_updated":"2026-05-11T13:48:57Z","snapshot_observed_at":"2026-08-03T17:44:06.655773Z","submitted_at":"2026-05-11T13:48:57Z","title":"SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T04:00:50.940530Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.10576"},"observation_digest":"sha256:d04b338e854a73de8ce7e8569504d8fc0efde5e95e018cdc3bb4bff327f07fa7","observation_id":"44535bfc-7a27-43d3-9996-ed6a4c7d08ad","resolution":{"observed_at":"2026-05-12T06:46:35.081227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.10813","last_updated":"2026-05-11T16:33:47Z","snapshot_observed_at":"2026-07-30T22:58:47.084744Z","submitted_at":"2026-05-11T16:33:47Z","title":"NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized Research Automation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:12:49.742272Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.10813"},"observation_digest":"sha256:2292dd1103dca866eac6f84e14330aee07bf96f74b88bd0fd500cc19deac5837","observation_id":"02956506-94bd-4833-8c62-b86720e4cc37","resolution":{"observed_at":"2026-05-12T06:31:27.353807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-12T17:04:17.588929Z","title":"arXiv preprint arXiv:2504.07491 (2025) 1, 13","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.10886","last_updated":"2026-07-09T02:30:06Z","snapshot_observed_at":"2026-07-12T23:17:31.243229Z","submitted_at":"2026-05-11T17:32:29Z","title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T17:04:17.588929Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.10886"},"observation_digest":"sha256:b869cf8ea2215d25e1cfcdc23a2b941d7a6986e0fa4134178adc2e0d8291b8d2","observation_id":"75586e0a-b514-4f9e-aedb-8ce5ac422ef5","resolution":{"observed_at":"2026-07-12T17:04:17.588929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.10887","last_updated":"2026-05-11T17:32:37Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:32:37Z","title":"Count Anything at Any Granularity","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T04:19:44.335405Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.10887"},"observation_digest":"sha256:46885c88891a5d236a0401d7691bd5b376b3e2d51391a6286d70838ea94beff6","observation_id":"04bdf586-7b0c-472e-b631-475e7fc8be21","resolution":{"observed_at":"2026-05-12T06:21:27.742404Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.11212","last_updated":"2026-06-05T22:18:46Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:27:54Z","title":"ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T02:12:42.449883Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.11212"},"observation_digest":"sha256:a8ed7baa96829f1a91583d63f40fd6e6a0336447557aff1e640caf998b2cd940","observation_id":"d597b91d-b9da-4b38-a13a-89bcda16b691","resolution":{"observed_at":"2026-05-13T02:17:06.857745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.11212","last_updated":"2026-06-05T22:18:46Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:27:54Z","title":"ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-14T20:56:56.216287Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.11212"},"observation_digest":"sha256:c2e0736d785dd3636793e77a7c367b81ee76ea12c5afbfb78b08c478895653ed","observation_id":"e077f81d-82a4-431a-a405-3fc7b9a93245","resolution":{"observed_at":"2026-05-14T20:57:59.213371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.12969","last_updated":"2026-05-30T10:28:38Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T04:02:36Z","title":"Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T20:21:26.640493Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.12969"},"observation_digest":"sha256:5d37f17764fbecde83f1e31eb6566b53f0025c13e7468560d8f2d257c26543fe","observation_id":"e479df73-081e-4129-a889-de4397b03b0a","resolution":{"observed_at":"2026-05-14T20:22:54.848190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.12969","last_updated":"2026-05-30T10:28:38Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T04:02:36Z","title":"Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T21:42:49.452347Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.12969"},"observation_digest":"sha256:ce190e59e8c2f77544e17688a7028e14536835a23deef42dba486a73a384d371","observation_id":"c96b2197-4b03-408d-8ed1-ed372401f371","resolution":{"observed_at":"2026-05-20T21:43:45.403517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.07491/citation-record","integrity":"/paper/2504.07491/integrity","json":"/paper/2504.07491/citation-record.json","paper":"/paper/2504.07491"},"outbound":[],"paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 100 inbound Pith citation observations for arXiv:2504.07491."}