{"as_of":"2026-08-12T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46491cc593608ef6a1c5f99b54f347db77c3a790ea6c926b90a55f5b195b5b69","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:13:15.593994Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.31457/citation-record","integrity":"/paper/2605.31457/integrity","json":"/paper/2605.31457/citation-record.json","paper":"/paper/2605.31457"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:821a055f131d1e06bc30de9a0002a5b61c67af1facb640fff57a8f30ef42115a","observation_id":"fd4d505e-01e1-42d6-975f-b038b984bff1","resolution":{"observed_at":"2026-06-29T00:12:50.578005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08806","last_updated":"2025-06-17T06:04:01Z","snapshot_observed_at":"2026-08-08T13:44:26.014435Z","submitted_at":"2025-06-17T06:04:01Z","title":"Think Clearly: Improving Reasoning via Redundant Token Pruning","version":1},"cited_work":{"arxiv_id":"2507.08806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08806","snapshot_observed_at":"2026-06-29T00:12:50.579209Z","title":"Think clearly: Improving reasoning via redundant token pruning","venue":null,"work_id":"d8a2f7e5-7e4f-4ccc-9691-df39cb83281d","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2507.08806","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:cb925aaefb15b1e3a50cb0ed68c50ed4aa29622ca7daa5cdbb889e27a2c99ec7","observation_id":"997dde5f-5dcc-44bc-9f54-065a0fbd3774","resolution":{"observed_at":"2026-06-29T00:12:50.580956Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:06a009e0fc8c9fa81e81163bdc123071dd26a9be5205b556bccfeda1939605ba","observation_id":"31b1ba56-24a3-49a8-92b8-a5e6d4485e5e","resolution":{"observed_at":"2026-06-29T00:12:50.586292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:b2938e24bd2008364d3a4ae79575701292bd7f3ddfa7eee08f636b8fd5ee86d6","observation_id":"5c8640b3-9191-4a69-8019-a3f804756657","resolution":{"observed_at":"2026-06-29T00:12:50.586463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:905269c5a676ae4bda4af8225db399a6640d3d5649ea0466db88cf223cc7b70c","observation_id":"494d7288-de93-4018-834a-47fb4884390c","resolution":{"observed_at":"2026-06-29T00:12:50.584225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":"2202.07800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-07-08T01:44:26.264568Z","title":"arXiv preprint arXiv:2202.07800 , year=","venue":"cs.CV","work_id":"af84514a-13b0-4fb4-a42d-e5b1e4b5df41","year":2022},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:1e5be9a52a0b8ff628b6780cdc040c9c2faaac89c97802f45ff6df4e34211d7c","observation_id":"c000258d-a7ff-47ae-9c8c-a15336907d71","resolution":{"observed_at":"2026-06-29T00:12:50.564283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00553","last_updated":"2026-04-20T01:01:28Z","snapshot_observed_at":"2026-08-02T05:49:04.586461Z","submitted_at":"2025-08-01T11:48:11Z","title":"HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2508.00553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00553","snapshot_observed_at":"2026-07-03T14:48:32.416276Z","title":"HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models","venue":"cs.CV","work_id":"d6506c08-735f-4534-a5b7-1562505824d9","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2508.00553","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:ca26bfb4a5f3ecda109c28bf0b60af504580b3940add7cd5cd919e83a933e6ae","observation_id":"0cacf445-a2be-4995-a822-07bc6d941093","resolution":{"observed_at":"2026-06-29T00:12:50.588896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:15.593994Z","title":"L., Tan, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:3625be7a27f2757b781f07c6eaac08e055786246ac665348bf428c2d46fac663","observation_id":"d5c5d5ae-8a3d-4f3c-b403-ef3e649f7a75","resolution":{"observed_at":"2026-06-28T23:13:15.593994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:d21e7c4bf081af20ce25452d680e913f695f36aa7651ee11b002434fdf96beaa","observation_id":"f6f59feb-9fda-4e9d-bea5-f7a375758e55","resolution":{"observed_at":"2026-06-29T00:12:50.541483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:a7ea348454dd184eccec6f24cc440cc52dcfb42ab1498a52e53538761bf31159","observation_id":"ecfb1240-c0a0-4fb5-a808-9049115ef076","resolution":{"observed_at":"2026-06-29T00:12:50.569596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-04T06:27:25.663339Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":"2406.18139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-07-10T01:36:44.109589Z","title":"Look-m: Look-once optimization in kv cache for efficient multimodal long-context inference","venue":"cs.CL","work_id":"da97cf3b-beee-4636-a502-e1fe148927cb","year":2024},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:752bd1fc5833a449001cfd151dff67358bb165f2da7621525bfd1d21324212e2","observation_id":"1c2908e8-a975-435b-a5e8-182033b85bd2","resolution":{"observed_at":"2026-06-29T00:12:50.575478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00898","last_updated":"2025-07-01T16:01:08Z","snapshot_observed_at":"2026-08-08T10:42:07.640863Z","submitted_at":"2025-07-01T16:01:08Z","title":"ONLY: One-Layer Intervention Sufficiently Mitigates Hallucinations in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2507.00898","doi":"10.48550/arxiv.2507.00898","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00898","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Q., Stepputtis, S., Morency, L.-P., Ramanan, D., Sycara, K., and Xie, Y","venue":null,"work_id":"48d79968-2876-497c-ab80-5effbe6d983d","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2507.00898","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:600213b968f6260de07acb878695c800d259393997194d1434707cd8a82e8ab4","observation_id":"392264aa-5eb5-4da6-a67e-93caf0c54a51","resolution":{"observed_at":"2026-06-29T00:12:50.561358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2504.08837","doi":"10.48550/arxiv.2504.08837","metadata_source":"pith","pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","venue":"cs.LG","work_id":"b13ff087-9614-48cc-8991-ad75b6543bbc","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:6fe2acd571260b607332e5581ef0c23a33ee4ab23c3181eff8ed1bd65fd8a368","observation_id":"78efca44-1cf1-48dc-9efd-9bf72f00011b","resolution":{"observed_at":"2026-06-29T00:12:50.573182Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2503.12605","doi":"10.48550/arxiv.2503.12605","metadata_source":"pith","pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","venue":"cs.CV","work_id":"a8fbb385-8ed1-4952-9ee8-8d03be2b6821","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:1107e71bcfdba9c831acb8561d9c4dc8287989fd16226a4ea32ab792702c8271","observation_id":"a664e121-c2e0-42cc-9158-cf2bd93c1ac6","resolution":{"observed_at":"2026-06-29T00:12:50.581682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":"2407.15754","doi":"10.48550/arxiv.2407.15754","metadata_source":"pith","pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","venue":"cs.CV","work_id":"f6bb6dd9-35f5-4788-9063-af4d76699147","year":2024},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:4fb83f603a35403839a7e7088efa031a6a96137a6e2e3dcd98cda48c6a607bfe","observation_id":"6fd908c0-611d-4160-adf7-a299b677d698","resolution":{"observed_at":"2026-06-29T00:12:50.596604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.12067","doi":"10.48550/arxiv.2502.12067","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tokenskip: Controllable chain-of-thought compression in llms.arXiv preprint arXiv:2502.12067","venue":"ArXiv.org","work_id":"3ef0bd59-5ccb-4785-82a0-6c2ad863a0c1","year":2024},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:bdd5e6fffcffb888c7118c9b0cd7d87cefd0f548cef413f457b7c42bf7f2894b","observation_id":"b9586db2-5c1a-4ebe-ade8-410680ee40f5","resolution":{"observed_at":"2026-06-29T00:12:50.578033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.18458","doi":"10.48550/arxiv.2504.18458","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2504.18458 , year=","venue":"arXiv (Cornell University)","work_id":"7b665773-1674-4edc-8254-237d30c3db5d","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:2cb655de19532fbd3a175babf2f6e20647bae12b4034ab0f1b4ada00a38d7529","observation_id":"2ac26f35-e0db-4748-85dd-67f48dec80ee","resolution":{"observed_at":"2026-06-29T00:12:50.567176Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":"2410.17247","doi":"10.48550/arxiv.2410.17247","metadata_source":"pith","pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","venue":"cs.CV","work_id":"ca5cea36-45c6-4d00-8408-14876a5d59c3","year":2024},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:6b3ffda99c2e9bc59d74fde0f7306d09f1e5da6ff34067d14fe0e5a0f2bf96e5","observation_id":"85b4cc93-84c7-4410-802e-2f00d4df2a9e","resolution":{"observed_at":"2026-06-29T00:12:50.569823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03019","last_updated":"2025-07-02T14:59:35Z","snapshot_observed_at":"2026-08-12T06:11:43.310913Z","submitted_at":"2025-07-02T14:59:35Z","title":"Look-Back: Implicit Visual Re-focusing in MLLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.03019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.03019","snapshot_observed_at":"2026-07-11T03:17:51.718484Z","title":"Look-back: Implicit visual re-focusing in mllm reasoning","venue":"cs.CV","work_id":"faa45ef9-d74d-43aa-939b-f243fb061e33","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2507.03019","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:3df3eb921496733995deeacd8c4d1d0bbd04abdd7d3571ee346eb57c8b6d6354","observation_id":"141616eb-2574-40b2-8685-dae74dd5d590","resolution":{"observed_at":"2026-06-29T00:12:50.591396Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":"2502.03373","doi":"10.48550/arxiv.2502.03373","metadata_source":"pith","pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","venue":"cs.CL","work_id":"6d35a498-cdd6-463a-a0d9-5a29224a06d8","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:9f18cee7b1e7d3f466fca8a9a61ea2dd58950ac122d526a170d2f9c490543e18","observation_id":"d9a5c939-091c-4390-9be3-727c6c91a4dd","resolution":{"observed_at":"2026-06-29T00:12:50.561905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08243","last_updated":"2022-03-15T20:38:22Z","snapshot_observed_at":"2026-07-06T12:48:20.464521Z","submitted_at":"2022-03-15T20:38:22Z","title":"Unified Visual Transformer Compression","version":1},"cited_work":{"arxiv_id":"2203.08243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.08243","snapshot_observed_at":"2026-06-29T00:12:50.551553Z","title":"Unified visual transformer compression","venue":null,"work_id":"1673d256-fee7-4dee-85ae-71f8da3fb497","year":null},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2203.08243","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:38dff5a55d75fba17b70f099b60d1f818a569dae3b31faafe6514a76afa1f93b","observation_id":"e4e7d9a4-4ab9-404c-aa76-6d5a1505cf3c","resolution":{"observed_at":"2026-06-29T00:12:50.553383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13417","last_updated":"2025-05-19T17:50:52Z","snapshot_observed_at":"2026-08-07T15:42:59.701048Z","submitted_at":"2025-05-19T17:50:52Z","title":"AdaptThink: Reasoning Models Can Learn When to Think","version":1},"cited_work":{"arxiv_id":"2505.13417","doi":"10.48550/arxiv.2505.13417","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13417","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.13417 , year=","venue":"ArXiv.org","work_id":"c6dc49e8-993c-43ba-bf8c-650b5139cd50","year":2025},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"cited_paper":"/paper/2505.13417","citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:724ae1a7d387f1e6b3a6c1f2b8b2fce5122959cce40937cde6b6420702fa6eee","observation_id":"4c923cbf-ef0c-43e1-9256-0d4e6636c162","resolution":{"observed_at":"2026-06-29T00:12:50.594042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:15.593994Z","title":"Additional Analysis A.1","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:c3b5b4522e77b33ac208dc8f9331a29441496a489b99fbe91f199a035376ca60","observation_id":"e2b5de62-db43-45a2-97aa-08f36abe5aaa","resolution":{"observed_at":"2026-06-28T23:13:15.593994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:13:15.593994Z","title":"This suggests that VisionPulse is orthogonal to static visual token pruning methods such as FastV and can be combined with them for additional efficiency improvements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T23:13:15.593994Z"},"links":{"citing_paper":"/paper/2605.31457"},"observation_digest":"sha256:f594e6147e47a2031908c9b134f049caeb140e5a6cd8785bae3f4586a3f687a6","observation_id":"c041c2ca-250b-4483-a790-3a80bbab479c","resolution":{"observed_at":"2026-06-28T23:13:15.593994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.31457","last_updated":"2026-05-29T15:51:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T20:26:12.081479Z","submitted_at":"2026-05-29T15:51:12Z","title":"VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":3,"verified_exact":17,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2605.31457."}