{"as_of":"2026-08-13T23:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c98a3c354e54d89b499208184cc9a4698c3e6484a3855f7c63fd7e24a90beb0","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:34:01.937707Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:53:14.415257Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.252188Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-07-04T15:09:55.252188Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning","venue":null,"work_id":"0794050e-4b73-47bd-b7a5-0f46305fd793","year":2025},"citing_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T01:17:55.500268Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2509.07969"},"observation_digest":"sha256:80f11173334e5202d5a76e3b016ccccc67c0fa9c7ad1068716b4ac4cd3b5d2cb","observation_id":"8fecda78-1b5d-476b-9704-a0d4e552fa10","resolution":{"observed_at":"2026-05-18T01:17:55.594921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-08-03T13:07:44.032336Z","title":"Visionthink: Smart and efficient vision lan- guage model via reinforcement learning.arXiv preprint arXiv:2507.13348, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00501","last_updated":"2026-05-26T22:35:38Z","snapshot_observed_at":"2026-08-13T02:05:32.120498Z","submitted_at":"2026-01-01T22:48:26Z","title":"CPPO: Contrastive Perception Policy Optimization for VLM Agents","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T13:07:44.032336Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2601.00501"},"observation_digest":"sha256:d74ed0d509ab83e2c6f54111b96bc3bb26fb8a13eccfc81585feb05958c6866a","observation_id":"b9a0a6a5-466d-4361-bef5-7c82b50e13c7","resolution":{"observed_at":"2026-08-03T13:07:44.032336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-07-04T15:09:55.252188Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning","venue":null,"work_id":"0794050e-4b73-47bd-b7a5-0f46305fd793","year":2025},"citing_paper":{"arxiv_id":"2604.03179","last_updated":"2026-04-03T16:56:34Z","snapshot_observed_at":"2026-08-12T23:53:53.905795Z","submitted_at":"2026-04-03T16:56:34Z","title":"Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T20:48:52.130130Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2604.03179"},"observation_digest":"sha256:2a0a96d770cfe4c77e6d617eaea9798cc2f5c753259c81e170fd4eab58cff39e","observation_id":"cb48a970-db4c-4076-b231-3d3c34bde422","resolution":{"observed_at":"2026-05-13T20:53:16.245320Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-07-04T15:09:55.252188Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning","venue":null,"work_id":"0794050e-4b73-47bd-b7a5-0f46305fd793","year":2025},"citing_paper":{"arxiv_id":"2604.04500","last_updated":"2026-04-06T07:51:59Z","snapshot_observed_at":"2026-08-13T02:16:47.977396Z","submitted_at":"2026-04-06T07:51:59Z","title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T19:59:19.379119Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2604.04500"},"observation_digest":"sha256:3079a46e576084931f2c0c64b0a58ddfcd69ea7fea0acab657a3680fbb04a9ae","observation_id":"9ea7e297-4901-4d3d-8959-3dbf53117b4b","resolution":{"observed_at":"2026-05-10T22:20:47.758290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-07-04T15:09:55.252188Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning","venue":null,"work_id":"0794050e-4b73-47bd-b7a5-0f46305fd793","year":2025},"citing_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-13T10:27:03.396626Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:02.559108Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2604.06777"},"observation_digest":"sha256:fe67cd89f4b17735d087e4441273c82ed7c7b78345ca51bec05ebf1f4b331bb1","observation_id":"f55e675c-9e83-4278-b74b-1bb613346095","resolution":{"observed_at":"2026-05-11T00:45:50.083817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-07-04T15:09:55.252188Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning","venue":null,"work_id":"0794050e-4b73-47bd-b7a5-0f46305fd793","year":2025},"citing_paper":{"arxiv_id":"2605.06121","last_updated":"2026-05-07T12:30:02Z","snapshot_observed_at":"2026-08-11T09:39:19.750568Z","submitted_at":"2026-05-07T12:30:02Z","title":"Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T14:02:29.480442Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2605.06121"},"observation_digest":"sha256:702766594ec1866f80e81b586910e2583c97c4243091de05b82b657225c64e8e","observation_id":"29867f44-26e8-4580-a43f-2dd7d40e30a5","resolution":{"observed_at":"2026-05-11T18:46:09.467557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-07-04T15:09:55.252188Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning","venue":null,"work_id":"0794050e-4b73-47bd-b7a5-0f46305fd793","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-08-13T03:40:06.714401Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":216,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:090627ca505fd35796956fc8fef5ec71b9125c632b537510f9a3e01b02d79779","observation_id":"de9a2b32-ea13-4eed-906b-98b19e0948f3","resolution":{"observed_at":"2026-07-04T15:09:55.253992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-07-04T15:09:55.252188Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning","venue":null,"work_id":"0794050e-4b73-47bd-b7a5-0f46305fd793","year":2025},"citing_paper":{"arxiv_id":"2606.28266","last_updated":"2026-06-26T16:57:40Z","snapshot_observed_at":"2026-08-12T16:54:45.166709Z","submitted_at":"2026-06-26T16:57:40Z","title":"RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T04:09:32.397341Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2606.28266"},"observation_digest":"sha256:2c412b450cc8c11e1c616a00c92c089df56462f0237937e89d520845cb3bd09a","observation_id":"7e02849c-b735-40ee-a42e-aa47d2031c0f","resolution":{"observed_at":"2026-07-01T17:05:51.428117Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.13348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-07-04T15:09:55.252188Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning","venue":null,"work_id":"0794050e-4b73-47bd-b7a5-0f46305fd793","year":2025},"citing_paper":{"arxiv_id":"2606.31599","last_updated":"2026-06-30T12:47:30Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:47:30Z","title":"Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-01T05:36:43.609602Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2606.31599"},"observation_digest":"sha256:a3e3592e78e59a38eefbee6da78fd4a0bcc8024d70c9348b3f66a4cae69e0e2a","observation_id":"835848df-0893-4a49-b43c-5fb2e4080dc5","resolution":{"observed_at":"2026-07-01T10:15:45.227978Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-08-04T14:48:45.590719Z","title":"J.; Lai, X.; Yu, B.; Zhao, H.; and Jia, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-08T15:21:48.479435Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:45.590719Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:0f52e9fcbd36bc09994ae8bb5ae9e1153d3e36507b896edca3f71343f95f3d1e","observation_id":"acfb3eed-9d37-47d4-9f02-b0800db2683c","resolution":{"observed_at":"2026-08-04T14:48:45.590719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-08-05T16:41:28.850093Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03580","last_updated":"2026-08-04T12:34:46Z","snapshot_observed_at":"2026-08-13T01:18:20.066680Z","submitted_at":"2026-08-04T12:34:46Z","title":"SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T16:41:28.850093Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2608.03580"},"observation_digest":"sha256:110f4bba1fe4e01d0c4b4c6b37310dd9c187215467b245f068391b9f8502e80d","observation_id":"246074eb-9658-4376-bc90-6260f8ec3191","resolution":{"observed_at":"2026-08-05T16:41:28.850093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13348","snapshot_observed_at":"2026-08-11T12:53:14.415257Z","title":"VisionThink: Smart and efficient visual language model via reinforcement learning.arXiv preprint arXiv:2507.13348, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-13T23:46:12.268840Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:14.415257Z"},"links":{"cited_paper":"/paper/2507.13348","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:39599d903a3a2410a26421cc49286806fc1ec7ad1c684f836deeeb1a6a2b0dc2","observation_id":"5e606f51-b262-42b5-8073-9e895eb919f4","resolution":{"observed_at":"2026-08-11T12:53:14.415257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13348/citation-record","integrity":"/paper/2507.13348/integrity","json":"/paper/2507.13348/citation-record.json","paper":"/paper/2507.13348"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T16:33:56.746930Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.746930Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:ed21058930eadbbcc90c0ba4abee74bd331ece9d33d9eb10e279e3581f17aa9d","observation_id":"da95d1df-9518-4a8e-a71e-b870b6d4c67c","resolution":{"observed_at":"2026-08-06T16:33:56.746930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:56.751678Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.751678Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:87ae5cb8b506789d74ef430ec34a57ab50f15653906e61e8be8be45bdfe647c4","observation_id":"2d95a751-ad97-4055-b8e0-c162006be85c","resolution":{"observed_at":"2026-08-06T16:33:56.751678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T16:33:56.759782Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.759782Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:fbbb842645e85d4b0b0eb2d9655783caa59269957e5d6ec8cc738ec77f1cc948","observation_id":"f1884637-c2db-4215-bda3-91804fcee012","resolution":{"observed_at":"2026-08-06T16:33:56.759782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T16:33:56.767649Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.767649Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:cfd823d68dd309b9b1780a151d87de259eb33e71be2705b6ebd69f3edd447907","observation_id":"1b7adfda-4429-4ee8-8dc4-e9ecb974f46f","resolution":{"observed_at":"2026-08-06T16:33:56.767649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:56.771438Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.771438Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:fbe1f3470db5f500a91adb34590f5c1d7390a18394d3f35658579de39176105d","observation_id":"55e63009-bc8f-4cc5-ab82-e1a081868b4f","resolution":{"observed_at":"2026-08-06T16:33:56.771438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:56.775183Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.775183Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:698c9c4c33a438b25e0a30662ee8fc0513ba41c98776ebf207b7347db7f6bed6","observation_id":"ec44fc80-013c-4d1b-a646-dfbc958c68d7","resolution":{"observed_at":"2026-08-06T16:33:56.775183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T16:33:56.778875Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.778875Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:2f666d50979f2797eef02e69e268d2dbfc673c3c600db00d4668cc2a7691861e","observation_id":"5d4cf5ad-8aba-4c2a-baa4-bfcb2d777283","resolution":{"observed_at":"2026-08-06T16:33:56.778875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:56.782852Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.782852Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:fe426e438444f960b1cceb35d106ab0019a0c357bdaaf425cd8d93f4b22667fa","observation_id":"ba782bfe-c4eb-4186-889d-ebdf45cb8148","resolution":{"observed_at":"2026-08-06T16:33:56.782852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T16:33:56.786502Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.786502Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:53762f5e97e35b7e58f30c4e9db21e863c0c8b77138f8633be8475953a69ee28","observation_id":"d71fb9da-0dbe-4b14-b3dc-0510552f3603","resolution":{"observed_at":"2026-08-06T16:33:56.786502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:56.790426Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.790426Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:78b4bdcb68701c07c13fe62d9ad75613310747a448cc4bcf58ae17fc17d95706","observation_id":"5f9216d3-a8fb-434a-95c3-7893aea77b86","resolution":{"observed_at":"2026-08-06T16:33:56.790426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:56.793697Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.793697Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:630dd7ea6d12ad25b4257e598db4ed98a090c1ad4330dc23ed7300d19b2b96b5","observation_id":"e3c64ecb-a8fe-451d-a100-25e3c759d55f","resolution":{"observed_at":"2026-08-06T16:33:56.793697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-12T15:08:59.751071Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-06T16:33:56.797064Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.797064Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:d2ddf952fc989000a088b3b111d101f4ecaea20e0c4e0e9768361afdfa66e563","observation_id":"1f66b485-f4fb-4722-afef-bb7155abd312","resolution":{"observed_at":"2026-08-06T16:33:56.797064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T16:33:56.800543Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.800543Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:2536c8455241fe1c92f6eb06a5516e5c61a0432c842d9511a87886fc9a695517","observation_id":"d863578d-65b2-45c0-97cd-4460a77e271c","resolution":{"observed_at":"2026-08-06T16:33:56.800543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:33:56.807485Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.807485Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:edc36a8b48357428e66aa36c4f7fdfd7a662f2f5e0bc2e817bd56b883d8403bc","observation_id":"743d4fb7-f580-48e8-be02-1fb52840f3c5","resolution":{"observed_at":"2026-08-06T16:33:56.807485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-08-12T22:25:41.628595Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-08-06T16:33:56.811210Z","title":"Zipvl: Efficient large vision-language models with dynamic token sparsification and kv cache compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.811210Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:4336de05b75d91c851f2926e3672e0c432bab05728fafdec5ae424e194a3c8dd","observation_id":"2fc953bd-036c-4dcd-9c22-3bead0df8910","resolution":{"observed_at":"2026-08-06T16:33:56.811210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T16:33:56.818801Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.818801Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:20f7e258e724c428229356c3075d3625c507db3a0d2eb1f6750ae6b8cddd7975","observation_id":"dfe46faf-d796-4198-ac54-15d9c6346955","resolution":{"observed_at":"2026-08-06T16:33:56.818801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T16:33:56.825316Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.825316Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:855d4cace4455f130c965896fb226894d27a82623e4d023c372c8ab1dff111ae","observation_id":"ef28b65c-d973-4e8d-b63f-0bd2f1c293f9","resolution":{"observed_at":"2026-08-06T16:33:56.825316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03291","last_updated":"2024-02-21T09:36:15Z","snapshot_observed_at":"2026-08-13T05:57:06.432176Z","submitted_at":"2023-10-05T03:40:06Z","title":"Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction","version":3},"cited_work":{"arxiv_id":"2310.03291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.03291","snapshot_observed_at":"2026-08-06T16:34:02.836216Z","title":"Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction","venue":"cs.CV","work_id":"dc10fefb-3e33-423d-86f1-894fdcd55706","year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.835798Z"},"links":{"cited_paper":"/paper/2310.03291","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:f30751a5a25234c7fd7c05b93e01c29bda43957ee600e2dc901c2784b9f6abcd","observation_id":"0c2b952d-3b65-4f2e-ad7c-ad93db122eec","resolution":{"observed_at":"2026-08-06T16:34:02.915215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-06T16:33:56.851016Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.851016Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:18d6e12561c3d9ec4e831e49805c47555ba812b8133b483188ebdc1aefb1aeda","observation_id":"8b61d9c3-fad0-46e3-973d-6624242e8946","resolution":{"observed_at":"2026-08-06T16:33:56.851016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T16:33:56.867525Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.867525Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:e39e37f5263245fc4afedd5acefb5957a840b7fb26a0a4e209414c2f0d8e49fe","observation_id":"49f78ed6-e73d-420c-bf21-17a1b8c6002c","resolution":{"observed_at":"2026-08-06T16:33:56.867525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:56.888627Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.888627Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:70348702767610d42b2188c6483ba9a064b6d7f244543e9d83c29b75e5d212af","observation_id":"7b35b5cd-9fde-4b65-8634-28f024b0f4c2","resolution":{"observed_at":"2026-08-06T16:33:56.888627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T16:33:56.916800Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.916800Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:108b97580be03b273699527a5db76973cf52e8ab913e8c46ffa5469930788c2a","observation_id":"781612d5-9bc4-4af2-812d-dee76c2e90ef","resolution":{"observed_at":"2026-08-06T16:33:56.916800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:56.951119Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.951119Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:50498d5383b820dd39e6110f15707154da21af6b433d4caf95b670c231178ef2","observation_id":"ea45fec3-8ef2-4a24-ba64-0758dad17eaf","resolution":{"observed_at":"2026-08-06T16:33:56.951119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T16:33:56.974839Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.974839Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:08c73a855289c45ddf8471eb005c4a39a13d45d2fab27232c5900f57bbb92a0e","observation_id":"9a6ffabb-92c8-44a2-8c91-e1ba8a5e6622","resolution":{"observed_at":"2026-08-06T16:33:56.974839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24461","last_updated":"2025-06-11T16:40:39Z","snapshot_observed_at":"2026-08-10T11:05:09.427914Z","submitted_at":"2025-05-30T10:57:09Z","title":"Logits-Based Finetuning","version":2},"cited_work":{"arxiv_id":"2505.24461","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24461","snapshot_observed_at":"2026-08-06T16:34:02.652999Z","title":"Logits-Based Finetuning","venue":"cs.LG","work_id":"9c54c771-5580-4891-8a4c-9cd8f440d20e","year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.991972Z"},"links":{"cited_paper":"/paper/2505.24461","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:4e5876015d75c6e774a4df26cffa7b37032ba200dbe6750681354cebd156f327","observation_id":"d20b9ee4-5029-447d-bb24-61ac7af57067","resolution":{"observed_at":"2026-08-06T16:34:02.719238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:57.019527Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.019527Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:c9991237cb55430213983efa09d9a568dbdac4cbd638671a69b4ca4425674ab8","observation_id":"74632ecc-34ae-41dd-a6bc-b48e83a7a78e","resolution":{"observed_at":"2026-08-06T16:33:57.019527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T16:33:57.049334Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.049334Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:6ce9953900ab2faf9d6bd4565f9d07e8742e620896624e7f51335481256d0789","observation_id":"bb65240d-bf0e-449f-b50c-2607018e3afc","resolution":{"observed_at":"2026-08-06T16:33:57.049334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T16:33:57.065129Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.065129Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:021c21082d4d9964785ee4f053848db4f953994019fa9cf7d8321ab3f443d838","observation_id":"8fe7027b-76b2-4af2-aa25-012a059d5481","resolution":{"observed_at":"2026-08-06T16:33:57.065129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T16:33:57.074808Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.074808Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:9f2705aea662a5e303ce257a85a4b3011a3f3682e47543776a7817462de67be4","observation_id":"a722a3b3-9118-4761-8350-f957bdd06929","resolution":{"observed_at":"2026-08-06T16:33:57.074808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:57.086274Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.086274Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:09bca237c6dc63919b4b31dfc9246c0c0277391b4b7f5459c003ea92239e171c","observation_id":"a89c9bfe-08bd-436d-8ecf-b1be72ebeb6f","resolution":{"observed_at":"2026-08-06T16:33:57.086274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:57.093223Z","title":"Visual instruction tuning.Advances in neural information processing systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.093223Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:4202644e9177f35f9bb5bcb64515c62421cd6712c819db56de9924551f6cf428","observation_id":"38382b80-ab54-4621-b467-a189d88b6472","resolution":{"observed_at":"2026-08-06T16:33:57.093223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-12T23:48:29.295997Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-06T16:33:57.134511Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.134511Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:0576ed923f96a624d1c428a8a29cac163fd91bb809ccc15de9515bf375664cd2","observation_id":"c3e0b10e-500c-40ed-9d4b-64a657555ab4","resolution":{"observed_at":"2026-08-06T16:33:57.134511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-06T16:33:57.223241Z","title":"Ocrbench: On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.223241Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:25cf9f96dd558c7e6014c1c33936702d8e137b5c8d0465ae67a79e90d3943fa7","observation_id":"63493399-6b72-4a1e-9e33-15c4ee441e79","resolution":{"observed_at":"2026-08-06T16:33:57.223241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-06T16:33:57.253690Z","title":"Seg- zero: Reasoning-chain guided segmentation via cognitive reinforcement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.253690Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:aa4b8a91a539316ab2156ea342257ab7948ddb21ee02334b5b6a8c62827594cd","observation_id":"6c022fdd-2e6f-4693-bd7a-ea92cd5f7d33","resolution":{"observed_at":"2026-08-06T16:33:57.253690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T16:33:57.308765Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.308765Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:563291225c8a9cea5945225962e4511b53d1779f6d79f857ae7cb623eacc2e6e","observation_id":"bc3223df-08c8-42a8-98e3-0e0b2ce1e0ea","resolution":{"observed_at":"2026-08-06T16:33:57.308765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:04.975988Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"b6f9f94e-23b4-4aed-a6c8-b3eccfd57abb","year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.384004Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:86ef2fa64635948ec0fc8ccf7c9d0381c670758cee138b03fd64056ed7db6eeb","observation_id":"ada00429-bdb6-4b68-a957-2b0fe26b9906","resolution":{"observed_at":"2026-08-06T16:34:05.063403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09797","last_updated":"2024-04-15T13:54:35Z","snapshot_observed_at":"2026-08-13T00:29:52.803874Z","submitted_at":"2024-04-15T13:54:35Z","title":"TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09797","snapshot_observed_at":"2026-08-06T16:33:57.441181Z","title":"Textcot: Zoom in for enhanced multimodal text-rich image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.441181Z"},"links":{"cited_paper":"/paper/2404.09797","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:d531405ffe705d9af0094160b8650b30577e3d6eb5abdedf36f8f93bbebf2b0c","observation_id":"cf724eff-60da-4cd5-9d17-31b711af7b41","resolution":{"observed_at":"2026-08-06T16:33:57.441181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:04.836005Z","title":"Reft: Reasoning with reinforced fine-tuning, 2024","venue":null,"work_id":"b622c76b-5978-434f-8fc7-28d3b12269fb","year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.524682Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:75d5eeb128e4f0a712a036b4fe8b8e4e9e5aece02561614d3a9f3b710b3c27df","observation_id":"6b5bac22-0585-49b9-8249-3a315b9070c3","resolution":{"observed_at":"2026-08-06T16:34:04.909715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T16:33:57.577590Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.577590Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:732847858fd5dca31a578d57937588b71dd74df8d3c6ab7c0a7a3ba0fd7b86d5","observation_id":"190fc5b8-08ca-4758-8fb9-05c4c89a1ead","resolution":{"observed_at":"2026-08-06T16:33:57.577590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:57.644320Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.644320Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:744e6db59129c6be0c6e9d435c91957b53294618ea779c14f7d5a3844086d78c","observation_id":"b8ed46d8-0a0c-4c68-88cf-a64d0a16d8cf","resolution":{"observed_at":"2026-08-06T16:33:57.644320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T16:33:57.725132Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.725132Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:d45b7fe8fe910233874b3073596770f284c929a8563c748476ac9779023b9395","observation_id":"4f3c7a72-0495-4bdf-afb0-e3fe0c9012e2","resolution":{"observed_at":"2026-08-06T16:33:57.725132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:57.822522Z","title":"Compositional chain-of- thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.822522Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:a50b01495d4abc25be8426cbf9e3d4e3f50d4cab8f3fe3fc29a595ed91d57cd3","observation_id":"b86261a5-d535-4b67-8687-e413764752df","resolution":{"observed_at":"2026-08-06T16:33:57.822522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:04.641778Z","title":null,"venue":null,"work_id":"716d74e6-77aa-4a57-be57-23cc2c7000f4","year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.868180Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:2b59f189be7b30bb33e29ab1cdc709de318330c348f16a5752ed668709be2995","observation_id":"dbb7009c-7257-47ba-be1d-361a20955a47","resolution":{"observed_at":"2026-08-06T16:34:04.718264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:57.924849Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.924849Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:09d41045702bd681486d9f315407fe615822ab45d7f0a376c13b16bbe8bf55b8","observation_id":"dac4ad05-d0cb-452e-bdb1-f1a565175c4b","resolution":{"observed_at":"2026-08-06T16:33:57.924849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-06T16:33:57.990838Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:57.990838Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:578ff72ca74346c389f2068e5973432ccee7afcdc7e0ee6885c894840a7576f5","observation_id":"04e6aa37-0a21-4794-8eb5-27865046cde5","resolution":{"observed_at":"2026-08-06T16:33:57.990838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18921","last_updated":"2025-03-20T05:23:42Z","snapshot_observed_at":"2026-08-12T23:25:50.215277Z","submitted_at":"2024-07-09T13:47:05Z","title":"Mobile Edge Intelligence for Large Language Models: A Contemporary Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18921","snapshot_observed_at":"2026-08-06T16:33:58.028138Z","title":"Mo- bile edge intelligence for large language models: A contemporary survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.028138Z"},"links":{"cited_paper":"/paper/2407.18921","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:8b7d16e3b376d29776a7aa655e4184d1d30dbe64f5fb2e044aeee86c73e4516e","observation_id":"50002ef9-0b0e-4598-af83-00b8b7afc9d4","resolution":{"observed_at":"2026-08-06T16:33:58.028138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12496","last_updated":"2025-03-28T03:51:10Z","snapshot_observed_at":"2026-08-07T17:00:38.062410Z","submitted_at":"2025-03-16T13:12:45Z","title":"Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12496","snapshot_observed_at":"2026-08-06T16:33:58.078291Z","title":"Does your vision-language model get lost in the long video sampling dilemma? arXiv preprint arXiv:2503.12496, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.078291Z"},"links":{"cited_paper":"/paper/2503.12496","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:28b73c1c117cbea5e04c20572cb1fdb7d45a923fad54e865d380fc4553ee952a","observation_id":"d074ebb3-c178-4196-b9c9-61f8004e1eb0","resolution":{"observed_at":"2026-08-06T16:33:58.078291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T16:33:58.138206Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.138206Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:2274d98264c0f2db9b83ec0c6072b268c712abceb1bfbcc7581364ec01ac8bbd","observation_id":"9a12de7c-4924-45b9-b901-ff5cb5d3ef5d","resolution":{"observed_at":"2026-08-06T16:33:58.138206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-13T05:30:51.244198Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-06T16:33:58.198624Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.198624Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:5ec6688ab790210899764c3e2edcf31b0867098a2aba42b28d381646c1e3716f","observation_id":"18abe2f2-7f3f-48fc-95ca-2e44e8f2f866","resolution":{"observed_at":"2026-08-06T16:33:58.198624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T16:33:58.258329Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.258329Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:6e140b785595625a611e77dc290e17e9f0bb1a87470009cf3b9c21d24a824702","observation_id":"9a773f1b-c1ba-466a-a934-a74df1015fdf","resolution":{"observed_at":"2026-08-06T16:33:58.258329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:04.504141Z","title":"Upop: Unified and progressive pruning for compressing vision-language transformers","venue":null,"work_id":"9797a815-c91a-4dcb-82ab-f1a56d3587e9","year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.303405Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:c5b2267304b54df280354f67de69c0a4d128af942524dea6626021a58b5fe849","observation_id":"5e53cef5-87e9-4f3a-b8a2-c1cf457f4df8","resolution":{"observed_at":"2026-08-06T16:34:04.561921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:58.387685Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.387685Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:527cab729c8b53daacda774975b7e552d5934ae112e7bf5182fa9b4c793aca0a","observation_id":"26cfacdb-d057-4e52-8e20-eef8b834fcab","resolution":{"observed_at":"2026-08-06T16:33:58.387685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T16:33:58.427122Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.427122Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:9f4efa6f1d39cc54f87387f4943667b1265fd3448adba64650b1eeafccfaa85f","observation_id":"7e2efef3-76db-421b-8e71-933985bf32fa","resolution":{"observed_at":"2026-08-06T16:33:58.427122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:58.489578Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.489578Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:6ff028948614d7df0fa0534d51b49bd02a0ecc06b9a84460431b69bb64b592d7","observation_id":"d632d097-2b37-42ef-8975-816d603e72e1","resolution":{"observed_at":"2026-08-06T16:33:58.489578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-08-10T21:03:22.633699Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-06T16:33:58.579049Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.579049Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:92865591ace8e35a7e35dfa9dcb4f911d47c97d7177964ccca82efc9db726a74","observation_id":"698c338b-2676-4e7d-8a5f-c50531bf238b","resolution":{"observed_at":"2026-08-06T16:33:58.579049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-06T16:33:58.643728Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.643728Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:9e411863b52933ff37210d7020c6d303f9ce7c3fc73c1c2da29b5bab646fb82b","observation_id":"46013f82-98a1-4d69-bd3e-55189183af7f","resolution":{"observed_at":"2026-08-06T16:33:58.643728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T16:33:58.707722Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.707722Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:2595b4f1bfe6a9381c493fdcd3db3f57b1d54bdbe531d0fee96a202b852c4757","observation_id":"d7fd3475-6b15-457f-8f06-21c8551e55b0","resolution":{"observed_at":"2026-08-06T16:33:58.707722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T16:33:58.784485Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.784485Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:cd51cabb36bdc47480db381ed106d4431620c9460a3317f4f18204b228fc7344","observation_id":"ed7f98f9-3856-4acb-990e-a88a47331b96","resolution":{"observed_at":"2026-08-06T16:33:58.784485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:58.848223Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.848223Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:b274e81a6c21812a82ac4055325934003d2a6de7ccb7b5e41dd5f258b93f58e0","observation_id":"d8ec72ae-ae33-432a-a719-abac1b198ee4","resolution":{"observed_at":"2026-08-06T16:33:58.848223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:58.909406Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.909406Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:52eda20835a7be35abc64ab102301c742b3eb2a4daf2093c26984936d3d6f97d","observation_id":"db00efe8-f24b-4e2d-8365-d6b9b9651e0a","resolution":{"observed_at":"2026-08-06T16:33:58.909406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-12T22:20:29.783424Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-06T16:33:58.959189Z","title":"Efficient vision- language models by summarizing visual tokens into compact registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.959189Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:6b010fa5127253cfdfeeeb949488aa9f6fa417b9675d494b14da076afd40802e","observation_id":"00402166-99a3-4c38-b206-feb971afe9d9","resolution":{"observed_at":"2026-08-06T16:33:58.959189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-08-06T16:33:59.034226Z","title":"Mmsearch-r1: Incentivizing lmms to search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.034226Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:effd124843f48698a5d1e662d5d634afcb91613cee019d25a2ba0ddadcd5e077","observation_id":"4c5f3fec-36e2-407a-b268-45f443a9ed73","resolution":{"observed_at":"2026-08-06T16:33:59.034226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:04.314189Z","title":null,"venue":null,"work_id":"6d745303-cd2e-4f2d-9b8c-ba674bc78933","year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.127978Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:517c1425ef48f2978a20359e9d0d51ae97b5a045c0f0875eb8c21d25fe6cd424","observation_id":"2a6c133e-1395-4ee8-8969-a7ce9812f5d7","resolution":{"observed_at":"2026-08-06T16:34:04.403753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:04.140145Z","title":"Grok-1.5 vision preview","venue":null,"work_id":"23516d68-f836-463b-90f8-43f8463df060","year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.253541Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:1aa271326ae6b192ecad40644ca6dc4c1fb6dbd6b116740e633758e79fd66366","observation_id":"1aed168d-ca7f-4465-8be2-0de1239bd892","resolution":{"observed_at":"2026-08-06T16:34:04.225345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:59.353607Z","title":"Lillicrap, Kenji Kawaguchi, and Michael Shieh","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.353607Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:d5cd84eb28a47792f988b4dad862025da9e4f9e9328681ffb0c82a680ad2eac8","observation_id":"124dff46-9e7c-425b-9b9f-779072c4e2ef","resolution":{"observed_at":"2026-08-06T16:33:59.353607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-06T16:33:59.440141Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.440141Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:df5d74d7443ff6409adfbfe026ce114b950db8a832c2dfe13b908a6a7ee6793a","observation_id":"7818043c-e0e1-4932-ac46-9f1dfc5fffcf","resolution":{"observed_at":"2026-08-06T16:33:59.440141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:03.975607Z","title":"Llava-o1: Let vision language models reason step-by-step","venue":null,"work_id":"e7f955b0-857d-4085-ac56-b0734357e47a","year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.511167Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:0e0fe821ae8a6ee7f7df821fe55e3f7bb8d3018f9d466ca9b588a8ebdf464a8d","observation_id":"6cc8635c-249d-4614-a294-0db998297d3f","resolution":{"observed_at":"2026-08-06T16:34:04.033878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T16:33:59.593100Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.593100Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:c7ff4b67840a3294366f8d8e196ea043935f268e977ed06aaa8933ab4728128c","observation_id":"1317a9f8-a4e1-4b3b-a61b-b6642aea8c2f","resolution":{"observed_at":"2026-08-06T16:33:59.593100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:33:59.681440Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.681440Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:be057425bfeb36023e90d1487fd2ae7a8bdc262d0b4d9099e7675c6dec4d294b","observation_id":"c739e576-e451-49be-9b6f-865b7ee079c8","resolution":{"observed_at":"2026-08-06T16:33:59.681440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-08-13T04:55:54.891747Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-06T16:33:59.762003Z","title":"Lidar-llm: Exploring the potential of large language models for 3d lidar understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.762003Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:ac48d928a09b1717e2595ecf39f7695304fde11bebe0a2f0b5cf7a427721f120","observation_id":"2d1dd959-0b45-452e-b3bb-8f28fb0625bc","resolution":{"observed_at":"2026-08-06T16:33:59.762003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-13T04:52:37.935795Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-06T16:33:59.844125Z","title":"An improved baseline for reasoning segmentation with large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.844125Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:629b4ddcf7707144a44278a45794c1880b74eddc8f7563fc48a743ba60c84ae9","observation_id":"6526a65c-7687-4b8c-a824-684863e2301c","resolution":{"observed_at":"2026-08-06T16:33:59.844125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:03.823368Z","title":"Unified language-driven zero-shot domain adaptation","venue":null,"work_id":"35cd3aff-0dc9-4e59-aa2a-3ab3f0071ed2","year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:59.929682Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:f25ed4487be19c2e5239bf6d97291e07592607a2581819abae27dfaca6416bb9","observation_id":"bfc05a37-56a0-44f3-8078-ffee2b80e882","resolution":{"observed_at":"2026-08-06T16:34:03.877874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-06T16:34:00.063593Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.063593Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:a76c4cb104283158f4e72e2af6d1847ffe7839f50a01a35dd611e4494104b90f","observation_id":"762ee269-420c-4337-8c24-a5637ac4898b","resolution":{"observed_at":"2026-08-06T16:34:00.063593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-12T11:51:34.032343Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-06T16:34:00.236317Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search.arXiv preprint arXiv:2412.18319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.236317Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:d5c1c01c9608e29f581443baa1f32b8e8eb06cbe2222b602d43255ae40ff3966","observation_id":"4a463d6b-3352-4a14-aa1c-214b488ba78f","resolution":{"observed_at":"2026-08-06T16:34:00.236317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:00.302368Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.302368Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:19095b6a4dfb77fdbe83613dd4344eca43abd4402aa4d012262db58f38761e79","observation_id":"bcda4650-79f0-4b1b-b557-dd424ea46021","resolution":{"observed_at":"2026-08-06T16:34:00.302368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T16:34:00.387393Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.387393Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:96a32c9c1342ed0649c1e00784fd75d50824b9f421e9344925e3a775dabfaf99","observation_id":"90840c33-14ce-4c6b-81e5-f0780b1351e0","resolution":{"observed_at":"2026-08-06T16:34:00.387393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T16:34:00.472565Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.472565Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:4a5e2a96771f207140acba69402e0a8edf89ca9373a988016ad334f23acc3955","observation_id":"9dee110b-579e-4210-a735-6351a73f62fe","resolution":{"observed_at":"2026-08-06T16:34:00.472565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:03.679071Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"201ad895-b4b2-46ee-a5d6-a97138ebc939","year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.538538Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:0650b03d77005fe477ae18f1fa4d43c0e8822b3e2e1d3694bdcbd667af237d69","observation_id":"a8b7a85d-446e-487c-a456-24ff8fd81c3c","resolution":{"observed_at":"2026-08-06T16:34:03.729409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:00.632100Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.632100Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:74e239a1c070450436c774fdcebc9f09ae0230e673153c0f4f6f531069c5e3d5","observation_id":"50efae99-8717-47a9-b628-0d10516eebfc","resolution":{"observed_at":"2026-08-06T16:34:00.632100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:00.725182Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.725182Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:47c1bc3e28d5fa87287dbc3f42f1de2dc952b7c6ee6c0a601bfb096571745ae8","observation_id":"548b07ba-dfef-49f8-998f-a9f5e8cb8418","resolution":{"observed_at":"2026-08-06T16:34:00.725182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T16:34:00.823567Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.823567Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:aa3205e75e92a0806992b7362dab4427eb7ae86f8bd4fef96c34086ccdd1a7c8","observation_id":"94ef0cc7-fe5a-4dab-97df-7275881dcd82","resolution":{"observed_at":"2026-08-06T16:34:00.823567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-13T05:45:31.410659Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-06T16:34:00.909844Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.909844Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:76c9637600de4ee3b5f9cd2484e51df2d3ac1886603d4a6f6bdddafcc299a674","observation_id":"90b0d707-6c91-4c6c-9dd0-97998cf439d8","resolution":{"observed_at":"2026-08-06T16:34:00.909844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:00.995997Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.995997Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:8041c0f319e49b18558e2cd42ec1bcf8869f2b4ec0b8f9de0d2eb8e3b76d39a7","observation_id":"459cbbc0-a507-46b2-a5cd-8681be28c480","resolution":{"observed_at":"2026-08-06T16:34:00.995997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-12T22:18:20.809421Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-06T16:34:01.234969Z","title":"Improve vision language model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:01.234969Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:2313567ae6c2b4c6de875c0a0a8071026d8fd7ca11e5591a3ba14e7936fc38ff","observation_id":"c5a75915-87ef-4dcb-b7eb-b693d5b72e9f","resolution":{"observed_at":"2026-08-06T16:34:01.234969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-06T16:34:01.354846Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:01.354846Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:c49c20777765dfcc14d5393f6fc2468f7f88c33d3dda8189c20dcc480084270b","observation_id":"c5d878cc-0c51-4125-9ef3-115bf8dd040d","resolution":{"observed_at":"2026-08-06T16:34:01.354846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09501","last_updated":"2024-12-12T17:50:39Z","snapshot_observed_at":"2026-08-11T16:57:13.836666Z","submitted_at":"2024-12-12T17:50:39Z","title":"Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09501","snapshot_observed_at":"2026-08-06T16:34:01.464550Z","title":"Lyra: An efficient and speech-centric framework for omni-cognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:01.464550Z"},"links":{"cited_paper":"/paper/2412.09501","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:b10889f45ab0a47073f1f8be86893273c5c70cb5b643ae235004519845c83f2c","observation_id":"e81e025c-e2ad-4830-a38a-db29bf9dfb49","resolution":{"observed_at":"2026-08-06T16:34:01.464550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T16:34:01.579723Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:01.579723Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:abb9c31f43be796b70c9b79d073f3d8160946fdf508ca9d578ad9580d0b76db2","observation_id":"08f82fe7-f8c9-41b8-b55c-aede079122c6","resolution":{"observed_at":"2026-08-06T16:34:01.579723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:03.441663Z","title":null,"venue":null,"work_id":"2921c1d0-9d8a-4fb9-a7d6-057d29d1dc63","year":null},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:01.683979Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:858fa490dba790ea192a68c14e461049143cd6c32f7c9c0376ef2b264fe78fe3","observation_id":"f0fefdaf-7ede-4c55-89bc-0249bde07191","resolution":{"observed_at":"2026-08-06T16:34:03.561959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:03.250070Z","title":null,"venue":null,"work_id":"f3cd7f44-bc19-47bb-85d9-8944e0aee741","year":null},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:01.831065Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:e2f546b5d4fdb03e4eff2aab6ae52bede66ae26ce1f84dacb38c5d5e4efe768f","observation_id":"84399186-c08a-4387-8d5c-cfe50d713c5f","resolution":{"observed_at":"2026-08-06T16:34:03.345800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:34:03.084911Z","title":"type\": \"function","venue":null,"work_id":"8f883377-e19c-4e88-b3c2-aa9219b802de","year":1920},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:01.937707Z"},"links":{"citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:e1d08d016c6d3701f90e64723d13317ad22caad0e9d24f5f67038706e4d3469a","observation_id":"4c2d35a4-da57-4bf7-b17f-602c30b33f00","resolution":{"observed_at":"2026-08-06T16:34:03.146767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 12 inbound Pith citation observations for arXiv:2507.13348."}