{"as_of":"2026-08-11T13:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3656dbfc306c54157664a0f3369f4702c3921f277f10484aedd8b69ad29eb4c6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:19:23.188483Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:40:07.154168Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-11T13:19:23.188483Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13303","last_updated":"2025-05-15T22:00:19Z","snapshot_observed_at":"2026-08-11T13:13:07.570235Z","submitted_at":"2024-12-17T20:09:55Z","title":"FastVLM: Efficient Vision Encoding for Vision Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T13:19:23.188483Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2412.13303"},"observation_digest":"sha256:69720e88c18ebac68ef39bb7cd393188a0c96413e2aadd0a36ef188e26ea11a8","observation_id":"37976e9a-38a0-43ba-b502-0c0f2ee8555e","resolution":{"observed_at":"2026-08-11T13:19:23.188483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-10T22:08:10.041348Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-11T04:56:13.579583Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":294,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:10.041348Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:407f1752d650ae0a24e960ba9711af6f89f7fe480db2792c788fe073807c2b83","observation_id":"c46585a1-cbc9-40e3-9432-9fe4c0339963","resolution":{"observed_at":"2026-08-10T22:08:10.041348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-08T22:47:39.147822Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-10T02:46:21.304913Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.147822Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:c3190340656637c96d020a44b1e18b7e549c5249dc706369f8f7242f03731baa","observation_id":"f02c1b66-f08c-445d-a481-2881b210d20a","resolution":{"observed_at":"2026-08-08T22:47:39.147822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:726d737b26e9330bfa740a12f57d9b13eb3b97fd94c16e0d672ef7b0ca02911c","observation_id":"b93518cb-dc78-4422-81fb-50abce96ca5d","resolution":{"observed_at":"2026-05-23T02:25:19.077389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T00:19:20.462455Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2503.10615"},"observation_digest":"sha256:5c8b5d977270fddaca05d616b73c43d7153136cf85764874ff38af63eee824b6","observation_id":"d37b096c-0952-4d52-aa29-37be6b437a11","resolution":{"observed_at":"2026-05-16T00:19:20.527581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:3a78d75af33dc9c9ef99004350a8683b0a33c1b937dd9c28f7fb876b43218636","observation_id":"0ccbae95-297b-469a-988f-6eacb9334bb8","resolution":{"observed_at":"2026-05-15T17:18:53.580628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:9450e3a86d327996908ac15e3d8f5298a8d15bebb6faacbb81988969cc865485","observation_id":"7df89b55-a208-4c96-8197-b601b33a9e54","resolution":{"observed_at":"2026-05-19T06:59:03.395929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:50.552549Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2504.05299"},"observation_digest":"sha256:4a8fb868e4659c326e1927cba04658347ff4e3dbda56e84d83b063eac299d9f5","observation_id":"8ef85ad1-efd7-4ce8-b69a-92e49a222d70","resolution":{"observed_at":"2026-05-13T20:23:51.709217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-11T10:16:40.394612Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:b7dd74aee1c8514f16e01dc29fee941a97c12138d82a72c6bfcc17d83eb298bb","observation_id":"954eea10-c87b-43cf-9ec2-6b1c8ad09be5","resolution":{"observed_at":"2026-05-10T16:23:42.186601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:5e7dae2f99a9096ab301fc818acf24aa86f4bdfb1afac5292aca16fb1587fe69","observation_id":"703e8ac5-584c-48aa-bd45-2f71d209e61b","resolution":{"observed_at":"2026-05-22T14:21:39.771573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:3d3ce59d493f3824cb9e848a2ab6b05603dfaca19211ca6b57505e4ca483f61c","observation_id":"74420e64-e9bf-490e-9bad-8518905b5848","resolution":{"observed_at":"2026-05-17T03:46:06.232126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T14:12:03.775772Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-08T16:19:49.539801Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:03.775772Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:1a5283b02da547ea4022eab5cb191ce147b59a54fcb1af8c4088ca2f9bae541b","observation_id":"535af07f-bec3-4081-8631-57ba21dd4d66","resolution":{"observed_at":"2026-08-07T14:12:03.775772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T13:12:53.708467Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-08T13:10:29.457567Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.708467Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:5eb40cc45acce5c9f1e197d6ea53961df1b4d34acf0210aec33a61ef6c01acbc","observation_id":"f099e45b-584b-4429-90f8-7bfef4ee4b09","resolution":{"observed_at":"2026-08-07T13:12:53.708467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T12:40:44.530844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.530844Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:69215bc77927f5de1fafd2d187495bd3e65285d43091b8e0013e60ca7e3e33e9","observation_id":"4cc616f9-4037-4362-bdce-c9897d81045c","resolution":{"observed_at":"2026-08-07T12:40:44.530844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T10:53:59.200727Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04088","last_updated":"2025-06-04T15:46:30Z","snapshot_observed_at":"2026-08-08T10:57:58.673564Z","submitted_at":"2025-06-04T15:46:30Z","title":"Multimodal Tabular Reasoning with Privileged Structured Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:59.200727Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.04088"},"observation_digest":"sha256:70cd89c0d25c9d273b260ad1cb661b7f17a082bcee9da2375fd4e3a5500b877d","observation_id":"2e5b393c-95b4-44a1-8b11-cd619c3751bb","resolution":{"observed_at":"2026-08-07T10:53:59.200727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T05:45:30.600959Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-10T06:54:48.824689Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.600959Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:25045f5eb16355c9f8719921b27a2b3cac0939b965c2ebf619394b412b65aca8","observation_id":"e5b51c26-c286-46df-9016-544557ae8b24","resolution":{"observed_at":"2026-08-07T05:45:30.600959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T05:09:18.908261Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08691","last_updated":"2025-06-10T11:02:36Z","snapshot_observed_at":"2026-08-08T00:05:08.877544Z","submitted_at":"2025-06-10T11:02:36Z","title":"VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:18.908261Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.08691"},"observation_digest":"sha256:f0920ca06ba9af6f0381d3c3a5963ebca4616431bab3ada710864ca1c6013afd","observation_id":"545bdbd5-21ae-42ef-983b-af63ca588c00","resolution":{"observed_at":"2026-08-07T05:09:18.908261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T00:34:03.216795Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.216795Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:97cf13889e18d0831c91696ca7402e64253561be165caac7fcb324931360754a","observation_id":"456f258d-cdda-45e3-a431-c54fb8de5b8a","resolution":{"observed_at":"2026-08-07T00:34:03.216795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T21:52:22.687226Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-07T01:05:19.522559Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.687226Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:8556f5a171444c859268ebc0385703a85b2dcc2d9ff79298e32f7f497ade51a6","observation_id":"de573936-c557-4175-a5a9-a506d29443bb","resolution":{"observed_at":"2026-08-06T21:52:22.687226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T21:27:39.353274Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-11T02:17:33.995061Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.353274Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:d79eab3903143f9d463891aaacd5cb50af793f5b7023538c3ae35e36dd46bd2b","observation_id":"4a6c5b47-e72a-42bd-911d-b726c8c2e9cd","resolution":{"observed_at":"2026-08-06T21:27:39.353274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T20:15:52.742706Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.742706Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:ee9582347855ccbdec4575329d25a0de077ec93675c516d7c76f33898b4f7d62","observation_id":"4d4fd369-42ff-48dd-aa16-8a3b2a588772","resolution":{"observed_at":"2026-08-06T20:15:52.742706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T18:43:12.605646Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-07T12:51:50.265761Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.605646Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:d9784e424d7ec9e1ae69395cc1f04e579746decb1557cfa67273197f1914d5f6","observation_id":"48f42d94-ef92-4dc4-9138-292463bcf64b","resolution":{"observed_at":"2026-08-06T18:43:12.605646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-05T20:15:26.877320Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-05T20:14:58.845639Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:26.877320Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2508.10875"},"observation_digest":"sha256:4aeba26cb53abe3771245be8458a15f38a953786030115387021e74a1b604196","observation_id":"6fb502f8-5f62-4b9c-91fe-4b1e13d4cbbe","resolution":{"observed_at":"2026-08-05T20:15:26.877320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-05T10:39:02.399950Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.399950Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:42c811dbba95dca6bc4677c078048a28b776b2c5d0370b3d57bd98af21ea4ac8","observation_id":"b685855f-c7de-430b-a29e-3eb89d776736","resolution":{"observed_at":"2026-08-05T10:39:02.399950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-04T15:39:35.481243Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-04T15:39:16.754746Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T15:39:35.481243Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2509.19244"},"observation_digest":"sha256:dc728940f3ac9c71bbb9c887a163cc295bea67347cec4476b79ff7cb9aa3aa86","observation_id":"262f9d64-69a0-4f8f-bde8-be33d8710e31","resolution":{"observed_at":"2026-08-04T15:39:35.481243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2511.22663","last_updated":"2026-05-12T09:31:31Z","snapshot_observed_at":"2026-08-11T08:21:56.075227Z","submitted_at":"2025-11-27T17:55:25Z","title":"AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T04:17:07.534291Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2511.22663"},"observation_digest":"sha256:163b62a739cf547fa06064881b1fea04c18a85815e2be4ce5ad99e77d9a162fd","observation_id":"0cdb59a1-27ed-4549-b01c-685666eba19b","resolution":{"observed_at":"2026-05-17T04:19:00.503308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-03T16:21:32.491974Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-04T04:44:58.323566Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.491974Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:01e1d6afcdcabafc6cbd812b133920681ebd88cb6bdcb3695131fcfac5fec65c","observation_id":"422dbeb9-5e7f-4fe7-90ca-88f2e6ae6291","resolution":{"observed_at":"2026-08-03T16:21:32.491974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:260483cf2f837ed0d2cd56fa4d3a31357ee2b5530b9178249ddfcb9e8e37d95a","observation_id":"ddbf47d8-68f0-498c-9092-dccac2e046ba","resolution":{"observed_at":"2026-05-14T22:08:04.394620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2604.11490","last_updated":"2026-04-16T23:50:04Z","snapshot_observed_at":"2026-07-06T22:59:54.573362Z","submitted_at":"2026-04-13T13:56:00Z","title":"Anthropogenic Regional Adaptation in Multimodal Vision-Language Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:29:12.064221Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2604.11490"},"observation_digest":"sha256:72eae6c69ffe3ab5b5566d4e473551d9ce668f40c90b70b67e2ea856db5bb835","observation_id":"0f5eeb8b-5a5a-402f-8a76-d3fcc9128ac7","resolution":{"observed_at":"2026-05-11T08:50:57.788020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T11:06:03.693471Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:afa4996e621dacfaa7b817e3c288c428385238a53819dd869b3b688476c5aa59","observation_id":"7cd4543e-76bc-4aef-82f1-3d065e399684","resolution":{"observed_at":"2026-05-11T21:41:19.313335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2605.08560","last_updated":"2026-05-08T23:41:13Z","snapshot_observed_at":"2026-08-06T15:47:06.010179Z","submitted_at":"2026-05-08T23:41:13Z","title":"ZAYA1-VL-8B Technical Report","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:16.607346Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2605.08560"},"observation_digest":"sha256:8d9a61130f3bea3e9e87fda7c09d68d5217fa868ab7093845c00016f86e710eb","observation_id":"76be5cd6-6450-49f2-94c9-332626a6307e","resolution":{"observed_at":"2026-05-12T08:21:23.557358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:83729b64c71fe086756ff6e4e0c22141581b8601269a51c801efcdc9f32bb767","observation_id":"6e757b67-7e18-4a2b-886d-e421665c2846","resolution":{"observed_at":"2026-05-13T02:57:09.462443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:b53bb6a572e19d1d4b948ac9465170a23dd1d39ed7d37e88e572b9dc7b023e48","observation_id":"17807cb5-4354-418f-bf11-a74de5b5aafc","resolution":{"observed_at":"2026-05-14T21:29:28.594707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2605.17283","last_updated":"2026-05-17T06:39:05Z","snapshot_observed_at":"2026-08-08T15:14:20.631028Z","submitted_at":"2026-05-17T06:39:05Z","title":"OProver: A Unified Framework for Agentic Formal Theorem Proving","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-20T14:43:46.517807Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2605.17283"},"observation_digest":"sha256:21f8ba9a6fb810370f558bc907eb88e97f7b1bddd5b6fe1e49bf2393ec53464a","observation_id":"d4359dae-d5c6-4551-9dd7-9321babad716","resolution":{"observed_at":"2026-05-20T14:48:23.449898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2606.00390","last_updated":"2026-05-29T22:12:40Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:12:40Z","title":"Zamba2-VL Technical Report","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-06-28T22:34:20.970856Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2606.00390"},"observation_digest":"sha256:b828d4b78a199172d374f4c9e1d82a57284200ce8efdf9b20e07b71bf4b2fee6","observation_id":"6fce37bc-1f7d-4864-8b6a-863019af4870","resolution":{"observed_at":"2026-07-01T19:26:00.687479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:4cbc73afc2cf7b477ee015005b3bc877b8c5afea7be8ddcb5525dbcc1d5f31d6","observation_id":"f408383a-4775-42a0-928c-b751d250b4af","resolution":{"observed_at":"2026-07-03T14:38:28.896690Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2606.25432","last_updated":"2026-06-29T19:08:38Z","snapshot_observed_at":"2026-08-06T21:03:12.899914Z","submitted_at":"2026-06-24T05:50:28Z","title":"Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-25T21:05:36.836361Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2606.25432"},"observation_digest":"sha256:c2282952119942f7ca837fb9d9b3d9b3b479f319ee3959c72613799440cff515","observation_id":"53f7f1b4-06df-4382-85c3-14791267f844","resolution":{"observed_at":"2026-07-04T19:40:07.156125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2606.25432","last_updated":"2026-06-29T19:08:38Z","snapshot_observed_at":"2026-08-06T21:03:12.899914Z","submitted_at":"2026-06-24T05:50:28Z","title":"Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-01T06:30:27.178950Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2606.25432"},"observation_digest":"sha256:5a0da22b3051319d6ab4d47e703184bd22b42ec043fd38d7ad273cc9d840d72b","observation_id":"a48d31d2-7767-4a25-86a5-01e2722079ac","resolution":{"observed_at":"2026-07-01T09:35:39.583796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.05237/citation-record","integrity":"/paper/2412.05237/integrity","json":"/paper/2412.05237/citation-record.json","paper":"/paper/2412.05237"},"outbound":[],"paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T04:20:15.211547Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2412.05237."}