{"as_of":"2026-08-08T04:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4325bcda2c0de37e441b73ea9f7fdc338981355b3affb026031a6de5d56040fd","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:37:50.854503Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:13:16.940627Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24164","snapshot_observed_at":"2026-08-03T11:13:16.940627Z","title":"Mixed-r1: Unified reward perspective for reasoning capa- bility in multimodal large language models.arXiv preprint arXiv:2505.24164, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07298","last_updated":"2026-06-21T08:39:33Z","snapshot_observed_at":"2026-08-07T01:28:13.061117Z","submitted_at":"2026-01-12T08:15:36Z","title":"Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T11:13:16.940627Z"},"links":{"cited_paper":"/paper/2505.24164","citing_paper":"/paper/2601.07298"},"observation_digest":"sha256:2614aa2c32a00986f38354704c29ca58a3765aaff881433e23edf632dc702c5f","observation_id":"47793b81-619c-4a58-94a6-a23602ca3b68","resolution":{"observed_at":"2026-08-03T11:13:16.940627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24164/citation-record","integrity":"/paper/2505.24164/integrity","json":"/paper/2505.24164/citation-record.json","paper":"/paper/2505.24164"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:37:42.783123Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:42.783123Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:3b298ebbc4226ddc169107bbb10f3278c55af6fd7bb5e71d6644890170149131","observation_id":"a205b59b-d940-44ec-b20b-b1ce05113763","resolution":{"observed_at":"2026-08-07T12:37:42.783123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T12:37:42.873209Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:42.873209Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:6b501ae13918e4bdde02a8cdf88df1cd3f48a09b73c264ba66f6eb9f2cd26d49","observation_id":"5b68f802-f117-4d20-9c57-9b2f6fc45502","resolution":{"observed_at":"2026-08-07T12:37:42.873209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:37:42.957030Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:42.957030Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:448d4fea15bcb621a3fc43e63ce132a748e5b5669309aafe88b79a5296f33d2c","observation_id":"bc5380aa-495b-403f-b824-c951af462fd2","resolution":{"observed_at":"2026-08-07T12:37:42.957030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-07-06T14:18:49.988227Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-08-07T12:37:43.047242Z","title":"Mapqa: A dataset for question answering on choropleth maps.arXiv preprint arXiv:2211.08545, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.047242Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:062beb523e3f0db9654620d994e366630a02276da48069b53adf2f15cb54dcbf","observation_id":"a354a0fe-2f23-4469-9fb5-6d57164bfc21","resolution":{"observed_at":"2026-08-07T12:37:43.047242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-07T12:37:43.118516Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models.arXiv preprint arXiv:2402.11684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.118516Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:3dd3ad95eb3895a565c184374af38bb9bc744de7f23223714c72f7a233e4c55f","observation_id":"0ba50aa3-3999-460d-a51b-f97816fe33cf","resolution":{"observed_at":"2026-08-07T12:37:43.118516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-06T05:59:54.593795Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-08-07T12:37:43.218009Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression.arXiv preprint arXiv:2212.02746,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.218009Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:ff83ad6d3e9a7fc98fc430edf41c7a027c75085125bbd9e1cbf7e521aadb8499","observation_id":"c960d2c9-ada4-4dc6-b172-2fc19031cb0f","resolution":{"observed_at":"2026-08-07T12:37:43.218009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14517","last_updated":"2022-01-11T03:50:31Z","snapshot_observed_at":"2026-07-06T11:14:04.454155Z","submitted_at":"2021-05-30T12:34:17Z","title":"GeoQA: A Geometric Question Answering Benchmark Towards Multimodal Numerical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14517","snapshot_observed_at":"2026-08-07T12:37:43.332355Z","title":"Geoqa: A geometric question answering benchmark towards multimodal numerical reasoning.arXiv preprint arXiv:2105.14517, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.332355Z"},"links":{"cited_paper":"/paper/2105.14517","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:2217dca0533d846b74c3a55d1fc1f472092acfe2bb8ff5f3b3fca6f1c351a196","observation_id":"e4615098-7cfd-4dfc-abb7-03ccc8f23df0","resolution":{"observed_at":"2026-08-07T12:37:43.332355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:56.221961Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3.https://github.com/Deep-Agent/R1-V, 2025","venue":null,"work_id":"24947496-79c3-4d4b-b62b-4a443c6a7698","year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.437869Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:27a6e43259c34de0623ab3f3a4b09d9ba30bce3ffbb88cc36470ce894afc9a66","observation_id":"910e8922-4bdd-4d7c-95a5-cd450e5e09d3","resolution":{"observed_at":"2026-08-07T12:37:56.305112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T12:37:43.536170Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.536170Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:3b7b42d19c73de1150928f1a410d9c169aac9e2e6ffd3fcd1708ba09cf8abb64","observation_id":"ad424351-a347-45cf-9118-0edb67921a5c","resolution":{"observed_at":"2026-08-07T12:37:43.536170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:37:43.644290Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.644290Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:a1c2f33f857ddf26731e45256d178e48a9d0d7bc23e511c86e308d5156505e59","observation_id":"82dd815f-cc4c-4aac-a85e-a3dd84af6992","resolution":{"observed_at":"2026-08-07T12:37:43.644290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:56.042838Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"3da62171-8d35-4309-bda0-110afdf8c597","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.735687Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:17a9988a7901b8c4d6de625ebea0a0553ae01fdb85a732ebacf3ff3f37426fde","observation_id":"d1e9d65b-6059-4ad6-be0b-c45f35d4a376","resolution":{"observed_at":"2026-08-07T12:37:56.125085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.852845Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":"80f1ef76-91fa-40e2-bbd6-ab0a6a09a532","year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.800014Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:4bc66038b7796a17d052d4a8de15c71912f63e13f873da7899a920cea92b4107","observation_id":"3531540a-cfb7-48ce-8f1b-fe894f167470","resolution":{"observed_at":"2026-08-07T12:37:55.949527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.673769Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution","venue":null,"work_id":"20f5e115-dd2c-4f8c-bab2-fb24a2410112","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.845422Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:9c319b660ad5c67b493eabdb628fe58ca56685fbb50d3b3c06164807bd8041d0","observation_id":"271734de-2d98-44a3-b87c-25be0653fdd4","resolution":{"observed_at":"2026-08-07T12:37:55.748517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.526699Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":"1735a9ea-cd30-4aad-9a85-8091efbeaff5","year":2019},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.920685Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:8956b90cecad5a74023ef42537854ef056f14c1a34962479d8b35cd99ca0c1a7","observation_id":"d29e0a8c-db58-4aaa-aa98-07b0f9a8dac0","resolution":{"observed_at":"2026-08-07T12:37:55.599809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04620","last_updated":"2025-05-07T17:59:32Z","snapshot_observed_at":"2026-08-07T15:49:04.921787Z","submitted_at":"2025-05-07T17:59:32Z","title":"On Path to Multimodal Generalist: General-Level and General-Bench","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04620","snapshot_observed_at":"2026-08-07T12:37:43.985549Z","title":"On path to multimodal generalist: General-level and general-bench","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.985549Z"},"links":{"cited_paper":"/paper/2505.04620","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:a4e85d300df503aed62a7ce2302e00ce3fb01c1147e841ee64a8f2eb95bed3df","observation_id":"1b27fa32-f58d-4a23-b944-4dd3a2c638d1","resolution":{"observed_at":"2026-08-07T12:37:43.985549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T12:37:44.072119Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.072119Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:15b7741ee5444d2cd7b3e5066e6207e569914e13329ea6a43a0c4a97b779a3a0","observation_id":"fa40b409-6c78-442b-84d4-fc1701f09a5a","resolution":{"observed_at":"2026-08-07T12:37:44.072119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-07T12:37:44.110624Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.110624Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:bf073769e9f761ef476c939f0b56e6f021f41c58f74a905e6454a42041ce856f","observation_id":"2d9e2b31-4beb-472a-9052-bcc9a9d5f27c","resolution":{"observed_at":"2026-08-07T12:37:44.110624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.383300Z","title":"Cantor: Inspiring multimodal chain-of-thought of mllm.ACM MM, 2024","venue":null,"work_id":"296a4c65-9060-40a3-8ff1-b73e32a22123","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.208714Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:a394e6d61020e1f7117144db1fb595bacc38616510a4c104ed32846bbd299f4d","observation_id":"701d8e6c-81b1-4d7a-85e4-20d51bce3fd2","resolution":{"observed_at":"2026-08-07T12:37:55.458081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.200207Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"b616bc6d-2b58-4d35-9ec9-6c1e75a2d6e4","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.295082Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:74d10683b763b716b55b98a7a942747b72b894b128c0340054b0aae939ead1c4","observation_id":"ba33b5e7-45dd-4ffc-b33e-d25f34b1d1ed","resolution":{"observed_at":"2026-08-07T12:37:55.289867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:37:44.393355Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.393355Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:3c6b8b63d086caa35288b6c75f836243916818bf55076ae17db25580ebc9e093","observation_id":"0812ec8e-1fea-492a-9148-2110ca2e4d0d","resolution":{"observed_at":"2026-08-07T12:37:44.393355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10441","last_updated":"2024-10-16T09:45:06Z","snapshot_observed_at":"2026-08-04T03:48:44.723741Z","submitted_at":"2024-10-14T12:35:12Z","title":"Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10441","snapshot_observed_at":"2026-08-07T12:37:44.473998Z","title":"Free video-llm: Prompt-guided visual perception for efficient training-free video llms.arXiv preprint arXiv:2410.10441, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.473998Z"},"links":{"cited_paper":"/paper/2410.10441","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:25d6bdf9681f66775d5c08854d77195bf93b429162ff868f3217e6a0a390995a","observation_id":"9848067d-40d2-44bd-a3a3-aac8c40b6c7f","resolution":{"observed_at":"2026-08-07T12:37:44.473998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:37:44.516429Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.516429Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:8635f8917b301d66bb3d4db61234d818a92f88a5ecd78994724390912d36ef6c","observation_id":"3fa536d7-b889-42b8-afff-03f25b2f2e80","resolution":{"observed_at":"2026-08-07T12:37:44.516429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05615","last_updated":"2024-05-09T08:23:20Z","snapshot_observed_at":"2026-08-07T04:07:58.370340Z","submitted_at":"2024-05-09T08:23:20Z","title":"Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05615","snapshot_observed_at":"2026-08-07T12:37:44.565913Z","title":"Memory-space visual prompting for efficient vision-language fine-tuning.arXiv preprint arXiv:2405.05615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.565913Z"},"links":{"cited_paper":"/paper/2405.05615","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:29b221a246eb1c5e33e41e49ef9725b5303f6a16ea9c910ea636f08a92cef746","observation_id":"d1dc0482-7b39-4693-b682-578cc52782db","resolution":{"observed_at":"2026-08-07T12:37:44.565913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:55.021365Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"d87f04be-e06a-4a18-ac95-57fb9db68421","year":2017},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.642885Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:be9117528223570c11cd0a33855b2cd00f161ce8eb7ab07c1f2e5dfb23882c8d","observation_id":"045da288-d805-43d5-872b-449c83ab6d74","resolution":{"observed_at":"2026-08-07T12:37:55.115246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-07T12:37:44.703110Z","title":"Figureqa: An annotated figure dataset for visual reasoning.arXiv preprint arXiv:1710.07300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.703110Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:c67e4a49d398ae0ca7d22bff7e350f1a3a43e2aaa6432544c2d9d3bdf1612db8","observation_id":"bacc674a-5048-48a6-8529-75e556c96760","resolution":{"observed_at":"2026-08-07T12:37:44.703110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.865852Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"e5138560-9ca5-407b-8eb4-95b9fe62ecd9","year":2016},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.746200Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:2ffdf6b36664897b767b868ac212c971554c93a85ed8e2ab888b2c4d0706ccbe","observation_id":"0140bf2a-a5ea-4d8a-a649-d9bf3e65de77","resolution":{"observed_at":"2026-08-07T12:37:54.951630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:37:44.784518Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.784518Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:b0048608437473092f803413b7ec818f053269966042f8f7efc277ca5c0ad8c5","observation_id":"080d880f-5ecb-4032-a0cc-3c6fb3a37e2f","resolution":{"observed_at":"2026-08-07T12:37:44.784518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T12:37:44.857093Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.857093Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:02556296d3876ccc7a7d3c8eced67403e3fc01100542b44d4b2bfed31fea16c9","observation_id":"fb4f7a2e-b358-47af-b11e-7b046b6e82c5","resolution":{"observed_at":"2026-08-07T12:37:44.857093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.720770Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"653a367d-1d9b-40b0-b1a9-8c2be13da8b1","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.902929Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:775865ba431742d808357ed94935303f72ba262caf7da1b449e0ad3b24fd64af","observation_id":"2ab70df7-2694-4d02-9eac-22b516c053c1","resolution":{"observed_at":"2026-08-07T12:37:54.794908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T12:37:44.976247Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:44.976247Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:d964f62f74c372722acb80d30baa7630f2ffe9af24451673eb29611dbb2c2f3f","observation_id":"059e7857-0160-4348-a977-ab5a86d5b89e","resolution":{"observed_at":"2026-08-07T12:37:44.976247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:37:45.063410Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.063410Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:9c89cf09fc246fa46ec38f2ecfa90fc5ee2c56d5114df60aedab16b9aa208ae8","observation_id":"311990ad-275b-4c1d-943d-b49c5c529f35","resolution":{"observed_at":"2026-08-07T12:37:45.063410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.522998Z","title":"Visual spatial reasoning.TACL, 2023","venue":null,"work_id":"fe1d6d1c-0836-4674-bad8-3faf26eeb4e3","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.149681Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:ad96ca4fcbd531ccf10b764852392d452f848fe7638e60b8b5ce6522b405ed4e","observation_id":"e3d474fd-64fa-4b36-b4b2-e8e5f73f7bed","resolution":{"observed_at":"2026-08-07T12:37:54.625675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.348451Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"3db383db-4cc0-4e29-89c4-93a8784709c3","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.152810Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:41bb1133771d779f64cd529182e61f92a51a31e88d5a7939c76e6996bb892437","observation_id":"f8a42cc8-70a8-4716-91f5-9b8cd2cf7515","resolution":{"observed_at":"2026-08-07T12:37:54.441783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:45.234152Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.234152Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:963fa67fb76113bb0ba8d79007139b760e90ec28e6946084645f20408b2160ba","observation_id":"848b80bc-c73f-4377-93be-7c36b161b31b","resolution":{"observed_at":"2026-08-07T12:37:45.234152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.185126Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, 2024","venue":null,"work_id":"d60aa43f-efa8-4c83-8dc1-9e226f1c06b0","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.396245Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:c6f1bb4304e96a8d1889f93245b2e0abdf9e5c902bc0c6c28c45ea2714fd7e2f","observation_id":"f937c7b9-8cfc-4f61-9ad7-50ae0c9f615b","resolution":{"observed_at":"2026-08-07T12:37:54.262844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:54.064575Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"0a9b3a7a-e0ca-4794-9400-31ceb2f59fc5","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.618007Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:bdac0680b7704ca57f41aab66168a7e8a2e3198d8c42d638aa4924b806f04861","observation_id":"aec24713-eebd-41a3-a6c3-f838f33c3b54","resolution":{"observed_at":"2026-08-07T12:37:54.130873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T12:37:45.787946Z","title":"Deepseek-vl: towards real-world vision-language understanding.arXiv preprint arXiv:2403.05525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.787946Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:768b12562d501e463aac66e2087518ecca0bbaf478950639e0767d253dfb5d45","observation_id":"49741e44-f24e-421a-9897-31100a89f9e4","resolution":{"observed_at":"2026-08-07T12:37:45.787946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.898719Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"53053182-bfb2-4b17-97df-506c62cde606","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:45.960301Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:cd6f2da30ff8e7d2ad6a853ce96d84a8ce7e89a34af303701a1dde5f8074d018","observation_id":"14856869-d85c-4176-9161-29c064ad3d38","resolution":{"observed_at":"2026-08-07T12:37:53.983355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.733995Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"0d565392-29b6-4bcd-a8a4-484f4ffda67a","year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.128342Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:15f022b13e0f878150a63f273249497fc7b85a1b0d4b465b6ead3c50acf4d86d","observation_id":"6a495537-6ea1-4de9-9765-6701e7bbcf4e","resolution":{"observed_at":"2026-08-07T12:37:53.808532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.559028Z","title":"Cheap and quick: Efficient vision-language instruction tuning for large language models.NeurIPS, 2023","venue":null,"work_id":"065e1327-aa21-45dd-975e-e07652af2546","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.363496Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:ddbc0ba22c1dd4f3d106c48c1ce3c247a652ec06ec98cbd9b525964195748a7b","observation_id":"4a02b294-cac4-4826-b864-84262d5b913c","resolution":{"observed_at":"2026-08-07T12:37:53.634049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T12:37:46.509499Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models.arXiv preprint arXiv:2403.03003,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.509499Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:1311b59c028081ba9dbe8cd37402f0b65a0f14b81d8cb8242967e6d9cf471681","observation_id":"7d0232be-36ae-4f25-a436-a166fe6a183e","resolution":{"observed_at":"2026-08-07T12:37:46.509499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:46.617047Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.arXiv preprint arXiv:2411.13093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.617047Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:727cada328a51b598d10e56524df7066238c7cd93d197dccb867abf672eb41dc","observation_id":"90b0c37c-04c1-4dc9-93d3-0e3233b263b0","resolution":{"observed_at":"2026-08-07T12:37:46.617047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20502","last_updated":"2025-03-30T03:54:36Z","snapshot_observed_at":"2026-08-07T16:35:40.970337Z","submitted_at":"2025-03-26T12:42:37Z","title":"MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20502","snapshot_observed_at":"2026-08-07T12:37:46.790491Z","title":"Mllm-selector: Necessity and diversity-driven high-value data selection for enhanced visual instruction tuning.arXiv preprint arXiv:2503.20502, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.790491Z"},"links":{"cited_paper":"/paper/2503.20502","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:147b21cabdb0abeb6327e6d6b96cc9056324c3abefd3cd60c5157a83d5fc9793","observation_id":"a972f16f-ab27-413d-8770-72947fbea608","resolution":{"observed_at":"2026-08-07T12:37:46.790491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.401849Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"58973b82-993b-48ce-af74-89885494b838","year":2016},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:46.908031Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:1649b645404c827886ceb4dd44ba1566d287117f45319dba03b355068ee3d63f","observation_id":"db05e5a2-683a-422b-9098-eb214b87e391","resolution":{"observed_at":"2026-08-07T12:37:53.474140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T12:37:47.054610Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.054610Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:3fa96965e288f3924f0c144598eff3aaaa1ce651a219dd702f3a857a4d5a2528","observation_id":"6aa570e5-7757-4a4d-9507-a2c62a29d32a","resolution":{"observed_at":"2026-08-07T12:37:47.054610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.255411Z","title":"Infographicvqa","venue":null,"work_id":"54bd602c-cef2-4577-8120-4ba3629ae91e","year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.219388Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:e6c06b4dfaeb47a0582ed05b1ba1a9e6db537b9db2052c1f535a8be4dac1a8fb","observation_id":"feb65134-920d-4bf9-8fbb-cd50e46492e0","resolution":{"observed_at":"2026-08-07T12:37:53.318799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:53.055959Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"09634144-119f-436b-9846-5e4758430181","year":2021},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.344366Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0b3401463f58d5ae05ce73ce17449aed4537d7b65b5ee9383bc62a952d3c1491","observation_id":"eb606e72-c086-4dac-bfbc-73847b3c9101","resolution":{"observed_at":"2026-08-07T12:37:53.165749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T12:37:47.537408Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.537408Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:52543a1b3c03d59f83854677e0ca264276ec73df35fdc7c9a6b4d1f6d16ca40c","observation_id":"a7e68bb9-1055-4b61-88d0-f5951e67213b","resolution":{"observed_at":"2026-08-07T12:37:47.537408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.785943Z","title":"Training language models to follow instructions with human feedback.NeurIPS, 2022","venue":null,"work_id":"874ab487-ba34-4d61-a6f1-4ba90191b76f","year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.706893Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:0702db6baf488cd94360affb2234349b705710491dcfd35a51398bebf542c7d2","observation_id":"9d097eab-a669-4ed7-9c41-8431050b7f92","resolution":{"observed_at":"2026-08-07T12:37:52.920910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:47.865340Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:47.865340Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:cc47d1ed8133cc2dbf1196858f48a23ea9be30b399bbd72ad47cd2dbb823dfca","observation_id":"e11f3118-abc1-47d5-8ca4-0dd272df0855","resolution":{"observed_at":"2026-08-07T12:37:47.865340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.583798Z","title":"Direct preference optimization: Your language model is secretly a reward model.NeurIPS, 2023","venue":null,"work_id":"8c728ead-ddd9-4054-a8c2-c13e9a9fe173","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.030928Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:023098e11ae47b70782d9cce985c6e454860d14fe02797dd376823d490654166","observation_id":"c0ff8c5d-9f1b-41e6-911a-855075ae6886","resolution":{"observed_at":"2026-08-07T12:37:52.695218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-08-07T12:37:48.199482Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts.arXiv preprint arXiv:2501.04322, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.199482Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:93beff2aabbdeb2f7b81592ca6376c9acfc674919a7feb60a09a5c82829b46cd","observation_id":"879f13ae-d0b9-4b5c-a844-38f843aaf72a","resolution":{"observed_at":"2026-08-07T12:37:48.199482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T12:37:48.318387Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.318387Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:46f7d7037d06762e5ecce973f94094ce8b5e99217d31998261412f897d0d043d","observation_id":"791d5a95-3c79-490a-b88c-e20176d1b599","resolution":{"observed_at":"2026-08-07T12:37:48.318387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:37:48.437328Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.437328Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:e26712e6c3f4ef55b29a4d8640f18649303071a0c6ec0bb2a39543bc0287c23b","observation_id":"a8abd1ea-e136-48d5-a244-bb3c22e22062","resolution":{"observed_at":"2026-08-07T12:37:48.437328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:37:48.531778Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.531778Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:fb93dee19911d24fcaef3310c711e9de1cc2df93a7557eddba66f44e4995bbe7","observation_id":"d0afd5ec-f21b-4d35-8aca-16b8b8b998d0","resolution":{"observed_at":"2026-08-07T12:37:48.531778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T12:37:48.622594Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.622594Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:5acd1ffd6f3739b48a60616fb6e577eebb5041086a944f37f2fb04b8edd335dc","observation_id":"75ff2723-9024-4e4a-883d-f23746d7593b","resolution":{"observed_at":"2026-08-07T12:37:48.622594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:48.691734Z","title":"Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.691734Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:3ea83d7b86d1015ca2f8d8efe58cc45b9d0869fd801ef35177c1193b4c497dcb","observation_id":"2323e1fd-fc9b-4b47-9264-b649af1f9014","resolution":{"observed_at":"2026-08-07T12:37:48.691734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:37:48.782938Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.782938Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:312be4044e45c8cfd452dd98520fce0e8547e34bbaca84c721edf6291ee9e77a","observation_id":"020874f4-2c31-4234-a8ee-10e3083fa6cc","resolution":{"observed_at":"2026-08-07T12:37:48.782938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:37:48.877517Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.877517Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:d639e9a94bf09fe32731c5217af9bdffcfbd4a9700d8793a370155c60e2910f0","observation_id":"13ea1e57-dedf-46a7-90b6-3388db6d6b98","resolution":{"observed_at":"2026-08-07T12:37:48.877517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-06T04:41:26.667478Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-07T12:37:48.974699Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.arXiv preprint arXiv:2402.14804, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:48.974699Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:2ea188904e3f416f66c295b470eabf22c8cd65849683a5f49768ea88b12d07e7","observation_id":"61cfd93d-8772-489c-9a56-e7c2efee99cf","resolution":{"observed_at":"2026-08-07T12:37:48.974699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:37:49.073537Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.073537Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:17a9b16096cb99a523cbb71e669dc67217b7c67f504c6527158f5d74f7220859","observation_id":"e22b9b99-6fa5-4feb-9213-419fb69ecb85","resolution":{"observed_at":"2026-08-07T12:37:49.073537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-07T12:37:49.199326Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference.arXiv preprint arXiv:2412.13663, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.199326Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:4dbeb7ba53710f084f21f04449a9b8e21bfd87ab37ad9126d33cbd8c51ba3f2a","observation_id":"bc7baed4-4b75-4a71-ad43-1f2c7c87d3b2","resolution":{"observed_at":"2026-08-07T12:37:49.199326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T12:37:49.263799Z","title":"Qwen2.5-1m technical report.arXiv preprint arXiv:2501.15383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.263799Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:d671229df08fdd10f4d36d6f1d88779da6669dcb40d49290e127875193ab6ae4","observation_id":"9b330a79-d238-4eb8-889c-aa84aefb3fce","resolution":{"observed_at":"2026-08-07T12:37:49.263799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T12:37:49.357574Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.357574Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:300fa2b60ecf29d085a75ff7ba65bd8ad507f1d834055c2ac35f4b67dc6da24b","observation_id":"9297dae2-6215-44be-8af7-ec6c6cb9706f","resolution":{"observed_at":"2026-08-07T12:37:49.357574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:37:49.453135Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.453135Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:e602988f6000f3dd6b48acd75f2073f17d4dde2a22a6465e209f96dea33106d6","observation_id":"575783b0-dd21-4941-b5eb-464ca8c32aea","resolution":{"observed_at":"2026-08-07T12:37:49.453135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T12:37:49.581401Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.581401Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:325a1f9bd756eadd875a057a80526f7b6d86b944ff6bdf2ca70c74ba5749539b","observation_id":"6ee38d23-7e1c-47d9-9d2f-37e72a156375","resolution":{"observed_at":"2026-08-07T12:37:49.581401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-07T12:37:49.696896Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos.arXiv preprint arXiv:2501.04001, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.696896Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:fd9482549a663638716bd1de3a896124f1d2c6db1323e9aeeb3a6f5264aa4bf9","observation_id":"20fefdf2-e833-4a4e-aee3-f6208b8e0f46","resolution":{"observed_at":"2026-08-07T12:37:49.696896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.389357Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"c66ad354-05f7-434e-9cff-3e197a7ba207","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.827448Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:5d89caff020c17b1ddef8ce74077b833897d8f519619854abe7d14f0d41ab0a9","observation_id":"7099775a-08ff-495f-82ff-6a60aa94f3bf","resolution":{"observed_at":"2026-08-07T12:37:52.485583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.225933Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"78b7af76-df01-46cd-ba01-3b0c62bec1fc","year":2023},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:49.936532Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:fe1f555761c1c503969c569cc73d54b65a0bb552aa04523381dbe0b9bc90f8b4","observation_id":"7976af05-89f0-42e2-a8c6-20aa80e3b659","resolution":{"observed_at":"2026-08-07T12:37:52.301424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-07T16:43:26.268417Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T12:37:50.037158Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision-guided reinforcement learning.arXiv preprint arXiv:2503.18013, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.037158Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:ec33743b2eaf08145a0b215787c7c69e3e4b940eecb0e7d8751090c9ecfb6145","observation_id":"9b77ae93-91de-49b5-8e52-1196ea0c1596","resolution":{"observed_at":"2026-08-07T12:37:50.037158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T12:37:50.123928Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models.arXiv preprint arXiv:2407.12772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.123928Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:8e2df08245816097baa45c906096391a48543d45abd726ea1540733fcd4f37d6","observation_id":"cb348a27-c885-4a0a-9667-9fb0ed96adda","resolution":{"observed_at":"2026-08-07T12:37:50.123928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:52.054130Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"217dfb22-ec5c-4f97-aa0a-eae9642997b6","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.210810Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:64682269d86cea0df133e31fa7093ded47c91cb5ac82f03a123dc75210703517","observation_id":"71428098-f6cc-4eec-83ea-f68eedcd226a","resolution":{"observed_at":"2026-08-07T12:37:52.132720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-08-07T16:05:47.627466Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-08-07T12:37:50.273762Z","title":"Pixel-sail: Single transformer for pixel-grounded understanding.arXiv preprint arXiv:2504.10465, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.273762Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:88273ad3c7852de1089a329331428993ea28dc12713a1ef321792ecde694c055","observation_id":"5984fb9c-150c-4bbd-9f4c-cb0289374dcf","resolution":{"observed_at":"2026-08-07T12:37:50.273762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:51.857945Z","title":"Enhancing multimodal large language models complex reason via similarity computation.AAAI, 2024","venue":null,"work_id":"19e5391e-8239-4e8f-9429-c217223d6b19","year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.386378Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:af81199e7ff4c1d53c32f972387baa952bd64ccbdc95cb0dce19913ff506cfd7","observation_id":"5be7b6d3-807f-4516-908c-2ae4f0eb2d20","resolution":{"observed_at":"2026-08-07T12:37:51.942715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:51.642688Z","title":"MultiHiertt: Numerical reasoning over multi hierarchical tabular and textual data","venue":null,"work_id":"64bb9197-fec4-44e1-bd28-2c18904441bb","year":2022},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.496263Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:4f9b7d3e864d827b3bda554534cbf92ceee0af5f1ff4c401c60a53f5ccae4a4a","observation_id":"3b8c0bd6-739c-4e66-bd74-6d7741264b85","resolution":{"observed_at":"2026-08-07T12:37:51.749703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T12:37:50.564213Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding.arXiv preprint arXiv:2406.04264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.564213Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:cec132463cb392e290a116055e0057994b560637594f3d7309438df1950a2783","observation_id":"627beefb-2d62-4fc4-9721-e296d26b16a3","resolution":{"observed_at":"2026-08-07T12:37:50.564213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-02T10:38:59.539887Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04670","snapshot_observed_at":"2026-08-07T12:37:50.658662Z","title":"Are they the same? exploring visual correspondence shortcomings of multimodal llms.arXiv preprint arXiv:2501.04670, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.658662Z"},"links":{"cited_paper":"/paper/2501.04670","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:4139a615468d5a32efc0a20dc105d4c45d196c365bdf86c7e257fb0b5ad60b83","observation_id":"b1c18b3a-35d8-48a1-9128-c02701f41d19","resolution":{"observed_at":"2026-08-07T12:37:50.658662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:37:50.749824Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.749824Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:19ae34b6ecc49826171cb370f70e98b67d0ca673a9791da8f1fb59dc06c6c6d7","observation_id":"ea093f35-2b5b-40ce-9134-c4dd340489b8","resolution":{"observed_at":"2026-08-07T12:37:50.749824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:37:51.473608Z","title":"Genimage: A million-scale benchmark for detecting ai-generated image.NeurIPS,","venue":null,"work_id":"e6e13f78-0d8b-4a76-8b09-0516df140dae","year":null},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.854503Z"},"links":{"citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:901642f2b0d01ca4bc69d580331987a9d83406f9cea300fcd582fdab47f5be75","observation_id":"9105b61a-f351-4ab7-be17-3628b1c0f762","resolution":{"observed_at":"2026-08-07T12:37:51.554229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:29:46.881822Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 1 inbound Pith citation observation for arXiv:2505.24164."}