{"as_of":"2026-08-07T15:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:378b9d20343431a09225082cf363fc7b24de8d759b6d4e4ade49c112e9b4a857","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:39.624185Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:24:12.349405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:41:27.623339Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"cited_work":{"arxiv_id":"2506.14907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14907","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perl: Permutation-enhanced reinforcement learning for interleaved vision-language reasoning","venue":null,"work_id":"6ed035ce-1053-4717-8ca6-1ecc2365d0a3","year":2025},"citing_paper":{"arxiv_id":"2605.09614","last_updated":"2026-05-10T15:53:11Z","snapshot_observed_at":"2026-07-31T22:46:33.839024Z","submitted_at":"2026-05-10T15:53:11Z","title":"Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T02:24:12.349405Z"},"links":{"cited_paper":"/paper/2506.14907","citing_paper":"/paper/2605.09614"},"observation_digest":"sha256:4ae71f91b0f4cc0f1993429e9cc4ad561db6be83b57e629e70c5320590a204c2","observation_id":"b6ea3834-aab7-4c19-9a34-08b612d1218e","resolution":{"observed_at":"2026-05-12T07:41:27.635779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14907/citation-record","integrity":"/paper/2506.14907/integrity","json":"/paper/2506.14907/citation-record.json","paper":"/paper/2506.14907"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:41.829650Z","title":null,"venue":null,"work_id":"4e78f1ef-1e45-4176-bd56-ed5bc3114f73","year":2023},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:31.914954Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0c5c4f231a3b371f5d2298550f5038078259eac8255dc8ef8ebdfc0738afd3d4","observation_id":"7092c52b-5bca-473c-9826-8149a8b766be","resolution":{"observed_at":"2026-08-07T00:13:41.901593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T00:13:32.009011Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.009011Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:25f5e9c3b9a744cdfadeb717aabe1a59f53d385717c5d8297929a7a629b34959","observation_id":"a6445511-1020-4d41-bf05-90d35ac66653","resolution":{"observed_at":"2026-08-07T00:13:32.009011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:32.220329Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.220329Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:bb57b150f06f3c6b9ee9993e9cd7607c40195f801118e744578d88d9baaa0a25","observation_id":"9a406960-5b41-49e5-ab7d-faf1c48482fa","resolution":{"observed_at":"2026-08-07T00:13:32.220329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T00:13:32.352115Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.352115Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:6a3ac89d1918922f7172dd41b2d01a6fc18f07169c9f5ca56486061ecbe83144","observation_id":"99ab7755-a867-4a3f-a010-852e7f934c84","resolution":{"observed_at":"2026-08-07T00:13:32.352115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T00:13:32.538218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.538218Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:39d30cb9bb584013f3bb8f11b68aadb143b5783d9464796f2195b55e64a2c00d","observation_id":"edb2f5a2-d2e2-418c-9825-522082cb27e5","resolution":{"observed_at":"2026-08-07T00:13:32.538218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:32.756391Z","title":"R1-v: Reinforcing super generaliza- tion ability in vision-language models with less than $3.https://github.com/Deep-Agent/ R1-V, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.756391Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:d6f81dff8a26ea52103e35197bc4e95408ce2e240f20442764d6bffb1526abee","observation_id":"28e8f5b2-f541-40ab-bddc-7ac53985a7e9","resolution":{"observed_at":"2026-08-07T00:13:32.756391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T00:13:32.948421Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:32.948421Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:b88a421274a8f432be491e2eafc160411a96d2aa64958160dd3c6f81f388bce3","observation_id":"184742c6-bfff-4dff-b576-0814a270fcff","resolution":{"observed_at":"2026-08-07T00:13:32.948421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:33.133533Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.133533Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:cfe93cce630159f46715df2e82fe5c703b6cd0e6fa7e2a8927744c64ac300631","observation_id":"9654d880-b9d4-40cc-9421-ba067ee95d51","resolution":{"observed_at":"2026-08-07T00:13:33.133533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:33.262709Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.262709Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:cefa8cf8855e056c06f1b889b24c442952e4ca70426ea202e8bd84fc0a9a110f","observation_id":"81d95e07-7c81-4516-aee5-534b3670bf48","resolution":{"observed_at":"2026-08-07T00:13:33.262709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T00:13:33.384064Z","title":"Open- vlthinker: An early exploration to complex vision-language reasoning via iterative self- improvement.arXiv preprint arXiv:2503.17352, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.384064Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0ff1bf9a0faf65bd59779e87433e86be3708b3f3ab14ca3ec605de1740155064","observation_id":"2e8e6fc8-a836-430b-a708-30f8d4e9fa8c","resolution":{"observed_at":"2026-08-07T00:13:33.384064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:33.524376Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.524376Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:22096b8df83667bc9acc1485bdb93a9f3ecdc387032e9526c1da63c5f7a3df28","observation_id":"f041fc3e-2fd4-49b4-ac1e-f3b8011fc45b","resolution":{"observed_at":"2026-08-07T00:13:33.524376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:33.648674Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.648674Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:d1f242bcbab3c5a1caf50d0daafddd3260ab16b282e71137e3293f215d317606","observation_id":"1433762e-0e14-48f1-9b58-26362d305067","resolution":{"observed_at":"2026-08-07T00:13:33.648674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:13:33.821384Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.821384Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:b6a6c570d3f3855b58524ba573456f28ea656eccdafa0445b49e097f32a16b1d","observation_id":"de473be6-df96-4f94-8e09-42e1161ac5ac","resolution":{"observed_at":"2026-08-07T00:13:33.821384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T00:13:33.957683Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:33.957683Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:e9e62963b3baec0a3e1b4dde166a22bf3e23cda0da2400039cd5c4d5466a3835","observation_id":"7ba9abc4-c2b4-418a-97f2-d52f1800de0d","resolution":{"observed_at":"2026-08-07T00:13:33.957683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T00:13:34.087876Z","title":"Mantis: Interleaved multi-image instruction tuning.arXiv preprint arXiv:2405.01483, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.087876Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:3dc7f52ece72ab0c16767479c684177ffc0e14af06d131237f162901d0de013a","observation_id":"478156f5-7241-4773-a1a2-e247ff7c9487","resolution":{"observed_at":"2026-08-07T00:13:34.087876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:41.601772Z","title":"Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024","venue":null,"work_id":"d7d6d656-4773-4553-92d1-d804319f38d2","year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.221237Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:929a976faeda083ca30b39f059cccbab5b0c7025f32c664e991d542a34697249","observation_id":"ec0b58ea-ebb6-455b-8d00-5f57b13f99a5","resolution":{"observed_at":"2026-08-07T00:13:41.668514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-07T00:13:34.402388Z","title":"Mimic-it: Multi-modal in-context instruction tuning.arXiv preprint arXiv:2306.05425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.402388Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:09b28a49856623a1374e11eb31a1bfcbff5e2b3fe814a2d4109f0dc174a26d65","observation_id":"1e62c27f-6b19-485b-bdc4-9715a2074995","resolution":{"observed_at":"2026-08-07T00:13:34.402388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:13:34.565255Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.565255Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:79675eef7cdf5d0f1a9750e32d999377998f3d37cbd19599a5f4c9687ee2522a","observation_id":"e53a2749-ad2a-4335-a6f2-d026a31666f3","resolution":{"observed_at":"2026-08-07T00:13:34.565255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T00:13:34.729605Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.729605Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:2b176bfe567c342a958c74b00c0282c2f2c6f82c49cabee2846841c0d32d7f80","observation_id":"aa1eb206-ca7b-4363-b8fd-77b9c0e6ef69","resolution":{"observed_at":"2026-08-07T00:13:34.729605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-07-06T20:19:07.706492Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-08-07T00:13:34.937970Z","title":"Migician: Revealing the magic of free-form multi-image grounding in multimodal large language models.arXiv preprint arXiv:2501.05767, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.937970Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:9e427b5947c9a098e7c350b76bed56024ae894c387e2302adc94fb9a2207282f","observation_id":"2274912a-62dd-498c-9c8a-40ea3cd393f8","resolution":{"observed_at":"2026-08-07T00:13:34.937970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-07T00:13:35.115254Z","title":"From system 1 to system 2: A survey of reasoning large language models.arXiv preprint arXiv:2502.17419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.115254Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:09433fe4b57ddcaa5eb05418ba1cde7a5fbd148b3a9d4ef63d224bea2d537e65","observation_id":"8e90f3af-d9cf-4891-82ab-e32038325b4b","resolution":{"observed_at":"2026-08-07T00:13:35.115254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:35.298768Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.298768Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:e805f356a58a6a4da759d22dff61e2b4944709e4275de484ddb3b711f9f6c1f7","observation_id":"6a1a9c86-15d6-4581-8f42-f0c60376f761","resolution":{"observed_at":"2026-08-07T00:13:35.298768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:35.442727Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.442727Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:2db3bcad1d842824fdc6c7f37dd3dbad4e0b4ae9c2e27b2089d2afc536206037","observation_id":"c824f2f8-60bc-48b9-b6c8-08237dc06a80","resolution":{"observed_at":"2026-08-07T00:13:35.442727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T00:13:35.595022Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.595022Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:dba4171b85a1fb0021b007450587008409975b5a27396265909022e1994a5465","observation_id":"d4ca0f18-ef2c-4ad0-934b-34a7904cc1df","resolution":{"observed_at":"2026-08-07T00:13:35.595022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T00:13:35.700936Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.700936Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:1067964a5b5d7305c37afeff2a9e4f20f6e43219cd660a02331735a3b234a169","observation_id":"2ff7774c-4b31-439e-9014-b250ba33e0d9","resolution":{"observed_at":"2026-08-07T00:13:35.700936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T00:13:35.879349Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.879349Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:099c5f1ed5f1fd3b115bb4d768b6521c98bc3e3c692cd04871fae64fb319544c","observation_id":"7e8f4daf-9202-42bd-bce7-898792bd8cbc","resolution":{"observed_at":"2026-08-07T00:13:35.879349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-07-06T18:57:09.545013Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-07T00:13:36.034767Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision-language models.arXiv preprint arXiv:2408.02718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.034767Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:db5939e65eac46cc3819eb776811e727633f99de8ed5584ec8390eefbb0aa47f","observation_id":"bdadbe14-78f8-4313-9062-86a97b7c5f15","resolution":{"observed_at":"2026-08-07T00:13:36.034767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:36.207581Z","title":"Compositional chain-of- thought prompting for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.207581Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:ca0fed5ac034be3db2d1f4bcd390bbbc7a835c87bea8376411b70ef243025038","observation_id":"d624d141-7b69-4ce4-92d1-14900e371b1d","resolution":{"observed_at":"2026-08-07T00:13:36.207581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-07T00:13:36.315527Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl.arXiv preprint arXiv:2503.07536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.315527Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:ecbfb1597fb9ba3a9d4bb85b30e0fc9443c649509c680b3e4002e3eb0a206752","observation_id":"b003eea8-f02f-44ca-b787-9f27e783d4f9","resolution":{"observed_at":"2026-08-07T00:13:36.315527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:13:36.455699Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.455699Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:6f551ee7745c00d11b152a592abf6a4939983153a16b964c2ca1e96b059d25f4","observation_id":"62e16628-6758-4883-802e-bb8abce82333","resolution":{"observed_at":"2026-08-07T00:13:36.455699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T00:13:36.582059Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.582059Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:333645fa612aad64c808b19c1dc8b15f8f4eea6254ff260dcff9b61907a590f5","observation_id":"90c1b662-c989-420d-b621-aa1b4ad3a9b6","resolution":{"observed_at":"2026-08-07T00:13:36.582059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T00:13:36.715006Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.715006Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:c9ec4deffc5f35835c6e79e874ad55c49bf499f6ac889c5a83fe73f17621b07b","observation_id":"b60d486f-3e83-4dfc-82a1-882f978f8b58","resolution":{"observed_at":"2026-08-07T00:13:36.715006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:36.849148Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.849148Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:a8190f3ec31bc60c51f6a8a745e916a7680998b0a240ceef4a9c02cc0557b551","observation_id":"fbe8e408-d38e-4d83-b997-b3745f1fca6d","resolution":{"observed_at":"2026-08-07T00:13:36.849148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:36.989656Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:36.989656Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:a6c4d10846703ba355d8ef0e71081b6393c54c265ed487dd49bb1ae537ccdc9e","observation_id":"3ce6b951-cd47-4683-884f-15b36ff612f0","resolution":{"observed_at":"2026-08-07T00:13:36.989656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T00:13:37.117863Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.117863Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:c8d9a171c79f5d1bea0f3eb18ab1860e24b8fb1ae62e0fc562e54f4e12b67485","observation_id":"1ab728e6-e5c3-49aa-9bf2-89d59bb4acb3","resolution":{"observed_at":"2026-08-07T00:13:37.117863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13792","last_updated":"2025-03-18T00:45:02Z","snapshot_observed_at":"2026-08-05T12:42:51.726822Z","submitted_at":"2025-03-18T00:45:02Z","title":"Identifying and Mitigating Position Bias of Multi-image Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13792","snapshot_observed_at":"2026-08-07T00:13:37.269158Z","title":"Identifying and mitigating position bias of multi-image vision-language models.arXiv preprint arXiv:2503.13792, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.269158Z"},"links":{"cited_paper":"/paper/2503.13792","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:94f17d4c5a1f3ccc103a1cb634c596986c42ede313b5e85547756cacf5d765ac","observation_id":"fd78d89e-0a1d-4c24-9d28-09fb75ad6012","resolution":{"observed_at":"2026-08-07T00:13:37.269158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-06T10:53:26.005728Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-07T00:13:37.427098Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding.arXiv preprint arXiv:2406.09411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.427098Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:2ac25adca389786ade2bea2e4b3111c3851b19d2ad5b5377dcca6b9df838f180","observation_id":"ba28c4ed-87bd-4f28-8a1e-0dc9d73bc252","resolution":{"observed_at":"2026-08-07T00:13:37.427098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T00:13:37.599695Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.599695Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:5d680c93820579f34f3f2648c66cf13e290b15f01a9658576787e3bbdb3417c3","observation_id":"1964cd2d-2e29-4943-8abb-0bb44abc25d2","resolution":{"observed_at":"2026-08-07T00:13:37.599695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:37.725734Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.725734Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:9e4d477afe4dfacbeebbbb30afb1a47d0a4c87d0adb2bdea0c844771489962de","observation_id":"f441ceca-fd9d-4f93-be5f-703d0c7dc510","resolution":{"observed_at":"2026-08-07T00:13:37.725734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20808","last_updated":"2025-08-01T13:54:16Z","snapshot_observed_at":"2026-07-06T20:44:13.353359Z","submitted_at":"2025-02-28T07:50:36Z","title":"MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts","version":6},"cited_work":{"arxiv_id":"2502.20808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.20808","snapshot_observed_at":"2026-08-07T00:13:39.856562Z","title":"MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts","venue":"cs.AI","work_id":"b9e36e90-ba20-4986-847d-f238009800e7","year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.882009Z"},"links":{"cited_paper":"/paper/2502.20808","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:2540e27d3dae05c9aadadece8df353b77cb9d369479442fefe831ccc5c2cf941","observation_id":"8d44726a-0687-4b8f-8626-30727eb0e571","resolution":{"observed_at":"2026-08-07T00:13:39.956964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:13:37.984565Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.984565Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:b5c70a5e0dfe46fe71c02f4dd9b25d73be2871ba23a8540104af3f1329ae01f9","observation_id":"1a54b7a3-06ed-4e51-9bac-347642c2cbbc","resolution":{"observed_at":"2026-08-07T00:13:37.984565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T00:13:38.129961Z","title":"Deepseek-vl2: Mixture-of-experts vision- language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.129961Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:aa1832757df3e7c84710b298a991dbfe426a28adfa775fbfe9d96993a86a9097","observation_id":"b17b943e-74b1-4da0-b8b0-fa9175c1f749","resolution":{"observed_at":"2026-08-07T00:13:38.129961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T00:13:38.298726Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.298726Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:73ab2044fa0c6b2a09f645508179e3cff5225d2084cba7cf46b7461461619eb0","observation_id":"7a55003c-15a0-438a-849e-98e537465ebb","resolution":{"observed_at":"2026-08-07T00:13:38.298726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-02T02:03:01.950155Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-07T00:13:38.425045Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search.arXiv preprint arXiv:2412.18319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.425045Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:6f139215214240d4cfbc02d94e63c69f1eeaec31ab17b83e912579d6b6fe16d0","observation_id":"7dcb0f31-3bf2-4cea-bf6c-bd8fbc64ad49","resolution":{"observed_at":"2026-08-07T00:13:38.425045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-04T01:05:26.679801Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-07T00:13:38.613601Z","title":"Perception-r1: Pioneering perception policy with reinforcement learning.arXiv preprint arXiv:2504.07954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.613601Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:c500229eeb094f8e42b644d3f2cc6896966279c2c3bf3b45d52a905e1db49581","observation_id":"318971f5-3c8e-4986-9e14-17882b99da2e","resolution":{"observed_at":"2026-08-07T00:13:38.613601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T00:13:38.760957Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.760957Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:fd02f5d2df59122fb49691afab24b2d492689ac73a0521204b9c7de5c8488402","observation_id":"8660b85e-6440-41bf-bfad-4132c46f346c","resolution":{"observed_at":"2026-08-07T00:13:38.760957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20199","last_updated":"2025-04-28T19:02:18Z","snapshot_observed_at":"2026-07-06T21:16:04.069216Z","submitted_at":"2025-04-28T19:02:18Z","title":"Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20199","snapshot_observed_at":"2026-08-07T00:13:38.864735Z","title":"Weaving context across images: Improving vision-language models through focus-centric visual chains.arXiv preprint arXiv:2504.20199, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.864735Z"},"links":{"cited_paper":"/paper/2504.20199","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:a0e40b378722a49523e99a2f840c2dd9a09b9e792f76e720db1879e722db09d9","observation_id":"e96dd684-1d67-49e9-ade6-dc48f2146cc4","resolution":{"observed_at":"2026-08-07T00:13:38.864735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:38.951679Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:38.951679Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:df74969d1609e846dff41dbf0d0ed7708c90d5228e01e39e173c23e097ad5414","observation_id":"04c97516-3cfc-4ad1-b5ff-7318ad84af4b","resolution":{"observed_at":"2026-08-07T00:13:38.951679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-07T00:13:39.058338Z","title":"aha moment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.058338Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:a0a3c280875e8429644ceb830f8637483d8b89de9105d428c68d8d4c2420ffa0","observation_id":"d101a7d7-f6ae-4f1b-b221-7b6c73884ae8","resolution":{"observed_at":"2026-08-07T00:13:39.058338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:41.294909Z","title":"<image> <image> <image>","venue":null,"work_id":"ce007a1e-1e23-40e8-b4fe-c43dddb5f1f3","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.156891Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:c8b5e04997eac77f092314da87174ac193696f286b13d3af77a8ee916fe767e5","observation_id":"71e1be06-232f-4421-a9e0-465fa8439e73","resolution":{"observed_at":"2026-08-07T00:13:41.417822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:41.114551Z","title":"A\", \"B\",","venue":null,"work_id":"15196cd0-91a5-4bda-8ed5-1fd56be3bdd4","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.231536Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0e1c9aa6508006415fdbcbb332ba29693cd50d327d2164c106853e788af15cf6","observation_id":"658e9f6c-80b5-417d-ae13-dc24caa3edd0","resolution":{"observed_at":"2026-08-07T00:13:41.203753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:40.936592Z","title":"question","venue":null,"work_id":"d6b31191-5c45-4140-9e8b-0bae275218a1","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.382669Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:657c0d9ff747bbce80b23eaf460baa1bed0dce6600f6c926a35176315c8fabba","observation_id":"0489e2ff-37dc-4717-83b3-87d0ffaefcc4","resolution":{"observed_at":"2026-08-07T00:13:41.009674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:40.651720Z","title":null,"venue":null,"work_id":"e54d0239-5cb5-4958-b0fa-d3e818ef64f1","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.502807Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:19d1233f8eee75052de11e51a2b4119344728e550a65508e67c9ed2d14f59368","observation_id":"e6222173-1915-4f3d-bf24-b3597aaff662","resolution":{"observed_at":"2026-08-07T00:13:40.815528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:13:40.400183Z","title":"should_change","venue":null,"work_id":"cad3afe4-21ab-4440-abf7-d63689c515d6","year":null},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:39.624185Z"},"links":{"citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0a12092f156bdce8f22f770fb9f3e05b0dcd630ac081859c4616cd9578fd7c63","observation_id":"49b31685-98cd-4e34-ac50-81f53b919c9b","resolution":{"observed_at":"2026-08-07T00:13:40.469684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:07:28.744256Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2506.14907."}