Pith. sign in

Paper Citation Record · LEDGER

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning

As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2506.14907.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.14907 v1

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:13:39.624185Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-12T02:24:12.349405Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-12T07:41:27.623339Z

Reference resolution

54 of 54 outbound references displayed

  • verified exact1
  • verified fuzzy5
  • unresolved48
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7092c52b-5bca-473c-9826-8149a8b766be · outbound

This paper cites an unresolved cited work.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:41.901593Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:13:31.914954Z digest=sha256:0c5c4f231a3b371f5d2298550f5038078259eac8255dc8ef8ebdfc0738afd3d4

Observation a6445511-1020-4d41-bf05-90d35ac66653 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:32.009011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:32.009011Z digest=sha256:25f5e9c3b9a744cdfadeb717aabe1a59f53d385717c5d8297929a7a629b34959

Observation 9a406960-5b41-49e5-ab7d-faf1c48482fa · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:32.220329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:32.220329Z digest=sha256:bb57b150f06f3c6b9ee9993e9cd7607c40195f801118e744578d88d9baaa0a25

Observation 99ab7755-a867-4a3f-a010-852e7f934c84 · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:32.352115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:32.352115Z digest=sha256:6a3ac89d1918922f7172dd41b2d01a6fc18f07169c9f5ca56486061ecbe83144

Observation edb2f5a2-d2e2-418c-9825-522082cb27e5 · outbound

This paper cites Qwen2.5-VL Technical Report.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Qwen2.5-VL Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:32.538218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:32.538218Z digest=sha256:39d30cb9bb584013f3bb8f11b68aadb143b5783d9464796f2195b55e64a2c00d

Observation 28e8f5b2-f541-40ab-bddc-7ac53985a7e9 · outbound

This paper cites R1-v: Reinforcing super generaliza- tion ability in vision-language models with less than $3.https://github.com/Deep-Agent/ R1-V, 2025.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning R1-v: Reinforcing super generaliza- tion ability in vision-language models with less than $3.https://github.com/Deep-Agent/ R1-V, 2025

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:32.756391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:32.756391Z digest=sha256:d6f81dff8a26ea52103e35197bc4e95408ce2e240f20442764d6bffb1526abee

Observation 184742c6-bfff-4dff-b576-0814a270fcff · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:32.948421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:32.948421Z digest=sha256:b88a421274a8f432be491e2eafc160411a96d2aa64958160dd3c6f81f388bce3

Observation 9654d880-b9d4-40cc-9421-ba067ee95d51 · outbound

This paper cites How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101, 2024.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101, 2024

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:33.133533Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:33.133533Z digest=sha256:cfe93cce630159f46715df2e82fe5c703b6cd0e6fa7e2a8927744c64ac300631

Observation 81d95e07-7c81-4516-aee5-534b3670bf48 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:33.262709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:33.262709Z digest=sha256:cefa8cf8855e056c06f1b889b24c442952e4ca70426ea202e8bd84fc0a9a110f

Observation 2e8e6fc8-a836-430b-a708-30f8d4e9fa8c · outbound

This paper cites OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:33.384064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:33.384064Z digest=sha256:0ff1bf9a0faf65bd59779e87433e86be3708b3f3ab14ca3ec605de1740155064

Observation f041fc3e-2fd4-49b4-ac1e-f3b8011fc45b · outbound

This paper cites Vlmevalkit: An open-source toolkit for evaluating large multi-modality models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Vlmevalkit: An open-source toolkit for evaluating large multi-modality models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:33.524376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:33.524376Z digest=sha256:22096b8df83667bc9acc1485bdb93a9f3ecdc387032e9526c1da63c5f7a3df28

Observation 1433762e-0e14-48f1-9b58-26362d305067 · outbound

This paper cites Blink: Multimodal large language models can see but not perceive.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Blink: Multimodal large language models can see but not perceive

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:33.648674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:33.648674Z digest=sha256:d1f242bcbab3c5a1caf50d0daafddd3260ab16b282e71137e3293f215d317606

Observation de473be6-df96-4f94-8e09-42e1161ac5ac · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:33.821384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:33.821384Z digest=sha256:b6a6c570d3f3855b58524ba573456f28ea656eccdafa0445b49e097f32a16b1d

Observation 7ba9abc4-c2b4-418a-97f2-d52f1800de0d · outbound

This paper cites Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:33.957683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:33.957683Z digest=sha256:e9e62963b3baec0a3e1b4dde166a22bf3e23cda0da2400039cd5c4d5466a3835

Observation 478156f5-7241-4773-a1a2-e247ff7c9487 · outbound

This paper cites MANTIS: Interleaved Multi-Image Instruction Tuning.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning MANTIS: Interleaved Multi-Image Instruction Tuning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:34.087876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:34.087876Z digest=sha256:3dc7f52ece72ab0c16767479c684177ffc0e14af06d131237f162901d0de013a

Observation ec0b58ea-ebb6-455b-8d00-5f57b13f99a5 · outbound

This paper cites Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:13:41.668514Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:13:34.221237Z digest=sha256:929a976faeda083ca30b39f059cccbab5b0c7025f32c664e991d542a34697249

Observation 1e62c27f-6b19-485b-bdc4-9715a2074995 · outbound

This paper cites MIMIC-IT: Multi-Modal In-Context Instruction Tuning.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning MIMIC-IT: Multi-Modal In-Context Instruction Tuning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:34.402388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:34.402388Z digest=sha256:09b28a49856623a1374e11eb31a1bfcbff5e2b3fe814a2d4109f0dc174a26d65

Observation e53a2749-ad2a-4335-a6f2-d026a31666f3 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning LLaVA-OneVision: Easy Visual Task Transfer

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:34.565255Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:34.565255Z digest=sha256:79675eef7cdf5d0f1a9750e32d999377998f3d37cbd19599a5f4c9687ee2522a

Observation aa1eb206-ca7b-4363-b8fd-77b9c0e6ef69 · outbound

This paper cites LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:34.729605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:34.729605Z digest=sha256:2b176bfe567c342a958c74b00c0282c2f2c6f82c49cabee2846841c0d32d7f80

Observation 2274912a-62dd-498c-9c8a-40ea3cd393f8 · outbound

This paper cites Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:34.937970Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:34.937970Z digest=sha256:9e427b5947c9a098e7c350b76bed56024ae894c387e2302adc94fb9a2207282f

Observation 8e90f3af-d9cf-4891-82ab-e32038325b4b · outbound

This paper cites From System 1 to System 2: A Survey of Reasoning Large Language Models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning From System 1 to System 2: A Survey of Reasoning Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:35.115254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:35.115254Z digest=sha256:09433fe4b57ddcaa5eb05418ba1cde7a5fbd148b3a9d4ef63d224bea2d537e65

Observation 6a1a9c86-15d6-4581-8f42-f0c60376f761 · outbound

This paper cites Improved baselines with visual instruction tuning.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Improved baselines with visual instruction tuning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:35.298768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:35.298768Z digest=sha256:e805f356a58a6a4da759d22dff61e2b4944709e4275de484ddb3b711f9f6c1f7

Observation c824f2f8-60bc-48b9-b6c8-08237dc06a80 · outbound

This paper cites Noisyrollout: Reinforcing visual reasoning with data augmentation.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Noisyrollout: Reinforcing visual reasoning with data augmentation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:35.442727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:35.442727Z digest=sha256:2db3bcad1d842824fdc6c7f37dd3dbad4e0b4ae9c2e27b2089d2afc536206037

Observation d4ca0f18-ef2c-4ad0-934b-34a7904cc1df · outbound

This paper cites Visual-RFT: Visual Reinforcement Fine-Tuning.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Visual-RFT: Visual Reinforcement Fine-Tuning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:35.595022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:35.595022Z digest=sha256:dba4171b85a1fb0021b007450587008409975b5a27396265909022e1994a5465

Observation 2ff7774c-4b31-439e-9014-b250ba33e0d9 · outbound

This paper cites MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:35.700936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:35.700936Z digest=sha256:1067964a5b5d7305c37afeff2a9e4f20f6e43219cd660a02331735a3b234a169

Observation 7e8f4daf-9202-42bd-bce7-898792bd8cbc · outbound

This paper cites MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:35.879349Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:35.879349Z digest=sha256:099c5f1ed5f1fd3b115bb4d768b6521c98bc3e3c692cd04871fae64fb319544c

Observation bdadbe14-78f8-4313-9062-86a97b7c5f15 · outbound

This paper cites MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:36.034767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:36.034767Z digest=sha256:db5939e65eac46cc3819eb776811e727633f99de8ed5584ec8390eefbb0aa47f

Observation d624d141-7b69-4ce4-92d1-14900e371b1d · outbound

This paper cites Compositional chain-of- thought prompting for large multimodal models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Compositional chain-of- thought prompting for large multimodal models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:36.207581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:36.207581Z digest=sha256:ca0fed5ac034be3db2d1f4bcd390bbbc7a835c87bea8376411b70ef243025038

Observation b003eea8-f02f-44ca-b787-9f27e783d4f9 · outbound

This paper cites LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:36.315527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:36.315527Z digest=sha256:ecbfb1597fb9ba3a9d4bb85b30e0fc9443c649509c680b3e4002e3eb0a206752

Observation 62e16628-6758-4883-802e-bb8abce82333 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:36.455699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:36.455699Z digest=sha256:6f551ee7745c00d11b152a592abf6a4939983153a16b964c2ca1e96b059d25f4

Observation 90c1b662-c989-420d-b621-aa1b4ad3a9b6 · outbound

This paper cites VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:36.582059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:36.582059Z digest=sha256:333645fa612aad64c808b19c1dc8b15f8f4eea6254ff260dcff9b61907a590f5

Observation b60d486f-3e83-4dfc-82a1-882f978f8b58 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning HybridFlow: A Flexible and Efficient RLHF Framework

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:36.715006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:36.715006Z digest=sha256:c9ec4deffc5f35835c6e79e874ad55c49bf499f6ac889c5a83fe73f17621b07b

Observation fbe8e408-d38e-4d83-b997-b3745f1fca6d · outbound

This paper cites Generative multimodal models are in-context learners.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Generative multimodal models are in-context learners

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:36.849148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:36.849148Z digest=sha256:a8190f3ec31bc60c51f6a8a745e916a7680998b0a240ceef4a9c02cc0557b551

Observation 3ce6b951-cd47-4683-884f-15b36ff612f0 · outbound

This paper cites Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:36.989656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:36.989656Z digest=sha256:a6c4d10846703ba355d8ef0e71081b6393c54c265ed487dd49bb1ae537ccdc9e

Observation 1ab728e6-e5c3-49aa-9bf2-89d59bb4acb3 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Gemini: A Family of Highly Capable Multimodal Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:37.117863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:37.117863Z digest=sha256:c8d9a171c79f5d1bea0f3eb18ab1860e24b8fb1ae62e0fc562e54f4e12b67485

Observation fd78d89e-0a1d-4c24-9d28-09fb75ad6012 · outbound

This paper cites Identifying and Mitigating Position Bias of Multi-image Vision-Language Models.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Identifying and Mitigating Position Bias of Multi-image Vision-Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:37.269158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:37.269158Z digest=sha256:94f17d4c5a1f3ccc103a1cb634c596986c42ede313b5e85547756cacf5d765ac

Observation ba28c4ed-87bd-4f28-8a1e-0dc9d73bc252 · outbound

This paper cites MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:37.427098Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:37.427098Z digest=sha256:2ac25adca389786ade2bea2e4b3111c3851b19d2ad5b5377dcca6b9df838f180

Observation 1964cd2d-2e29-4943-8abb-0bb44abc25d2 · outbound

This paper cites VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:37.599695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:37.599695Z digest=sha256:5d680c93820579f34f3f2648c66cf13e290b15f01a9658576787e3bbdb3417c3

Observation f441ceca-fd9d-4f93-be5f-703d0c7dc510 · outbound

This paper cites Measuring multimodal mathematical reasoning with math-vision dataset.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Measuring multimodal mathematical reasoning with math-vision dataset

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:37.725734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:37.725734Z digest=sha256:9e4d477afe4dfacbeebbbb30afb1a47d0a4c87d0adb2bdea0c844771489962de

Observation 8d44726a-0687-4b8f-8626-30727eb0e571 · outbound

This paper cites MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning MV-MATH: Evaluating Multimodal Math Reasoning in Multi-Visual Contexts

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-08-07T00:13:39.956964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:13:37.882009Z digest=sha256:2540e27d3dae05c9aadadece8df353b77cb9d369479442fefe831ccc5c2cf941

Observation 1a54b7a3-06ed-4e51-9bac-347642c2cbbc · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:37.984565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:37.984565Z digest=sha256:b5c70a5e0dfe46fe71c02f4dd9b25d73be2871ba23a8540104af3f1329ae01f9

Observation b17b943e-74b1-4da0-b8b0-fa9175c1f749 · outbound

This paper cites DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:38.129961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:38.129961Z digest=sha256:aa1832757df3e7c84710b298a991dbfe426a28adfa775fbfe9d96993a86a9097

Observation 7a55003c-15a0-438a-849e-98e537465ebb · outbound

This paper cites R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:38.298726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:38.298726Z digest=sha256:73ab2044fa0c6b2a09f645508179e3cff5225d2084cba7cf46b7461461619eb0

Observation 7dcb0f31-3bf2-4cea-bf6c-bd8fbc64ad49 · outbound

This paper cites Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:38.425045Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:38.425045Z digest=sha256:6f139215214240d4cfbc02d94e63c69f1eeaec31ab17b83e912579d6b6fe16d0

Observation 318971f5-3c8e-4986-9e14-17882b99da2e · outbound

This paper cites Perception-R1: Pioneering Perception Policy with Reinforcement Learning.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Perception-R1: Pioneering Perception Policy with Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:38.613601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:38.613601Z digest=sha256:c500229eeb094f8e42b644d3f2cc6896966279c2c3bf3b45d52a905e1db49581

Observation 8660b85e-6440-41bf-bfad-4132c46f346c · outbound

This paper cites R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:38.760957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:38.760957Z digest=sha256:fd02f5d2df59122fb49691afab24b2d492689ac73a0521204b9c7de5c8488402

Observation e96dd684-1d67-49e9-ade6-dc48f2146cc4 · outbound

This paper cites Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:38.864735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:38.864735Z digest=sha256:a0e40b378722a49523e99a2f840c2dd9a09b9e792f76e720db1879e722db09d9

Observation 04c97516-3cfc-4ad1-b5ff-7318ad84af4b · outbound

This paper cites Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:38.951679Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:38.951679Z digest=sha256:df74969d1609e846dff41dbf0d0ed7708c90d5228e01e39e173c23e097ad5414

Observation d101a7d7-f6ae-4f1b-b221-7b6c73884ae8 · outbound

This paper cites R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:39.058338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:39.058338Z digest=sha256:a0a3c280875e8429644ceb830f8637483d8b89de9105d428c68d8d4c2420ffa0

Observation 71e1be06-232f-4421-a9e0-465fa8439e73 · outbound

This paper cites <image> <image> <image>.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning <image> <image> <image>

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:13:41.417822Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:13:39.156891Z digest=sha256:c8b5e04997eac77f092314da87174ac193696f286b13d3af77a8ee916fe767e5

Observation 658e9f6c-80b5-417d-ae13-dc24caa3edd0 · outbound

This paper cites A", "B",.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning A", "B",

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:13:41.203753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:13:39.231536Z digest=sha256:0e1c9aa6508006415fdbcbb332ba29693cd50d327d2164c106853e788af15cf6

Observation 0489e2ff-37dc-4717-83b3-87d0ffaefcc4 · outbound

This paper cites question.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning question

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:13:41.009674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:13:39.382669Z digest=sha256:657c0d9ff747bbce80b23eaf460baa1bed0dce6600f6c926a35176315c8fabba

Observation e6222173-1915-4f3d-bf24-b3597aaff662 · outbound

This paper cites an unresolved cited work.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:40.815528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:13:39.502807Z digest=sha256:19d1233f8eee75052de11e51a2b4119344728e550a65508e67c9ed2d14f59368

Observation 49b31685-98cd-4e34-ac50-81f53b919c9b · outbound

This paper cites should_change.

PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning should_change

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:13:40.469684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T00:13:39.624185Z digest=sha256:0a12092f156bdce8f22f770fb9f3e05b0dcd630ac081859c4616cd9578fd7c63

Pith citing papers

Observation b6ea3834-aab7-4c19-9a34-08b612d1218e · inbound

Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning cites this paper.

Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-12T07:41:27.635779Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-12T02:24:12.349405Z digest=sha256:4ae71f91b0f4cc0f1993429e9cc4ad561db6be83b57e629e70c5320590a204c2