Pith. sign in

Paper Citation Record · LEDGER

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

As of 23 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 12 inbound Pith citation observations for arXiv:2505.04623.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.04623 v1

Coverage vector

measured 38 of 38 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T23:27:27.827281Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:31:13.645079Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-22T06:36:10.581673Z

Reference resolution

38 of 38 outbound references displayed

  • verified exact0
  • verified fuzzy13
  • unresolved25
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4b583074-11a8-439f-a37f-c14b260aa7d5 · outbound

This paper cites Language Models are Few-Shot Learners.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Language Models are Few-Shot Learners

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.654416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.654416Z digest=sha256:1a5681e074787d9d50bfd6c4e7bae1cef0a828537516fbe915cff9ba152ffb07

Observation a2a31147-77fb-4652-b64d-67a13a4d6525 · outbound

This paper cites VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.660010Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.660010Z digest=sha256:e67813127f52ca85705b60f459fc1077169170fea27d72ab84679a939b237d91

Observation 52a38cfe-52a2-4db5-b38e-7d94f9226696 · outbound

This paper cites Meerkat: Audio-visual large language model for grounding in space and time.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Meerkat: Audio-visual large language model for grounding in space and time

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.487046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.665376Z digest=sha256:bc87177ce11a79cb06df567fce3a879664caa8170bc4430be22b0b13f05b6d20

Observation d0ff539c-5fd0-4e91-aaa5-997b077ec6c6 · outbound

This paper cites Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.670138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.670138Z digest=sha256:2b33c805cd73fe47da4d2b1ffe911a37fa251dc0f35e6a0c4e3a67ac045f1e6d

Observation 896af91e-17e4-4d06-9681-f14ead0631b9 · outbound

This paper cites Video-R1: Reinforcing Video Reasoning in MLLMs.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Video-R1: Reinforcing Video Reasoning in MLLMs

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.675101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.675101Z digest=sha256:83bb02bb21a1cce0b49282129183f0ec21c5e8fc63b1e9a38fa4add345f5ebcd

Observation 81be52e9-c157-40db-9323-3d4f55f1569b · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.679804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.679804Z digest=sha256:052f00fb88d6803509872fdecda7b09981df6220dfe7cde0c68ac95ce2ca7310

Observation 604dcc0c-8dae-4bdc-acb1-9d2f44af38ba · outbound

This paper cites Aligned better, listen better for audio-visual large language models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Aligned better, listen better for audio-visual large language models

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.473498Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.684961Z digest=sha256:d9f2a756b2bdd2affe1576cccbe585df0680ec77b9862530ce44756b2a5e39a0

Observation f6786f8a-ce2f-41d6-9a5c-376375de6683 · outbound

This paper cites Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.689476Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.689476Z digest=sha256:f52e90283bced87d9fc58c430ebe4ff114d8ce2e23f1ffcf78f2bf8356e549cb

Observation a3755e8f-7520-44c5-b5b9-398597adbc9c · outbound

This paper cites Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.693947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.693947Z digest=sha256:7af804022eb9f25184a5f0d8c87ce55f60b606b897a0b8f8b13ac53d76f88a7b

Observation 9deca145-4eb3-4eda-bfad-e25fc82b5eeb · outbound

This paper cites Reinforcement learning outperforms supervised fine-tuning: A case study on audio question an- swering, 2025.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Reinforcement learning outperforms supervised fine-tuning: A case study on audio question an- swering, 2025

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.455823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.698661Z digest=sha256:f40180b20f4c894e54b0c6cd1619e9ed740dd9aa409f1cc63f2003ddc550031c

Observation 3fd20983-66b3-40b1-9cba-1b76e40a456a · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning VideoChat: Chat-Centric Video Understanding

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.703419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.703419Z digest=sha256:f3ae82bac4bcd10bbd0bbff1fd04a2cbee2fe0c11fc1b4b6a450da64add8823a

Observation 4ddb042e-a39a-467e-ba8e-c519944e414a · outbound

This paper cites OmniBench: Towards the future of universal omni-language models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning OmniBench: Towards the future of universal omni-language models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.708273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.708273Z digest=sha256:75f9196e50a0bcf2baefff8d1cef7911e115da10cf5b4865431aa245ed06a3aa

Observation db271f2e-c079-482e-a40d-b05fe25f8bfd · outbound

This paper cites Visual-RFT: Visual Reinforcement Fine-Tuning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Visual-RFT: Visual Reinforcement Fine-Tuning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.712721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.712721Z digest=sha256:93d32b3f5a584be2e242965e0f6354125eb6e8c13b1e5b08b14b7077ec18ebf6

Observation 3fa0bc64-62cf-4278-aafd-8ca2b1111978 · outbound

This paper cites Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.717662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.717662Z digest=sha256:8b7c0e6fe58bd329625a93765d8d73d07c492addc8f2fa7b02b701191812cd5e

Observation cf64872e-1e45-4470-a8a4-3c4bd825e0d9 · outbound

This paper cites MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.722104Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.722104Z digest=sha256:cda00aa50a63b8c1eed54efa85309618d690429fac7ab4176b7dd1c5ef742d56

Observation 55587098-4e55-4ebb-9224-1afc8103add8 · outbound

This paper cites ChatGPT: Optimizing language models for dia- logue.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning ChatGPT: Optimizing language models for dia- logue

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.441405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.726796Z digest=sha256:c88346b48ba0f7f0e0d6cd4a4b5d02a2c44c24fb9a1e75badb6bc5f565396bee

Observation 02d9c16e-2fd3-410e-85c1-8258fcfb539a · outbound

This paper cites Introducing OpenAI o1-preview, 2024.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Introducing OpenAI o1-preview, 2024

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.427094Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.731200Z digest=sha256:aedd48d78155c146d7cd5e12a124af614dc6c66cd8bb8819aa6ef17145f5105c

Observation af057320-42e9-4ee4-b1d1-493c261e4fbd · outbound

This paper cites Training language models to follow instructions with human feedback.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Training language models to follow instructions with human feedback

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.412309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.735755Z digest=sha256:2e8c6af288f8d0fe501064d893b7c1e87c93e9bc847fcaa691210f3bc07742ed

Observation 818984fb-e77a-47a7-a7f9-31f034ed8550 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Robust speech recognition via large-scale weak supervision

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.397688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.740382Z digest=sha256:601e09581f4a5454a2346a486e08804986b03faaa990395d17a7dcf3e7e98cd9

Observation 30d61480-77e3-40eb-a381-12f2b1ae17ec · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Direct preference optimization: Your language model is secretly a reward model

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.380972Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.744829Z digest=sha256:097ef66e89d5db9bbac90f931702b8990fa6941fde15a1f5554890bee1935591

Observation 5f052796-5804-430d-a8eb-bd3a3f2c2dcb · outbound

This paper cites Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Hybrid Group Relative Policy Optimization: A Multi-Sample Approach to Enhancing Policy Optimization

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.749182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.749182Z digest=sha256:3540b37efc03bb23a6d9f6d26ece199c0f3ee901e688d8e3d1c6aa16cc6bd2be

Observation e45f8923-ab84-418f-b9ef-4a0d9f455b99 · outbound

This paper cites Proximal Policy Optimization Algorithms.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.753728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.753728Z digest=sha256:a6fd4ff211be9f90869885a41f14a47f067abba92b9acc0c945713b9ff0208c2

Observation 29d67698-bd4b-47bf-9fdd-7277381470ef · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.757989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.757989Z digest=sha256:f03ff61a495d7bc4c953f82625e2cae42bb204ad87be73d55724620b3ac6139c

Observation e7c95f25-c2f4-4215-9faf-19278f05bbc6 · outbound

This paper cites Audio-Visual LLM for Video Understanding.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Audio-Visual LLM for Video Understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.762524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.762524Z digest=sha256:b577b7f4e08f834a3efe8b88bfac2cabe0fc5084b337cd060972362a070677f0

Observation 794e8067-f56a-4b2e-bde6-ff49c4c7946f · outbound

This paper cites Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Fine-grained Audio-Visual Joint Representations for Multimodal Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.767079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.767079Z digest=sha256:4aba2f0107c47ab84f86e99de66159bc449ff1cf84ecfaa2e444a49e560d3753

Observation 963ef653-9f17-4b5f-a022-d3f4d8471171 · outbound

This paper cites Hawk: Learning to understand open-world video anomalies.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Hawk: Learning to understand open-world video anomalies

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.364887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.771876Z digest=sha256:6d31b00651a5b5cb1df803b27c1b54c1652949226f2e618c4a679a6f3b5e6adc

Observation c0f5dbda-e996-4b8e-9ae8-c033c9bea811 · outbound

This paper cites Sari: Structured audio reasoning via curriculum-guided reinforcement learning, 2025.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Sari: Structured audio reasoning via curriculum-guided reinforcement learning, 2025

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.350237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.776637Z digest=sha256:ab804a6a77bf1a90408261d8fa314c96b00a07cc67002dfc3ae6a6c54377573c

Observation 2cec31b1-09f4-451e-99bf-792fb76c1a22 · outbound

This paper cites ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.781024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.781024Z digest=sha256:2308dace01715b4bb0400283b6eeb4c4f23bc1b58602e009aea5a13d611d81c6

Observation 9c7eab77-d681-4a8d-a209-6c61a6932a84 · outbound

This paper cites Audio-reasoner: Im- proving reasoning capability in large audio language models,.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Audio-reasoner: Im- proving reasoning capability in large audio language models,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.335871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.785639Z digest=sha256:8adda180a88385fa1508ab89b71340c3484b3c50a807732c3734d9f628becb48

Observation 0e800d49-314d-4a38-8678-63d2554c9d14 · outbound

This paper cites EchoTraffic: Enhancing traffic anomaly understanding with audio-visual insights.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning EchoTraffic: Enhancing traffic anomaly understanding with audio-visual insights

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.320586Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.790312Z digest=sha256:1c94d25f02e0c03be0521bde6b58698a10e49756363bf0bdcad2d98808b43271

Observation 14e74d12-223f-40c8-99e1-52830f61462b · outbound

This paper cites Qwen2.5-Omni Technical Report.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Qwen2.5-Omni Technical Report

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.794790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.794790Z digest=sha256:53716d57b6a2ad088917b77dfbbc4a9081d24905d989e391885a0c6bac841524

Observation 9fd210cb-f8a9-4e66-b6f0-a45c09f85238 · outbound

This paper cites Avqa: A dataset for audio- visual question answering on videos.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Avqa: A dataset for audio- visual question answering on videos

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T23:27:28.304745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-15T23:27:27.799527Z digest=sha256:740b52035f28c624f740f1b42e21bccf2b26878a3f3da6893251ec37d5244ec4

Observation a93e76ce-37e0-45b8-9e13-c96ca0fc2221 · outbound

This paper cites R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.803799Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.803799Z digest=sha256:37f4538d412256be42d0567199fa1667a076290032418588b1870c14f73d117f

Observation 6bc1a75f-25e6-4a3b-b580-c93f4834e014 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.808323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.808323Z digest=sha256:9ee6b306522fcbe9b80805a94c4840bda40fbef5cb248ddd44c3f6be9ada7723

Observation 1a53c6b4-b4dd-47ae-b0eb-acb21f4e9081 · outbound

This paper cites Scaling Relationship on Learning Mathematical Reasoning with Large Language Models.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Scaling Relationship on Learning Mathematical Reasoning with Large Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.813403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.813403Z digest=sha256:1229545f8b948e974ee3f84a39291b4701f468acc663c3c3aa7d1ada218d68e7

Observation ef2f2f44-9146-4cf3-ba64-eafcc5f6c11e · outbound

This paper cites Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.818013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.818013Z digest=sha256:164d1ecfa6262b24c02b7a1effbea3b299dc3d8db2c8f0cfba5f212242f24428

Observation f7c1a011-9a13-42f2-a884-9b0061a923b5 · outbound

This paper cites R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.822566Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.822566Z digest=sha256:34aca4023e8430487d31ffa84f95cb849beed4581bbec4bc9d3464a0720524e0

Observation bd67daff-5bc9-4a8a-8bf3-cf5a2b685f90 · outbound

This paper cites R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model.

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T23:27:27.827281Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:27:27.827281Z digest=sha256:6578f83afe1e0d5ddf31c0e297a627461770b134c4b1d4bb5543bd23eac2e8bd

Pith citing papers

Observation bb8cd184-7364-4401-a920-23f1239dae01 · inbound

Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models cites this paper.

Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T14:31:13.645079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:31:13.645079Z digest=sha256:13c79ffb84ab7b13f557255af69342b59bac551316a1b749c0f558b289a3ac0e

Observation 8809531c-3f7a-4032-8af3-4ab46ef679fb · inbound

FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design cites this paper.

FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:40.398754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:40.398754Z digest=sha256:0dd8fe9fbe9688626057293ee9ffe1f514cb68a99c04e287d5e22e42542f2d06

Observation 2caf0f52-2c2f-4cb8-bcf5-c365bbbc7f9b · inbound

HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context cites this paper.

HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T22:36:15.038514Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:36:15.038514Z digest=sha256:366ddac3f11274d103cfc9a51701e9f47e31f91dfc48d40ceed5a2f17aeab0e6

Observation 2f29198a-1efa-4caf-8739-a82b313520b7 · inbound

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey cites this paper.

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 264

Resolution
verified exact
arxiv_id, observed 2026-05-18T19:21:48.404714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-18T19:19:36.427337Z digest=sha256:e56d05374ac9729852bdd5119fa70f4a65421aa80f4ada278eda9b9e418a70f0

Observation e0a7d057-b8c4-4e62-9dde-6caf0ffe500f · inbound

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models cites this paper.

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-18T05:45:56.120572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-18T05:45:07.700571Z digest=sha256:58d951f584f6507ae449e8ccc54f50b50370e3287f87b6b81759c4c6f944b570

Observation 6cbf7b30-a75b-4436-97f2-cf6cb8b1392d · inbound

Development of a 3D-CNN-based Prediction Model for Migration Barriers in Plasma-Wall Interactions cites this paper.

Development of a 3D-CNN-based Prediction Model for Migration Barriers in Plasma-Wall Interactions EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-13T09:25:05.174833Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T09:25:05.174833Z digest=sha256:dca81ee8a0d898a7009a1d2ba7170839863b31ec7016c5435445f8faec92c34f

Observation 0a9dfaff-cf0c-4434-995f-49833a1bc469 · inbound

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs cites this paper.

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:25:49.792701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T19:10:52.629490Z digest=sha256:661573ce4f6619d2b27439db230ffb0e89076295a1cb9898a6b26dcea70ad9aa

Observation cb2b7095-f2cf-4861-8605-52d8989c1bad · inbound

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding cites this paper.

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:11:03.503815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T15:07:45.595260Z digest=sha256:bf5db10c3a6f9790cb3b648758f213e80855b4d8684e2ec0af3dd278696c2940

Observation 87eebf59-fac5-45cc-b15c-4399c9236ab6 · inbound

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale cites this paper.

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:16:03.279034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T16:07:52.017037Z digest=sha256:528a7a8337be834c297d954b193a1dacfc060cb15a243e48174953418e725021

Observation 1afb3801-19f9-4cf1-a99e-336a9f694b0a · inbound

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs cites this paper.

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-10T12:10:22.117814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T12:05:54.551728Z digest=sha256:94de0220166497453599ddf1af0b9f2ec3b1dd20f5b6d562186d0a3f16b42b46

Observation 43e2786f-801b-4e1b-aab3-a201e66cfbbc · inbound

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers cites this paper.

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T09:18:32.200681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-10T08:02:53.574120Z digest=sha256:28b0cab037b8a8eae97ed1ef9037a374eb85f8f837c0ddc7cd14a73ebb31397a

Observation dcd6a649-c1a0-4046-af9f-6f01963efd5f · inbound

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning cites this paper.

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-22T06:36:10.587746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-22T06:34:57.483234Z digest=sha256:de1b9ebce7d1fb600a5f426ef6501de98c349cbe86850dac31a2bc1baa21f019