Pith. sign in

Paper Citation Record · LEDGER

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

As of 13 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2510.02561.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2510.02561 v2

Coverage vector

measured 17 of 17 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T12:43:27.228812Z

measured 17 of 17 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

17 of 17 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7cf321b0-87e6-485b-a24d-3d6a4a98476e · outbound

This paper cites RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:25.890929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:25.890929Z digest=sha256:efd98c5df116754cf0b869e527103c2a42efe30606eb4766b532a390b989b921

Observation d511aa32-e20f-437d-a84d-cbd0157179fe · outbound

This paper cites Video-llava: Learning united visual representation by alignment before projection.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback Video-llava: Learning united visual representation by alignment before projection

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.110667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.110667Z digest=sha256:7f4fa37a994d982e80887e4872edc29898929bed37a0f3d799cf67a9587f2126

Observation 43a8ced4-544f-4856-a4f3-1850d05a8341 · outbound

This paper cites doi: 10.18653/v1/2024.emnlp-main.342.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback doi: 10.18653/v1/2024.emnlp-main.342

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.180441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.180441Z digest=sha256:d37293428e8c78dfdf9976b492dc9ed8353ca72e46c358e226e4de4bdb6cec68

Observation 4b5a927f-3563-448b-b4f1-cbf3e29cf05d · outbound

This paper cites BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.262167Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.262167Z digest=sha256:28f7ad0b9cc73c1c36335bcc6d712a7d2f27ac1932a67d94d6ed8e476c1fcfff

Observation e96f5fa5-9c47-4287-b1a2-a73a8c623e35 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback Direct preference optimization: Your language model is secretly a reward model

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.509948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.509948Z digest=sha256:45fd539bb73c54cdf4793073a3970d240ac5e9919a1bb92892a34090871092f6

Observation 3d8ab01b-b7fc-47b3-9052-01d855daeaee · outbound

This paper cites Proximal Policy Optimization Algorithms.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback Proximal Policy Optimization Algorithms

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.690312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.690312Z digest=sha256:6fd507865a150baf6035c9a9d2d57bfc88cfcf409a212677035cf9546abd5738

Observation 6eda4fb1-a3c0-42f7-bc1d-8bed18076076 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback LLaMA: Open and Efficient Foundation Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.965324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.965324Z digest=sha256:6e3b5b3b544481812f7b248dd9649cca888b84cb6a2a4ecad08a6e0d3153988f

Observation 116573cf-f3c5-45d8-8ec7-f40e46dac953 · outbound

This paper cites Raft: Reward-ranked fine-tuning for generative foundation model alignment.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback Raft: Reward-ranked fine-tuning for generative foundation model alignment

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:27.041149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:27.041149Z digest=sha256:8f5e9f71656d62e0c86e7da84b03d452c06d44b71fc6bb145bef6123811b08e6

Observation 597da5fc-a21c-406d-8a06-12c1a5a55e55 · outbound

This paper cites LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:27.130472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:27.130472Z digest=sha256:119968ae5687e76c70a30bd808d558cb8d124f4a7ba7cce31bed209125f3b890

Observation fbb0c4d1-fcf3-4de5-9125-aea7c65c6655 · outbound

This paper cites an unresolved cited work.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:27.228812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:27.228812Z digest=sha256:7a202f00dd6adc29cc2c2ea741d50b563bf3072a11dba3bbb1d9fee633830190

Observation d9ea132b-402b-4138-b2d4-e438e1c1daa5 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.794397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.794397Z digest=sha256:3cd29b9f4a0769874ca16852637ffcf7c6829dafc362a90dac9d3384c8a0e562

Observation d856d017-90c0-44e8-8ee0-6df666939542 · outbound

This paper cites PandaGPT: One Model To Instruction-Follow Them All.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback PandaGPT: One Model To Instruction-Follow Them All

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.888581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.888581Z digest=sha256:3ecd6c7f6fc6eaec30a0e6cbc50d277bbc9fbdb4f1cdb9dab1e0a4c6358a6421

Observation 8200a115-dbf0-4055-87ca-a8a71ac058d1 · outbound

This paper cites The accuracy paradox in rlhf: When better reward models don’t yield better language models.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback The accuracy paradox in rlhf: When better reward models don’t yield better language models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:25.703607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:25.703607Z digest=sha256:dfd2c3adc7bdd51b6ecac4d6fbf6bdf4b019b4cf013efe9e2c8cea2588f9c935

Observation e13194ef-23b6-422f-b0dd-408c34e93c02 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:25.631443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:25.631443Z digest=sha256:f151a67f0c499085e5749b69fe75b209e812845090b07cb73d5611216d4dbd87

Observation 546abc83-3175-495f-8eb4-18acdfcc4ff9 · outbound

This paper cites VideoChat: Chat-Centric Video Understanding.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback VideoChat: Chat-Centric Video Understanding

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.001661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.001661Z digest=sha256:c9eadbb324e812ef13ac3f73270ae08cb4c12287636a2f30b39886cb92842782

Observation b41a9b51-1ea5-442c-9df0-2eea39130c92 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:25.780727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:25.780727Z digest=sha256:d201eeb23b98dfee1673923368ce35cb6412d17b1a3810ef14dfd8b2f7b3124c

Observation cc54c339-f4b6-4761-841c-302c20bcdb77 · outbound

This paper cites Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models.

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-04T12:43:26.369390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T12:43:26.369390Z digest=sha256:7799076601963ea3b466bfe41e8af431a6bf0bd8822f25f7d7178680a5d82ca2

Pith citing papers

No inbound Pith citation observations are available.