Pith. sign in

Paper Citation Record · LEDGER

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

As of 14 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.08491.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.08491 v1

Coverage vector

measured 52 of 52 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-14T04:40:11.975172Z

measured 52 of 52 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

52 of 52 outbound references displayed

  • verified exact0
  • verified fuzzy17
  • unresolved35
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e0d22af6-881a-40a9-ad56-cfcaa581314c · outbound

This paper cites Eureka: Human-level reward design via coding large language models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Eureka: Human-level reward design via coding large language models

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.587619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.779147Z digest=sha256:a53f10964b0b0fcfe9359cc7afe480f132ce32caa010d377be0e4719b97a8c56

Observation e5ab305d-2dae-49b4-8184-b6bda825693b · outbound

This paper cites Serl: A software suite for sample- efficient robotic reinforcement learning.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Serl: A software suite for sample- efficient robotic reinforcement learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.784324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.784324Z digest=sha256:bea33957d1a7b838e5942df1106a80910157818b81c5db01abcf55e64b58f2f2

Observation 62a73c9e-3392-40cf-a88e-febe6f022191 · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.788149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.788149Z digest=sha256:916a04b93a6283ede6c82d94d9909ce83b01283f934cf72b76b4aa033bb1ab13

Observation 2e38b2f5-f651-47ad-923c-a4f7d76c52ea · outbound

This paper cites Improving vision-language-action model with online reinforcement learning.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Improving vision-language-action model with online reinforcement learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.792711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.792711Z digest=sha256:0118bdcef4bbc55844f298c9c2d4ca53c81a0619c06a74b1ccc1bf2dadd42f17

Observation 769055bf-55da-4452-90ad-e1cce2da1523 · outbound

This paper cites Robot-r1: Reinforcement learning for enhanced embodied reasoning in robotics.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Robot-r1: Reinforcement learning for enhanced embodied reasoning in robotics

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.554576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.796781Z digest=sha256:3c5546e2540d5c7082b4a7a6479f3c06d8fca5e4adb3a2db212c92ac66e8690a

Observation 9ca47e5f-3f36-4b14-8605-de65615983c1 · outbound

This paper cites Reinforcement learning with foundation priors: Let embodied agent efficiently learn on its own.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Reinforcement learning with foundation priors: Let embodied agent efficiently learn on its own

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.541917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.800620Z digest=sha256:c257fe9c4532efa5b4b01907731274c90f2015ca0139d284d66c5aeb850aaf7e

Observation 30d88430-1e91-41cd-822f-e86ab0170b9f · outbound

This paper cites Self-improving embodied foundation models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Self-improving embodied foundation models

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.529740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.804984Z digest=sha256:25889f8dc51ca14194f59d7d776c92ad7e5a9071f7721152f4ef76c29a390a48

Observation d9f4bd21-72a3-4fa7-9909-efd9b3646c86 · outbound

This paper cites Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.809335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.809335Z digest=sha256:dc4d30a1a59a4d5f5a8c543a996734a99d67418b434c9736dae7b6d7405ce01f

Observation ee2fe596-3c97-4093-a37c-1e5df48ade05 · outbound

This paper cites Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.510106Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.813385Z digest=sha256:38e81d7da209d1b4058df3fb3c30e6dd57914c7f56c818418b87747fa37222c6

Observation 6d2e1e5f-42ba-49b0-9dfc-961bd938fc13 · outbound

This paper cites Roboreward: General-purpose vision-language reward models for robotics.arXiv preprint arXiv:2601.00675, 2026.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Roboreward: General-purpose vision-language reward models for robotics.arXiv preprint arXiv:2601.00675, 2026

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.817154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.817154Z digest=sha256:fc05bfcff3da1ad42673b7d1f64594e17433a10421262523c2de01b2086b9039

Observation c6ced9ac-b537-47b1-b6e7-e1ea237941f2 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.820969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.820969Z digest=sha256:e85bdc5cdf76aa4d6b4a5623d850924872fc877b23150214d9312fd424001ff9

Observation 5e30c658-ab9d-462b-9014-8f3557ebefcc · outbound

This paper cites Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv e-prints, pages arXiv–2501, 2025.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv e-prints, pages arXiv–2501, 2025

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.497747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.824989Z digest=sha256:302c7fa813deb9a1b04b7104abed87766a54ed9af0ac4889a6695db9068116c9

Observation c4470bf2-8fcc-4120-8bdb-1f8db33533c1 · outbound

This paper cites rstar-math: Small llms can master math reasoning with self-evolved deep thinking.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models rstar-math: Small llms can master math reasoning with self-evolved deep thinking

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.485788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.828550Z digest=sha256:e43fb178de086738826ac5ec3c6208f8eaac35fd918cbe51d5688f9b76dd9480

Observation 1cddd270-4b8e-4d7d-9528-9d61ca4b08e2 · outbound

This paper cites Training software engineering agents and verifiers with swe-gym.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Training software engineering agents and verifiers with swe-gym

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.474431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.832736Z digest=sha256:a3a572b38a5a5328f1e35c31ea24a439f9d243715756f1ab78bada7c3f960c16

Observation 8a491032-55db-4aa9-8f3f-b0b755e49a0d · outbound

This paper cites Swe-bench: Can language models resolve real-world github issues? In The twelfth international conference on learning representations, 2023.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Swe-bench: Can language models resolve real-world github issues? In The twelfth international conference on learning representations, 2023

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.836535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.836535Z digest=sha256:efa039b3c74e04a82292f0c24f97c3d8afee4fb7124cd8a9a2a4f8d40178e3bd

Observation aab7bcd4-4428-4309-883a-25b4b258a4de · outbound

This paper cites Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652, 2024.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652, 2024

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.840164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.840164Z digest=sha256:916f5a4a3e88272b872bb7f705c77217256765bfacd56a6627f7d3897a23b3c2

Observation 0f46069f-7c1b-4654-84df-8d5951222a0d · outbound

This paper cites OpenHands: An Open Platform for AI Software Developers as Generalist Agents.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models OpenHands: An Open Platform for AI Software Developers as Generalist Agents

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.844460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.844460Z digest=sha256:e9747844439cf7345b976b370e73fd4967ab59494a21509c2f51f50ce92f4447

Observation cd4ec506-4b13-428a-944a-5586424a8fdd · outbound

This paper cites GPT-4 Technical Report.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models GPT-4 Technical Report

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.849338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.849338Z digest=sha256:6ea4d8148abed7accd27da5c2d95d32408ed89fd0d8421309df980ebe52212fc

Observation 0244c97d-84c3-426d-b3c0-5cac0892ee80 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.853614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.853614Z digest=sha256:4ccaf8b55c36c030f6f9aff5cbc224914bedaa02744d838f957bc05d44694e63

Observation cbd3c701-2e96-4d91-a28f-00fa08833227 · outbound

This paper cites Qwen3-VL Technical Report.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Qwen3-VL Technical Report

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.857250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.857250Z digest=sha256:eaf18fc251371d4718da8d12537aa05ffcf63d0b42ad065b026c18f5cc2be336

Observation 49f5f19b-2114-465f-b9f8-0c06d8428758 · outbound

This paper cites Manning, and Chelsea Finn.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Manning, and Chelsea Finn

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.860774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.860774Z digest=sha256:82ec4dc01d75591bdf0710c09ce7da04b67d02bc45b23f8495af06380a860cbf

Observation b0ec75f3-7a02-4059-91b8-766d49da58c8 · outbound

This paper cites an unresolved cited work.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.864231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.864231Z digest=sha256:68af0628d14604be8b078960be30b13efeb4ea3c43735ece9c2071197077d222

Observation 9bae433f-b067-4f58-be23-2d5f145d7305 · outbound

This paper cites RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.868376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.868376Z digest=sha256:fb1f4666cde5a62b7bb3f012d78ab6532881d6c462ed9a69ab03604330242259

Observation 24d777e0-76c9-4ab5-85bd-eae9eff9b2a4 · outbound

This paper cites Alpacaeval: An automatic evaluator of instruction-following models, 2023.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Alpacaeval: An automatic evaluator of instruction-following models, 2023

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.872649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.872649Z digest=sha256:fe293070b27259363a20afb48cc806f8ed90f55e26ac63ba78b70db3a591d446

Observation 6fb073d5-c527-4045-a412-cf0a26b973ef · outbound

This paper cites Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.876058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.876058Z digest=sha256:3d632e2fb9fae039f7f6e3a072985ac795190ef81bbd7016f24856dff85b3dde

Observation 2c9bbe76-1df1-4aef-ae18-83594b368b6d · outbound

This paper cites Trustjudge: Inconsistencies of LLM-as-a-judge and how to alleviate them.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Trustjudge: Inconsistencies of LLM-as-a-judge and how to alleviate them

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.413092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.879873Z digest=sha256:6de3133becc5d48bb56d0f00732d4d2742c2396271da72c7e67cb7469232c553

Observation 95d835a8-80d7-4953-a92f-9aba5429a9ae · outbound

This paper cites OpenAI GPT-5 System Card.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models OpenAI GPT-5 System Card

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.883152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.883152Z digest=sha256:79cca1f6a64e81ac03a7baf1ad326bae345500d3e12d2a3171fd6b01ff02f5b2

Observation 3d3d6085-8313-4b13-a5d8-55ee0111d7e2 · outbound

This paper cites Pai-bench: A comprehensive benchmark for physical ai.arXiv preprint arXiv:2512.01989, 2025.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Pai-bench: A comprehensive benchmark for physical ai.arXiv preprint arXiv:2512.01989, 2025

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.886678Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.886678Z digest=sha256:631a0177d427b11f60cdb1e735b32be5ea7c5a9068d692c87df726ca88190109

Observation 567042e8-a546-4d6a-9c96-f9deddd1aa5c · outbound

This paper cites Llava-onevision: Easy visual task transfer.Transactions on Machine Learning Research.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Llava-onevision: Easy visual task transfer.Transactions on Machine Learning Research

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.400689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.890054Z digest=sha256:de9ab0b31ac656ee775004969fcf6b52740f1e5e2f21348235fbd60c755a1742

Observation aa3b390b-492d-4fd5-967a-aeddbd515426 · outbound

This paper cites Xing, Hao Zhang, Joseph E.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Xing, Hao Zhang, Joseph E

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.893585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.893585Z digest=sha256:314343fee6242ca1f57255ab412330e3164c66b4040d88f27c11253104253870

Observation 1a132033-3cb5-484d-8f74-39ce15a92cb4 · outbound

This paper cites Prometheus-vision: Vision-language model as a judge for fine-grained evaluation.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Prometheus-vision: Vision-language model as a judge for fine-grained evaluation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.896957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.896957Z digest=sha256:442d1d87e43c44681586c659032b4fabddf0ede329bb12b569f18148a62fd17c

Observation 0358f445-0b76-4706-ad16-d7655157e7d1 · outbound

This paper cites MLLM-as-a-Judge: Assessing multimodal LLM-as-a-Judge with vision-language benchmark.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models MLLM-as-a-Judge: Assessing multimodal LLM-as-a-Judge with vision-language benchmark

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.373460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.900443Z digest=sha256:c69830f4acfa82bcc4dffb615c2fb56bfb467f47e63aceb1f532aa883701207c

Observation 2c624792-f540-4523-b288-24a52e8861ae · outbound

This paper cites Llava-critic: Learning to evaluate multimodal models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Llava-critic: Learning to evaluate multimodal models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.903918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.903918Z digest=sha256:a685ccfaa5afc8c559419bc8fcb327a57a321822796de9c0bdcc8b80f7d2d15c

Observation e25d5e47-2cdd-4167-bc22-087b125ba711 · outbound

This paper cites Generative Reward Models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Generative Reward Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.908413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.908413Z digest=sha256:c5432590543fb890e7d9b71b85f7a319898896a39418cd2ab363c1f291dc6a57

Observation be7c3ea8-06e3-45d4-a8a0-e9b0d15f2db7 · outbound

This paper cites CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.912277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.912277Z digest=sha256:6478b7da050de8c6a72514c04367b8b432e91be23760d4295338218d606af2da

Observation 82c510b3-bbc4-4023-8563-b5d3aeec15a6 · outbound

This paper cites Vision- language models are zero-shot reward models for reinforcement learning.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Vision- language models are zero-shot reward models for reinforcement learning

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.355874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.916450Z digest=sha256:02f2bef2d9a05db107abacdfd37c891f3d9f1b744c6cd817e373e45bf9a4d407

Observation d15df90e-4803-44d6-92a7-80e66e763c95 · outbound

This paper cites Rl-vlm-f: reinforcement learning from vision language foundation model feedback.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Rl-vlm-f: reinforcement learning from vision language foundation model feedback

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.342809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.920048Z digest=sha256:522b0189d583c1721e848a8f8f64a26fcad2292124dd46066a6d338c7a4489e5

Observation 0884635c-e168-4f7e-8c97-f4efbcac098c · outbound

This paper cites Vision-Language Models as a Source of Rewards.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Vision-Language Models as a Source of Rewards

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.923452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.923452Z digest=sha256:c0d414a035c99dd500764e49aac6c2443b3e0b60291b8d03e191cc56b7077895

Observation e6b023bb-0e25-414a-9ac6-145d4b8800f1 · outbound

This paper cites VisionReward: Fine-grained multi-dimensional human preference learning for image and video generation.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models VisionReward: Fine-grained multi-dimensional human preference learning for image and video generation

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.329036Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.927270Z digest=sha256:67678d6b560fdff3508d2890a9f6a2effd4d04e1801089e8be676fd1e9821f0e

Observation 2ed783aa-f9e8-42c0-9c80-2013255c69df · outbound

This paper cites Improving video generation with human feedback.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Improving video generation with human feedback

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.315099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.930706Z digest=sha256:32b9007a83251da0183c3c138f7ac335fed95f3d9bff41fc22da6fa97be54939

Observation aa38349e-b5d5-4685-97c6-03eaab10ba6b · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models RewardBench: Evaluating Reward Models for Language Modeling

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.934216Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.934216Z digest=sha256:1b77890a90256c1c59b8bc3e7b321056fa765ee8e56051aef9b56388eb641e6f

Observation 9be46e54-4553-46b7-9318-4825b8aaabbb · outbound

This paper cites Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.938227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.938227Z digest=sha256:803f4cd9a5fdfe6d7037a9958e38942bcd0dcee3f0d5f7f518e274b43324c182

Observation 04a0d552-7e46-4fe0-8ec3-db08307b25d3 · outbound

This paper cites Vl-rewardbench: a challenging benchmark for vision-language generative reward models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Vl-rewardbench: a challenging benchmark for vision-language generative reward models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.941977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.941977Z digest=sha256:711f144b13cd645c5bf72d6afc937f57332db218a0dcdcc3d3beaa4671841a09

Observation e0a2c348-bf0c-4fa1-a269-d6549e76e10b · outbound

This paper cites Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235, 2024.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235, 2024

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.945910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.945910Z digest=sha256:61f51cfd73ea6b95fd0655326da4d90f0e52b899942bca13a30ffb4715c446ef

Observation 33621821-7d61-40bb-ab70-e5d5e7c53fb5 · outbound

This paper cites Aligning with human judgement: The role of pairwise preference in large language model evaluators.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Aligning with human judgement: The role of pairwise preference in large language model evaluators

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.289737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.949377Z digest=sha256:244ea3ace28c878f51c4ef01e2119caf6800ceeb091d063decaba6fe06f3484a

Observation 85df1f86-a21a-437e-95d8-6f8232afdfb2 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Constitutional AI: Harmlessness from AI Feedback

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.953577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.953577Z digest=sha256:c6b9f32904ef3193c05250b35f7b3aca6aa72dae0b309b9c9f319ec23138fb81

Observation 1d27a4f9-312c-4712-b3c9-eb31e566a8ad · outbound

This paper cites Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.957080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.957080Z digest=sha256:40a4a26b6784f45c00b226d2291f5ac066b2fb7fe97fea5cf0965593bb082ae2

Observation 1f9e4c15-1c26-4f84-8480-61c12bb86da4 · outbound

This paper cites An empirical distribution function for sampling with incomplete information.The annals of mathematical statistics, pages 641–647, 1955.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models An empirical distribution function for sampling with incomplete information.The annals of mathematical statistics, pages 641–647, 1955

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.271486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-14T04:40:11.960523Z digest=sha256:0ec59c30e692815ca0f4400449da93849ef8e9485383c3580c5f3051084e1bbd

Observation 6daa94cf-372b-4674-9224-44b2b1c4959a · outbound

This paper cites Finetuned language models are zero-shot learners.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Finetuned language models are zero-shot learners

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.964323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.964323Z digest=sha256:174a02779da19403796643ffecc5b23b3260a3b8ccd5fe94101484c8ba3924ce

Observation 5c570ab1-c0c9-4ba6-85ed-58cc0c1e2242 · outbound

This paper cites Swift: a scalable lightweight infrastructure for fine-tuning.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Swift: a scalable lightweight infrastructure for fine-tuning

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.968028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.968028Z digest=sha256:a03cdce67ccc0053bd3c7551031b5d1ece83c6c4f3b1c1e2882e051020bf79e5

Observation 49b5de5b-6a5f-423a-bddb-39e2d77891dc · outbound

This paper cites Hybridflow: A flexible and efficient rlhf framework.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Hybridflow: A flexible and efficient rlhf framework

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.971503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.971503Z digest=sha256:c6faa62b7c4c981a918141e4424122a579000030045bb6e830e92d2349c9ae82

Observation 5231abc1-8303-491c-bc12-84ef2fe769e3 · outbound

This paper cites World Simulation with Video Foundation Models for Physical AI.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models World Simulation with Video Foundation Models for Physical AI

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.975172Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.975172Z digest=sha256:e6b4dfecbf290b53bd5c09ceb2ba8f05e99a817df24932e79e7159fd53c41e31

Pith citing papers

No inbound Pith citation observations are available.