Pith. sign in

Paper Citation Record · LEDGER

Reward Design with Language Models

As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 46 inbound Pith citation observations for arXiv:2303.00001.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2303.00001 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 46 of 46 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 46 of 46 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T22:52:24.111055Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T04:47:38.286725Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation d23a82d5-3c8d-410b-b9e7-3dd456ea4d2c · inbound

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models cites this paper.

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models Reward Design with Language Models

Reference 76

Resolution
verified exact
arxiv_id, observed 2026-05-13T08:57:22.564735Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-13T08:57:22.299028Z digest=sha256:701a3d0d3c817aa5638c32cd5ce0887898339f4aa3b8e0319a7fad7b2ca9057f

Observation e8819983-5ecb-496f-bbce-4df5d85468f5 · inbound

ViSTa Dataset: Do vision-language models understand sequential tasks? cites this paper.

ViSTa Dataset: Do vision-language models understand sequential tasks? Reward Design with Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-12T16:45:47.239421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:45:47.239421Z digest=sha256:9235bd0b5f42de5d0bf5305981e699433ae1795db39de2f8717e57d259b1d68a

Observation 2af37483-66ce-4409-ab30-92b282968b82 · inbound

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback cites this paper.

A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback Reward Design with Language Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-12T16:30:09.409414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:30:09.409414Z digest=sha256:e0f50443807ca694b3d50c3ea5f0a4fdbb7ff250cdec970e50ebd1fadc8ec1b1

Observation e52a120c-1d04-4860-9bba-02ba5df35fda · inbound

From Laws to Motivation: Guiding Exploration through Law-Based Reasoning and Rewards cites this paper.

From Laws to Motivation: Guiding Exploration through Law-Based Reasoning and Rewards Reward Design with Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-12T13:49:22.437321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T13:49:22.437321Z digest=sha256:807fe2ba16ce4028ecae877808d7f3fd722fe5eb4a517de0089ade3fe989330a

Observation 0ebfa616-5bd7-4b38-8a0a-65e98fccf70f · inbound

Effective Reward Specification in Deep Reinforcement Learning cites this paper.

Effective Reward Specification in Deep Reinforcement Learning Reward Design with Language Models

Reference 177

Resolution
unresolved
no resolver link, observed 2026-08-11T19:09:54.659518Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T19:09:54.659518Z digest=sha256:c47657e6e5a59bc9123d0e8eac68966c9dc0461ec87426d7beea74b33265d022

Observation a83ac4b3-1c2d-44ea-9dc8-5d22cd921da5 · inbound

VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving cites this paper.

VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving Reward Design with Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T11:25:15.388046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:25:15.388046Z digest=sha256:a0364fa849cd220a4e06629848730da096b65836fc8cb670bac9607065ba3d24

Observation 34c0a8b7-072c-44f6-a59f-6e3c658a54bf · inbound

CLIP-RLDrive: Human-Aligned Autonomous Driving via CLIP-Based Reward Shaping in Reinforcement Learning cites this paper.

CLIP-RLDrive: Human-Aligned Autonomous Driving via CLIP-Based Reward Shaping in Reinforcement Learning Reward Design with Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T14:10:08.712747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:10:08.712747Z digest=sha256:70f1721ce213d5a73a350e4e93a865f2bb3ced017a2d7e0acff3f90cea3017bc

Observation d262a1ab-8bab-491c-9b18-ea69d84b4a2e · inbound

An Overview and Discussion on Using Large Language Models for Implementation Generation of Solutions to Open-Ended Problems cites this paper.

An Overview and Discussion on Using Large Language Models for Implementation Generation of Solutions to Open-Ended Problems Reward Design with Language Models

Reference 126

Resolution
unresolved
no resolver link, observed 2026-08-10T22:51:52.642220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:51:52.642220Z digest=sha256:381481901cb9c5e838d2e8b7f76e6eba00a8f4754763fe8f08f223d23c7ac6e3

Observation 0ea6dc14-69d3-49db-a5df-b65e316fc368 · inbound

MoE$^2$: Optimizing Collaborative Inference for Edge Large Language Models cites this paper.

MoE$^2$: Optimizing Collaborative Inference for Edge Large Language Models Reward Design with Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-10T20:13:14.756649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:13:14.756649Z digest=sha256:2dad640d7f2326c5cc414833de787b7b8932e9bd5f36e50715b1a43be9ae2d6d

Observation 2e5c5b9e-0d1f-4aad-8466-8707d846346c · inbound

Multilinguality in LLM-Designed Reward Functions for Restless Bandits: Effects on Task Performance and Fairness cites this paper.

Multilinguality in LLM-Designed Reward Functions for Restless Bandits: Effects on Task Performance and Fairness Reward Design with Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T18:04:54.853730Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:04:54.853730Z digest=sha256:963506b5bd9a76d74c6a359fc8cbaecc6090505c17996e4f015409a6a969cf12

Observation 4837da17-58ba-4590-bce9-46fbd5cafc6c · inbound

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning cites this paper.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Reward Design with Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.069804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.069804Z digest=sha256:1d2623b732f0d2d3b6a7feed4f1fc8d42a6b1be6d04a98ba7995bcc674310f30

Observation 58299a99-58f8-457c-b70b-e78e651891c2 · inbound

TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations cites this paper.

TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations Reward Design with Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T22:52:24.111055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:52:24.111055Z digest=sha256:b08b109e3047043751461d9096fee5a9336c8308c8cce93354ea4a875fc3380a

Observation f9347ac1-3a04-4b37-87f8-a2a89600d53f · inbound

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation cites this paper.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Reward Design with Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.196985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.196985Z digest=sha256:84edc0cf1b7f826aec884f91f87ea3fcb79c5ae34787769f98ac5c6cf820d953

Observation eedeb1d1-d01b-488b-bf83-d900cfbef269 · inbound

Divide-Fuse-Conquer: Eliciting "Aha Moments" in Multi-Scenario Games cites this paper.

Divide-Fuse-Conquer: Eliciting "Aha Moments" in Multi-Scenario Games Reward Design with Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:07:04.302130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:07:04.302130Z digest=sha256:3fd6af6a9c408ce9c1d57e82e4e83bbc7cbd829eeccc62961d856202988b1505

Observation 20383376-18c4-4a35-860a-eda6c56fc415 · inbound

Where You Go is Who You Are: Behavioral Theory-Guided LLMs for Inverse Reinforcement Learning cites this paper.

Where You Go is Who You Are: Behavioral Theory-Guided LLMs for Inverse Reinforcement Learning Reward Design with Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:54:15.052114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:54:15.052114Z digest=sha256:10653eae44539992e6ecd8befe4fe0b75e534f60d19698c9e11bc26e84b05258

Observation e2c8dac2-a844-4e4f-a062-14f1f34ff23c · inbound

LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation cites this paper.

LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation Reward Design with Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T13:53:38.843038Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:53:38.843038Z digest=sha256:88b642f6790b823a06e9a05f38e07fde452e1e1292a6679947af61d96b98d7f3

Observation 89208768-7722-478d-a081-5d8dfc6c7f02 · inbound

An evaluation of LLMs for generating movie reviews: GPT-4o, Gemini-2.0 and DeepSeek-V3 cites this paper.

An evaluation of LLMs for generating movie reviews: GPT-4o, Gemini-2.0 and DeepSeek-V3 Reward Design with Language Models

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T12:12:54.004545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:12:54.004545Z digest=sha256:c89bdb5482780df09296df7f5381d1aae3f2a7f0a630145c6966c458e04919bd

Observation cd972443-e59a-40ce-b06d-3303f40eea88 · inbound

Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively cites this paper.

Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively Reward Design with Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T12:11:43.508406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T12:11:43.508406Z digest=sha256:f35e328360a5263a67865a7e96e3130e6a47d5796a51488f71561210699d30dc

Observation c49e6e44-5eb9-430d-b0db-fbe209d244c6 · inbound

Agentic Episodic Control cites this paper.

Agentic Episodic Control Reward Design with Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T11:50:00.420509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:50:00.420509Z digest=sha256:6fd861d9b55a8aac375d2bace85c42d979a3a4d4a05fdcf3c71a2fdd28ecb95d

Observation de54f59e-6712-4905-8a83-7fe6714d6b9d · inbound

Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function cites this paper.

Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function Reward Design with Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T11:20:10.973403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:20:10.973403Z digest=sha256:8f8066cc25b16aacb00018a47e58976403e9ce835d503c55c36d6a574094dcd2

Observation 0e6cf36c-3d6b-4d3e-a5a5-6284597625a8 · inbound

ACTLLM: Action Consistency Tuned Large Language Model cites this paper.

ACTLLM: Action Consistency Tuned Large Language Model Reward Design with Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T22:34:08.994748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:34:08.994748Z digest=sha256:d7b1169b2259fdd3a905315b9f593bd79708e3e93653ceec8962a5809fa17574

Observation add81e89-0e28-4c1e-b6a8-8551fdc962c9 · inbound

Prompt Informed Reinforcement Learning for Visual Coverage Path Planning cites this paper.

Prompt Informed Reinforcement Learning for Visual Coverage Path Planning Reward Design with Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T17:39:45.103900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:39:45.103900Z digest=sha256:62eee4f19ce38d90c9989b9faaded0e91a00025f50426dca8aa548fdfb626948

Observation 1c00c216-2a6c-4e00-bfd4-e78c84b992a8 · inbound

FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making cites this paper.

FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making Reward Design with Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T17:12:28.663704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:12:28.663704Z digest=sha256:53e14c8a0bcbf438fe562d9d64ff45e3410caf5ffab60658099d4cda36bd6a8d

Observation 33e0d3f5-5f7a-4d3d-a8d7-a3ec2544814f · inbound

Towards Reliable, Uncertainty-Aware Alignment cites this paper.

Towards Reliable, Uncertainty-Aware Alignment Reward Design with Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T15:40:15.257918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T15:40:15.257918Z digest=sha256:25fefd7502feefa56f4c43d75208c8c9869c0a166493aef1678976835ae6da82

Observation 158fe600-ef6b-423d-b6c2-3bc5a8a134f2 · inbound

Edge Agentic AI Framework for Autonomous Network Optimisation in O-RAN cites this paper.

Edge Agentic AI Framework for Autonomous Network Optimisation in O-RAN Reward Design with Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T12:30:39.980782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T12:30:39.980782Z digest=sha256:d8ea034b449ef3e1d2abdf0d01659487cc37acc5306b2560b9f4a0f5af98822e

Observation f305a4a6-4972-4115-b611-ad80f1e9c0ef · inbound

GPLight+: A Genetic Programming Method for Learning Symmetric Traffic Signal Control Policy cites this paper.

GPLight+: A Genetic Programming Method for Learning Symmetric Traffic Signal Control Policy Reward Design with Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T17:36:53.242484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T17:36:53.242484Z digest=sha256:a84e037b0ef7db301c368f4e3f2fcceb090c2bdac35b4b6aa92ac516e9012c33

Observation 68ebd632-382e-45fe-8ad4-a5484af427e8 · inbound

Toward Edge General Intelligence with Agentic AI and Agentification: Concepts, Technologies, and Future Directions cites this paper.

Toward Edge General Intelligence with Agentic AI and Agentification: Concepts, Technologies, and Future Directions Reward Design with Language Models

Reference 232

Resolution
unresolved
no resolver link, observed 2026-08-05T16:21:00.388060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:21:00.388060Z digest=sha256:af997de449636abb0bdf34e0af759400e30f2acffd752cecaf33cfbab30383b4

Observation 0d87d1aa-846d-47c2-8241-a9f836e426a5 · inbound

RoboInspector: Unveiling the Unreliability of Policy Code for LLM-enabled Robotic Manipulation cites this paper.

RoboInspector: Unveiling the Unreliability of Policy Code for LLM-enabled Robotic Manipulation Reward Design with Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T14:20:39.757357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:20:39.757357Z digest=sha256:6628d68c8e7aa5900ad4e8ab6f28686a7db1b7a4c5c13bf4c8ff6d82d9c23028

Observation 53f15e63-da33-4bec-97ac-afdc54c976d8 · inbound

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning cites this paper.

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning Reward Design with Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T16:06:58.488030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:06:58.488030Z digest=sha256:f2741a50cd3def7e4d9511744581edac490a49d03acb5c213e046f92adb6c7de

Observation 8d415c79-628b-4620-92da-edc874336346 · inbound

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning cites this paper.

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning Reward Design with Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:21:32.889019Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-18T15:19:30.609974Z digest=sha256:42b2de84b3a1d679245bebd81302b00062c344ae66d05d5ab8893e31578db5bb

Observation 0c805b36-670c-40b6-a7f6-f052dc25baf7 · inbound

Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization cites this paper.

Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization Reward Design with Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T10:37:26.093669Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T10:37:26.093669Z digest=sha256:d4c18ab3a34e0725a6bbc78f0d705402d92dfe891ea9d920dcbf7df22eb8ba6e

Observation 587ece49-1ab1-4654-ac28-0f2667bb4dd4 · inbound

InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training cites this paper.

InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training Reward Design with Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T09:22:42.928860Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T09:22:42.928860Z digest=sha256:9a85995032097fde3bb027d8365933d36eb230cda4c11b38a42be5ff61d94c0e

Observation e7182a7d-daf9-4bc4-82b3-89d1677e696b · inbound

Debate2Create: Robot Co-design via Multi-Agent LLM Debate cites this paper.

Debate2Create: Robot Co-design via Multi-Agent LLM Debate Reward Design with Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T07:27:03.942685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T07:27:03.942685Z digest=sha256:1956100b98c3c808478a2837a8107a72ceacec4e28ab1427804c55b060964be9

Observation ebcf14d4-251c-4889-8f75-1e163c19b504 · inbound

What Is Preference Optimization Doing, and Why? cites this paper.

What Is Preference Optimization Doing, and Why? Reward Design with Language Models

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-05-21T18:40:28.991254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-21T18:37:48.161545Z digest=sha256:699b196474aa16bec47cbd733b178d6b120d57a37235650a37c54514c02b398b

Observation dffd4cd3-bcf8-45cd-b02b-63d131037c6a · inbound

From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning cites this paper.

From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning Reward Design with Language Models

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T08:30:58.248439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-10T16:35:36.083682Z digest=sha256:496ff254c196e0eb90f337896de9964aa5ea199f958b5194eaaa95c3a430e7a4

Observation e2cb6821-a8dc-49f6-adeb-643f1b2a32b6 · inbound

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs cites this paper.

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs Reward Design with Language Models

Reference 40

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T15:51:42.642392Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-05-09T19:09:07.557773Z digest=sha256:6f0fd40fd5da7e499bc1803ac540a854e0a8ebb5583fd69dc805dca850e780bd

Observation 95fafb7d-3014-4d2b-b6dc-572abe964758 · inbound

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning cites this paper.

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning Reward Design with Language Models

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:00:35.202959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-08T19:14:22.162163Z digest=sha256:a00db9befc0ff77694b88c7f033ce650a682021efd74533e00d12d359e6d9a98

Observation dfbba3b9-0fd3-4fa0-86ff-dd484a6ff85b · inbound

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning cites this paper.

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning Reward Design with Language Models

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-11T03:50:58.007955Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-11T02:10:46.725354Z digest=sha256:6a6fef3089f5e556224af699482e4c3f75e6ee68e07abcfd19e8979d8dbe155b

Observation a11363b3-61f5-44ea-97ff-02d463e3429f · inbound

Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias cites this paper.

Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias Reward Design with Language Models

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:41:24.007336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-12T00:51:58.315109Z digest=sha256:bb8cae2f2e4fb16f49cff51da5bd67c72313c471f3f2f6f19c1f67d6ae15cd26

Observation 5ee0afc7-d13a-45fd-8fc6-79051e300cb8 · inbound

EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models cites this paper.

EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models Reward Design with Language Models

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:27:18.924884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-13T05:19:38.587352Z digest=sha256:53488a5ecf0edbe763d8ff3f3342339aafdba0a627eb400e508bf3ef38a2ce25

Observation 1a53cd80-346a-4d58-93e6-720fad5239bf · inbound

DuIVRS-2: An LLM-based Interactive Voice Response System for Large-scale POI Attribute Acquisition cites this paper.

DuIVRS-2: An LLM-based Interactive Voice Response System for Large-scale POI Attribute Acquisition Reward Design with Language Models

Reference 26

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T10:33:12.905500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-05-20T10:30:48.957568Z digest=sha256:3a2d111150cdcdef2120b57fd89ec48d5f1f84c434c1eead34e7cede91de3fae

Observation 19b9b349-5bd5-431a-80e2-fc59e6710367 · inbound

Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning cites this paper.

Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning Reward Design with Language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-02T11:56:55.227147Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-28T02:47:16.737433Z digest=sha256:c100ffd8bd282040ec66efa04e1d574de939f1ea92d5e6d0fc9147e5072d9f5a

Observation c880b2a2-7d08-4386-8ba3-647b6b3461c4 · inbound

Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output cites this paper.

Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output Reward Design with Language Models

Reference 33

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T04:47:38.288260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-06-27T13:39:17.701196Z digest=sha256:301cbfeef2ce36d103c8831ab41e602adb6342d4fdadefafc32438c7370c8b8d

Observation e6ae1a8e-4136-4dfc-aa6e-dccf1d2d497b · inbound

ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation cites this paper.

ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation Reward Design with Language Models

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-06-30T06:04:21.642435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-06-30T05:59:13.483829Z digest=sha256:926dc4faaf47795d9714c32f5937f169b58aaf4266e9fca9fcd174b47926ad23

Observation 29c5a56c-d257-4a05-9423-3de842757ff7 · inbound

TAPAS: Throughput-adaptive Perception for Autonomous Systems cites this paper.

TAPAS: Throughput-adaptive Perception for Autonomous Systems Reward Design with Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-01T18:24:05.608019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T18:24:05.608019Z digest=sha256:8b13eb14d8c51b3f2a2f88479c2f6e9c9a4b1fa6b621ef43618504b08cdee682

Observation 913bc2cf-6378-4779-8888-177241f91b5a · inbound

Computational models of pragmatic reasoning with flexible generation of meaning and expression alternatives cites this paper.

Computational models of pragmatic reasoning with flexible generation of meaning and expression alternatives Reward Design with Language Models

Reference 150

Resolution
unresolved
no resolver link, observed 2026-08-01T15:27:06.396909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T15:27:06.396909Z digest=sha256:7eef1e02d19ad23f65ac98ca493c3ee14747cce1ea9acd38159ab6ce6f41cc22