Pith. sign in

Paper Citation Record · LEDGER

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning

As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2502.03717.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.03717 v2

Coverage vector

measured 41 of 41 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T01:04:04.161124Z

measured 41 of 41 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

41 of 41 outbound references displayed

  • verified exact1
  • verified fuzzy13
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9862a8bb-a89c-4762-90ec-f217dcae7027 · outbound

This paper cites Walk these ways: Tuning robot control for generalization with multiplicity of behavior,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Walk these ways: Tuning robot control for generalization with multiplicity of behavior,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.058228Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.058228Z digest=sha256:cccc491fd175a537f1d2d8dbfc4dc398495231722a0cba9e128123e59be53e68

Observation 27d7851e-e09c-4253-8ab9-8c60dbdf1b89 · outbound

This paper cites RMA: Rapid Motor Adaptation for Legged Robots.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning RMA: Rapid Motor Adaptation for Legged Robots

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.061490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.061490Z digest=sha256:374dfd81d3db84d396f958455bb800d152b83cdcf6128372127b95b6ec606148

Observation 060ce7d0-de42-43e0-be15-115deb11a287 · outbound

This paper cites Learning quadrupedal locomotion over challenging terrain,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Learning quadrupedal locomotion over challenging terrain,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.064526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.064526Z digest=sha256:e33a4c9b08009b3797906619aea2cd344e30fe2a9c6bb7a6df4cbdd7855dc8f7

Observation 2de40d92-583b-412d-805c-9cd47179d2d4 · outbound

This paper cites Inverse reward design,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Inverse reward design,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.067042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.067042Z digest=sha256:f70e69f44ce9a56357c63f0c99f28b02bc894725166d49098a30d050e67fdb19

Observation 4837da17-58ba-4590-bce9-46fbd5cafc6c · outbound

This paper cites Reward Design with Language Models.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Reward Design with Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.069804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.069804Z digest=sha256:2dd2493c198e2d9053518afecd3a706c616bf39f2a9932859b77edd54294e56c

Observation 64b65b33-7600-4aa1-b7b9-cf8a7245ee5a · outbound

This paper cites Language to Rewards for Robotic Skill Synthesis.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Language to Rewards for Robotic Skill Synthesis

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.072614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.072614Z digest=sha256:9a277aac49639a9f0ab1ea47bb9c729ddf80ed87bdf78b456cc115933ef8c3a5

Observation d771b9c7-bfe8-4072-9f82-70ce3b44ccde · outbound

This paper cites SayTap: Language to Quadrupedal Locomotion.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning SayTap: Language to Quadrupedal Locomotion

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.075537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.075537Z digest=sha256:38c2999c04e11bc659752bfefed7031d1d17ef8fca80fb58eed92882575f1ef2

Observation 6dc50f98-2973-42fb-ac68-accebfe8d797 · outbound

This paper cites Eureka: Human-Level Reward Design via Coding Large Language Models.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Eureka: Human-Level Reward Design via Coding Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.078126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.078126Z digest=sha256:d3666e3ae0c6deb9d6ed6de863e23a348fe36562e55eb15fcff034499e8eb5fa

Observation 539c8285-fa94-41a4-ab54-15348654d59b · outbound

This paper cites Interactive learning from policy- dependent human feedback,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Interactive learning from policy- dependent human feedback,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.466325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.080899Z digest=sha256:2189c04f27d8a19c192a1bdca580c6b6b36932fd006f5724626afde591dea579

Observation b0ac61ae-d3c3-4e39-95b7-97d63f2418bf · outbound

This paper cites Deep reinforcement learning from human preferences,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Deep reinforcement learning from human preferences,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.083359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.083359Z digest=sha256:7d3508c3f457df5ed5ebda41409321d5ff1ff60e128299f75106639008c7bd5d

Observation f5750ba4-345c-479c-b362-073007f18f0d · outbound

This paper cites PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.085762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.085762Z digest=sha256:afe0eb042f65333b917e1fc2442be35c6cac69a217547b1c3fcfafe1d41df68f

Observation b1355008-a2f1-4702-bc83-86db8485d1f4 · outbound

This paper cites Few-shot preference learning for human- in-the-loop rl,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Few-shot preference learning for human- in-the-loop rl,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.453650Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.088220Z digest=sha256:186c119fb5b447d1b9872b91aab00e364b91f86e1841f0a0f95a666c8a5462f1

Observation f9dd4e5d-dff2-4841-aa77-11be2ec4c5b2 · outbound

This paper cites Barkour: Benchmarking Animal-level Agility with Quadruped Robots.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Barkour: Benchmarking Animal-level Agility with Quadruped Robots

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.090671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.090671Z digest=sha256:a9c68c06c254dcf35a425862f87f75aaa68f21e315aeb81f6a77a8274431d1c8

Observation ae7638f6-b09f-4d7b-9d81-b13095502303 · outbound

This paper cites Minimizing Energy Consumption Leads to the Emergence of Gaits in Legged Robots.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Minimizing Energy Consumption Leads to the Emergence of Gaits in Legged Robots

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.093592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.093592Z digest=sha256:21fec448c5cfe96a48fbca5f2720290d83917015d395a2698a223a461b44e277

Observation 65fc7f5b-293d-440c-aa85-5d35205685b8 · outbound

This paper cites Fast and efficient locomotion via learned gait transitions,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Fast and efficient locomotion via learned gait transitions,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.445282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.096516Z digest=sha256:c1e68f1890a9dd3819bd12c1bd03c028cbd1e76be0067abfb0ef2a084e6b2e27

Observation 24ec8c59-73b2-439e-b7e2-8cffc0b41ec1 · outbound

This paper cites Code as policies: Language model programs for embodied control,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Code as policies: Language model programs for embodied control,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.099122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.099122Z digest=sha256:df29c16e3074c4fe0d68254e6bb8549c0d090cefd2b91b3da646b4fbdcd47953

Observation 21d9a400-f896-46ae-b6a0-0c9723b8bbeb · outbound

This paper cites Do as i can, not as i say: Grounding language in robotic affordances,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Do as i can, not as i say: Grounding language in robotic affordances,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.101740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.101740Z digest=sha256:e12cf0218fd674475662bce577a03c9d7b5cfa647e96bf04f9c1c0e8bf5bd7e8

Observation 425c8df5-9d11-49ef-a939-9b06610a7654 · outbound

This paper cites Generative expressive robot behaviors using large language models,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Generative expressive robot behaviors using large language models,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.426709Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.104488Z digest=sha256:459b2a6dca1ec2aafc8267a440e010f3d20060e596578e886f09303b000a4728

Observation 3519c8d9-9308-441f-abba-0962489ea263 · outbound

This paper cites Text2Interaction: Establishing Safe and Preferable Human-Robot Interaction.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Text2Interaction: Establishing Safe and Preferable Human-Robot Interaction

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.107067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.107067Z digest=sha256:9156519d0e32ab8e1712c478f1b071fa106074f39a7f0aca46e4f21b18e56f7e

Observation c7170756-a754-423d-95b7-0c7413b27345 · outbound

This paper cites Learning to Learn Faster from Human Feedback with Language Model Predictive Control.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Learning to Learn Faster from Human Feedback with Language Model Predictive Control

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.109915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.109915Z digest=sha256:2d5c8d8175a7136e6ca3da8bee3f13c85dc74e647e334e1c2eeceae46a27a236

Observation ba02c72b-6728-44ef-8118-682170279fd8 · outbound

This paper cites Language instructed reinforcement learning for human-ai coordination,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Language instructed reinforcement learning for human-ai coordination,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.418886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.112879Z digest=sha256:37f8a4ffe3877f85e2c67181e6eb4aad62c3ea71b2d15624a0e02e959c0b6e37

Observation 19ba90b6-35f8-4d14-996f-9b0f03fd7e62 · outbound

This paper cites Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.115081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.115081Z digest=sha256:059e679136323e3e80f16f8a9f620a86cb52c7f647ef694ccfe189d81229075f

Observation cfce0453-4214-4ed9-8f30-82ccf5d2a35a · outbound

This paper cites Learning human objectives from sequences of physical corrections,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Learning human objectives from sequences of physical corrections,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.410955Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.117681Z digest=sha256:ac1f3549837acb6052406438990b3a063d38bd98caeb3c1ebbedee747a18e2bf

Observation d51c9db1-cb4e-458a-b2b7-0072325c16e5 · outbound

This paper cites Interactively shaping agents via human reinforcement: The tamer framework,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Interactively shaping agents via human reinforcement: The tamer framework,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.402901Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.119945Z digest=sha256:3dfb57dea0f4728f96e2ad135e9fda19f255a4a3669ce2109f00880bff2d8548

Observation 89db36bf-8add-4e6b-a911-0bbc2542b9d6 · outbound

This paper cites Learning multimodal rewards from rankings,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Learning multimodal rewards from rankings,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.395402Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.122216Z digest=sha256:1b19f42974e5bbeae3b8c54a75b9f8074cccc20ed03e6a7d5bf63568cd989658

Observation 2fa5e376-b293-42ee-a8ec-e5ca97fd3662 · outbound

This paper cites Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.124561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.124561Z digest=sha256:f67525b0d42efba3b0c4f727b81f203323799c9c411a08da503d878a30e84bca

Observation c5a44fc6-fb89-4297-93ad-68c6bff49fa4 · outbound

This paper cites Sadigh, A.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Sadigh, A

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.382482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.127091Z digest=sha256:ed3663b9780a8261999d3b0695d7af93464400de88583692ecb89a8cde3db7f1

Observation 940e35dc-0d03-4f4d-9fe6-32276b1a422b · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Fine-Tuning Language Models from Human Preferences

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.129314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.129314Z digest=sha256:0259686d79023b365a0489d01835f7461c753dce3b777ee532216d03d6116a26

Observation 3d1b2b3c-9d17-4128-8b5e-f31e0f16c049 · outbound

This paper cites Preference-conditioned language- guided abstraction,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Preference-conditioned language- guided abstraction,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.374581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.131784Z digest=sha256:9c51149769787104b95591d2f11d61212ad69392147563fee87f6a401467d8d0

Observation 9466e122-8789-4dcf-bc52-52526e0b088e · outbound

This paper cites MAPLE: A Framework for Active Preference Learning Guided by Large Language Models.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning MAPLE: A Framework for Active Preference Learning Guided by Large Language Models

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-09T01:04:04.236834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.134254Z digest=sha256:841f46779f5d49b645d879e5143bfe9a20b5581ffffb0610c0d8120a9af7abac

Observation d4789680-6288-45d6-b030-618b320d2ccc · outbound

This paper cites Batch active preference-based learning of reward functions,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Batch active preference-based learning of reward functions,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.365667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.136933Z digest=sha256:e96dee210fa3145087f743428b1142e8d4877f37a43f4fd1748e7170d46da926

Observation 35ac569d-eb5e-48ca-be22-58e922b18a07 · outbound

This paper cites ICPL: Few-shot In-context Preference Learning via LLMs.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning ICPL: Few-shot In-context Preference Learning via LLMs

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.139176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.139176Z digest=sha256:4f53f433bccc32200ce388d78744fe636bebb0c4c710bc72f3cbc052a5093061

Observation 36d0384a-c41d-4b7b-8547-6004e5a37dce · outbound

This paper cites B-Pref: Benchmarking Preference-Based Reinforcement Learning.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.141508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.141508Z digest=sha256:f30b7d09baead7845444d2c350f52d403e452970a4392f6efae76e6e87a762d4

Observation d86b9fff-eb9e-41d3-9310-4f373a8b727b · outbound

This paper cites A bayesian approach for policy learning from trajectory preference queries,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning A bayesian approach for policy learning from trajectory preference queries,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.356690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.143870Z digest=sha256:491ec6bf0685dc66038ca05785e5630b116c017dd8db2f0ca960ed4ec0389ce4

Observation 6df6945f-7cda-4f7e-a133-e155c9af6660 · outbound

This paper cites Rank analysis of incomplete block designs: I. the method of paired comparisons,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Rank analysis of incomplete block designs: I. the method of paired comparisons,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.146109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.146109Z digest=sha256:a051f1eec9211849248ea86610b336e0fe9601d021509ed334859b5ce078e35a

Observation 5c02d76a-77b5-477f-8028-75d4157eff5d · outbound

This paper cites Safe imitation learning via fast bayesian reward inference from preferences,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Safe imitation learning via fast bayesian reward inference from preferences,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.342407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-09T01:04:04.148428Z digest=sha256:d336fe06e4bb033255f168aa7e9f7fb087594b9a94908dae8d61a3b0c5ae04a4

Observation 27c8227b-bf54-4de5-8750-a1e287986fcf · outbound

This paper cites SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.151124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.151124Z digest=sha256:a82996b8d4350c24b227da41daf0a40d18995c4a699b3477b0c52f74140e4430

Observation 7e3833e5-4445-4fa7-8fc6-4177bf36919c · outbound

This paper cites Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.153622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.153622Z digest=sha256:36642db57540f18c59a6fad0b64372ea193dfb6082626e6b5c013b720e3bb68e

Observation 163a41e4-fc20-47aa-9ab8-c13d796a35c5 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Proximal Policy Optimization Algorithms

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.156322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.156322Z digest=sha256:5d2c9982de606f42de4153bb3873ad975946be331538cdac70c42ea582ac8062

Observation a1d407fa-3b44-4c3b-a192-a1c49da205f4 · outbound

This paper cites GPT-4 Technical Report.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning GPT-4 Technical Report

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.158705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.158705Z digest=sha256:34c18515b904c9266b34ff55f9a56730638236397a6a9e1c287794c51b772b65

Observation 6ac6859e-a717-431a-9250-38252ec7df62 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Chain-of-thought prompting elicits reasoning in large language models,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.161124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.161124Z digest=sha256:c397194bf9ce5bf5f4382304791603e28bde3e8ca176ebbff5f13b0ca8c5b8cc

Pith citing papers

No inbound Pith citation observations are available.