{"as_of":"2026-08-09T20:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0b19dfe1ecf9cbea6971baeba8357f95769335d7c26649a968f3539a5a14177","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T01:04:04.161124Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.03717/citation-record","integrity":"/paper/2502.03717/integrity","json":"/paper/2502.03717/citation-record.json","paper":"/paper/2502.03717"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.058228Z","title":"Walk these ways: Tuning robot control for generalization with multiplicity of behavior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.058228Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:cccc491fd175a537f1d2d8dbfc4dc398495231722a0cba9e128123e59be53e68","observation_id":"9862a8bb-a89c-4762-90ec-f217dcae7027","resolution":{"observed_at":"2026-08-09T01:04:04.058228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04034","last_updated":"2021-07-08T17:59:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-08T17:59:59Z","title":"RMA: Rapid Motor Adaptation for Legged Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04034","snapshot_observed_at":"2026-08-09T01:04:04.061490Z","title":"Rma: Rapid motor adaptation for legged robots,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.061490Z"},"links":{"cited_paper":"/paper/2107.04034","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:374dfd81d3db84d396f958455bb800d152b83cdcf6128372127b95b6ec606148","observation_id":"27d7851e-e09c-4253-8ab9-8c60dbdf1b89","resolution":{"observed_at":"2026-08-09T01:04:04.061490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.064526Z","title":"Learning quadrupedal locomotion over challenging terrain,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.064526Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:e33a4c9b08009b3797906619aea2cd344e30fe2a9c6bb7a6df4cbdd7855dc8f7","observation_id":"060ce7d0-de42-43e0-be15-115deb11a287","resolution":{"observed_at":"2026-08-09T01:04:04.064526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.067042Z","title":"Inverse reward design,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.067042Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:f70e69f44ce9a56357c63f0c99f28b02bc894725166d49098a30d050e67fdb19","observation_id":"2de40d92-583b-412d-805c-9cd47179d2d4","resolution":{"observed_at":"2026-08-09T01:04:04.067042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-09T01:04:04.069804Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.069804Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:2dd2493c198e2d9053518afecd3a706c616bf39f2a9932859b77edd54294e56c","observation_id":"4837da17-58ba-4590-bce9-46fbd5cafc6c","resolution":{"observed_at":"2026-08-09T01:04:04.069804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-07T14:05:45.642543Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-09T01:04:04.072614Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.072614Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:9a277aac49639a9f0ab1ea47bb9c729ddf80ed87bdf78b456cc115933ef8c3a5","observation_id":"64b65b33-7600-4aa1-b7b9-cf8a7245ee5a","resolution":{"observed_at":"2026-08-09T01:04:04.072614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07580","last_updated":"2023-09-14T06:59:51Z","snapshot_observed_at":"2026-08-01T14:57:27.337879Z","submitted_at":"2023-06-13T07:09:11Z","title":"SayTap: Language to Quadrupedal Locomotion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07580","snapshot_observed_at":"2026-08-09T01:04:04.075537Z","title":"Saytap: Lan- guage to quadrupedal locomotion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.075537Z"},"links":{"cited_paper":"/paper/2306.07580","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:38c2999c04e11bc659752bfefed7031d1d17ef8fca80fb58eed92882575f1ef2","observation_id":"d771b9c7-bfe8-4072-9f82-70ce3b44ccde","resolution":{"observed_at":"2026-08-09T01:04:04.075537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-09T01:04:04.078126Z","title":"Eureka: Human- level reward design via coding large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.078126Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:d3666e3ae0c6deb9d6ed6de863e23a348fe36562e55eb15fcff034499e8eb5fa","observation_id":"6dc50f98-2973-42fb-ac68-accebfe8d797","resolution":{"observed_at":"2026-08-09T01:04:04.078126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.463382Z","title":"Interactive learning from policy- dependent human feedback,","venue":null,"work_id":"3d2e72d0-6d84-46c8-ac68-c6e44f22882e","year":2017},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.080899Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:2189c04f27d8a19c192a1bdca580c6b6b36932fd006f5724626afde591dea579","observation_id":"539c8285-fa94-41a4-ab54-15348654d59b","resolution":{"observed_at":"2026-08-09T01:04:04.466325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.083359Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.083359Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:7d3508c3f457df5ed5ebda41409321d5ff1ff60e128299f75106639008c7bd5d","observation_id":"b0ac61ae-d3c3-4e39-95b7-97d63f2418bf","resolution":{"observed_at":"2026-08-09T01:04:04.083359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05091","last_updated":"2021-06-09T14:10:50Z","snapshot_observed_at":"2026-08-09T12:10:10.862824Z","submitted_at":"2021-06-09T14:10:50Z","title":"PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05091","snapshot_observed_at":"2026-08-09T01:04:04.085762Z","title":"Pebble: Feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre- training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.085762Z"},"links":{"cited_paper":"/paper/2106.05091","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:b7dd248d38bd35186d6985cc39c5c60793714916547c8d55e635e18a75320dbb","observation_id":"f5750ba4-345c-479c-b362-073007f18f0d","resolution":{"observed_at":"2026-08-09T01:04:04.085762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.450457Z","title":"Few-shot preference learning for human- in-the-loop rl,","venue":null,"work_id":"b4ab3087-ae63-4c24-a927-248d8f0bacf5","year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.088220Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:186c119fb5b447d1b9872b91aab00e364b91f86e1841f0a0f95a666c8a5462f1","observation_id":"b1355008-a2f1-4702-bc83-86db8485d1f4","resolution":{"observed_at":"2026-08-09T01:04:04.453650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14654","last_updated":"2023-05-24T02:49:43Z","snapshot_observed_at":"2026-07-06T15:32:10.481273Z","submitted_at":"2023-05-24T02:49:43Z","title":"Barkour: Benchmarking Animal-level Agility with Quadruped Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14654","snapshot_observed_at":"2026-08-09T01:04:04.090671Z","title":"Barkour: Bench- marking animal-level agility with quadruped robots,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.090671Z"},"links":{"cited_paper":"/paper/2305.14654","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:a9c68c06c254dcf35a425862f87f75aaa68f21e315aeb81f6a77a8274431d1c8","observation_id":"f9dd4e5d-dff2-4841-aa77-11be2ec4c5b2","resolution":{"observed_at":"2026-08-09T01:04:04.090671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.01674","last_updated":"2021-10-25T17:59:58Z","snapshot_observed_at":"2026-07-06T12:04:39.450849Z","submitted_at":"2021-10-25T17:59:58Z","title":"Minimizing Energy Consumption Leads to the Emergence of Gaits in Legged Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.01674","snapshot_observed_at":"2026-08-09T01:04:04.093592Z","title":"Minimizing energy consump- tion leads to the emergence of gaits in legged robots,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.093592Z"},"links":{"cited_paper":"/paper/2111.01674","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:21fec448c5cfe96a48fbca5f2720290d83917015d395a2698a223a461b44e277","observation_id":"ae7638f6-b09f-4d7b-9d81-b13095502303","resolution":{"observed_at":"2026-08-09T01:04:04.093592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.442581Z","title":"Fast and efficient locomotion via learned gait transitions,","venue":null,"work_id":"d14b17d3-8c8e-406f-853b-b25fc2035c65","year":2022},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.096516Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:c1e68f1890a9dd3819bd12c1bd03c028cbd1e76be0067abfb0ef2a084e6b2e27","observation_id":"65fc7f5b-293d-440c-aa85-5d35205685b8","resolution":{"observed_at":"2026-08-09T01:04:04.445282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.099122Z","title":"Code as policies: Language model programs for embodied control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.099122Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:df29c16e3074c4fe0d68254e6bb8549c0d090cefd2b91b3da646b4fbdcd47953","observation_id":"24ec8c59-73b2-439e-b7e2-8cffc0b41ec1","resolution":{"observed_at":"2026-08-09T01:04:04.099122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.101740Z","title":"Do as i can, not as i say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.101740Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:e12cf0218fd674475662bce577a03c9d7b5cfa647e96bf04f9c1c0e8bf5bd7e8","observation_id":"21d9a400-f896-46ae-b6a0-0c9723b8bbeb","resolution":{"observed_at":"2026-08-09T01:04:04.101740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.423880Z","title":"Generative expressive robot behaviors using large language models,","venue":null,"work_id":"2cc9f4ae-8a6c-4f5f-8a56-ebfa08c7b701","year":2024},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.104488Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:459b2a6dca1ec2aafc8267a440e010f3d20060e596578e886f09303b000a4728","observation_id":"425c8df5-9d11-49ef-a939-9b06610a7654","resolution":{"observed_at":"2026-08-09T01:04:04.426709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06105","last_updated":"2024-10-18T14:02:07Z","snapshot_observed_at":"2026-08-08T04:02:59.939408Z","submitted_at":"2024-08-12T12:43:46Z","title":"Text2Interaction: Establishing Safe and Preferable Human-Robot Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06105","snapshot_observed_at":"2026-08-09T01:04:04.107067Z","title":"Text2interaction: Establishing safe and preferable human-robot interaction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.107067Z"},"links":{"cited_paper":"/paper/2408.06105","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:9156519d0e32ab8e1712c478f1b071fa106074f39a7f0aca46e4f21b18e56f7e","observation_id":"3519c8d9-9308-441f-abba-0962489ea263","resolution":{"observed_at":"2026-08-09T01:04:04.107067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11450","last_updated":"2024-05-31T17:25:38Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T04:16:24Z","title":"Learning to Learn Faster from Human Feedback with Language Model Predictive Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11450","snapshot_observed_at":"2026-08-09T01:04:04.109915Z","title":"Learning to learn faster from human feedback with language model predictive control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.109915Z"},"links":{"cited_paper":"/paper/2402.11450","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:2d5c8d8175a7136e6ca3da8bee3f13c85dc74e647e334e1c2eeceae46a27a236","observation_id":"c7170756-a754-423d-95b7-0c7413b27345","resolution":{"observed_at":"2026-08-09T01:04:04.109915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.416124Z","title":"Language instructed reinforcement learning for human-ai coordination,","venue":null,"work_id":"98101f9d-7d74-486f-95fd-260b371dce8e","year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.112879Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:37f8a4ffe3877f85e2c67181e6eb4aad62c3ea71b2d15624a0e02e959c0b6e37","observation_id":"ba02c72b-6728-44ef-8118-682170279fd8","resolution":{"observed_at":"2026-08-09T01:04:04.418886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-09T01:04:04.115081Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.115081Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:059e679136323e3e80f16f8a9f620a86cb52c7f647ef694ccfe189d81229075f","observation_id":"19ba90b6-35f8-4d14-996f-9b0f03fd7e62","resolution":{"observed_at":"2026-08-09T01:04:04.115081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.408146Z","title":"Learning human objectives from sequences of physical corrections,","venue":null,"work_id":"5e59af98-1f95-46ba-ab1b-b09fe9ad95ea","year":2021},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.117681Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:ac1f3549837acb6052406438990b3a063d38bd98caeb3c1ebbedee747a18e2bf","observation_id":"cfce0453-4214-4ed9-8f30-82ccf5d2a35a","resolution":{"observed_at":"2026-08-09T01:04:04.410955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.400151Z","title":"Interactively shaping agents via human reinforcement: The tamer framework,","venue":null,"work_id":"fffc8bbc-314d-4aaf-b1f0-e8dcc98741de","year":2009},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.119945Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:3dfb57dea0f4728f96e2ad135e9fda19f255a4a3669ce2109f00880bff2d8548","observation_id":"d51c9db1-cb4e-458a-b2b7-0072325c16e5","resolution":{"observed_at":"2026-08-09T01:04:04.402901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.392396Z","title":"Learning multimodal rewards from rankings,","venue":null,"work_id":"2fadf03e-7f24-45df-b3b1-56260b92496e","year":2022},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.122216Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:1b19f42974e5bbeae3b8c54a75b9f8074cccc20ed03e6a7d5bf63568cd989658","observation_id":"89db36bf-8add-4e6b-a911-0bbc2542b9d6","resolution":{"observed_at":"2026-08-09T01:04:04.395402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.124561Z","title":"Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.124561Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:f67525b0d42efba3b0c4f727b81f203323799c9c411a08da503d878a30e84bca","observation_id":"2fa5e376-b293-42ee-a8ec-e5ca97fd3662","resolution":{"observed_at":"2026-08-09T01:04:04.124561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.379952Z","title":"Sadigh, A","venue":null,"work_id":"908433f3-82c1-4a06-81ce-4a2811cbe614","year":2017},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.127091Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:ed3663b9780a8261999d3b0695d7af93464400de88583692ecb89a8cde3db7f1","observation_id":"c5a44fc6-fb89-4297-93ad-68c6bff49fa4","resolution":{"observed_at":"2026-08-09T01:04:04.382482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-09T01:04:04.129314Z","title":"Fine-tuning language models from human preferences. arxiv 2019,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.129314Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:0259686d79023b365a0489d01835f7461c753dce3b777ee532216d03d6116a26","observation_id":"940e35dc-0d03-4f4d-9fe6-32276b1a422b","resolution":{"observed_at":"2026-08-09T01:04:04.129314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.371395Z","title":"Preference-conditioned language- guided abstraction,","venue":null,"work_id":"dbe551d4-fc95-454e-974e-137e8e56b41c","year":2024},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.131784Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:9c51149769787104b95591d2f11d61212ad69392147563fee87f6a401467d8d0","observation_id":"3d1b2b3c-9d17-4128-8b5e-f31e0f16c049","resolution":{"observed_at":"2026-08-09T01:04:04.374581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07207","last_updated":"2024-12-20T01:08:20Z","snapshot_observed_at":"2026-08-04T06:50:49.835619Z","submitted_at":"2024-12-10T05:55:14Z","title":"MAPLE: A Framework for Active Preference Learning Guided by Large Language Models","version":2},"cited_work":{"arxiv_id":"2412.07207","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.07207","snapshot_observed_at":"2026-08-09T01:04:04.231836Z","title":"MAPLE: A Framework for Active Preference Learning Guided by Large Language Models","venue":"cs.LG","work_id":"51c83990-ae6c-4ccb-bad3-bb3de9b2be4d","year":2024},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.134254Z"},"links":{"cited_paper":"/paper/2412.07207","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:841f46779f5d49b645d879e5143bfe9a20b5581ffffb0610c0d8120a9af7abac","observation_id":"9466e122-8789-4dcf-bc52-52526e0b088e","resolution":{"observed_at":"2026-08-09T01:04:04.236834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.362399Z","title":"Batch active preference-based learning of reward functions,","venue":null,"work_id":"fcccc15a-3013-4086-96d8-ba6d280e93c5","year":2018},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.136933Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:e96dee210fa3145087f743428b1142e8d4877f37a43f4fd1748e7170d46da926","observation_id":"d4789680-6288-45d6-b030-618b320d2ccc","resolution":{"observed_at":"2026-08-09T01:04:04.365667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17233","last_updated":"2025-04-03T08:27:46Z","snapshot_observed_at":"2026-08-01T16:39:40.651695Z","submitted_at":"2024-10-22T17:53:34Z","title":"ICPL: Few-shot In-context Preference Learning via LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17233","snapshot_observed_at":"2026-08-09T01:04:04.139176Z","title":"Few-shot in-context preference learning using large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.139176Z"},"links":{"cited_paper":"/paper/2410.17233","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:4f53f433bccc32200ce388d78744fe636bebb0c4c710bc72f3cbc052a5093061","observation_id":"35ac569d-eb5e-48ca-be22-58e922b18a07","resolution":{"observed_at":"2026-08-09T01:04:04.139176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03026","last_updated":"2021-11-04T17:32:06Z","snapshot_observed_at":"2026-07-06T12:05:32.449744Z","submitted_at":"2021-11-04T17:32:06Z","title":"B-Pref: Benchmarking Preference-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03026","snapshot_observed_at":"2026-08-09T01:04:04.141508Z","title":"B-pref: Bench- marking preference-based reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.141508Z"},"links":{"cited_paper":"/paper/2111.03026","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:f30b7d09baead7845444d2c350f52d403e452970a4392f6efae76e6e87a762d4","observation_id":"36d0384a-c41d-4b7b-8547-6004e5a37dce","resolution":{"observed_at":"2026-08-09T01:04:04.141508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.353444Z","title":"A bayesian approach for policy learning from trajectory preference queries,","venue":null,"work_id":"58546553-8243-411a-b0b1-dbbfd5204997","year":2012},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.143870Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:491ec6bf0685dc66038ca05785e5630b116c017dd8db2f0ca960ed4ec0389ce4","observation_id":"d86b9fff-eb9e-41d3-9310-4f373a8b727b","resolution":{"observed_at":"2026-08-09T01:04:04.356690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.146109Z","title":"Rank analysis of incomplete block designs: I. the method of paired comparisons,","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.146109Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:a051f1eec9211849248ea86610b336e0fe9601d021509ed334859b5ce078e35a","observation_id":"6df6945f-7cda-4f7e-a133-e155c9af6660","resolution":{"observed_at":"2026-08-09T01:04:04.146109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.338752Z","title":"Safe imitation learning via fast bayesian reward inference from preferences,","venue":null,"work_id":"724a177c-b774-498f-a3cd-9ded78f6943a","year":2020},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.148428Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:d336fe06e4bb033255f168aa7e9f7fb087594b9a94908dae8d61a3b0c5ae04a4","observation_id":"5c02d76a-77b5-477f-8028-75d4157eff5d","resolution":{"observed_at":"2026-08-09T01:04:04.342407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10050","last_updated":"2022-03-18T16:50:38Z","snapshot_observed_at":"2026-07-06T12:49:40.338344Z","submitted_at":"2022-03-18T16:50:38Z","title":"SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10050","snapshot_observed_at":"2026-08-09T01:04:04.151124Z","title":"Surf: Semi-supervised reward learning with data augmentation for feedback- efficient preference-based reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.151124Z"},"links":{"cited_paper":"/paper/2203.10050","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:a82996b8d4350c24b227da41daf0a40d18995c4a699b3477b0c52f74140e4430","observation_id":"27c8227b-bf54-4de5-8750-a1e287986fcf","resolution":{"observed_at":"2026-08-09T01:04:04.151124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-09T01:04:04.153622Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.153622Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:36642db57540f18c59a6fad0b64372ea193dfb6082626e6b5c013b720e3bb68e","observation_id":"7e3833e5-4445-4fa7-8fc6-4177bf36919c","resolution":{"observed_at":"2026-08-09T01:04:04.153622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T01:04:04.156322Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.156322Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:5d2c9982de606f42de4153bb3873ad975946be331538cdac70c42ea582ac8062","observation_id":"163a41e4-fc20-47aa-9ab8-c13d796a35c5","resolution":{"observed_at":"2026-08-09T01:04:04.156322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T01:04:04.158705Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.158705Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:34c18515b904c9266b34ff55f9a56730638236397a6a9e1c287794c51b772b65","observation_id":"a1d407fa-3b44-4c3b-a192-a1c49da205f4","resolution":{"observed_at":"2026-08-09T01:04:04.158705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T01:04:04.161124Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.161124Z"},"links":{"citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:c397194bf9ce5bf5f4382304791603e28bde3e8ca176ebbff5f13b0ca8c5b8cc","observation_id":"6ac6859e-a717-431a-9250-38252ec7df62","resolution":{"observed_at":"2026-08-09T01:04:04.161124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2502.03717."}