Pith. sign in

Paper Citation Record · LEDGER

Learning More from Less: Reinforcement Learning from Hindsight

As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.09042.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.09042 v1

Coverage vector

measured 35 of 35 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-13T00:46:28.503923Z

measured 35 of 35 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

35 of 35 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved35
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f00161e5-b403-4de4-9476-b508fe2ac1df · outbound

This paper cites an unresolved cited work.

Learning More from Less: Reinforcement Learning from Hindsight Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:bea0c9ad7d08ca1b3fcc90c6b09cd5c664c9ceedcb9481718b2eda568e764ff4

Observation 843f21d0-ec44-4fd1-bd04-68ca84bb0645 · outbound

This paper cites Ouyang, J.

Learning More from Less: Reinforcement Learning from Hindsight Ouyang, J

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:90ca3be5b6dbed2e8688d119758a9a9ee6a54fe5465f7b5bacf48c2c0e923979

Observation 8103bb86-da10-4f95-88b2-7d516f4dd7d0 · outbound

This paper cites GPT-4 Technical Report.

Learning More from Less: Reinforcement Learning from Hindsight GPT-4 Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:724c0f318055ed37ad5a83a1d82f0e3cacc0609c364fddc7e1d7c44a7c676cc9

Observation a17b14ad-54de-4652-81fa-ca65d5896356 · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

Learning More from Less: Reinforcement Learning from Hindsight $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:17db36413fab48fd994e5ec57edab332a6fb555680c0d2138dc7dec63bfd05be

Observation de8fcbd5-e2dd-4a71-93e2-d42332420541 · outbound

This paper cites Bellemare, S.

Learning More from Less: Reinforcement Learning from Hindsight Bellemare, S

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:61e236c782a8912213ef83e655a8009382af2511b0f067bed3bd79b15984d03f

Observation dcbeed02-f257-495e-af2e-e7ef0a1bb26d · outbound

This paper cites Pathak, P.

Learning More from Less: Reinforcement Learning from Hindsight Pathak, P

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:1b8282ebea6463372bc7e9a9229d62333560ce947bd0fa06deed7f5626a27009

Observation 2a35f4df-face-414b-9e7c-342ac8ba2f85 · outbound

This paper cites Andrychowicz, F.

Learning More from Less: Reinforcement Learning from Hindsight Andrychowicz, F

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:be4d5b9db8a641f0af2a44dbf76ecf708fec73a75a28213a34da62bcdfd604de

Observation f27f1afe-7513-44b5-b258-bb857c5a39c3 · outbound

This paper cites Hindsight policy gradients.

Learning More from Less: Reinforcement Learning from Hindsight Hindsight policy gradients

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:28e154e0cccb52387957faa6d4ba2b7456312375820c52d46354c3cd2c7bd95c

Observation d9897961-0b38-4890-950c-2e8118b9f40b · outbound

This paper cites Pathak, P.

Learning More from Less: Reinforcement Learning from Hindsight Pathak, P

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:a2a96bdcbf2290fc78ad5705eed13430b1c494d5a4dd72b58199ecd3f1b8c673

Observation c7296443-a23c-4cb1-8123-e4d03618e392 · outbound

This paper cites Eysenbach, T.

Learning More from Less: Reinforcement Learning from Hindsight Eysenbach, T

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:01060b5751b2228b9e2f4838d965b03df2863deb95250f29b34eb492d7ea1ae0

Observation 62dfe183-d33d-4202-8e52-d14672b9a8cf · outbound

This paper cites Sahni, T.

Learning More from Less: Reinforcement Learning from Hindsight Sahni, T

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:ed908d4807c9b48a7f1f079b88dc19b7e2475195bcbbdf770245cb3718cecbea

Observation 36d24651-2d1f-4ca4-8a93-acf8adbf4371 · outbound

This paper cites Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons.

Learning More from Less: Reinforcement Learning from Hindsight Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:da43430d90090d87d144b071bcc89dc01e314e045615127b84894feb8bbf1f9a

Observation c1aa68f0-f66b-4a27-9754-ab748f90b9e8 · outbound

This paper cites Qwen2.5-VL Technical Report.

Learning More from Less: Reinforcement Learning from Hindsight Qwen2.5-VL Technical Report

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:ce54c0539091e0cc8eaec32a56e65c186036cae561917d5f1f8046bdcbdbd6cd

Observation 6d0eb24d-430f-4a63-9ba3-99c081bbdb3a · outbound

This paper cites LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization.

Learning More from Less: Reinforcement Learning from Hindsight LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:6cf21607dd3b8ed4d3b7e79e861a32c0228cec0eca58d5228b45622a1c77be84

Observation 43ae3d0d-4a67-4b72-bfa8-56d0de804332 · outbound

This paper cites Autonomous Improvement of Instruction Following Skills via Foundation Models.

Learning More from Less: Reinforcement Learning from Hindsight Autonomous Improvement of Instruction Following Skills via Foundation Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:d83a18146e886650fa16594d963c054a801dfce998d7d8629946be1c40e8d116

Observation 0e39e0b9-01c2-4be0-9674-7f933d8fded8 · outbound

This paper cites Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models.

Learning More from Less: Reinforcement Learning from Hindsight Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:d0aee218f980f3baa48f50bb03d7e01736d4deb430dee54ecf4629514a4e56ec

Observation e4238627-2b95-455f-8382-181629a0ca7d · outbound

This paper cites an unresolved cited work.

Learning More from Less: Reinforcement Learning from Hindsight Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:027c1f408eb3a43a29a702abfde087ebb07efdfe8147c46214bea1a0aaf17cca

Observation a1f74b4f-9c0e-4037-acb4-f8b45d13a328 · outbound

This paper cites VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training.

Learning More from Less: Reinforcement Learning from Hindsight VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:45093a273567a7b05860cf11c22c23a915651147440211d12570c9306191bbf7

Observation 0c0f97db-bee2-4f1f-837b-37186fefb61d · outbound

This paper cites an unresolved cited work.

Learning More from Less: Reinforcement Learning from Hindsight Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:5135adecf19c0484e693a529553b7109233a280e1c07470e04b6f01a618f0112

Observation 0e69b5bc-d6f4-4c2c-8eb8-bf1f51bfefac · outbound

This paper cites an unresolved cited work.

Learning More from Less: Reinforcement Learning from Hindsight Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:aea4fd7417e09a084b9cb8807218de9be98fb71f841ff41e3147cc89772022af

Observation 6c41ceef-7621-49ea-aace-af2755895afc · outbound

This paper cites an unresolved cited work.

Learning More from Less: Reinforcement Learning from Hindsight Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:86def5e11e69fe2d51d14d6c225759e15e6c414d23d15b22ace73df37ec3dc25

Observation aaa22542-473a-4093-a51c-0125399e5ac2 · outbound

This paper cites RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback.

Learning More from Less: Reinforcement Learning from Hindsight RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:30d575e50afa80fa2fd3c8decc8bb74b2e15860605ebf4a6e2dd16b032859485

Observation 794d7590-b709-4e18-a185-63f9ad7ae119 · outbound

This paper cites Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models.

Learning More from Less: Reinforcement Learning from Hindsight Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:244acae38b91675c65942fa3f5a1759d4f6b4363ea3b93534be52364e9c896fc

Observation e90da314-6691-4ee4-b5b0-cd6728142487 · outbound

This paper cites Zhang, K.

Learning More from Less: Reinforcement Learning from Hindsight Zhang, K

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:a405b75eb332c3ca986f10d67869e9571180f1189b309baf18727eee84b5580f

Observation 19241193-ec53-4c31-aa8b-0e4de2d803c8 · outbound

This paper cites CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models.

Learning More from Less: Reinforcement Learning from Hindsight CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:733af8da76a8c812f90ffefb55d014767644fd1e8474621f46d657808b8183c2

Observation 64dedc25-74bc-476b-8001-6c1344634fca · outbound

This paper cites an unresolved cited work.

Learning More from Less: Reinforcement Learning from Hindsight Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:7887cd3f0aafdc43a422bb30af679f07b5e5dcfcf6ed65a3cafcb22db5f3255a

Observation ff983015-b822-4591-a033-a53a3fbe89de · outbound

This paper cites an unresolved cited work.

Learning More from Less: Reinforcement Learning from Hindsight Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:5e02ddf4ea947eaab801bd69f042f403c743962c50996bc8ab070a10fb05d989

Observation bea7da46-8bc4-4d26-b9db-03bbbde43f2c · outbound

This paper cites OpenVLA: An Open-Source Vision-Language-Action Model.

Learning More from Less: Reinforcement Learning from Hindsight OpenVLA: An Open-Source Vision-Language-Action Model

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:98e25789aace96d1ca7dffc382c39d7ea4d6c674be10f9de77390d903ebef50c

Observation c5b60470-9163-48a8-81cc-8bffad55ac2c · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Learning More from Less: Reinforcement Learning from Hindsight DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:6a9d24dc9265f014472ac2f79e9b9ed14077f8c7f76fef649e1f4b057dc2574b

Observation 15b09afd-8d72-4ae7-8715-efc0d9995fac · outbound

This paper cites an unresolved cited work.

Learning More from Less: Reinforcement Learning from Hindsight Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:4b24a697fbc005edc7ec1c4d4cdb3862776b56058611035f403ebf5099b968e4

Observation b798d2e7-5db2-4ea2-8aef-2ace63374622 · outbound

This paper cites an unresolved cited work.

Learning More from Less: Reinforcement Learning from Hindsight Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:1097847af16aa59dc7c4d07f1bb766da32e3777d44710ec1ce0da1f30a56e13c

Observation 27992df7-1055-4f59-ae4e-f7eacf1eec31 · outbound

This paper cites GR00T N1: An Open Foundation Model for Generalist Humanoid Robots.

Learning More from Less: Reinforcement Learning from Hindsight GR00T N1: An Open Foundation Model for Generalist Humanoid Robots

Reference 32

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:914f0a79b021bc6471b5f061ffe5e82df78e805572dc1cf58617fb95d7d95019

Observation 0e7a3819-3aa5-4e81-9e1f-b57d85585d0a · outbound

This paper cites Nothing” option that allows the relabeler to identify uninteresting trajectories, which are then filtered out during training, and (3) an “unsure.

Learning More from Less: Reinforcement Learning from Hindsight Nothing” option that allows the relabeler to identify uninteresting trajectories, which are then filtered out during training, and (3) an “unsure

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:ffbf26beb19d9f8e9e9a1b77bf158f2b9118309c450c22f775775ab4ea43171e

Observation ff1f4836-c156-4ca1-a515-42b0589dc212 · outbound

This paper cites pick up the mug and place it in the microwave.

Learning More from Less: Reinforcement Learning from Hindsight pick up the mug and place it in the microwave

Reference 34

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:4ca085811c2e9034b0482f51513b399cf120f915f2713be5275507114cfbbea2

Observation 2b48d3e7-308a-484a-b1ab-79e69e452a08 · outbound

This paper cites pick up the tape.

Learning More from Less: Reinforcement Learning from Hindsight pick up the tape

Reference 35

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:e99db2bf6aeddb51291ed8e5a046621664ee026d083eb2fe43452675b343b00d

Pith citing papers

No inbound Pith citation observations are available.