{"as_of":"2026-08-09T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a53189f39781781f8a4942b8d2d76c70c001772d48263fdbfda611b346601b3","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:10:14.710517Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19767/citation-record","integrity":"/paper/2505.19767/integrity","json":"/paper/2505.19767/citation-record.json","paper":"/paper/2505.19767"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:10:10.441248Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:10.441248Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:4e3fa93ff03b66a0bc91eebd91536192e8a93a461d4b66cdeb47828d1609645e","observation_id":"84d7d996-2113-49df-b533-066e031b2686","resolution":{"observed_at":"2026-08-07T14:10:10.441248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:10.514798Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:10.514798Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:c46a5fb7b0d4027329ab8d5d3b7b2e5427a98e0183517e7fccc7c98f73c1371c","observation_id":"0cefab2a-604e-4025-b595-1d9023d64e15","resolution":{"observed_at":"2026-08-07T14:10:10.514798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T14:10:10.646523Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:10.646523Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:461bae5d649d02861a943b278b691ba58b6222d146b1da4911794b144d6fc1d7","observation_id":"25d58bb7-f8a8-4b61-b200-6d99f679d5d5","resolution":{"observed_at":"2026-08-07T14:10:10.646523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T14:10:10.773196Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:10.773196Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:b4db08ec41b0d41bbd5317413314cc0d38afe8811255ee1992b2d409c6777836","observation_id":"26cd55c1-25b9-4c35-89ce-385b705f08d3","resolution":{"observed_at":"2026-08-07T14:10:10.773196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.944275Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":"ccc35549-2d90-40bc-a5e7-8e1309662685","year":2023},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:10.884953Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:2624ab3bbf2c08e506674109427f6838c01d3c7405976ae15190676800baa6ce","observation_id":"10297ea3-b1a0-45fb-8768-1687b41cc52f","resolution":{"observed_at":"2026-08-07T14:10:17.989060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-07T14:10:11.005810Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:11.005810Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:dbad77fcfb50d3d996d81ed31be01d13fac665acef18ac1ed3e662436d0d439e","observation_id":"ca446ca0-4380-40a2-b952-0367c84dc081","resolution":{"observed_at":"2026-08-07T14:10:11.005810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09016","last_updated":"2024-10-16T08:38:07Z","snapshot_observed_at":"2026-07-06T19:15:08.847236Z","submitted_at":"2024-09-13T17:45:07Z","title":"Closed-Loop Visuomotor Control with Generative Expectation for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09016","snapshot_observed_at":"2026-08-07T14:10:11.153669Z","title":"Closed-loop visuomotor control with generative expectation for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:11.153669Z"},"links":{"cited_paper":"/paper/2409.09016","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:428da846654c30e45334212a5a4a273d2cc153eb807842700c6c445029c9726f","observation_id":"2f5a51c2-fe4b-4098-a172-7fc68a980344","resolution":{"observed_at":"2026-08-07T14:10:11.153669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-07T14:10:11.309613Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:11.309613Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:7dc0669919edc183db075a01bf735afd766b2a3e0698ccfe943797446674de87","observation_id":"32791648-9a9f-474d-a85c-0e52b1a44714","resolution":{"observed_at":"2026-08-07T14:10:11.309613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05450","last_updated":"2025-04-14T04:53:32Z","snapshot_observed_at":"2026-08-08T19:14:06.157767Z","submitted_at":"2025-02-08T05:01:17Z","title":"ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05450","snapshot_observed_at":"2026-08-07T14:10:11.420265Z","title":"Con- rft: A reinforced fine-tuning method for vla models via consistency policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:11.420265Z"},"links":{"cited_paper":"/paper/2502.05450","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:33cc7d6b37f2691bf1776a17b590ac05d3a46dc33e037a98f310bbea189cad64","observation_id":"d2a96252-7877-47d8-aade-4f0386510bf9","resolution":{"observed_at":"2026-08-07T14:10:11.420265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.789491Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"0f3b177d-159b-48c2-a8d2-e7f2a3616847","year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:11.532371Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:4f63d256f82c2681e7c54315b2abd573ed23eeb0b66724c0d495e4f4b287a692","observation_id":"132f271d-e618-43d2-8cfd-7213a697e4ad","resolution":{"observed_at":"2026-08-07T14:10:17.849191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:10:11.616045Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:11.616045Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:c0f86bf68ad5468497a7038b8234b85bac3e5727c62b8505c2988b769069adcb","observation_id":"deb26e8c-db32-4229-b4a8-e404067fa895","resolution":{"observed_at":"2026-08-07T14:10:11.616045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16664","last_updated":"2025-01-28T02:53:48Z","snapshot_observed_at":"2026-08-06T21:08:23.353594Z","submitted_at":"2025-01-28T02:53:48Z","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16664","snapshot_observed_at":"2026-08-07T14:10:11.693083Z","title":"Improving vision-language-action model with online reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:11.693083Z"},"links":{"cited_paper":"/paper/2501.16664","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:3b7ecfc80a7cdc468390d9800554e77e49c1c022a249563e1ef716347415648d","observation_id":"a27cf8f7-cea0-43b4-b7c8-1ec0799ea99a","resolution":{"observed_at":"2026-08-07T14:10:11.693083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15959","last_updated":"2025-03-23T05:03:59Z","snapshot_observed_at":"2026-07-06T19:37:03.013065Z","submitted_at":"2024-10-21T12:43:54Z","title":"Diffusion Transformer Policy","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15959","snapshot_observed_at":"2026-08-07T14:10:11.796953Z","title":"Diffusion transformer policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:11.796953Z"},"links":{"cited_paper":"/paper/2410.15959","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:e850814f06bcf84854f6913d49235c9497063095b9b7a557a7d7cf8ceeccc2d7","observation_id":"9601e9e1-6c59-4e3b-982d-2d31622ec4e8","resolution":{"observed_at":"2026-08-07T14:10:11.796953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16578","last_updated":"2024-09-30T21:40:17Z","snapshot_observed_at":"2026-07-06T19:21:33.180652Z","submitted_at":"2024-09-25T03:15:17Z","title":"FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16578","snapshot_observed_at":"2026-08-07T14:10:11.936652Z","title":"Flare: Achieving masterful and adaptive robot policies with large-scale reinforcement learning fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:11.936652Z"},"links":{"cited_paper":"/paper/2409.16578","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:3d4b2316500057b7089d9bb49563a717d6fb7ad5a0b86d45267157579a57bad9","observation_id":"595a48b4-583f-4508-961f-4d32ac9e6a73","resolution":{"observed_at":"2026-08-07T14:10:11.936652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-07T02:37:30.672574Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-07T14:10:12.043431Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.043431Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:b5f7b9c1349bbea3be6995c440e17b19d36d46bfc573fe859756e31d92179f8a","observation_id":"f5ed7ac3-7079-4303-a82c-676d6c11c2f8","resolution":{"observed_at":"2026-08-07T14:10:12.043431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-07T14:10:12.160489Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.160489Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:05c1c68b35395b412e4ab6d48e4a35aa0a1ccdc06d16a8850c80d484d5f631c1","observation_id":"48acf3a8-a8c5-495d-bb47-c09580192076","resolution":{"observed_at":"2026-08-07T14:10:12.160489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-07T17:39:03.240589Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-07T14:10:12.271482Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.271482Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:578d221103d4decc295909989ea0c92435f1b4347cfe01f132a5517b96be6144","observation_id":"f5da6f77-aa0a-4f7a-aff8-73cba822e6c9","resolution":{"observed_at":"2026-08-07T14:10:12.271482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.606587Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"6893df2d-b91e-47bd-8c2b-27adc7b91625","year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.340763Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:68c08f67cfa69af1c467864b84c9521ceb7014aa708d4e5a4967a92373fb5eee","observation_id":"f2593529-d885-4a0c-88e6-041bbb5838f6","resolution":{"observed_at":"2026-08-07T14:10:17.705508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-07T14:10:12.407220Z","title":"3d diffuser actor: Policy diffusion with 3d scene representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.407220Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:a3c830686392b5b5084374593d0f7a4b17b1a7fe627b7ddedcf4c94c07b3cf7c","observation_id":"fba6cf7e-a5ab-4ff0-bad7-344f4cb4c0e4","resolution":{"observed_at":"2026-08-07T14:10:12.407220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T14:10:12.477348Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.477348Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:834beccd84ac902ef41f1dfa39f77b2f61cb167de91a5721ad7aba68272181ca","observation_id":"170d07f2-10c9-4a20-b293-700f65812c2f","resolution":{"observed_at":"2026-08-07T14:10:12.477348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.441918Z","title":"Gr-mg: Leveraging partially-annotated data via multi-modal goal-conditioned policy","venue":null,"work_id":"25b445f4-a8ee-4cab-bf2e-22703b51e25a","year":2025},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.561753Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:9353e251f6f4bafa85f9e2605b04c7104426498aaa0674767dc9732499f06d46","observation_id":"662bd5c9-a28e-4bb5-9d50-0f00bdfe42f0","resolution":{"observed_at":"2026-08-07T14:10:17.499237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.317269Z","title":"Manipllm: Embodied multimodal large language model for object-centric robotic manipulation","venue":null,"work_id":"7c9d3d0c-27b9-4438-81ba-b9be25ab4a20","year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.646019Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:1b57518c5c3a943f903878d1437d191dd36a84ee27721a58f9504ffef046a10e","observation_id":"829083fe-0ec1-4bfc-8589-afd904549977","resolution":{"observed_at":"2026-08-07T14:10:17.366697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.151032Z","title":"Visual instruction tuning","venue":null,"work_id":"4005a041-668e-4212-b425-dc297ff7050a","year":2023},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.702322Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:7216533bf06029743cabe1e95b8ac530960498e1cb2fa4863513e03fd8aa8783","observation_id":"4cb70d16-4877-422c-80bd-9af4a09c4f5d","resolution":{"observed_at":"2026-08-07T14:10:17.205490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T14:10:12.795591Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.795591Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:8b332d088c8c4cb331a8078d492cb2ff63336519b10965538a30603ba4b3e831","observation_id":"a091da66-7b2d-410c-bd73-9b4b9b49537e","resolution":{"observed_at":"2026-08-07T14:10:12.795591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-06T16:04:56.349386Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-07T14:10:12.871855Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.871855Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:b172333f2c8e6f54ea015f4fcf2741a348ff7710c24f2f54568f4d5c9609fa6e","observation_id":"8b0aca1d-5856-4d18-8f72-b1d6733a5134","resolution":{"observed_at":"2026-08-07T14:10:12.871855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-08T14:18:42.353169Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-07T14:10:12.939491Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:12.939491Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:acacbd09f3912bfd2a8283a6fe6819e767463c6955c1bafca5932ca87a39784b","observation_id":"04b7eaec-cacb-4cbb-85b3-b00ad11efe56","resolution":{"observed_at":"2026-08-07T14:10:12.939491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-07T14:10:13.032121Z","title":"A survey on vision- language-action models for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.032121Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:4c753f4148f37e873949c67262292e0d1c1444bff73cf566815e264c0e6fd046","observation_id":"718535f4-56c7-42e8-9b0a-1fe475137173","resolution":{"observed_at":"2026-08-07T14:10:13.032121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00171","last_updated":"2025-03-25T09:43:25Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-29T17:36:03Z","title":"RoboMatrix: A Skill-centric Hierarchical Framework for Scalable Robot Task Planning and Execution in Open-World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00171","snapshot_observed_at":"2026-08-07T14:10:13.120606Z","title":"Robomatrix: A skill-centric hierarchical framework for scalable robot task planning and execution in open-world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.120606Z"},"links":{"cited_paper":"/paper/2412.00171","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:4ebfc5f3222ee9891168a258ec1a1e756c7fc4fccb95306d4a119d288a2134d8","observation_id":"dbe37bec-c507-46d9-954d-854dce1def88","resolution":{"observed_at":"2026-08-07T14:10:13.120606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:17.007881Z","title":"Genrl: Multimodal-foundation world models for generalization in embodied agents.Neural Information Processing Systems (NeurIPS), 2024","venue":null,"work_id":"b7604f08-c4cb-4004-830a-324b2eb02c66","year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.226413Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:9f734fb77e070154ccf23465b857452662106858e97c96ff7f7b8613c791de7a","observation_id":"fd506478-a35b-4b75-8882-5beed27e6043","resolution":{"observed_at":"2026-08-07T14:10:17.076094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.858223Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks","venue":null,"work_id":"313378c9-6221-498e-a262-8ad1b31c9c0a","year":2022},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.313734Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:50ac1f5147b246d38cb9d4b4a95f37d9244ccb6d9cb88fc8334de24f2504bc31","observation_id":"a926ba9d-a3ac-48e9-a991-a4c0054f2623","resolution":{"observed_at":"2026-08-07T14:10:16.922107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.733757Z","title":"Policy invariance under reward transfor- mations: Theory and application to reward shaping","venue":null,"work_id":"a3e43460-b7a4-4358-8ad0-5d1a137b207b","year":1999},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.386140Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:389d36a3cda9dc331a4fd552f8dcd83979e8b023d7361c19f9fb0e5af41082ab","observation_id":"c1af770b-cf65-43ff-bb77-4e464b3dd087","resolution":{"observed_at":"2026-08-07T14:10:16.789038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.544864Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"8e4fc7ba-229d-4383-b5da-55103cb2f128","year":2022},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.451288Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:e3a98a3b8511aa6226525e777d8e2d8343f5a3eba1d554aec94aadbb8391da11","observation_id":"789a1e12-6441-4c4f-8265-60bea975c1c6","resolution":{"observed_at":"2026-08-07T14:10:16.634960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.382574Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"e40fe8f2-7f01-44f4-9a6c-422179449749","year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.533614Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:4a25cf8af70c757f543800ed6140126266b4fb6d9f9a5ff6c6d8747104b47bb2","observation_id":"44169c1d-9b73-4100-9a24-cad41620917f","resolution":{"observed_at":"2026-08-07T14:10:16.458385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.230131Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"7e4e2fa1-510c-4968-b8b3-7491a2e3e686","year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.603390Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:d8b2b8154abe34876538c55e3e4f6b8e8b6c956fe74bf23ed30c8fcd0173c88b","observation_id":"cfce2e45-5d38-48af-a08b-d652d6b928e6","resolution":{"observed_at":"2026-08-07T14:10:16.298773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-07T14:10:13.679384Z","title":"Diffusion policy policy optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.679384Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:8c6997959a4d44d55652ef146eec75d4628fcb280d2ff6d35660eb8cf100e8c7","observation_id":"a51e8918-7449-4f2a-9cc9-b6d474515a9d","resolution":{"observed_at":"2026-08-07T14:10:13.679384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-08T15:29:26.223468Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T14:10:13.757826Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.757826Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:38ad925d5e40ff8da01ae32f29f4d5599093d8bfd0c2246d0127fd112195ab05","observation_id":"82e608ab-dec4-43f3-b186-d49f41d56a23","resolution":{"observed_at":"2026-08-07T14:10:13.757826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:10:13.833341Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.833341Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:7ee745cab4a9bf605c8f48f0f00a0af624323d87bb83346b2347c10291aeb913","observation_id":"25990dc4-a7e6-43a9-a577-72cf3780da04","resolution":{"observed_at":"2026-08-07T14:10:13.833341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:10:13.912863Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:13.912863Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:6785641785363716eb97c9ddc53d0413275662d9361d7d795f3ac0527b496e79","observation_id":"278423af-23a4-4733-9b88-b9827ebb80bc","resolution":{"observed_at":"2026-08-07T14:10:13.912863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:16.106354Z","title":"Large language models as general- izable policies for embodied tasks","venue":null,"work_id":"b5798b83-b11d-47dd-81d5-a5c5a119daef","year":2023},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:14.007026Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:70bea2a3ff88ef8e6a33b42e0cbaaa9076f0cf9dc626c4e5840da2c7410c437f","observation_id":"9fc9c671-1819-4976-bc23-e2e8caef6cd0","resolution":{"observed_at":"2026-08-07T14:10:16.163700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:10:14.083349Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:14.083349Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:9aa04a3649f6f0b544a2aa187c2cac50c15be04b03088ddd119cbd18308db4c7","observation_id":"26c447e8-a739-4411-a434-4c72a1249eed","resolution":{"observed_at":"2026-08-07T14:10:14.083349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-07T14:10:14.171540Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:14.171540Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:b95a8b72fb709efa041845751b7013f665f1e437bcf73a2887c5b3ab6b43182e","observation_id":"f2b7222c-2b51-4f65-ae09-0e8342420b22","resolution":{"observed_at":"2026-08-07T14:10:14.171540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:10:14.238253Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:14.238253Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:c9ed0bfdf9732f5cc6ee3eff2c967c193940852d1995ff5fc6ec6f1f3c9a765c","observation_id":"398732cb-7f57-4aaa-af4b-a73d90fe4d7a","resolution":{"observed_at":"2026-08-07T14:10:14.238253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.959303Z","title":"Reft: Rea- soning with reinforced fine-tuning","venue":null,"work_id":"a89f945f-e547-49cb-8b20-08cf23bfebeb","year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:14.284220Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:e702da2cac955e73288ab9bb576a84663357da43f5f11fa02cd6156bf2e30b8a","observation_id":"f1bad90d-60d1-4953-ba4d-71d0bc6ef7e4","resolution":{"observed_at":"2026-08-07T14:10:16.006898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01848","last_updated":"2023-07-04T17:58:25Z","snapshot_observed_at":"2026-08-06T10:55:32.798065Z","submitted_at":"2023-07-04T17:58:25Z","title":"Embodied Task Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01848","snapshot_observed_at":"2026-08-07T14:10:14.451539Z","title":"Embodied task planning with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:14.451539Z"},"links":{"cited_paper":"/paper/2307.01848","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:7c798b3ba7bc499abbf42070f86df952d0ad17dba03fda346476af5a9c189bae","observation_id":"1dc21c5f-2644-4847-a832-8a11beb6bd49","resolution":{"observed_at":"2026-08-07T14:10:14.451539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:10:14.543919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:14.543919Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:7e6152bd26e49bd8eb6e7a11d0648c7e3679f61c6dfd757475c7f26fc98f62cb","observation_id":"0f1717da-f9b7-49bc-a6e7-40611aea8a24","resolution":{"observed_at":"2026-08-07T14:10:14.543919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.847739Z","title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning","venue":null,"work_id":"03af9c20-9265-4395-bf94-ff030eb98143","year":2024},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:14.623426Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:70c43299a4afb8cb74a0c1df3e2baf0a7f3608805221ba411a4839d175af3e63","observation_id":"19ca6b3e-7f11-4af9-84f2-e563aad0994b","resolution":{"observed_at":"2026-08-07T14:10:15.877510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:10:15.730336Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"043222de-e269-4df2-a366-3a24e4f9ecff","year":2023},"citing_paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:14.710517Z"},"links":{"citing_paper":"/paper/2505.19767"},"observation_digest":"sha256:a5145b52b54b6d0b901c0d0c4d6f710d2cd482a5d162e47066583039e94dd400","observation_id":"0f7a4f8f-8980-45f4-91f8-fbca89ebc6f3","resolution":{"observed_at":"2026-08-07T14:10:15.785766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19767","last_updated":"2025-05-26T09:50:15Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T14:04:30.303953Z","submitted_at":"2025-05-26T09:50:15Z","title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2505.19767."}