{"as_of":"2026-08-23T17:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26f4adc91c4a118a62544cfb80fc73c53ab1446b59c90902e8c683019a6bca09","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:31:55.956455Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-12T16:45:47.260990Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-17T18:06:30.205840Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.260990Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:d4ef27c3cd15edab60ac67184f953c12680be839160a3664ae7d9cdb2c5672b0","observation_id":"cc57d9c5-0e98-4c8f-95e1-cf4e4564c3f0","resolution":{"observed_at":"2026-08-12T16:45:47.260990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-12T12:33:07.169030Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17135","last_updated":"2024-11-26T06:04:10Z","snapshot_observed_at":"2026-08-19T12:54:27.705808Z","submitted_at":"2024-11-26T06:04:10Z","title":"LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T12:33:07.169030Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2411.17135"},"observation_digest":"sha256:17b3c9f620435d31b00dad36a1a019674d64efcfb82f4618794d267845125d5d","observation_id":"7face66c-8094-4861-8bb5-e0511b7b31ba","resolution":{"observed_at":"2026-08-12T12:33:07.169030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-12T11:57:03.861532Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17636","last_updated":"2025-08-25T06:11:33Z","snapshot_observed_at":"2026-08-14T03:03:12.847317Z","submitted_at":"2024-11-26T17:53:44Z","title":"MALMM: Multi-Agent Large Language Models for Zero-Shot Robotics Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:57:03.861532Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2411.17636"},"observation_digest":"sha256:c699047f11d712883c589c616008fa9ea449b5c169f8def4d65dfbe3e81071cc","observation_id":"e923c4c4-e55c-4e44-b176-e626888b8f78","resolution":{"observed_at":"2026-08-12T11:57:03.861532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-11T20:25:14.989517Z","title":"Rl-vlm-f: Rein- forcement learning from vision language foundation model feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05818","last_updated":"2025-03-24T23:22:02Z","snapshot_observed_at":"2026-08-13T10:08:49.044831Z","submitted_at":"2024-12-08T05:28:08Z","title":"SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T20:25:14.989517Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2412.05818"},"observation_digest":"sha256:b3c173bf13cd6ebfa7f6fc6dea2956eff5a99945215e55d299880120eb224066","observation_id":"386c3901-3ef0-45c6-8a8e-f23fb05974a4","resolution":{"observed_at":"2026-08-11T20:25:14.989517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-11T17:17:49.488002Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-19T16:13:49.463844Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T17:17:49.488002Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2412.09168"},"observation_digest":"sha256:56f36f6f6a2051be45382e71fa40e7721f3a52d32b6d66f66b1609d2058d72fa","observation_id":"08752a8d-6ae4-4138-9b49-da9046bd152a","resolution":{"observed_at":"2026-08-11T17:17:49.488002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-11T11:25:15.406842Z","title":"arXiv preprint arXiv:2402.03681","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15544","last_updated":"2024-12-20T04:08:11Z","snapshot_observed_at":"2026-08-19T21:36:18.517895Z","submitted_at":"2024-12-20T04:08:11Z","title":"VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:25:15.406842Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2412.15544"},"observation_digest":"sha256:fc527594b24f941c95a856d2a78fa6a3b2dd66302c29de36b7c76296fda0517e","observation_id":"00b8eccd-443e-422a-a52b-e4e2b94300da","resolution":{"observed_at":"2026-08-11T11:25:15.406842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-11T14:10:08.693481Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16201","last_updated":"2024-12-17T00:12:45Z","snapshot_observed_at":"2026-08-14T04:20:06.939014Z","submitted_at":"2024-12-17T00:12:45Z","title":"CLIP-RLDrive: Human-Aligned Autonomous Driving via CLIP-Based Reward Shaping in Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:10:08.693481Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2412.16201"},"observation_digest":"sha256:03611941566703a6f70a1f2a41012e68222c5b4320a24c1ab58b2d7e529fdefe","observation_id":"72d9408e-e95e-407a-bcba-4cf965a72b72","resolution":{"observed_at":"2026-08-11T14:10:08.693481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-10T22:32:07.962630Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01367","last_updated":"2025-01-02T17:26:01Z","snapshot_observed_at":"2026-08-23T04:33:56.243602Z","submitted_at":"2025-01-02T17:26:01Z","title":"Contrastive Learning from Exploratory Actions: Leveraging Natural Interactions for Preference Elicitation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:07.962630Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2501.01367"},"observation_digest":"sha256:804a8cbb91d0dc69c304121cc010056f3f9a18345f19500f063904a71b4c8717","observation_id":"2e8e269f-ae0d-4245-a649-6aad57ad9ed3","resolution":{"observed_at":"2026-08-10T22:32:07.962630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-10T20:34:07.043762Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08259","last_updated":"2025-01-14T17:15:27Z","snapshot_observed_at":"2026-08-17T22:16:11.210384Z","submitted_at":"2025-01-14T17:15:27Z","title":"FDPP: Fine-tune Diffusion Policy with Human Preference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:34:07.043762Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2501.08259"},"observation_digest":"sha256:df51f6e9866cdabbac65ff158debce4bdc334c6656563e1b241b667a0021f9c2","observation_id":"7463f495-a244-4402-95be-4bc5fd03023d","resolution":{"observed_at":"2026-08-10T20:34:07.043762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-16T05:31:55.956455Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20520","last_updated":"2025-04-29T08:01:27Z","snapshot_observed_at":"2026-08-21T20:35:58.079704Z","submitted_at":"2025-04-29T08:01:27Z","title":"PRISM: Projection-based Reward Integration for Scene-Aware Real-to-Sim-to-Real Transfer with Few Demonstrations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:31:55.956455Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2504.20520"},"observation_digest":"sha256:b17dd13df6ad6c7a9d7bbe7ba4d65c4fbb58e29439208f26ac4b2f32fbd0446d","observation_id":"1e78bded-9810-45f3-9f60-d1d02b92c022","resolution":{"observed_at":"2026-08-16T05:31:55.956455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-15T22:52:23.759155Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06079","last_updated":"2025-05-09T14:22:43Z","snapshot_observed_at":"2026-08-19T23:04:35.722733Z","submitted_at":"2025-05-09T14:22:43Z","title":"TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:52:23.759155Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2505.06079"},"observation_digest":"sha256:192d68d07fc6c08760352f9cca6af260066738e41fc7d3a8a808e4cf445216b4","observation_id":"cb0a0399-3f18-42a0-bdf4-76f5bfcbbff7","resolution":{"observed_at":"2026-08-15T22:52:23.759155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-15T20:59:41.208656Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-19T18:57:15.558571Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.208656Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:bef2a5a9827d4ab58219ed64c96c8b5779d60940edfccfed2beb92bc001faa4f","observation_id":"d6e0d8eb-dcc5-43a1-8cd8-7c1850be8884","resolution":{"observed_at":"2026-08-15T20:59:41.208656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-07T13:53:59.540056Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-08-21T11:18:49.698318Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:59.540056Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2505.20726"},"observation_digest":"sha256:b9be645255e5ffc1c669c2492b02f6f0c4b0d76377d1c4c6816c3f846770b757","observation_id":"507ccd29-01c6-4931-9078-8b810bcaa289","resolution":{"observed_at":"2026-08-07T13:53:59.540056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-07T12:32:06.318385Z","title":"arXiv preprint arXiv:2402.03681 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24317","last_updated":"2025-05-30T08:00:51Z","snapshot_observed_at":"2026-08-19T15:28:44.190527Z","submitted_at":"2025-05-30T08:00:51Z","title":"ROAD: Responsibility-Oriented Reward Design for Reinforcement Learning in Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.318385Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2505.24317"},"observation_digest":"sha256:72b1572b29d516f39ba69401f7119a82c2463cdd6dd8a7fd1e6024ed1c749aa1","observation_id":"aad52432-1358-4d8d-8388-110825fd8d6a","resolution":{"observed_at":"2026-08-07T12:32:06.318385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-06T05:41:42.219536Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01539","last_updated":"2025-08-03T01:46:10Z","snapshot_observed_at":"2026-08-16T22:39:04.174569Z","submitted_at":"2025-08-03T01:46:10Z","title":"HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:41:42.219536Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2508.01539"},"observation_digest":"sha256:fcd6577a6b5e5502e7025e42478de6935b79030dac4bd15aa03d43fe35dfd50a","observation_id":"1debe993-d244-4a08-84cc-9bc6ccd864dc","resolution":{"observed_at":"2026-08-06T05:41:42.219536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2508.11196","last_updated":"2026-05-06T08:41:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-15T04:06:40Z","title":"UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T22:17:41.758059Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2508.11196"},"observation_digest":"sha256:05ff82232a57d518dd6e3e3b2ab58ab1b909a06514fc07cd3bc1a1066e68ade2","observation_id":"c5684732-36b4-4776-8e20-104819cb6eb6","resolution":{"observed_at":"2026-05-18T22:21:53.346287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2510.12710","last_updated":"2026-04-09T08:55:45Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-14T16:44:39Z","title":"Reflection-Based Task Adaptation for Self-Improving VLA","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T07:28:11.187479Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2510.12710"},"observation_digest":"sha256:659f1a46742c73afbe442ff9093ebd49d7ee56fe45e48924f3b95536637f41e6","observation_id":"060d5b69-72d5-4948-9dd6-85d684d9fe3c","resolution":{"observed_at":"2026-05-18T07:31:02.945003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2602.19837","last_updated":"2026-05-06T07:57:45Z","snapshot_observed_at":"2026-08-14T16:37:11.701513Z","submitted_at":"2026-02-23T13:39:58Z","title":"Meta-Learning and Meta-Reinforcement Learning -- Tracing the Path towards DeepMind's Adaptive Agent","version":3},"reference_index":182,"source":"pdf_text","source_observed_at":"2026-05-15T20:46:15.275441Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2602.19837"},"observation_digest":"sha256:687688b1306d5b347c8222daa76de0b17f0cfc5112f06d531e7a29cc8d6bb78e","observation_id":"8145122e-b207-4fe9-ad62-9219e51fd3a4","resolution":{"observed_at":"2026-05-15T20:46:35.641376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-19T14:14:25.412292Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:1379d9cc1ff010ded348b7ec8144154de2b0c18d1b9288896ea93cf699364b29","observation_id":"b0f84f00-831b-4459-8c57-1980f1a76a1b","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2605.17933","last_updated":"2026-05-18T06:41:14Z","snapshot_observed_at":"2026-08-19T08:47:18.614099Z","submitted_at":"2026-05-18T06:41:14Z","title":"AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T11:24:48.558423Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2605.17933"},"observation_digest":"sha256:4bafd29defc7624853f3722031eabfbc5484a76ae262c23e8f2fb29c208d0d49","observation_id":"be41da0a-9061-4663-b6dd-701b2e2ac0e9","resolution":{"observed_at":"2026-05-20T11:28:14.482581Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2605.18903","last_updated":"2026-05-17T13:26:09Z","snapshot_observed_at":"2026-08-15T02:25:30.143493Z","submitted_at":"2026-05-17T13:26:09Z","title":"Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T13:29:11.509966Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2605.18903"},"observation_digest":"sha256:a43aae0a80e3e2a0cd08ec8832774a6f93813e6d879b2aa989a407e03e6571a3","observation_id":"595aa6c1-82b7-4519-8978-ab500322f516","resolution":{"observed_at":"2026-05-20T13:33:19.313918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2605.22123","last_updated":"2026-05-21T07:55:35Z","snapshot_observed_at":"2026-08-17T02:56:36.144347Z","submitted_at":"2026-05-21T07:55:35Z","title":"Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T05:32:17.780012Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2605.22123"},"observation_digest":"sha256:205b224ed5d9d348f4cf2be19d723e425a7a2e6ba492a1cf5387e1a47872c328","observation_id":"1cc2b38f-b9e8-463c-b334-a8bb8672514d","resolution":{"observed_at":"2026-05-22T05:34:40.341672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-12T22:44:47.277650Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:64f04089364180f6a108decd853ab1ed5d2b5d9e98a498494daa7c251b64f6d9","observation_id":"2e8cf5b5-b2c5-4f1d-8830-fa282443f118","resolution":{"observed_at":"2026-06-28T20:32:37.635642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2606.12072","last_updated":"2026-06-10T13:40:19Z","snapshot_observed_at":"2026-08-02T21:32:50.432496Z","submitted_at":"2026-06-10T13:40:19Z","title":"World Model Self-Distillation: Training World Models to Solve General Tasks","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T10:16:35.511426Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.12072"},"observation_digest":"sha256:076519a7145c6c8aab97ec52bfb4def5cacf57852e6f22cef26a26cb23adb66f","observation_id":"58dec1c0-6e7c-4150-8538-f0174bd95a96","resolution":{"observed_at":"2026-07-03T10:07:55.861633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2606.20641","last_updated":"2026-06-02T16:07:28Z","snapshot_observed_at":"2026-08-15T08:39:43.756737Z","submitted_at":"2026-06-02T16:07:28Z","title":"MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T09:31:56.712360Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.20641"},"observation_digest":"sha256:08413ee5fae8da327e8a4a53d3c85e9158fd91359f4f526d7c9935ad1585ef3a","observation_id":"1549fe9b-7479-4347-8a31-cc63ad680120","resolution":{"observed_at":"2026-07-02T03:56:35.152732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:285addbe2cbc560d083bd7c9626d400bfc4cc70bec11993a13a88ca43d3022f8","observation_id":"bed6605d-e35a-41f4-81bb-bc60db7357fe","resolution":{"observed_at":"2026-07-04T09:59:44.552947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2606.25398","last_updated":"2026-06-24T04:52:04Z","snapshot_observed_at":"2026-08-18T11:08:26.799297Z","submitted_at":"2026-06-24T04:52:04Z","title":"MAPL: Multi-Objective Preference Learning for Robot Locomotion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-25T21:11:00.753949Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.25398"},"observation_digest":"sha256:6ce508e1c5bf04307cd5b84b079c66b4d855582d17a7769d5f8ad7189c001581","observation_id":"3c476429-1c35-4df5-8adf-9aa9847da207","resolution":{"observed_at":"2026-07-04T19:40:06.247908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2606.28570","last_updated":"2026-06-26T19:53:26Z","snapshot_observed_at":"2026-08-15T23:05:05.667627Z","submitted_at":"2026-06-26T19:53:26Z","title":"Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T01:04:10.556608Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.28570"},"observation_digest":"sha256:9cb77336a81ecdd7f2177c7cc96c361802014811a134354d0d725663a7186dd4","observation_id":"597a613c-efae-4c62-b916-b96e68cab2fb","resolution":{"observed_at":"2026-07-01T15:45:48.629240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-13T21:33:46.352583Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-01T04:58:28.971536Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:1cf85a61bf4c4d4a6adee530d2d45c6c39809acb7b3067b46c5937ab70974c9b","observation_id":"7942573f-050a-4597-90c3-7c9f599cb04a","resolution":{"observed_at":"2026-07-01T10:55:41.993344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-07-14T16:55:18.028851Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-13T21:33:46.352583Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T16:55:18.028851Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:63449416bd128054c1208784baabbcb1382d5688435f540f81d2827715f51268","observation_id":"0caae5b4-41cc-49c5-a5a7-dcc07bdc7d52","resolution":{"observed_at":"2026-07-14T16:55:18.028851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-04T02:32:21.801763Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-13T21:33:46.352583Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T02:32:21.801763Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:95935b4a5c487ba06083d334e9199eb8b92f59e22618927085bd1330f8a2abe0","observation_id":"e14f6cc5-e031-4ecd-8ea1-afff73aff912","resolution":{"observed_at":"2026-08-04T02:32:21.801763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2606.32034","last_updated":"2026-06-30T17:58:23Z","snapshot_observed_at":"2026-08-06T15:45:44.038676Z","submitted_at":"2026-06-30T17:58:23Z","title":"QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-01T05:59:13.631078Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.32034"},"observation_digest":"sha256:56a1fbd27c27aa4d6ca71828413dcced595bbea4d7d739f29fe7615219517060","observation_id":"f7fe787f-399f-467c-971e-38c5db5a2352","resolution":{"observed_at":"2026-07-01T06:05:28.995527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-12T04:52:01.599894Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-07T12:47:29.552283Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:3b13aa7f6dbec4b345ae4e729d76c0cca82dcb016df4ec46dba847e2a8f384cd","observation_id":"03ba039f-d16d-4838-a07f-6ea9688dbcf6","resolution":{"observed_at":"2026-07-07T12:53:50.157230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"RL-VLM-F: Reinforcement learning from vision language foundation model feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-12T04:52:01.599894Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:e8b57614ae8cd49548d304cc04702c10166cc7ece519b3e26f8391490ee71c5c","observation_id":"2159aea4-c9d6-488c-bf68-f1ac3e07fd84","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-07-13T06:21:42.026251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08837","last_updated":"2026-08-12T00:00:42Z","snapshot_observed_at":"2026-08-17T19:20:07.859473Z","submitted_at":"2026-07-09T18:00:24Z","title":"Prompt-Driven Exploration","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-07-13T06:21:42.026251Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2607.08837"},"observation_digest":"sha256:612b06f2561d75755ba55d5baa5655c709ef78a02c6882078bec7a9edbd72c44","observation_id":"cb1fefb5-d847-43f4-98f8-0233a4d79a31","resolution":{"observed_at":"2026-07-13T06:21:42.026251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-07-13T00:46:28.503923Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09042","last_updated":"2026-07-10T02:17:41Z","snapshot_observed_at":"2026-08-16T22:40:27.431467Z","submitted_at":"2026-07-10T02:17:41Z","title":"Learning More from Less: Reinforcement Learning from Hindsight","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T00:46:28.503923Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2607.09042"},"observation_digest":"sha256:7e5f58a2cf08cfb32497c4edc559c38ff1b1bb6fea34feb5adccea59799f0ac1","observation_id":"aaa22542-473a-4093-a51c-0125399e5ac2","resolution":{"observed_at":"2026-07-13T00:46:28.503923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-07-31T21:55:17.393310Z","title":"arXiv preprint arXiv:2402.03681 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27967","last_updated":"2026-07-30T10:14:24Z","snapshot_observed_at":"2026-08-19T08:32:48.558680Z","submitted_at":"2026-07-30T10:14:24Z","title":"MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-31T21:55:17.393310Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2607.27967"},"observation_digest":"sha256:7b19f85f5ee03f84116e109dc1e765f33bd3a8625c28562f50ff022c81e3b60e","observation_id":"886dba74-5a71-4507-9b08-7e7097e3363a","resolution":{"observed_at":"2026-07-31T21:55:17.393310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-04T19:45:35.307263Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-17T12:44:12.584111Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":260,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.307263Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:79d26f57d4f4071a512f8c80aaac5682d1837b4ae896d4e57c9f137c7301fdac","observation_id":"0513bdd3-5d69-46bb-8356-dde3addce4f4","resolution":{"observed_at":"2026-08-04T19:45:35.307263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.03681/citation-record","integrity":"/paper/2402.03681/integrity","json":"/paper/2402.03681/citation-record.json","paper":"/paper/2402.03681"},"outbound":[],"paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","latest_version":4,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-23T17:07:39.329403Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2402.03681."}