{"as_of":"2026-08-15T05:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7fc3a4994f23845e215b7c1ba2dd5798a78f7fb808676ea151041966269e696","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:45:47.211087Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.12921","doi":"10.48550/arxiv.2310.12921","metadata_source":"pith","pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.12921 (2023)","venue":"cs.LG","work_id":"d724c74d-9fe4-4890-98a6-fcd66125864e","year":2023},"citing_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-13T08:57:22.299028Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2307.05973"},"observation_digest":"sha256:869ad7885019d4d99a1562014438b6454159bb892631f7a30d79c9d47bc13ac8","observation_id":"0db6c1cc-34a3-4cf8-a65a-5ede233e8ad4","resolution":{"observed_at":"2026-05-13T08:57:22.363001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-12T16:45:47.211087Z","title":"Vision- Language Models are Zero-Shot Reward Models for Reinforcement Learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-15T04:05:57.706326Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.211087Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:dd401926259a9d3ae83350967f8345f50f1a6d803b64a25e2f4966db9d0c97f3","observation_id":"1c616136-d84a-46b6-ad8c-e02bdf1af33c","resolution":{"observed_at":"2026-08-12T16:45:47.211087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-12T12:33:07.124273Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17135","last_updated":"2024-11-26T06:04:10Z","snapshot_observed_at":"2026-08-14T15:52:44.410039Z","submitted_at":"2024-11-26T06:04:10Z","title":"LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T12:33:07.124273Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2411.17135"},"observation_digest":"sha256:43f2c1803c9dfb3e18323f4a11eea4f1b83b3f3b0f533fc63a4c599d81e60df7","observation_id":"a6765abe-bdc9-49d1-a9c3-8e254d7608b9","resolution":{"observed_at":"2026-08-12T12:33:07.124273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-11T17:17:49.468728Z","title":"Vision- language models are zero-shot reward models for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-11T17:11:46.609535Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T17:17:49.468728Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2412.09168"},"observation_digest":"sha256:9d6c755dded14f7acada3ff7b08cb499e525b13ea5bf2b4bfc75a203206ec993","observation_id":"809d90c1-9ee9-4b2c-9e03-0a98c76fa23c","resolution":{"observed_at":"2026-08-11T17:17:49.468728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-11T14:10:08.719867Z","title":"Vision- language models are zero-shot reward models for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16201","last_updated":"2024-12-17T00:12:45Z","snapshot_observed_at":"2026-08-14T04:20:06.939014Z","submitted_at":"2024-12-17T00:12:45Z","title":"CLIP-RLDrive: Human-Aligned Autonomous Driving via CLIP-Based Reward Shaping in Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:10:08.719867Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2412.16201"},"observation_digest":"sha256:e2f9636c72252ef3061c5ff70064c19f9f4f92158ed839f33e285b9e55b8332a","observation_id":"c5df7d45-d240-484d-a2a1-5d28d26010c9","resolution":{"observed_at":"2026-08-11T14:10:08.719867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-09T14:52:27.274360Z","title":"Vision-language models are zero-shot re- ward models for reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01616","last_updated":"2025-02-03T18:50:15Z","snapshot_observed_at":"2026-08-13T07:28:24.009063Z","submitted_at":"2025-02-03T18:50:15Z","title":"Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T14:52:27.274360Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2502.01616"},"observation_digest":"sha256:3a799f9e7ac6e8159236af81a8eaa939b149cae0848a2a0961d1ee5d04b525a4","observation_id":"5df212af-6864-4c05-bcde-c381e175389c","resolution":{"observed_at":"2026-08-09T14:52:27.274360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-08T11:25:49.172358Z","title":"Rocamonde, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07949","last_updated":"2025-05-20T19:54:36Z","snapshot_observed_at":"2026-08-13T21:04:47.602497Z","submitted_at":"2025-02-11T20:57:46Z","title":"Advancing Autonomous VLM Agents via Variational Subgoal-Conditioned Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T11:25:49.172358Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2502.07949"},"observation_digest":"sha256:e206836f8aa3d55f165bb8cda4a9e2f2391427380fa97af982858541453b63e5","observation_id":"c0df10cc-6fa3-4edf-bb43-6e49a0db3b95","resolution":{"observed_at":"2026-08-08T11:25:49.172358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-07T00:13:35.014210Z","title":"Rocamonde, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14763","last_updated":"2025-06-17T17:57:37Z","snapshot_observed_at":"2026-08-07T04:22:17.875129Z","submitted_at":"2025-06-17T17:57:37Z","title":"RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:35.014210Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2506.14763"},"observation_digest":"sha256:8153f87e9e0f1cbd1d810ca165723e4dd456793fca4b2d17703a36549764514d","observation_id":"6282dfeb-c2a8-4da9-88bf-5d1d1f081959","resolution":{"observed_at":"2026-08-07T00:13:35.014210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-06T17:12:29.623006Z","title":"Vision-language models are zero-shot reward models for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12496","last_updated":"2025-07-15T21:49:49Z","snapshot_observed_at":"2026-08-15T01:21:18.378106Z","submitted_at":"2025-07-15T21:49:49Z","title":"FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:12:29.623006Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2507.12496"},"observation_digest":"sha256:191665ce528162f4eff9697f887c35417ad9c25a9d3396333399eefabf3321f2","observation_id":"e8732b67-dd5e-4cdb-ba09-daf077b9ee65","resolution":{"observed_at":"2026-08-06T17:12:29.623006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.12921","doi":"10.48550/arxiv.2310.12921","metadata_source":"pith","pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.12921 (2023)","venue":"cs.LG","work_id":"d724c74d-9fe4-4890-98a6-fcd66125864e","year":2023},"citing_paper":{"arxiv_id":"2510.27157","last_updated":"2026-05-09T03:19:23Z","snapshot_observed_at":"2026-08-11T00:20:03.132239Z","submitted_at":"2025-10-31T04:02:58Z","title":"A Survey on Generative Recommendation: Data, Model, and Tasks","version":2},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-05-18T03:47:08.208082Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2510.27157"},"observation_digest":"sha256:2300a2afab41602adaacdc2a5483bdaccc7358b67bfdae49d6015948a0edb991","observation_id":"7be5cd62-64b7-4087-8c1e-9aa52721930d","resolution":{"observed_at":"2026-05-18T03:50:52.205396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-02T21:43:09.722349Z","title":"Vision-language models are zero-shot re- ward models for reinforcement learning.arXiv preprint arXiv:2310.12921,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19313","last_updated":"2026-07-22T22:14:13Z","snapshot_observed_at":"2026-08-15T01:36:19.409904Z","submitted_at":"2026-02-22T19:25:48Z","title":"TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics","version":2},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-02T21:43:09.722349Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2602.19313"},"observation_digest":"sha256:0db81ae2fe00f5524a28f5e3226fbf9b34f023a58dd9104729f0ad17e9951b4f","observation_id":"b3117d81-fdb0-4c25-8f81-157f93d8ecd7","resolution":{"observed_at":"2026-08-02T21:43:09.722349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-14T18:54:01.033350Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:fff91ae6d8efbc4c0ee25c2a5892b6eedd99b68cee89ea1f7ebb2267d2000959","observation_id":"326ddb2c-398e-47b5-8d62-9041f74f5f33","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.12921","doi":"10.48550/arxiv.2310.12921","metadata_source":"pith","pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.12921 (2023)","venue":"cs.LG","work_id":"d724c74d-9fe4-4890-98a6-fcd66125864e","year":2023},"citing_paper":{"arxiv_id":"2605.17933","last_updated":"2026-05-18T06:41:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-18T06:41:14Z","title":"AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T11:24:48.558423Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2605.17933"},"observation_digest":"sha256:abd92c43176b1f8abe9b859650e09fb5abcc780efc003418a5f4da4ccc2fc0cf","observation_id":"a3929100-c867-41f6-b196-3babab1b8bd3","resolution":{"observed_at":"2026-05-20T11:28:14.532171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.12921","doi":"10.48550/arxiv.2310.12921","metadata_source":"pith","pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.12921 (2023)","venue":"cs.LG","work_id":"d724c74d-9fe4-4890-98a6-fcd66125864e","year":2023},"citing_paper":{"arxiv_id":"2605.18455","last_updated":"2026-05-18T14:20:21Z","snapshot_observed_at":"2026-08-13T09:24:21.949739Z","submitted_at":"2026-05-18T14:20:21Z","title":"OrganicHAR: Towards Activity Discovery in Organic Settings for Privacy Preserving Sensors Using Efficient Video Analysis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T08:37:44.181899Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2605.18455"},"observation_digest":"sha256:a5f5ff616ea585faf4fbc8baf7eff44b104cbef24d645b9cf1f4c6f838ee2ba6","observation_id":"7525be9d-48ed-4c8c-92e6-7b6dd4f9ed10","resolution":{"observed_at":"2026-05-20T08:38:08.968547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.12921","doi":"10.48550/arxiv.2310.12921","metadata_source":"pith","pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.12921 (2023)","venue":"cs.LG","work_id":"d724c74d-9fe4-4890-98a6-fcd66125864e","year":2023},"citing_paper":{"arxiv_id":"2606.12072","last_updated":"2026-06-10T13:40:19Z","snapshot_observed_at":"2026-08-02T21:32:50.432496Z","submitted_at":"2026-06-10T13:40:19Z","title":"World Model Self-Distillation: Training World Models to Solve General Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T10:16:35.511426Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2606.12072"},"observation_digest":"sha256:b1ac145aab297d1f2019216d0b135c5b279c5c15299f23394f07aa01fea81f17","observation_id":"611fa5dd-27c9-484c-a022-5b5050bec545","resolution":{"observed_at":"2026-06-27T10:20:48.821380Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.12921","doi":"10.48550/arxiv.2310.12921","metadata_source":"pith","pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.12921 (2023)","venue":"cs.LG","work_id":"d724c74d-9fe4-4890-98a6-fcd66125864e","year":2023},"citing_paper":{"arxiv_id":"2606.13675","last_updated":"2026-06-11T17:59:45Z","snapshot_observed_at":"2026-07-30T00:58:38.369141Z","submitted_at":"2026-06-11T17:59:45Z","title":"Improving Robotic Generalist Policies via Flow Reversal Steering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T06:20:19.209180Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2606.13675"},"observation_digest":"sha256:474c34d9aa11341faec5e0f0e3a16992662e98cb4e4c59e1835ff9b5484f5b5c","observation_id":"06b70759-44ff-45b7-9b5d-d60bab24f3e9","resolution":{"observed_at":"2026-07-03T15:48:35.734667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.12921","doi":"10.48550/arxiv.2310.12921","metadata_source":"pith","pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.12921 (2023)","venue":"cs.LG","work_id":"d724c74d-9fe4-4890-98a6-fcd66125864e","year":2023},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:e16ad63091ef60c43bd74ceda24204f81e3bfe8bd295e9789a62a31d3f4c398a","observation_id":"9a3f352e-611b-48fa-a509-8c82461e9ba1","resolution":{"observed_at":"2026-07-04T09:59:44.662173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.12921","doi":"10.48550/arxiv.2310.12921","metadata_source":"pith","pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.12921 (2023)","venue":"cs.LG","work_id":"d724c74d-9fe4-4890-98a6-fcd66125864e","year":2023},"citing_paper":{"arxiv_id":"2606.28760","last_updated":"2026-06-27T06:32:47Z","snapshot_observed_at":"2026-08-13T10:47:42.246220Z","submitted_at":"2026-06-27T06:32:47Z","title":"Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T09:52:51.549135Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2606.28760"},"observation_digest":"sha256:528efc562e3bf59506d4e2c129e37296dffdcacabd88818d21aa2dc0e371aaaa","observation_id":"ed8f13a1-8017-4500-965e-fe11ff42e7c2","resolution":{"observed_at":"2026-06-30T09:54:34.569731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2310.12921","doi":"10.48550/arxiv.2310.12921","metadata_source":"pith","pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.12921 (2023)","venue":"cs.LG","work_id":"d724c74d-9fe4-4890-98a6-fcd66125864e","year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-12T04:52:01.599894Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-07T12:47:29.552283Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:4bd1a0508ad0ab633593e009e3f3274a01494356cd793b5a70d16954a1ed0f2f","observation_id":"bb0cf977-af77-4644-a776-9e4236e5ddd0","resolution":{"observed_at":"2026-07-07T12:53:50.203074Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:50.784481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Vision- language models are zero-shot reward models for reinforcement learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-12T04:52:01.599894Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:9a0f9ffd15076cd3609c626f020947b8148ab831e491bb23369ef685d49af923","observation_id":"d27b0c92-b711-49ec-a398-c26a00ba82a1","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-01T20:28:20.711404Z","title":"Vision-language models are zero-shot reward models for reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16636","last_updated":"2026-07-18T04:46:53Z","snapshot_observed_at":"2026-08-09T01:27:38.331708Z","submitted_at":"2026-07-18T04:46:53Z","title":"PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T20:28:20.711404Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2607.16636"},"observation_digest":"sha256:e57df56f24a64924aaf74b33630adf234fd889c3273c50a7cb301230f45f9cb9","observation_id":"73bebea9-1c91-4db5-ae22-76f5ed84a3c7","resolution":{"observed_at":"2026-08-01T20:28:20.711404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-07-31T21:55:17.391043Z","title":"arXiv preprint arXiv:2310.12921 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27967","last_updated":"2026-07-30T10:14:24Z","snapshot_observed_at":"2026-08-05T12:14:09.489312Z","submitted_at":"2026-07-30T10:14:24Z","title":"MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-31T21:55:17.391043Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2607.27967"},"observation_digest":"sha256:a71dbe21c35c289933f0c448a225ae6e71079d529bff7695680cb1f2ea0ea900","observation_id":"9eff0a4f-c6d2-4a5d-b544-92bb455fb36f","resolution":{"observed_at":"2026-07-31T21:55:17.391043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-04T19:45:35.172574Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-15T02:22:30.824958Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":216,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.172574Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:e7eec16864ce7cfd0ab56e0b47114863c940efd2e73a9c0021f30f8e862034e2","observation_id":"ad616c7d-68a3-4d77-9ff1-1bf7b6e5b624","resolution":{"observed_at":"2026-08-04T19:45:35.172574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.12921/citation-record","integrity":"/paper/2310.12921/integrity","json":"/paper/2310.12921/citation-record.json","paper":"/paper/2310.12921"},"outbound":[],"paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2310.12921."}