{"as_of":"2026-08-16T12:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c574379cd3398877fd25a31d2c3339b82ef784fe9252ef60e076127fe5c598f7","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:59:41.281514Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11221/citation-record","integrity":"/paper/2505.11221/integrity","json":"/paper/2505.11221/citation-record.json","paper":"/paper/2505.11221"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.016760Z","title":"Mastering the game of go with deep neural networks and tree search,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.016760Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:87414e8e725b5102dcdf4b4d5b11f00fe425fb54621686898624fcf41cdf4333","observation_id":"12b45feb-cf55-4525-be8a-32e6644f08ae","resolution":{"observed_at":"2026-08-15T20:59:41.016760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.192068Z","title":"Advanced planning for autonomous vehicles using reinforcement learning and deep inverse reinforcement learning,","venue":null,"work_id":"976f5c35-a85a-4eec-8a53-fc0d1d8b7725","year":2019},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.022428Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:4f10e3a7384a474f370fcaf285b4a11284af76ead0e32875d56b8b57de187b38","observation_id":"374f6784-dfc4-457b-873e-63da11c83dc0","resolution":{"observed_at":"2026-08-15T20:59:42.197622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.174774Z","title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipu- lation,","venue":null,"work_id":"4bffb7bf-68ff-4689-955f-7df88abedb7f","year":2018},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.027555Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:5debae8f9e9a2f10e0cb9810fd11801d9358db7c97e52acf38c121372a413d9f","observation_id":"2ada002b-50ab-4b48-999c-61eff2ab90db","resolution":{"observed_at":"2026-08-15T20:59:42.180669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.154603Z","title":"Mastering atari, go, chess and shogi by planning with a learned model,","venue":null,"work_id":"8be52c06-1f8a-4554-b349-8359a453e2c8","year":2020},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.033210Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:9f5bc526ae164fcdb1e1021ba5666950bba104bfe9cbce16af0edcfb20df5f09","observation_id":"88899db3-57af-4c87-973e-c91341cb9213","resolution":{"observed_at":"2026-08-15T20:59:42.161273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.131486Z","title":"Hindsight goal ranking on replay buffer for sparse reward environment,","venue":null,"work_id":"c31c9ba6-04b2-4a3a-a30b-850fb281b1aa","year":2021},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.038495Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:6913622ad97e250dd45c1145488a48244ddad4d9c1ad7f4887d4d02e0c46e78d","observation_id":"e761d655-2eb4-46a3-b0a8-a6924722d97d","resolution":{"observed_at":"2026-08-15T20:59:42.138548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.108814Z","title":"Utilizing skipped frames in action repeats for improving sample efficiency in reinforcement learning,","venue":null,"work_id":"9a50828e-e43f-4cd5-897d-4276d313527e","year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.044058Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:febd8d87723d9b86caf2b9592c8bbbcffaeac35585636ed6ff6cf9c921cca433","observation_id":"cacf23d0-8b6d-43f3-afdb-3bcaa311684c","resolution":{"observed_at":"2026-08-15T20:59:42.116098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.090152Z","title":"Predictive coding for decision transformer,","venue":null,"work_id":"8f3535c5-98ef-4445-8fd9-f6d68d9209f6","year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.050425Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:024f24a6d4b3a5ae1382ffd6ea8db2e8c1a655a1f26a60b705940f81880894bc","observation_id":"23b1ea9c-e676-46a9-9cc5-63fada2bb3e8","resolution":{"observed_at":"2026-08-15T20:59:42.096012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-15T20:59:41.056303Z","title":"Dota 2 with large scale deep reinforcement learning,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.056303Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:9bbcd81217d8855719384f21d25b76f972dd2186e086a6822b17346513f583de","observation_id":"6a11b1b3-ac27-41a0-9bfa-2f64ad4911f9","resolution":{"observed_at":"2026-08-15T20:59:41.056303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.071922Z","title":"A comprehensive survey on safe reinforce- ment learning,","venue":null,"work_id":"02e4d088-9016-433c-ac83-15a8de5264a1","year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.061637Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:0ca9fbedb50c3d77ace9af4f0e44f01720a252bd700b3f4d0ad9210849621daf","observation_id":"e12c152e-d9b1-43e1-abd5-c26168028409","resolution":{"observed_at":"2026-08-15T20:59:42.078854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.054539Z","title":"No falls, no resets: Reliable humanoid behavior in the darpa robotics challenge,","venue":null,"work_id":"2bcf5b5e-ca9a-4ba5-9ad2-acb2ca6af1c9","year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.067101Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:cda3494c5cea1080eff42172305f4a22fabbe98082161ca700bbd04453a39f0c","observation_id":"21454ae8-9264-4d55-b328-08ade17e5816","resolution":{"observed_at":"2026-08-15T20:59:42.060001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.034741Z","title":"Deep reinforcement learning: A brief survey,","venue":null,"work_id":"53ea38d0-0930-4602-b3dd-5c919114e1b0","year":2017},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.071821Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:3ae0adcbd221ce12a4bfacb771322133dc64ab3004d32775dcd0de71b51c6c11","observation_id":"2819d1b1-c94e-4d10-aebe-a8f57790659b","resolution":{"observed_at":"2026-08-15T20:59:42.040985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.076975Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.076975Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:dc57733a663097b41e51ab589eadef3a359fbdf6eef8221d365948029101a01c","observation_id":"004f6a71-28d9-429f-8bff-8b3771b7e502","resolution":{"observed_at":"2026-08-15T20:59:41.076975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T20:59:41.082178Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.082178Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:5abe255a3b7d1868e1278e040501d3b2d156641c527ee8064f9df8c81d4daa11","observation_id":"1a12b399-4e20-4909-9477-33ca8df11950","resolution":{"observed_at":"2026-08-15T20:59:41.082178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-15T20:59:41.087154Z","title":"On the opportunities and risks of foundation models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.087154Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:50971cbb9a807bcaf7826ef68a7f0b29a167eaa35b70738f8293163ad26efc77","observation_id":"3b9b039e-4a3d-4c01-98fe-c08c0e227e66","resolution":{"observed_at":"2026-08-15T20:59:41.087154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T20:59:41.091688Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.091688Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:a92fda5fde0074e6682b35cfa1e7a6acd09c66a306dbdeb5bd055eca46d4f14f","observation_id":"309e9cdc-7ec7-45f7-8d12-f298c6c72fd6","resolution":{"observed_at":"2026-08-15T20:59:41.091688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.003307Z","title":"Openai. gpt-4v,","venue":null,"work_id":"9198adae-373b-40de-a09f-f15b411c4b3c","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.097123Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:954eaec4c46f2cc7f928211079d7f45a4f55008f5d1fa46cefe7f3fa042cbba9","observation_id":"e853ad67-0be1-4149-8690-34eeb5e2efdc","resolution":{"observed_at":"2026-08-15T20:59:42.009167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-15T20:59:41.101775Z","title":"Do as i can, not as i say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.101775Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:50dea8420fae20abef35b19c793af6f1aa755e923d6abe0c6340b54eea1f4e8e","observation_id":"73121656-f8a6-48f4-94f6-cee085346f26","resolution":{"observed_at":"2026-08-15T20:59:41.101775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.983781Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,","venue":null,"work_id":"55714f79-26a6-4ec8-a596-ea416223bf82","year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.106538Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:b4f2fd7fdcf9f623886c6ba977b9abfc3c3f2e8378d5561d8fc478acab52de2e","observation_id":"0887c92a-18f5-4763-9aa5-0fb8b905530d","resolution":{"observed_at":"2026-08-15T20:59:41.989419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.966239Z","title":"Large language models as generalizable policies for embodied tasks,","venue":null,"work_id":"5f5f8b12-8635-4afd-8c8a-b19ece65fe76","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.111452Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:ca6f425aee11714c50cf8dce98c9c8ae115dbca87ac524bed4219f672841bb83","observation_id":"fcbea04e-e131-4401-9fec-3787d0fbcbee","resolution":{"observed_at":"2026-08-15T20:59:41.972020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-08-13T01:47:35.713102Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-15T20:59:41.116130Z","title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.116130Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:224c49d97d95a04c9dee15c4a751f174915917673b2740060687ec9c093f2e94","observation_id":"e1b7d85e-be24-4f27-acb9-2c7dc0e7d20f","resolution":{"observed_at":"2026-08-15T20:59:41.116130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:59:41.122020Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.122020Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:07062b48286be595e2ef9cfbcb1a7d75fc2f776490e8269f82aeda8848da47dc","observation_id":"399ad55a-72b2-4784-9348-0ab362b99e56","resolution":{"observed_at":"2026-08-15T20:59:41.122020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.948647Z","title":"Palm: Scaling language modeling with pathways,","venue":null,"work_id":"bbfd38e6-2ec8-42d3-af0d-67e9039844f0","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.126397Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:8fe703a6b28dd20f87a31f86281a4797f5b4425d9c0244845eba73f478b1e932","observation_id":"72b92636-9d51-4181-8bd3-1892a3bd2cb7","resolution":{"observed_at":"2026-08-15T20:59:41.954129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-15T20:59:41.131638Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.131638Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:df5e1966084b45023b956281f17a034b373d8d15fd176fcea280dc8e79c00f61","observation_id":"98407cff-95d8-42a0-8cb6-470690c23c8a","resolution":{"observed_at":"2026-08-15T20:59:41.131638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:59:41.136847Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.136847Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:fd0b70a825b211391c0aa5c6253423a3417e1dfb24cc0a3e1fdccc1150b8fe4f","observation_id":"304c07cf-6812-4672-98ba-78a28767842e","resolution":{"observed_at":"2026-08-15T20:59:41.136847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.931161Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":"6c136d35-9da0-4322-a8d7-0a1fe8f3cc23","year":2016},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.141241Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:69375efafd2dd8d7992df545c7fe53787395c030f3ff28d1cef60d7709f73b87","observation_id":"9375b1ad-ebf4-4abd-8857-850b3cbece2d","resolution":{"observed_at":"2026-08-15T20:59:41.936201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.914509Z","title":"Guiding pretraining in reinforcement learning with large language models,","venue":null,"work_id":"3fa86f4a-5a9a-4aae-9639-7581f7c5b2e2","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.147213Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:3ced415aca3009f52fa375d2bd23c539c1de71ffc944ac6d0df37ff20af277d5","observation_id":"7ae865fb-960e-4774-9e16-aa28089e8908","resolution":{"observed_at":"2026-08-15T20:59:41.919926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.152352Z","title":"Progprompt: Generating situated robot task plans using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.152352Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:cac1870ea545ce3f9dcb4e1f8a3f17b3d27a775c1d85c75eeae0daefc5a5df15","observation_id":"cb90abaf-fed4-450d-a731-507c58d1852f","resolution":{"observed_at":"2026-08-15T20:59:41.152352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-15T20:59:41.157203Z","title":"Inner mono- logue: Embodied reasoning through planning with language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.157203Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:2e7a66e92d4943f65012dd1f3de9f76e7c7312f2f39237f279dc3ba9f2c32e3b","observation_id":"921fad93-7cc5-4c14-8671-f21cf653fcb2","resolution":{"observed_at":"2026-08-15T20:59:41.157203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.885929Z","title":"Enabling intelligent interactions between an agent and an llm: A reinforcement learning approach,","venue":null,"work_id":"a160c479-aa90-41ec-808d-66e242ec4b5d","year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.162015Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:fdd94092dacada6b195e5711f28c54dc5f47c751a6ecadf136d3de70ded9b1ba","observation_id":"ba6aa2d7-a84e-4c0f-88e2-76eb8fa93d00","resolution":{"observed_at":"2026-08-15T20:59:41.892063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.868512Z","title":"Grounding large language models in interactive environments with online reinforcement learning,","venue":null,"work_id":"86e6978b-1187-4c33-90dd-57c47413fa0b","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.167776Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:9dfdd70604e593d99b0a403454176e7df6d7f8769b2fb3b304fd65443af83139","observation_id":"90e9c8ea-ab1c-4d35-9c1c-09e51f68285c","resolution":{"observed_at":"2026-08-15T20:59:41.874356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.850690Z","title":"Introducing gemini: our largest and most capable ai model,","venue":null,"work_id":"623ad8cb-fec3-4670-af0d-0aa33fd9652e","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.173907Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:615e708c46ef6ed7fa35ddbc535b32841a03364ad9dce2b3c3954d6fde18a1ef","observation_id":"627dc17b-390e-4f3b-9360-b7d22f48d547","resolution":{"observed_at":"2026-08-15T20:59:41.856431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T20:59:41.179132Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.179132Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:61bb3c2cc3913f7b39a7315b740f5938b066038661db92ac7bcd1b90a24fd031","observation_id":"dfcedf34-5a29-42cc-844b-085a800a7dfd","resolution":{"observed_at":"2026-08-15T20:59:41.179132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.184370Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.184370Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:8426a2ba5cdff6413fafa597921882ae39789c8c92b694089922998444eef3c3","observation_id":"8db894f0-eb4a-4bec-93d9-24ca9e2e60c6","resolution":{"observed_at":"2026-08-15T20:59:41.184370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01534","last_updated":"2024-05-02T17:59:31Z","snapshot_observed_at":"2026-08-14T19:57:55.502112Z","submitted_at":"2024-05-02T17:59:31Z","title":"Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01534","snapshot_observed_at":"2026-08-15T20:59:41.189783Z","title":"Plan-seq- learn: Language model guided rl for solving long horizon robotics tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.189783Z"},"links":{"cited_paper":"/paper/2405.01534","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:ece013be6c9f25ccf37683682aeb33fe59eee6d1beeae47258c8ecb46a03c975","observation_id":"c5d046f5-9430-464c-a32b-38894c703de5","resolution":{"observed_at":"2026-08-15T20:59:41.189783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-13T12:35:47.840646Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-15T20:59:41.196985Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.196985Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:2e192eb285fdc18943354fae16dd81a1aab0c06ff8a9ff8b3a4594ff2d099f18","observation_id":"f9347ac1-3a04-4b37-87f8-a2a89600d53f","resolution":{"observed_at":"2026-08-15T20:59:41.196985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-15T20:59:41.202600Z","title":"Vision-language models are zero-shot reward models for reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.202600Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:af2613986f498ca656fed6d47187094fee2469db683f6bdb9cbc0891b6d23442","observation_id":"4541a172-4582-4d2f-91c1-6f0dc5d04da7","resolution":{"observed_at":"2026-08-15T20:59:41.202600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-13T04:25:31.366043Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-15T20:59:41.208656Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.208656Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:46a4d8fc6f9af740bd103553cb39c3bd0a60b921f0b83a3344e719eb1b90d13d","observation_id":"d6e0d8eb-dcc5-43a1-8cd8-7c1850be8884","resolution":{"observed_at":"2026-08-15T20:59:41.208656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-13T16:55:46.498156Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-15T20:59:41.214510Z","title":"V oyager: An open-ended embodied agent with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.214510Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:a8399ccdb7dacb5b51d712df5ffa780ae3cd06716540f92ee12e93d356296279","observation_id":"79cb93c5-bbab-4fc9-a2e6-0b13b27de1a8","resolution":{"observed_at":"2026-08-15T20:59:41.214510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10021","last_updated":"2023-10-17T12:01:17Z","snapshot_observed_at":"2026-08-15T12:56:33.042136Z","submitted_at":"2023-10-16T02:43:47Z","title":"Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10021","snapshot_observed_at":"2026-08-15T20:59:41.221259Z","title":"Bootstrap your own skills: Learning to solve new tasks with large language model guidance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.221259Z"},"links":{"cited_paper":"/paper/2310.10021","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:e42e6864a7d37d8fbc6a5ded6e0b59b7a9920a5a9592fc7cfc9112cc1597f32d","observation_id":"aa1c2f58-d289-44cb-b677-69551e889f3e","resolution":{"observed_at":"2026-08-15T20:59:41.221259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.821583Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought,","venue":null,"work_id":"4abb8101-9f4a-4810-83d1-23d86e816a25","year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.226802Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:a51e404d862d2e7377506829be9c33fd3c0541ce50eed460cd9586a412438a77","observation_id":"8bdc0382-62f0-44ac-9437-0d12274b4263","resolution":{"observed_at":"2026-08-15T20:59:41.826830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02651","last_updated":"2024-05-23T01:04:11Z","snapshot_observed_at":"2026-08-13T04:27:10.738262Z","submitted_at":"2024-02-05T00:48:56Z","title":"Vision-Language Models Provide Promptable Representations for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02651","snapshot_observed_at":"2026-08-15T20:59:41.232110Z","title":"Vision-language mod- els provide promptable representations for reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.232110Z"},"links":{"cited_paper":"/paper/2402.02651","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:14d0138244c57eebb43d46c10df3631c50b5fb441fd1265e18931654b9b85bc9","observation_id":"0c388fba-6c6c-49d7-862e-aad30cc1e6e5","resolution":{"observed_at":"2026-08-15T20:59:41.232110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.805022Z","title":"Policy distillation,","venue":null,"work_id":"784e5a8e-c9d0-4596-bb9d-adfd06212f84","year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.237652Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:1bc04316cfb1e9c37347bf2d50e51878ba2376de337610141c494eb9a087e545","observation_id":"86f2b24e-5c2f-49cb-a5e0-0fa78e362dbe","resolution":{"observed_at":"2026-08-15T20:59:41.810268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06342","last_updated":"2016-02-22T19:59:40Z","snapshot_observed_at":"2026-08-14T22:22:09.818117Z","submitted_at":"2015-11-19T20:17:27Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06342","snapshot_observed_at":"2026-08-15T20:59:41.244006Z","title":"Actor-mimic: Deep multitask and transfer reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.244006Z"},"links":{"cited_paper":"/paper/1511.06342","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:6236b1095a31bc55d51ee37343394c6b72f0cfc22234fc9da4a99a2cd73957cb","observation_id":"ff176453-e3da-4a72-8bc3-f890816a73d3","resolution":{"observed_at":"2026-08-15T20:59:41.244006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.778621Z","title":"Guided policy search,","venue":null,"work_id":"631121f9-45bf-446b-9afd-3ae369e01ff5","year":2013},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.249797Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:a3c85b6e6f4d9cc9d3b9671e2d3907fe5dcde8fb3ebd1c25fb4d900b1e61aee7","observation_id":"ae662865-6a6f-42fe-b1ad-6f57d153b6d1","resolution":{"observed_at":"2026-08-15T20:59:41.793015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.758248Z","title":"Neural network dynamics for model-based deep reinforcement learning with model-free fine-tuning,","venue":null,"work_id":"3c076cd9-6063-45d0-a23e-be71d4680986","year":2018},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.255806Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:e61b667d181b230c44892bf942c73f28b5a514ce201a89713dac923c66774697","observation_id":"44c0d836-a331-474c-9338-6de3c43ae6bb","resolution":{"observed_at":"2026-08-15T20:59:41.764856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.737952Z","title":"Agents teaching agents: a survey on inter-agent transfer learning,","venue":null,"work_id":"b89a5178-6503-4950-aee2-3208177349d5","year":2020},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.260660Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:3f63d7b4b4bd72d0053c0edcc2c4df2229da064c07d9136f5beb89e66224993d","observation_id":"497f7ed1-13c2-4fea-a19c-dea6c2b02efc","resolution":{"observed_at":"2026-08-15T20:59:41.746078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.719739Z","title":"Reincarnating reinforcement learning: Reusing prior computation to accelerate progress,","venue":null,"work_id":"cf4a3274-3b39-41df-8647-3fdea14cdaea","year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.265404Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:c2e706f41097880c9cbcf573421cebf85b22040f2311a8667d75e41ed4dc32d5","observation_id":"9424baa2-0bc3-4fa1-b8f1-3a8f7965de6d","resolution":{"observed_at":"2026-08-15T20:59:41.725844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-08-14T19:37:32.915923Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-15T20:59:41.270545Z","title":"Kickstarting deep reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.270545Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:352e563aa9298d0727298d6a0d14b4314d8db3364380b8f4bb0fe41ac5abf8f3","observation_id":"7e66c295-55df-46b2-a47f-c04b0a8c8b1d","resolution":{"observed_at":"2026-08-15T20:59:41.270545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.701722Z","title":"When does label smoothing help?","venue":null,"work_id":"0aa8a46b-dbae-45f8-a716-5e76755744c5","year":2019},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.276607Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:d664e541dc4219b37f056fea447fa69256aadb3e02f7354c413b38e2fc53203e","observation_id":"7ee6f8c5-bf57-4e97-bcb9-0211e6784704","resolution":{"observed_at":"2026-08-15T20:59:41.707149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.681398Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal- oriented tasks,","venue":null,"work_id":"87ee3f1f-d0c7-4335-b982-53e8851c0446","year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.281514Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:1376507959da994e0b06c81ccdb3ce817e0aba5905f2c83e38132dc82957c3dd","observation_id":"1a679df0-1267-4705-a418-1b30313f31c6","resolution":{"observed_at":"2026-08-15T20:59:41.688286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:53:07.577171Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.11221."}