{"as_of":"2026-08-18T13:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20deeb9631d07d0d22d43bc52879b98d9d46ffe805d8729d218c3da8595284bc","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:14:53.207582Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08273/citation-record","integrity":"/paper/2608.08273/integrity","json":"/paper/2608.08273/citation-record.json","paper":"/paper/2608.08273"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:54.028741Z","title":"Understanding natural language commands for robotic navigation and mobile manipulation","venue":null,"work_id":"dc7e056c-aa04-4a00-a78b-4413b1dc350f","year":2011},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:52.964269Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:0bab1ff0b81b0112fdaf3f5daafd7c447426f7c294af7c49cc3ff0962f1accbf","observation_id":"8661a9ac-a07e-432c-80f7-50b797bc7d98","resolution":{"observed_at":"2026-08-12T00:14:54.033647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:54.013777Z","title":"Vision-and- language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"d6bd0288-f877-4ca8-bd5f-2d5402bc294f","year":2018},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:52.969980Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:a20e71fdd00d4349833d275213376f1a8abdb9146912fca5e723bff1c50d5963","observation_id":"d39cc3b8-9d17-40a9-9453-2abd65512dba","resolution":{"observed_at":"2026-08-12T00:14:54.018019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.999409Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"be090bed-c2a8-4f39-a32f-331c5e8cae8b","year":2020},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:52.974957Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:424f4693d8a9c4d383068a46dac26993a103e1398a479b5ad2088200a5a0370a","observation_id":"78090cf3-5262-43c5-a398-12fe77347a4c","resolution":{"observed_at":"2026-08-12T00:14:54.004373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.985678Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"01592e9c-d019-4d52-bc63-680c7e30bf8f","year":2021},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:52.980682Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:6349d5d669e94c1d7df10a16aeded8e0fe0dd71dc6781b96f035c357d85992f6","observation_id":"647a749b-fd4a-4d8c-9a73-c9f746998b3a","resolution":{"observed_at":"2026-08-12T00:14:53.990044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.971458Z","title":"Zero-shot reward specification via grounded natural language","venue":null,"work_id":"9ce527ac-010b-4c8e-b13b-664e8764d76b","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:52.985936Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:1a7043d6b0ee30f8c69078321be2c79919cd36842845f27df9ae4d5646ce3ffc","observation_id":"b55f337b-9e5b-4307-aceb-65f4ba04ded5","resolution":{"observed_at":"2026-08-12T00:14:53.976167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.956883Z","title":"Vision-language models are zero-shot reward models for reinforcement learning","venue":null,"work_id":"3e181f47-1050-4162-af51-88c23497220e","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:52.991180Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:2d004ee605ce8807ea010b6067466b0c37a5d274598f06271c756e7a9d4e2949","observation_id":"f9155e15-4f48-49bb-96ce-76367a7a3dfe","resolution":{"observed_at":"2026-08-12T00:14:53.961646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.942920Z","title":"R3m: A universal visual representation for robot manipulation","venue":null,"work_id":"6645cbb8-b790-4eb5-acd8-093e191e2c07","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:52.996765Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:19d2eac5f5a9bda4ac95c03fc4af9f95dcf339892ea2ed0e751439f9b5ef2aba","observation_id":"a8053856-7d00-4b58-9108-ab430e8a554c","resolution":{"observed_at":"2026-08-12T00:14:53.947687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.928251Z","title":"Liv: Language-image representations and rewards for robotic control","venue":null,"work_id":"f2881c99-07b9-4d08-b973-5f22956c01d3","year":2023},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.001334Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:dcecc88af8b4c94c93ae696c816f4b1375a0a1217642230bce1523a281ba554d","observation_id":"07acc79e-15e9-4b1c-95e9-a1fc83444920","resolution":{"observed_at":"2026-08-12T00:14:53.933060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.913389Z","title":"Roboclip: One demonstration is enough to learn robot policies","venue":null,"work_id":"ac5908fa-32a1-45ed-9204-27eea4aaf22f","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.005797Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:9db3cb9b7a2fe4c05f04e78d9dc123ca3e7eb4ac72a6d6ebd8d97a07fa645a3a","observation_id":"2033ec3d-347e-4ae9-87ba-9d65181455cd","resolution":{"observed_at":"2026-08-12T00:14:53.918272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.899572Z","title":"GPT-4V(ision) System Card","venue":null,"work_id":"bd6149de-f0fe-43b8-b9ca-8b2616ede14a","year":2023},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.010476Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:3748672701cf349d3a5f369a1ad18c30d4b30e9d1d5938d8c078d17a629b12c3","observation_id":"2990cf95-b285-4e96-a8a9-fbf19b8bb106","resolution":{"observed_at":"2026-08-12T00:14:53.903878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T00:14:53.014866Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv2024, arXiv:2403.05530","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.014866Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:499f14f51f0ee26f6e5e7ffdb7a0b530ecefbffe8a599c89d5a5a9fee887666e","observation_id":"9c314c26-8c9a-46f4-a9f0-09e522bf5538","resolution":{"observed_at":"2026-08-12T00:14:53.014866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.884667Z","title":"Hello GPT-4o","venue":null,"work_id":"e53f4fa8-4894-47be-9e65-1b75c6104e54","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.020003Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:849df4fa35878bc58dbcc302e5c595cd68a5da02713d16457f08d310ffc2053f","observation_id":"3047651b-19a2-4a6d-a31a-50c0f4d60cc7","resolution":{"observed_at":"2026-08-12T00:14:53.889371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-08-14T05:42:22.751765Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-12T00:14:53.024968Z","title":"Ai2-thor: An interactive 3d environment for visual ai.arXiv2017, arXiv:1712.05474","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.024968Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:37edd8f23f37efdde8b8387f244edd8d732fbfa62bf3cc8704c4065cf63efd7f","observation_id":"670f002b-94a5-4577-b3db-bdee28bad407","resolution":{"observed_at":"2026-08-12T00:14:53.024968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.870063Z","title":"Vision-language models for vision tasks: A survey.IEEE Trans","venue":null,"work_id":"34d7faf7-34e1-4750-b447-d315ffff780b","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.030102Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:3aa8ecd2beb5a49fc3ece8e8466f28c3d150d4764537aab574463675e4a9b268","observation_id":"2fb2de0c-0c4f-4006-8ce3-52c4b86c4a62","resolution":{"observed_at":"2026-08-12T00:14:53.874826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.855762Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":"564ffeb4-f5a1-40e0-9d4f-292deb941ea1","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.034808Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:7623fbbc578ce5cb2a7a7b402fc72dc5274eade5f339bd1765c9c480532b435e","observation_id":"2608f3ab-abab-4fcd-85fd-0ad77c527455","resolution":{"observed_at":"2026-08-12T00:14:53.860356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T00:14:53.039341Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv2024, arXiv:2409.12191","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.039341Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:ddfa5d7a7fec5b5a7b1615a80cbb95023c5af919b0634160d2122b4a8865c1d4","observation_id":"057600a0-43cb-4414-af5b-ce7aaa40080e","resolution":{"observed_at":"2026-08-12T00:14:53.039341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.841955Z","title":"Rethinking spatiotemporal feature learning: Speed-accuracy trade-offs in video classification","venue":null,"work_id":"437aef0f-11e3-46ef-9965-bf217e121b89","year":2018},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.044011Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:30a34cfc3585ab4e8b307df0c616159ed3be320e293e9a0d998e8b5ff5d0b4be","observation_id":"b3e57602-3110-4556-87d9-25f35a935ef5","resolution":{"observed_at":"2026-08-12T00:14:53.846250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.828250Z","title":"A survey of reinforcement learning informed by natural language","venue":null,"work_id":"d090b254-88d5-4387-83bb-eaa2c5df419b","year":2019},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.048688Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:ceb0789d99bbf5f11c670e37ecbc27c90d977e8d058d723e0a0bbefc4224d744","observation_id":"c04b2b11-fe66-4ca4-b477-435613260d6c","resolution":{"observed_at":"2026-08-12T00:14:53.832557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.813822Z","title":"Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation","venue":null,"work_id":"38ef2571-bb0f-4b94-ba35-205ab3800efe","year":2019},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.052911Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:001c963684273f7f82dd95d4ac45799a267917bb7158330aa645f1058f5ecc24","observation_id":"f16293f2-7118-4254-9828-d4e78ad76809","resolution":{"observed_at":"2026-08-12T00:14:53.818648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.799122Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks.IEEE Robot","venue":null,"work_id":"662632a6-1932-4286-89f9-84105daed218","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.057004Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:1bcb4482f03ded3d1e69705d3afcc1345e01d12de88c3f108e49234134becbec","observation_id":"70cd1617-4951-4e84-bc49-a1b9f644e150","resolution":{"observed_at":"2026-08-12T00:14:53.803771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.784660Z","title":"Walk the talk: Connecting language, knowledge, and action in route instructions","venue":null,"work_id":"c76f5952-c942-4e63-b427-0c2bc7f3a976","year":2006},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.061250Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:25ce34cb3eb8bb444dea0206c787d3d5d2b3049eafcede8bccd689461cc0fef2","observation_id":"82f919d6-c83c-4f55-8c1f-490264fa23ef","resolution":{"observed_at":"2026-08-12T00:14:53.789435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.769550Z","title":"Toward understanding natural language directions","venue":null,"work_id":"2cee68b3-0281-4bc8-8566-1ca0d2edf87c","year":2010},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.065238Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:dc9569d03d56a681d2901bbef085ababe695fb0406d48a394c4bbfa8e0998972","observation_id":"1bf8c1bc-07e8-40ca-9415-89a8c629f9c1","resolution":{"observed_at":"2026-08-12T00:14:53.774718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.753389Z","title":"Tell Me Dave: Context-Sensitive Grounding of Natural Language to Manipulation Instructions","venue":null,"work_id":"40b19ccb-8202-438a-ae96-7181013772cd","year":2014},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.069565Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:1f68321586d0fb0aaaa5235c40bab96d602e0d69b1e16985feade4940ea212d4","observation_id":"2f8ffcc9-6ca5-4545-b5ab-b526ed1cb11b","resolution":{"observed_at":"2026-08-12T00:14:53.758600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.737035Z","title":"Grounding English Commands to Reward Functions","venue":null,"work_id":"bfa728a1-2e62-4e81-9ba0-caf53bf3e632","year":2015},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.073985Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:d190e6e26b0f882f014b8e572d9afac9216312c4d97e384bbcaca91d3877a0ee","observation_id":"1c3f86e7-2fc7-4c8a-8989-8f3e92e32445","resolution":{"observed_at":"2026-08-12T00:14:53.742233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.720717Z","title":"Learning language-conditioned robot behavior from offline data and crowd-sourced annotation","venue":null,"work_id":"2828625c-ee5f-4ca9-b3eb-d5f693e9ea2c","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.078422Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:6d0597f0312a37228ac5c00cb9b62ad699a5ec61818869c8fff86331ad35afcb","observation_id":"a6b9ce72-d0fd-4e7b-83fa-7fc28cf49b81","resolution":{"observed_at":"2026-08-12T00:14:53.725996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.705586Z","title":"Algorithms for inverse reinforcement learning","venue":null,"work_id":"65d71970-bd0c-4ed8-8a6d-bd3e721b7764","year":2000},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.082907Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:4ad4e94301ae07cd11ba01cdb8a767274e96f83c1740ff2a45af90e8dee66096","observation_id":"9a76092d-810a-479b-ba14-b89331bae3fe","resolution":{"observed_at":"2026-08-12T00:14:53.710498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.690645Z","title":"Apprenticeship learning via inverse reinforcement learning","venue":null,"work_id":"d0727770-2386-439f-ab4b-4133715f8a37","year":2004},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.088367Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:1c26c7de35b8318a6a96af8bf44052943c0e0ea271df63925878135221466159","observation_id":"d5f7fd72-74aa-4471-9d50-71d25c3d7044","resolution":{"observed_at":"2026-08-12T00:14:53.695498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.676712Z","title":"Generative adversarial imitation learning","venue":null,"work_id":"85fbafa5-0e3a-4aec-9312-e5261d08f007","year":2016},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.092958Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:4a4d3a5a21088db4e73c31aaced9f5f76ae402e8684db1289fed832c8951fa60","observation_id":"92992ae9-aa61-4fef-b507-2a3dfa458998","resolution":{"observed_at":"2026-08-12T00:14:53.680865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.662274Z","title":"From language to goals: Inverse reinforcement learning for vision-based instruction following","venue":null,"work_id":"8f55797e-8558-495f-b486-6df71e643925","year":2019},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.098089Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:7541975244143de1692e6815502e5c27982afb35b673e9d37ddfafcefa0c9988","observation_id":"a8447baa-7fb1-4f17-a60d-827673d5ac3e","resolution":{"observed_at":"2026-08-12T00:14:53.667083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.646896Z","title":"Learning to Understand Goal Specifications by Modelling Reward","venue":null,"work_id":"314e6b08-d55e-43a3-9550-7e388ec7085e","year":2018},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.102920Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:3c48e0d13b45ccbcf990c08ea4b7d7c8520750b69f2983838d9d935cc9ccb18d","observation_id":"1626dc02-bb2f-4774-a44e-c3750f02122c","resolution":{"observed_at":"2026-08-12T00:14:53.651779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.632413Z","title":"Reward Design with Language Models","venue":null,"work_id":"ad3b6f8c-d799-4b5b-a814-16069469d6fd","year":2023},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.107505Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:1833af05b4addcb2b7b46168256c84d0247c26418dce0753be0d75d25f99c7cd","observation_id":"2c859d64-d627-4053-86b0-65671139af75","resolution":{"observed_at":"2026-08-12T00:14:53.637245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-17T22:16:17.971851Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-12T00:14:53.112288Z","title":"Language to rewards for robotic skill synthesis.arXiv2023, arXiv:2306.08647","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.112288Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:a72721ad4bf74e0ef038bacefe304f25d4fc9f8b45f0682a1afc0f3e00ef0d94","observation_id":"be7ad28a-7900-4234-a019-b335c08756fe","resolution":{"observed_at":"2026-08-12T00:14:53.112288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.617948Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":null,"work_id":"8a397449-5f56-45d1-a763-e87b00779966","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.118463Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:08013d73da9efc138fbce11a0105278c289384f5c18a7cceb8c2918ddfc83979","observation_id":"ef575489-4022-42da-9e92-42acbf469b03","resolution":{"observed_at":"2026-08-12T00:14:53.622640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.602996Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":"35305b15-e5d0-44bc-834a-3ef95c0feea1","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.123096Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:f4a3cac5b0a88a3c8e4aaa508b07b488cd6a8f4bded5ed6d7c39f426d87bba15","observation_id":"2812868e-82b7-4310-8c34-87a4bf4ed523","resolution":{"observed_at":"2026-08-12T00:14:53.607822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.588433Z","title":"Robogen: Towards unleashing infinite data for automated robot learning via generative simulation","venue":null,"work_id":"5e2b14b0-c9c3-4388-8147-30e29ed447c3","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.127834Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:9da5f89809e60312683ef430687e1bf8b99addbcb3446ac61bacd2fa6023caee","observation_id":"9152c17e-adbe-4bde-9c6f-75188065e6cb","resolution":{"observed_at":"2026-08-12T00:14:53.593269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.573092Z","title":null,"venue":null,"work_id":"743f7571-a8fa-4f96-9279-b2205586cb10","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.132841Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:30f64010cd91084e1fe195d78d7441d9336962a0e3b83bd9f8d1bd370999721a","observation_id":"f4e19eba-c9bb-4a31-8415-3442f2618c5b","resolution":{"observed_at":"2026-08-12T00:14:53.578351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.557600Z","title":"Vision-language models as success detectors","venue":null,"work_id":"e3f56442-f7b2-4bc2-8460-14f9ad4995f0","year":2023},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.137917Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:535096b944ffe105751518148b950ac8b5586c3b5025547c1c96af758861f9a1","observation_id":"c311f943-f30d-48f8-a359-d46742391e30","resolution":{"observed_at":"2026-08-12T00:14:53.562755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.542218Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback","venue":null,"work_id":"995b87f7-4f46-41aa-80fd-3f5d0f5fcaea","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.142723Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:5f747305cbadc80a1f6ddabcfc1a729a3ac93f924f42989f5b434e24ad76401f","observation_id":"79ed6e64-f6f7-4650-a39d-e52cb36eda0d","resolution":{"observed_at":"2026-08-12T00:14:53.547176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.526651Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"537994b8-713b-4b3b-84d6-f242e214a412","year":2017},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.147190Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:195142434c5a8febef107902bfa47c58fc8386ae01ecb6692faa70985fbd3965","observation_id":"ea720739-e555-41e2-835a-30e40e9dc585","resolution":{"observed_at":"2026-08-12T00:14:53.531829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.510990Z","title":"Interactive learning from policy-dependent human feedback","venue":null,"work_id":"ea9662e3-e0aa-4d9a-81c5-3ccaa44abfe0","year":2017},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.151536Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:3096772794fccfec253990cdc8d175d799be90c411187c37321132a5f46e4bf2","observation_id":"e6b72b7a-31fd-4d77-a1aa-174466f1f682","resolution":{"observed_at":"2026-08-12T00:14:53.516014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.497197Z","title":"Learning reward functions from scale feedback","venue":null,"work_id":"6b9a05c2-cea4-4d6d-ac97-afbaaa44f5f4","year":2021},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.156022Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:09e7a770c7f4754ae65190ca5db15fbcbb6737bc25cc6af76d5f46eae7b68752","observation_id":"5d9ded7e-8af5-4068-a227-11530886fa47","resolution":{"observed_at":"2026-08-12T00:14:53.501676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.480947Z","title":"Rating-based reinforcement learning","venue":null,"work_id":"73aa2330-36c6-49f4-9edd-a2622fd3dcfe","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.160639Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:f94ebe4eedb6d177fc5e6d4a080450a47dc69ed4178d10eb3f0be30e14302ec0","observation_id":"d6e4fbe1-6ec7-465a-aa33-5aad1c0f33c3","resolution":{"observed_at":"2026-08-12T00:14:53.486183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.465878Z","title":"NExT-QA: Next Phase of Question-Answering to Explaining Temporal Actions","venue":null,"work_id":"4083dd76-9c81-4768-acbb-75a2ccdeb1b5","year":2021},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.165188Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:8579880c6a63ec73ee17e3c6571ab3842d7954150a28444c325e263cd8d9a01e","observation_id":"f08808fd-23b0-441a-8b15-7802c64250ec","resolution":{"observed_at":"2026-08-12T00:14:53.470836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.450529Z","title":"From Representation to Reasoning: Towards Both Evidence and Commonsense Reasoning for Video Question-Answering","venue":null,"work_id":"31b49371-2fcb-4225-b5b1-6909b399734a","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.169788Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:d7e70d9fd8433a485a35ef64a06a04a1445c05a9a0d232edebfe95b1b09d7004","observation_id":"7f87dfa0-47ed-4eaa-a44d-269017156998","resolution":{"observed_at":"2026-08-12T00:14:53.455584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.434254Z","title":"Discovering the Real Association: Multimodal Causal Reasoning in Video Question Answering","venue":null,"work_id":"8f3d14ad-6c52-47a1-a67c-830885f59fdd","year":2023},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.174719Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:370db6ce703358c757aaaf9b5fde22774caa19b4741f477a6a0651e0cf1f435d","observation_id":"5a586739-b824-4f3b-951c-a71c053bd80a","resolution":{"observed_at":"2026-08-12T00:14:53.439686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.418556Z","title":"MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning","venue":null,"work_id":"8f168cc8-0a9e-408d-af16-8ef5712fc931","year":2024},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.179150Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:b961a1a8ed5b49150b2bddf85f454a6e6a9858d90d14f3b636dd8d8efb869728","observation_id":"3ea084ff-a6a9-42da-9e30-7c2d31fafa24","resolution":{"observed_at":"2026-08-12T00:14:53.422990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.404435Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback.Trans","venue":null,"work_id":"b6d33f3c-df77-4db2-aa0f-393a79adfe8c","year":2023},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.183259Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:2c95d7188ca8846f62bd3500a6cc04b00876e0a23ae65913d9ee5607bbc7375b","observation_id":"62820c07-afc0-4168-ba52-1cadd8b5d15b","resolution":{"observed_at":"2026-08-12T00:14:53.408760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.388905Z","title":"Visual prompt tuning","venue":null,"work_id":"86f78b4e-8221-4fd9-b53e-81811ed5ca15","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.187182Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:0394d8c751f226bf703f7b39f05ef90d31b5abcb06f266eee7cab7d3f81e7df8","observation_id":"7910f685-215b-4657-9ba9-34acda89ef37","resolution":{"observed_at":"2026-08-12T00:14:53.393842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.372091Z","title":"Visual prompting via image inpainting","venue":null,"work_id":"695fa3e0-af34-4902-8257-12caa850467a","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.191045Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:0c1f75e14733b8464b29155c272b17c07683bd31645241cb20b2b89ebc53e575","observation_id":"24a82449-7086-4698-8b78-46dc96409596","resolution":{"observed_at":"2026-08-12T00:14:53.377631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.356232Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":"aaa08e60-6c95-4f50-80c7-9ad336b5bb93","year":2023},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.195003Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:93ef7bd9ef8dcebf15029bc9724dd3c9e24b5cc42bcea13fadb8f64d6213ebb1","observation_id":"1bf75583-801e-4e89-aaeb-34e63fb22ce2","resolution":{"observed_at":"2026-08-12T00:14:53.361646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.339828Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":"c0c67c5d-1270-4fb5-ac00-7ab08aae8edc","year":2022},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.199150Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:c651c52b75ea17afae988267b03cd5e6b9b7e0cd977f5011e4ff4a09c984f018","observation_id":"286f98ee-f24b-4863-ad9f-f26b17dfc6aa","resolution":{"observed_at":"2026-08-12T00:14:53.344912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.323661Z","title":"Bootstrap your own skills: Learning to solve new tasks with large language model guidance","venue":null,"work_id":"0d22632f-d874-40aa-9cca-20d970bcb56b","year":2023},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.203175Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:b172650a9cbd20bdd613547e4885c0d9b349a768bce1cc2df66cd3c219cb98bc","observation_id":"3e54e165-b3e7-47c0-8e8c-c497aadef2c5","resolution":{"observed_at":"2026-08-12T00:14:53.328819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:14:53.305249Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"958f4325-e844-4786-8c61-da5ef6fd6442","year":2016},"citing_paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T00:14:53.207582Z"},"links":{"citing_paper":"/paper/2608.08273"},"observation_digest":"sha256:07c95d5728a75b11ca4530d0c898a827f8a587a4e5e843057c19a9b3e82f1b4c","observation_id":"cd29952b-f632-4979-af5d-f23506e1c664","resolution":{"observed_at":"2026-08-12T00:14:53.311803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08273","last_updated":"2026-08-08T18:05:21Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-18T06:50:28.896932Z","submitted_at":"2026-08-08T18:05:21Z","title":"Action- and Language-Conditioned Video Assessment for Embodied Control"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2608.08273."}