{"as_of":"2026-08-13T07:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bedec89906f437fadc4d71cd3c32ac7bdce8d637eda57f155c9946e3bb8bbe71","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:45:47.406893Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13211/citation-record","integrity":"/paper/2411.13211/integrity","json":"/paper/2411.13211/citation-record.json","paper":"/paper/2411.13211"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.161355Z","title":"Mas- tering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.161355Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:29d0e0244c1ace0f2ec7c90f12364adf9ff41c9af840127eb7052438ce71d047","observation_id":"fcc889a0-0f25-4e85-9f8f-3a7b480f2842","resolution":{"observed_at":"2026-08-12T16:45:47.161355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03539","last_updated":"2024-09-16T15:41:05Z","snapshot_observed_at":"2026-08-12T23:07:29.809700Z","submitted_at":"2024-08-07T04:35:38Z","title":"Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03539","snapshot_observed_at":"2026-08-12T16:45:47.168907Z","title":"Deep reinforcement learning for robotics: A survey of real-world successes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.168907Z"},"links":{"cited_paper":"/paper/2408.03539","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:1e03efeb25e49b8efe170a9503bf4de5ee441c128eb47e17ba7da1cea05b5b42","observation_id":"534fdd08-0d02-4d4d-bc0a-d5ea9d2d8de7","resolution":{"observed_at":"2026-08-12T16:45:47.168907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.150100Z","title":"Specification gaming: the flip side of ai ingenuity","venue":null,"work_id":"eb51ad70-4856-4ebd-9b00-49e895d51ba0","year":2020},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.176949Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:db649cde164f8c78d98cacd7a98d0f41795c6ea70ca38a4792f1c41fe8ae7550","observation_id":"e7042915-8ccb-4735-8104-11b6b7592550","resolution":{"observed_at":"2026-08-12T16:45:48.155246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.132737Z","title":"Defining and characterizing reward gaming","venue":null,"work_id":"2ef9ddfd-2092-4391-a3a2-9cc6a55f5116","year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.184902Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:a1bb0debd66df38ca225555f5bb8bf11c5ff58fccf72ab1bbfe7fe95fea9be68","observation_id":"e93a6f76-1f30-4f21-868b-f11ca058f76c","resolution":{"observed_at":"2026-08-12T16:45:48.138168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.114419Z","title":"On the importance of hyperparameter optimization for model-based reinforcement learning","venue":null,"work_id":"87bc821b-08e2-47a6-92cb-fa489a27a3ce","year":2021},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.191282Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:898b3c29126d6a41d24bf26a2eac7df27c186ff6152946c18e2761d8ac089f75","observation_id":"ae624301-8431-4ccc-9a5a-72ae93f62973","resolution":{"observed_at":"2026-08-12T16:45:48.120939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.096264Z","title":"Variational inverse control with events: A general framework for data-driven reward definition","venue":null,"work_id":"838e633e-881d-4afa-8409-cc5f08e6138c","year":2018},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.198072Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:57671d04358d2996d6ac2d10945a5a8f3002817a9d2cb081fc30529f19e9be09","observation_id":"ee53c557-2a5a-4e63-a00a-7aada7a3959c","resolution":{"observed_at":"2026-08-12T16:45:48.101686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.204429Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.204429Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:10d3e8bdf2959a53fbb0ab29335ef4db0b80f66dbe0223cdd54266d55f07e586","observation_id":"b13ec86d-3df7-422f-bb34-42b565521e38","resolution":{"observed_at":"2026-08-12T16:45:47.204429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-13T05:45:12.364751Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-12T16:45:47.211087Z","title":"Vision- Language Models are Zero-Shot Reward Models for Reinforcement Learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.211087Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:4b2fe7cdf6fe2734980ea2dc9f52ecec81b73e9e3c7d1dce4a26d83ea38a211a","observation_id":"1c616136-d84a-46b6-ad8c-e02bdf1af33c","resolution":{"observed_at":"2026-08-12T16:45:47.211087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07899","last_updated":"2023-10-11T21:10:21Z","snapshot_observed_at":"2026-08-13T05:51:45.729725Z","submitted_at":"2023-10-11T21:10:21Z","title":"RoboCLIP: One Demonstration is Enough to Learn Robot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07899","snapshot_observed_at":"2026-08-12T16:45:47.217346Z","title":"Sontakke, Jesse Zhang, Sébastien M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.217346Z"},"links":{"cited_paper":"/paper/2310.07899","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:61837a1cefd06b62299bc0f122dc13ab0c678b42739d3296ea00f0a437a6c6e7","observation_id":"ae1fa5bf-97f7-4b05-8bdb-1c3086adaa46","resolution":{"observed_at":"2026-08-12T16:45:47.217346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04210","last_updated":"2024-08-11T07:13:50Z","snapshot_observed_at":"2026-08-13T05:51:15.072422Z","submitted_at":"2024-02-06T18:07:43Z","title":"Task Success is not Enough: Investigating the Use of Video-Language Models as Behavior Critics for Catching Undesirable Agent Behaviors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04210","snapshot_observed_at":"2026-08-12T16:45:47.222909Z","title":"Task Success","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.222909Z"},"links":{"cited_paper":"/paper/2402.04210","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:dbf86634fc5f67d4a50b971bb573b10e0649d54a5d654f8fd69080b61323caee","observation_id":"aa9aa0c6-3229-493d-a173-15357e8c13cb","resolution":{"observed_at":"2026-08-12T16:45:47.222909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16817","last_updated":"2021-03-31T05:25:05Z","snapshot_observed_at":"2026-08-04T13:03:06.497574Z","submitted_at":"2021-03-31T05:25:05Z","title":"Learning Generalizable Robotic Reward Functions from \"In-The-Wild\" Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.16817","snapshot_observed_at":"2026-08-12T16:45:47.228810Z","title":"in-the-wild","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.228810Z"},"links":{"cited_paper":"/paper/2103.16817","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:d1da99b5d1bdd1340420db225483342654fdeedb5552e13e671024342593830f","observation_id":"a0169577-c9f9-4b4f-aace-dcf08d21b2bf","resolution":{"observed_at":"2026-08-12T16:45:47.228810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.065549Z","title":"The unsur- prising effectiveness of pre-trained vision models for control","venue":null,"work_id":"bc887f70-1d49-4964-96b0-a0283788614a","year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.233963Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:ea5d8019998f8a5632baa12eba14e08097f3d0e8a3f09c5b42518dd4773a779d","observation_id":"6718bc60-6efa-4b08-99ee-8934da57ee5c","resolution":{"observed_at":"2026-08-12T16:45:48.070961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-11T16:00:06.021847Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-12T16:45:47.239421Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.239421Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:676427cc0312fd66b7cd679f76a9d389a9b7d30fc313951a2d2d356c2d1f85e2","observation_id":"e8819983-5ecb-496f-bbce-4df5d85468f5","resolution":{"observed_at":"2026-08-12T16:45:47.239421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-13T00:49:16.605081Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-12T16:45:47.244847Z","title":"Smith, and Han- naneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.244847Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:ea9573f402d02a35e30e5489b9cd65d5f3c9b0e85e68e826a7015d16cbdb7c08","observation_id":"ed1eaabf-97a8-4d83-ba2c-94c173cec3a2","resolution":{"observed_at":"2026-08-12T16:45:47.244847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.047859Z","title":"Reward learning from narrated demonstrations","venue":null,"work_id":"ce72351f-16fa-4ddb-99c9-7330486a32e8","year":2018},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.251372Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:b1ad3397133d8f6196a2b2d9db70640734df6c2424c052f2fe541b004446f742","observation_id":"2d89699d-a082-48fc-9303-2e05cfd4779b","resolution":{"observed_at":"2026-08-12T16:45:48.053066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.029943Z","title":"Zero-shot reward specification via grounded natural language","venue":null,"work_id":"6678180b-b16b-4578-864c-647234694f7c","year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.256190Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:f7d073db4a393c34061273e7e9894a98c197a65d80a310fe9d163d68d5c76de5","observation_id":"710e80fd-f955-423f-8ebe-7018aaa971bc","resolution":{"observed_at":"2026-08-12T16:45:48.035370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-13T04:25:31.366043Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-12T16:45:47.260990Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.260990Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:3cb17c2606720786c14e22830efe54d515fe19f7f1215cbd877f69817befc975","observation_id":"cc57d9c5-0e98-4c8f-95e1-cf4e4564c3f0","resolution":{"observed_at":"2026-08-12T16:45:47.260990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15527","last_updated":"2024-02-21T07:09:58Z","snapshot_observed_at":"2026-08-13T04:13:57.403682Z","submitted_at":"2024-02-21T07:09:58Z","title":"PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15527","snapshot_observed_at":"2026-08-12T16:45:47.265925Z","title":"PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.265925Z"},"links":{"cited_paper":"/paper/2402.15527","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:96888a05d59f9c3cee1bc0f645e77ebbc7d49cc28f3aa1f1f44939cfdf6838c8","observation_id":"e93e662b-5681-4cfe-b64a-ed702c29e75b","resolution":{"observed_at":"2026-08-12T16:45:47.265925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:48.013118Z","title":"Paxion: Patching Action Knowledge in Video-Language Foundation Models,","venue":null,"work_id":"8997d793-6741-47a8-92fa-b9240dae9c70","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.271210Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:3491f84b3b4f95073fd02c20f4841b4129dc453b3f876df25cf8ba12cb81173a","observation_id":"bd236a1c-d166-4044-b0fc-81fa4e9e125e","resolution":{"observed_at":"2026-08-12T16:45:48.018311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09227","last_updated":"2024-03-14T09:48:36Z","snapshot_observed_at":"2026-08-06T09:37:53.788323Z","submitted_at":"2024-03-14T09:48:36Z","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09227","snapshot_observed_at":"2026-08-12T16:45:47.281865Z","title":"Matthews, Ivan Villa-Renteria, Jerry Huayang Tang, Claire Tang, Fei Xia, Yunzhu Li, Silvio Savarese, Hyowon Gweon, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.281865Z"},"links":{"cited_paper":"/paper/2403.09227","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:561b140e39257a7c5de8100de737b1edcfadb1a1adee97b98a6c6939134ceeed","observation_id":"12d3fae1-9b50-49d4-b082-a0c025bed755","resolution":{"observed_at":"2026-08-12T16:45:47.281865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07011","last_updated":"2018-06-19T02:16:44Z","snapshot_observed_at":"2026-08-03T16:15:12.385367Z","submitted_at":"2018-06-19T02:16:44Z","title":"VirtualHome: Simulating Household Activities via Programs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07011","snapshot_observed_at":"2026-08-12T16:45:47.286943Z","title":"VirtualHome: Simulating Household Activities via Programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.286943Z"},"links":{"cited_paper":"/paper/1806.07011","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:c25a8470192054629b18b9058bb63f3e3530a06ea3dcabf648fc2d98be2016cc","observation_id":"5874afd9-ede9-4663-bd7a-ac3b4119de37","resolution":{"observed_at":"2026-08-12T16:45:47.286943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.997194Z","title":"Habitat: A Platform for Embodied AI Research, 2019","venue":null,"work_id":"b61bb28a-5195-425f-9ca9-9a7dd35fa7ca","year":2019},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.292786Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:c3e376eaf90da4969633dcf95e7212eab435b40d52f5d0029e20489366ee37fa","observation_id":"71db451c-40d2-45f9-8b25-7e66452edb7b","resolution":{"observed_at":"2026-08-12T16:45:48.002322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13724","last_updated":"2023-10-19T17:29:17Z","snapshot_observed_at":"2026-08-13T05:45:12.083288Z","submitted_at":"2023-10-19T17:29:17Z","title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13724","snapshot_observed_at":"2026-08-12T16:45:47.297556Z","title":"Turner, Oleksandr Maksymets, Zsolt Kira, Mrinal Kalakrishnan, Jitendra Malik, Devendra Singh Chaplot, Unnat Jain, Dhruv Batra, Akshara Rai, and Roozbeh Mottaghi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.297556Z"},"links":{"cited_paper":"/paper/2310.13724","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:e751599cb51104e3df9dcff521c30a3fc73f2b2180bdc8925889a47ce22ddc06","observation_id":"bb1bd04c-aecc-4cc9-89e0-8037a97f1019","resolution":{"observed_at":"2026-08-12T16:45:47.297556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01734","last_updated":"2020-03-31T01:18:33Z","snapshot_observed_at":"2026-08-12T02:06:48.074254Z","submitted_at":"2019-12-03T23:18:59Z","title":"ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01734","snapshot_observed_at":"2026-08-12T16:45:47.303205Z","title":"ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.303205Z"},"links":{"cited_paper":"/paper/1912.01734","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:71b4fcb2cdd3872a3131baa82895d1da2cdbdebd816a91dfdd5cf7c7da3dc842","observation_id":"2279356c-1ac0-415b-9d63-798035e8fa5d","resolution":{"observed_at":"2026-08-12T16:45:47.303205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-08-13T00:33:12.549904Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-12T16:45:47.308527Z","title":"A short note on the kinetics- 700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.308527Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:26ecbf45879de227f33d036c559bc70adef9b0368cca47a3187e08ea5677a09d","observation_id":"f0770c95-1ffe-4f66-bf58-fe6bfe25b17b","resolution":{"observed_at":"2026-08-12T16:45:47.308527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.980302Z","title":"BEDD: the minerl BASALT evaluation and demonstrations dataset for training and benchmarking agents that solve fuzzy tasks","venue":null,"work_id":"c9817328-e008-492d-a892-4b983cee36e9","year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.314036Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:f82e431b3f0d553d8bab2ad24334a02e52beb7a15f773849c0eca471870227fb","observation_id":"c5d0ccb6-c9d5-4759-9588-a02d4e5e6e0b","resolution":{"observed_at":"2026-08-12T16:45:47.986056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16563","last_updated":"2023-12-04T14:53:15Z","snapshot_observed_at":"2026-08-12T12:36:41.051925Z","submitted_at":"2023-03-29T09:45:50Z","title":"Skill Reinforcement Learning and Planning for Open-World Long-Horizon Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16563","snapshot_observed_at":"2026-08-12T16:45:47.319151Z","title":"Plan4mc: Skill reinforcement learning and planning for open-world minecraft tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.319151Z"},"links":{"cited_paper":"/paper/2303.16563","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:1321586a02ad47955266a870a41d805e96a50966713879c2b4503dadcc244790","observation_id":"7826661d-af97-436e-821c-bab9a859cffa","resolution":{"observed_at":"2026-08-12T16:45:47.319151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.324717Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.324717Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:ccd52f1158c409cfe6f97cf2310875b1aee6bf704694c02bee0e8f890d41b1ee","observation_id":"d2683055-6a7f-4111-9dd9-1f7db5471581","resolution":{"observed_at":"2026-08-12T16:45:47.324717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07143","last_updated":"2024-07-13T14:20:07Z","snapshot_observed_at":"2026-08-09T21:43:00.189321Z","submitted_at":"2022-12-14T10:24:50Z","title":"Reproducible scaling laws for contrastive language-image learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07143","snapshot_observed_at":"2026-08-12T16:45:47.329565Z","title":"Reproducible scaling laws for contrastive language-image learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.329565Z"},"links":{"cited_paper":"/paper/2212.07143","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:7ae98c829fe0eada3de857a4174da14d8c6d5c3f880ddb438c967de90be55b5d","observation_id":"e028cb0c-5dc6-43e0-a6a0-b2a019949f23","resolution":{"observed_at":"2026-08-12T16:45:47.329565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-12T16:45:47.334727Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.334727Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:879614efa9ec5428b1b9fed62534acd5cf08c372941efeac950cabf05ee2b201","observation_id":"7cb16373-0c7a-453d-b7b7-d9eb3609c871","resolution":{"observed_at":"2026-08-12T16:45:47.334727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-12T16:45:47.339786Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.339786Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:910e538c456fef05f6168413d17a5d446d433a98e2d19db939bbc25f33b1144e","observation_id":"b1c1dc7f-dd84-4c26-a1f5-56965d91caf5","resolution":{"observed_at":"2026-08-12T16:45:47.339786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T16:45:47.344793Z","title":"break-craft","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.344793Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:b772ad417d3cf792571f1c19f124e6a97b975b04ab2fda2caeadf798e5a48c33","observation_id":"a5599288-1fb0-4b3a-a851-82adc3c08e5a","resolution":{"observed_at":"2026-08-12T16:45:47.344793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.953872Z","title":null,"venue":null,"work_id":"16ddfbcd-75d7-42cb-b2f5-15391ef4f171","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.350936Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:1f8d68357c95818ae5bd0a233807db0bb2d84a87fac1216e6e05a5d2084dd944","observation_id":"b56b9f6a-7f3e-411b-b0e0-2f5d1da7985b","resolution":{"observed_at":"2026-08-12T16:45:47.959247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.935986Z","title":"likely does not describe the video","venue":null,"work_id":"e65cc248-605b-4a2e-9e66-d4d5f83c8684","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.356076Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:8d256f35a262f1ecfdb5fb95d4f7f92dace8ce71824ffae544c62e336b08bdc6","observation_id":"0d463477-81d5-4b03-80d1-0e4d632067d4","resolution":{"observed_at":"2026-08-12T16:45:47.941465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.919290Z","title":"Player holds an oak fence block in their hands","venue":null,"work_id":"4643399c-6021-4eac-88a6-6873487b09ec","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.361398Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:36b34bcfbab53dfc35e9084f03a88d8eb1ab4eeec324e189303f052368c1ddaa","observation_id":"30a37c82-3666-4da5-88af-79c089e76955","resolution":{"observed_at":"2026-08-12T16:45:47.924572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.902873Z","title":null,"venue":null,"work_id":"ae788318-21e1-4dfb-8a6b-3aefe61e0c02","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.366264Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:48b2c79424301297abc5b978870f676e3c485f03679a031201bba5e19ab1fcdd","observation_id":"70e1214b-42bd-4e42-9f27-ab6895ef9a60","resolution":{"observed_at":"2026-08-12T16:45:47.907865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.886503Z","title":null,"venue":null,"work_id":"5df16f21-726f-4c3d-8897-94fcb5080266","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.371881Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:b55515047c7e43c0469c71c649c323251aeedbda8d56850c3f8873ce6b26a147","observation_id":"df5360ce-2569-4aa7-b5ad-0b5ad313d235","resolution":{"observed_at":"2026-08-12T16:45:47.891764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.871099Z","title":null,"venue":null,"work_id":"f57fd327-b795-41a5-aa34-a5c4dd24e85c","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.377065Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:3939e753e9a7d6135907af5da8ae09f9b242668c9b5b8a2c90f07bd6654ff435","observation_id":"a87f0140-0eb4-4f33-af8e-bb5b875d2568","resolution":{"observed_at":"2026-08-12T16:45:47.876042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.852675Z","title":null,"venue":null,"work_id":"e906522b-2a9f-48ef-b546-711fd8c2a095","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.382130Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:226fa966e46f75a5e9bc1193e7229c5055b4194ecae407209866fca4ff884607","observation_id":"57397734-49ee-4851-95fa-7ba559af7cbb","resolution":{"observed_at":"2026-08-12T16:45:47.858713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.835062Z","title":null,"venue":null,"work_id":"dd78f4d6-6cad-4946-9f96-5a41e14f8cba","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.387037Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:5d9e17c37a79311bf5a49802a061c93bc37758e241ff12a998afbde4c81b6595","observation_id":"1514cef4-3eb7-405d-aa8d-230ac9932723","resolution":{"observed_at":"2026-08-12T16:45:47.840209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.818855Z","title":null,"venue":null,"work_id":"632e79d2-cb10-41de-89e2-9596d0426099","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.392457Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:0cb8c3eb8dfcd03c9fc4b77ac11b63ba87d4188192fb754d5bc6dbe194ec6496","observation_id":"17260624-6b44-4002-beb6-dc5def08f35c","resolution":{"observed_at":"2026-08-12T16:45:47.823881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.803170Z","title":null,"venue":null,"work_id":"d9166d08-6801-4ab8-b9d7-2b7cb52d1784","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.397470Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:987ddc21c6bce21358a5911c97f9e84aa9b6b991b3b7b929c2900fe38541e62c","observation_id":"6b87587f-48bf-46ac-b72a-5ea90ab7105e","resolution":{"observed_at":"2026-08-12T16:45:47.807962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.787949Z","title":null,"venue":null,"work_id":"1f757a3a-4aeb-4057-8438-172bf4271446","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.402130Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:c06dbf185b0dc208ad94e1a44fad498380f32552159d1c32f12c9cb8a09bbc1b","observation_id":"23868eb5-550a-4cdc-aaaf-bc4eb6984541","resolution":{"observed_at":"2026-08-12T16:45:47.792703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:45:47.769571Z","title":"Figure 10: The prompt used to obtain frame-by-frame descriptions for Minecraft videos","venue":null,"work_id":"98e24b3d-1d2a-4b5a-ae1f-cd45618b08d0","year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.406893Z"},"links":{"citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:5783934c0f987b29c64f98e4479904b311a6a09e01be4082e5b9747a766aaf96","observation_id":"89dd84ec-b538-41e0-aba9-af172bd47aad","resolution":{"observed_at":"2026-08-12T16:45:47.776841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10683","last_updated":"2023-10-21T16:34:03Z","snapshot_observed_at":"2026-08-13T05:15:39.697199Z","submitted_at":"2023-05-18T03:53:59Z","title":"Paxion: Patching Action Knowledge in Video-Language Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10683","snapshot_observed_at":"2026-08-12T16:45:47.276058Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T16:45:47.276058Z"},"links":{"cited_paper":"/paper/2305.10683","citing_paper":"/paper/2411.13211"},"observation_digest":"sha256:0abbd0d99d207d1d2f1b627d1cb842d209471612fd5d53b53ad15c5c0e5f57ee","observation_id":"70ef0f7b-7277-46a0-89bb-879759f4bd46","resolution":{"observed_at":"2026-08-12T16:45:47.276058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.13211","last_updated":"2024-11-21T16:37:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T00:33:05.672886Z","submitted_at":"2024-11-20T11:19:22Z","title":"ViSTa Dataset: Do vision-language models understand sequential tasks?"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2411.13211."}