{"as_of":"2026-08-14T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e74aedc2d21037b13b3de821edcda3095dc113a718aa8c6acc326c3144d28ca4","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:10:46.421448Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T03:25:26.291747Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:21:26.116268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"cited_work":{"arxiv_id":"2411.09052","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09052","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"33 tasks over 3 compositional levels (L0/L1/L2) on ManiSkill2; even pretrained VLMs fail on L1/L2","venue":null,"work_id":"f24083ef-c321-4a7e-8cd9-2dd8eb2ecdb3","year":null},"citing_paper":{"arxiv_id":"2604.26689","last_updated":"2026-05-06T02:54:16Z","snapshot_observed_at":"2026-08-11T12:56:56.016831Z","submitted_at":"2026-04-29T13:56:11Z","title":"Atomic-Probe Governance for Skill Updates in Compositional Robot Policies","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T11:12:30.501043Z"},"links":{"cited_paper":"/paper/2411.09052","citing_paper":"/paper/2604.26689"},"observation_digest":"sha256:aaba2d611085de23e0c6ad4d48d0f080e86fd5741e352f8cd888d31d2b797f59","observation_id":"0f49247a-76b7-4a46-aedd-4da62c45cc81","resolution":{"observed_at":"2026-05-12T09:21:26.118216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"cited_work":{"arxiv_id":"2411.09052","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09052","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"33 tasks over 3 compositional levels (L0/L1/L2) on ManiSkill2; even pretrained VLMs fail on L1/L2","venue":null,"work_id":"f24083ef-c321-4a7e-8cd9-2dd8eb2ecdb3","year":null},"citing_paper":{"arxiv_id":"2604.26689","last_updated":"2026-05-06T02:54:16Z","snapshot_observed_at":"2026-08-11T12:56:56.016831Z","submitted_at":"2026-04-29T13:56:11Z","title":"Atomic-Probe Governance for Skill Updates in Compositional Robot Policies","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T03:25:26.291747Z"},"links":{"cited_paper":"/paper/2411.09052","citing_paper":"/paper/2604.26689"},"observation_digest":"sha256:9a5025176de16094c3729a9a5d122d88d38fbadf5efd854448e759987581e1bb","observation_id":"d3b485c0-5a92-433a-8a31-f7f4f4d351ac","resolution":{"observed_at":"2026-05-11T22:06:23.596263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.09052/citation-record","integrity":"/paper/2411.09052/integrity","json":"/paper/2411.09052/citation-record.json","paper":"/paper/2411.09052"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.084478Z","title":"Alayrac, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.084478Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:fcde29ccfc70e427e14ddf853687aa23de5815ef7b7d20cedd23950ff763f0b4","observation_id":"2c6af8fa-6f39-4186-ad41-6f9db5617171","resolution":{"observed_at":"2026-08-12T21:10:46.084478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.090617Z","title":"Bahdanau, H","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.090617Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:d1d0058bf1e3e49e9837c7fb83964bd0ac734d425401f901f8fc5c73690fe09a","observation_id":"1ba34407-835c-4a63-a5a0-0ac5be380e8a","resolution":{"observed_at":"2026-08-12T21:10:46.090617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.095842Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.095842Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:504dec2eb09d85f2c3fed9217060f8762715539f12e2454c282e8f00958bc02f","observation_id":"7b6a8fb9-975c-4450-bb6e-6679b9e0ee13","resolution":{"observed_at":"2026-08-12T21:10:46.095842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.100186Z","title":"Bhattacharyya, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.100186Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:4ac50eb53e373617cb14c119f1581b1bea908265f4a5f9fd6bbb9bb6cc7ea0ce","observation_id":"be659e5e-6e18-489d-8589-396d3114fc3f","resolution":{"observed_at":"2026-08-12T21:10:46.100186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-12T21:10:46.104422Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.104422Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:bdffe32b6146dc3363437e50cbc196ff0825661600dc7bf4f48bff47c261616b","observation_id":"22268713-c91e-42b9-94bb-68a3d1046853","resolution":{"observed_at":"2026-08-12T21:10:46.104422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T21:10:46.109001Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.109001Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:ca44be810fe8e06180a12608b5d9dfca5a2408531d13ac98e1ea4372ae47185c","observation_id":"6caea9b3-b158-49f0-9e63-62b1e085c5b6","resolution":{"observed_at":"2026-08-12T21:10:46.109001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T21:10:46.114518Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.114518Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:b4fc191a27fbd860609fe9531480d58035e9335fec54aa299b4cb0ef2070e0f0","observation_id":"54da9796-04fa-4dc8-b105-7ecf88f9d564","resolution":{"observed_at":"2026-08-12T21:10:46.114518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T21:10:46.119408Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.119408Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:a457a8e94c02be4022583368c4b334f27b72254b4e07c2ae9d50387647372eec","observation_id":"d6370412-b2d1-4502-985f-5bb28b639331","resolution":{"observed_at":"2026-08-12T21:10:46.119408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T21:10:46.123644Z","title":"Dubey, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.123644Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:65c30b46efeb9930c16c9a83a26d0e4416dbf771f05de94ddb9b76442c5f7b86","observation_id":"9e78159c-8d65-452c-8904-968158f3f5f9","resolution":{"observed_at":"2026-08-12T21:10:46.123644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-08-12T21:10:46.127941Z","title":"Ebert, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.127941Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:be668ed79258a418f5a5bb71ee1864466bbbc38ae0949d602ee6fd5f137d521c","observation_id":"05792bc4-7854-411b-9cf4-6e2e64ef2c06","resolution":{"observed_at":"2026-08-12T21:10:46.127941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00595","last_updated":"2023-09-26T10:47:35Z","snapshot_observed_at":"2026-08-13T11:04:17.407514Z","submitted_at":"2023-07-02T15:33:31Z","title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00595","snapshot_observed_at":"2026-08-12T21:10:46.132815Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.132815Z"},"links":{"cited_paper":"/paper/2307.00595","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:471de6a7c18d3ad8dfbd5e7c4aae1c1710226341e271f5ac31129cfb13f60208","observation_id":"c7bbe259-a24f-433e-846a-055869b5165f","resolution":{"observed_at":"2026-08-12T21:10:46.132815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09844","last_updated":"2024-07-10T15:56:14Z","snapshot_observed_at":"2026-08-13T04:18:27.663587Z","submitted_at":"2024-02-15T10:01:55Z","title":"Jack of All Trades, Master of Some, a Multi-Purpose Transformer Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09844","snapshot_observed_at":"2026-08-12T21:10:46.136956Z","title":"Gallouédec, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.136956Z"},"links":{"cited_paper":"/paper/2402.09844","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:e62735c498d11849bd9c417846e01b6afdcf94cc760687b097dac26b7bf65c31","observation_id":"8cb9e294-8a21-4552-9c96-e776835001f5","resolution":{"observed_at":"2026-08-12T21:10:46.136956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.140773Z","title":"Gebru, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.140773Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:ae1f06df4614bb04d6f462cc5cede6d42a28822c5a71f276db34df16cbbe56eb","observation_id":"c9b5721b-fc75-44a5-902a-7b5625c1b84f","resolution":{"observed_at":"2026-08-12T21:10:46.140773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.593489Z","title":null,"venue":null,"work_id":"cf751edc-70ac-4cd9-bccb-9a26eb3e9634","year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.144135Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:ff3d0002acd040e6effbf4455fa41a708e3cf2b603f7df0df42259627b809f41","observation_id":"e9eb17ec-b469-4960-bd24-5359684377d0","resolution":{"observed_at":"2026-08-12T21:10:47.597685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.579908Z","title":"something something","venue":null,"work_id":"a1868682-96e2-4ef0-bd03-47130008bc59","year":2017},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.147977Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:d2dd971b3e3c91a859a9b2f0092df8979e1856e979c71078d247847bb3b66a65","observation_id":"a5247066-ea60-4bbd-8d04-3bddc8895707","resolution":{"observed_at":"2026-08-12T21:10:47.584321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.566214Z","title":null,"venue":null,"work_id":"17cd4256-3cab-4bf9-ad7b-ab198b9cacb2","year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.151524Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:b34d800167c26e1c6eba70bb9a9680a146ef374992f6f170b74e2dc699833c58","observation_id":"6418ab87-0503-4000-a055-ca6c3dcbc09f","resolution":{"observed_at":"2026-08-12T21:10:47.570347Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.552399Z","title":"Hao Su’s Lab","venue":null,"work_id":"c8a94fba-4333-4d49-940e-08e296341346","year":2024},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.155581Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:242d766069379faf1f36f3d03286783f1ad5a0df31d03380cab0d31eae44a748","observation_id":"c7046abf-12fb-4a55-afa5-c94b1d622e34","resolution":{"observed_at":"2026-08-12T21:10:47.557501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.160243Z","title":"Hochreiter and J","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.160243Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:94a450fd442a47382527ed6fd833af6043eae2a4e0733a1f6be12d850dde0bc1","observation_id":"7719096a-14f8-4aa6-8b75-4d13a5c83135","resolution":{"observed_at":"2026-08-12T21:10:46.160243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.531842Z","title":null,"venue":null,"work_id":"1fc12232-65d0-4df7-ae9e-7633f5c71bea","year":2022},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.164398Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:a324ef879241146dfc86b74e98825f675a47410806b50047e0c9d8e0856225e8","observation_id":"71cfaa90-a1aa-4b0c-8e26-03a9f01f31da","resolution":{"observed_at":"2026-08-12T21:10:47.536344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.519461Z","title":"Jiang, A","venue":null,"work_id":"e2130db4-041a-47d2-8dee-dfbf5db3420f","year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.168221Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:07181012d8973756a5e7a2c54d75649b8f91d9e277ccd3de7d331734724bd429","observation_id":"b77d0076-68dc-46f7-a846-5121300bd3ca","resolution":{"observed_at":"2026-08-12T21:10:47.523440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.171850Z","title":"Johnson, B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.171850Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:903545f4d0e1ed6629f064d1ba70928a1258cdc26978e4c61ed1323a0c0b3432","observation_id":"f820dc68-1d63-4bb2-baf2-a3481966fbef","resolution":{"observed_at":"2026-08-12T21:10:46.171850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.498676Z","title":"Kahneman","venue":null,"work_id":"a8353a80-a45d-4955-b9a8-b76d0a805aa2","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.175411Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:371b8352888ffc00ce2fb444e1534bc58ff6badb6a3ef44b013bf35d67e95df8","observation_id":"b0c1caee-8f55-4ace-acca-8f55dc7f3c8e","resolution":{"observed_at":"2026-08-12T21:10:47.503309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-12T21:10:46.183052Z","title":"Kolve, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.183052Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:7169537c1d6ab2e60f85bbec09bff627a52ec9a105a19d16b5312990b7938427","observation_id":"e17293a4-93aa-42b5-8cf0-622d757b3423","resolution":{"observed_at":"2026-08-12T21:10:46.183052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.486398Z","title":null,"venue":null,"work_id":"958108f1-3614-4213-888f-5143cbe82f9a","year":1998},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.187108Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:c3bfec527a49340cb4f411d0555618bea823f5378aa461abbb439dda8c4c019f","observation_id":"05c30846-aeb0-4390-b15b-fa21a316bbe1","resolution":{"observed_at":"2026-08-12T21:10:47.490742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.472741Z","title":"Lerer, S","venue":null,"work_id":"d9bf2f4a-7e83-47c5-afcd-82be52aa2f79","year":2016},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.190939Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:f5b025e94baea849fd89d326e02fafc1c7691201203603a6df7e892c721759d0","observation_id":"4e0146ab-85cb-4b9e-8ddb-a500a1445577","resolution":{"observed_at":"2026-08-12T21:10:47.476930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03272","last_updated":"2021-11-03T18:51:07Z","snapshot_observed_at":"2026-08-13T18:32:49.357665Z","submitted_at":"2021-08-06T18:41:39Z","title":"iGibson 2.0: Object-Centric Simulation for Robot Learning of Everyday Household Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03272","snapshot_observed_at":"2026-08-12T21:10:46.195148Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.195148Z"},"links":{"cited_paper":"/paper/2108.03272","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:20d8733a32e7343a89f18ba74e1979239bc041003ad3e1c7544a56fc7f88604c","observation_id":"f1f858a6-c76d-4585-88b4-3e9153a2a916","resolution":{"observed_at":"2026-08-12T21:10:46.195148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.199053Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.199053Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:466959129181e7f8e922d7020f4ceb9fe00eb4cd5c5afc3bf816f2377d4608f0","observation_id":"c3db707f-9c5c-430e-be36-a199248693cd","resolution":{"observed_at":"2026-08-12T21:10:46.199053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.450146Z","title":null,"venue":null,"work_id":"6bd921db-4f09-45d7-b9ef-5c17119e7241","year":2024},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.204074Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:908465295aed3d0b71cbfc8b588eeaa158a7544d666bcd8882b37b976b53153b","observation_id":"1c1338f8-64ad-48cf-8bea-20b22017acdc","resolution":{"observed_at":"2026-08-12T21:10:47.454869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.207811Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.207811Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:f28fe40b6b67388ccc30953e2eca265d4f3c9cff8ea64b3baf29ef3e86e33104","observation_id":"99bd80ee-2b5c-4d79-a8e8-b003cc407742","resolution":{"observed_at":"2026-08-12T21:10:46.207811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08553","last_updated":"2024-09-03T07:59:26Z","snapshot_observed_at":"2026-08-13T04:41:49.178263Z","submitted_at":"2024-01-16T18:32:32Z","title":"FMB: a Functional Manipulation Benchmark for Generalizable Robotic Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08553","snapshot_observed_at":"2026-08-12T21:10:46.211573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.211573Z"},"links":{"cited_paper":"/paper/2401.08553","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:2630c382231bce7653e85f2b5d22adf055c36ae5b964d45f74977dd338e1e220","observation_id":"6db7c9cc-c7b6-4583-b943-9a40c5b6afb9","resolution":{"observed_at":"2026-08-12T21:10:46.211573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.215499Z","title":"Mandlekar, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.215499Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:d975d7faf6af42bb43575b084c5cc9663a56ac70c3af6f12111b7e731c64a580","observation_id":"d521933f-aee0-4ced-a518-c33901c295fd","resolution":{"observed_at":"2026-08-12T21:10:46.215499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.219507Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.219507Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:bba6c915c81ef47e8c6c3c5c5c549fc419d15e11d0419a3016939f4c9c95fead","observation_id":"516519ce-805d-47f9-9e01-22cff278ce65","resolution":{"observed_at":"2026-08-12T21:10:46.219507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-12T21:10:46.223569Z","title":"Padalkar, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.223569Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:6dd225435fbd1c5312a6b4171635bf9826ba06a81e87c37ce9db363ef72f78a9","observation_id":"35813a6d-6e75-457b-9630-ffacb57ebb92","resolution":{"observed_at":"2026-08-12T21:10:46.223569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.227838Z","title":"Paszke, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.227838Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:a5099964c4b7d80e02f624e84236189c0e39adf6a8d883be96f5a4149a9d61e9","observation_id":"5b391eb2-91f8-4e50-a871-96e6092b69bd","resolution":{"observed_at":"2026-08-12T21:10:46.227838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.231859Z","title":"Radford, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.231859Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:f7403bbc1c3e9a49dc16c82962952c817d4e84b4e4f70866f7041ca62d20c223","observation_id":"85738386-4dc9-4f28-9862-5a2efbfd2b69","resolution":{"observed_at":"2026-08-12T21:10:46.231859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-12T21:10:46.235692Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.235692Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:13a227cb0f0a07a578938835b545cc501e6db49dcac7a3521f97053681fba06f","observation_id":"75e04a7d-5931-4b79-a5b3-b8457306ef26","resolution":{"observed_at":"2026-08-12T21:10:46.235692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.393264Z","title":"Riveland and A","venue":null,"work_id":"5dcff6ca-be8c-431f-af6f-1052a97f08f3","year":2024},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.239624Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:e9df1615f46f62ee4e933d1fd613d022fa9e80661a1e94222b39eb0a025280e5","observation_id":"b5e192df-072d-4de6-9c3a-75ea9b83351c","resolution":{"observed_at":"2026-08-12T21:10:47.397378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.243519Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.243519Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:129509a15404704fa3a8c4e7fcdd4bde74e158930a64593d5935ae24ddb0d901","observation_id":"3d9cc63d-4423-4a4c-aabb-0c47bdfc9571","resolution":{"observed_at":"2026-08-12T21:10:46.243519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.247438Z","title":"Shridhar, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.247438Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:889deab1d886c14a5941e892fee07b3c2df76df1f87b9f27d528e5232a6433c2","observation_id":"1786498e-ce08-4bc2-937a-218391cfc925","resolution":{"observed_at":"2026-08-12T21:10:46.247438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.251921Z","title":"Shridhar, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.251921Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:2922342d2c22f169cb1d2737b49b79df039e455a038d741286b720375336ecf2","observation_id":"8c4ca68b-e94e-4d89-ac49-0e22c1a6e01e","resolution":{"observed_at":"2026-08-12T21:10:46.251921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.256539Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.256539Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:e97a246c66a85ec09641d81d2c355f91a8d54e25ea54dcd14d4d10b3908a9add","observation_id":"4f9149bc-a7da-42fa-b0b4-7d88e88f733e","resolution":{"observed_at":"2026-08-12T21:10:46.256539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.351296Z","title":null,"venue":null,"work_id":"da316727-ff86-4c60-956e-11bd44d146bc","year":2021},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.260374Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:bf50b871882e6007877b59a86efac6a5abf218ebaf6b34bd19c622d9143b4659","observation_id":"de378e50-3283-406b-a303-02e05f05ea9e","resolution":{"observed_at":"2026-08-12T21:10:47.356183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-12T21:10:46.264216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.264216Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:8f72934fd1a117f2f379a876e6b6fb22c35d54d0472d22b9808b1975afe7f84f","observation_id":"08dfe3e2-5892-4c62-9b47-7cd3765af415","resolution":{"observed_at":"2026-08-12T21:10:46.264216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.338173Z","title":"Weston, A","venue":null,"work_id":"7b65aca1-7055-436d-912d-15501b443a70","year":2015},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.268212Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:921ac1d28b8715cb190d332ac9b183db163aeac413964377b758267e76328e06","observation_id":"9a9b0751-3501-49b0-82b2-708dfe56635c","resolution":{"observed_at":"2026-08-12T21:10:47.342097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.324205Z","title":"Winograd","venue":null,"work_id":"b60b4dca-5cae-44ed-9a96-b02a2baf2b9a","year":1972},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.272161Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:c26bcd6c180a4e2004ac811038d00f96b10fb0f31ea2d59361a03bf476fb75e6","observation_id":"7c665127-f915-4d85-bf9f-b03155d2b094","resolution":{"observed_at":"2026-08-12T21:10:47.328606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.311339Z","title":null,"venue":null,"work_id":"c8b81940-f301-4cd6-8542-dcab4fe29296","year":2016},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.276256Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:a55befe33b6169b8cec8ed3741f75804939704ca98378e2e6d11c86ef9f0cb3d","observation_id":"cd9e9b63-2415-4df0-82b6-69c2018d2ec9","resolution":{"observed_at":"2026-08-12T21:10:47.315722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.299671Z","title":null,"venue":null,"work_id":"e2158406-68fb-4f8b-92fb-7653ca650d9e","year":2020},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.280099Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:e4c198ce734d92489c214faa53ea1916114ca4bd9694e9157aff4fbf061f22fa","observation_id":"fb50662c-6f48-4aa8-becf-902cb979ba65","resolution":{"observed_at":"2026-08-12T21:10:47.303681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13365","last_updated":"2024-03-20T07:48:32Z","snapshot_observed_at":"2026-08-13T15:46:08.436635Z","submitted_at":"2024-03-20T07:48:32Z","title":"ManiPose: A Comprehensive Benchmark for Pose-aware Object Manipulation in Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13365","snapshot_observed_at":"2026-08-12T21:10:46.283472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.283472Z"},"links":{"cited_paper":"/paper/2403.13365","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:317f913675a4cfa6f5b365371be206271d25aaa3b23e9c5fa4ee595748d32906","observation_id":"249eb0bc-cabb-4d56-833b-a9a77914ad9b","resolution":{"observed_at":"2026-08-12T21:10:46.283472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.288135Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.288135Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:858aa2437695f1effd561a26fa721d482697c49bfa3b0423f7c596cb6c01d57a","observation_id":"b5d10e64-0f34-4512-8373-8ac27a6744f6","resolution":{"observed_at":"2026-08-12T21:10:46.288135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-12T21:10:46.292233Z","title":"Zhang, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.292233Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:76a2a15191f8876812ab6e4e7fb9c21d69841985bd58c3f95f1c5574be5b568a","observation_id":"e928a47b-d831-43a0-8a0f-b9bfbfa6e1ba","resolution":{"observed_at":"2026-08-12T21:10:46.292233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.278522Z","title":"Match the pose of the end effector in {ks:keystep_1}, {ks:keystep_2} followed by {ks:keystep_3}","venue":null,"work_id":"94360900-24d9-4566-9e38-dcedd3566c5e","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.296386Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:ecd76b8849168f163638a807339a0c0f1daf5fbd09d416034da2a6c02f9111a4","observation_id":"b33a1f12-3e85-44af-ae97-feac9e146f66","resolution":{"observed_at":"2026-08-12T21:10:47.282707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.264924Z","title":"• Description: Similar to 1, but with an additional constraint of avoiding objects sus- pended in air","venue":null,"work_id":"1d72ac3e-1bb3-4e45-82e1-aac134c8dc72","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.300412Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:3d81322934129e67576538e266583a52a08a4aa75b0e7fe1e7c9c55abeea1cd5","observation_id":"ad7f0382-5ae6-4353-8ed5-69a008c7450f","resolution":{"observed_at":"2026-08-12T21:10:47.270553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.251558Z","title":"13 (b) Grab the {obj:object}","venue":null,"work_id":"e6b9ead4-198e-47b5-a238-58b23dbc9774","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.304164Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:db2aa749f6f95aa43292e39279b02ba9c435020f8e04096accb016c7055762c2","observation_id":"8cbddf44-b729-451c-b2b7-d6114cd4cf75","resolution":{"observed_at":"2026-08-12T21:10:47.256601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.238959Z","title":"(b) Put object with tex:object 1 texture on object with tex:object2 texture","venue":null,"work_id":"cee61b25-923e-43c4-990c-f759844d6b3d","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.307956Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:d2d59df43475f61948e7038537b5de2acc6c8242af40aba10ea8c45299885218","observation_id":"dad99882-3724-4bcd-aa3c-83efb92b0c21","resolution":{"observed_at":"2026-08-12T21:10:47.243122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.226373Z","title":"(b) Push object with {tex:object} 1 texture towards object with {tex:object}2 texture","venue":null,"work_id":"a5f4c871-0e18-451c-b9a8-9286af41098d","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.312034Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:20d69c77446062a62ff0c189f821ca7a9db115ab1456b472df0643ac8bcb31be","observation_id":"e8a29043-26ff-43b7-8525-3dad6f234e9b","resolution":{"observed_at":"2026-08-12T21:10:47.230357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.212591Z","title":"(b) Rotate object with {tex:object} 1 {angles} degrees {direction}","venue":null,"work_id":"651b84ed-996c-4b6f-9013-5ed0e328f936","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.315529Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:5542a0cde28dc88ba9d7f4e5e29014398ca9c113d116a44e679573fee8a543ab","observation_id":"a6370701-4f67-4fa6-915e-7799768c14a2","resolution":{"observed_at":"2026-08-12T21:10:47.218109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.199130Z","title":"(b) Hit {obj:object} 2 with {obj:object}1","venue":null,"work_id":"73cfe00d-aeea-4cee-9663-fc30e265d4af","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.319789Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:fffeefd1d3eaf7902e9db17dceb87870f718666b2176232ba92a084ad0cb42a2","observation_id":"e87a9001-3b60-4fd6-b222-90ba903a3e85","resolution":{"observed_at":"2026-08-12T21:10:47.204328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.185493Z","title":"(b) Hit {obj:object} 2 with {obj:object}1 such that {obj:object}2 falls over","venue":null,"work_id":"5bcd60f4-d8a4-4c98-9203-f8246acca146","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.324136Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:bf92d905d83ada101dabde6668820e913374ee958d60bd0535945263da6d21d5","observation_id":"9f1c37d0-5c86-4bbc-b1d6-29f3f12b4e4e","resolution":{"observed_at":"2026-08-12T21:10:47.189900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.167013Z","title":"• Description: The agent is tasked to gently touch a specified object without moving it","venue":null,"work_id":"13d1ddb8-8ef8-4962-8836-96a32a94751f","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.327995Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:fc33d8ce55348d289cb8fd505bf926d0ea4a316c5f45e560c076b35d4a404142","observation_id":"fd3a1283-7811-4c63-9fde-a994b6fe8d49","resolution":{"observed_at":"2026-08-12T21:10:47.172064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.153914Z","title":"• Description: Similar to 9, but now the specified object must move from its original position without the agent ever grasping it or the object toppling over","venue":null,"work_id":"70e65851-af53-496f-b651-431365ad8dba","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.331938Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:3ce6199e37e63d5d8d7a3d67f98cf379eeff4f08fd2059fca711c005fb82a3ec","observation_id":"d66e96ff-438d-4337-9ac4-8f41cd13eda7","resolution":{"observed_at":"2026-08-12T21:10:47.158420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.139861Z","title":"• Description: Similar to 9, but now the object must topple over","venue":null,"work_id":"b0523645-7ba8-417d-8ba7-b22882866911","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.335866Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:b961af80623184042332ed78ac82cf67e9becfa298d739f0b66d6b0a666173d0","observation_id":"93bfa4d8-d5bd-4546-832c-6dde6efd5f7e","resolution":{"observed_at":"2026-08-12T21:10:47.144816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.124670Z","title":"• Description: The agent is tasked to touch goal positions specified by green spheres suspended in air","venue":null,"work_id":"1d075d23-aacf-498d-8874-5055bb7b5350","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.339643Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:0fe31fa671c4317399b0a1cceb5b45219e10e0be486cf84ca6f00b5c6ddae59b","observation_id":"6c10d7f2-1c0c-496f-a170-98d47e9bfef9","resolution":{"observed_at":"2026-08-12T21:10:47.129644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.109601Z","title":"(b) Put object with {tex:object} 1 texture on object with {tex:object}2 texture","venue":null,"work_id":"1ff49af6-fdcb-48a5-bbf7-a34d4ed58009","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.343361Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:0d9657269dbc9588484648d124a37de5c48d56f84df774072a75834ef90911b5","observation_id":"2b1d1dad-9c01-47e1-8596-2a680ba68a97","resolution":{"observed_at":"2026-08-12T21:10:47.114891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.096415Z","title":"• Description: Given a specified object {obj:object} 1 and a set of goal states {ks:keystep1}, the agent is tasked to achieve the goal states for the specified object in order","venue":null,"work_id":"9509f6b8-eb78-4bff-b87e-ed12ca7c0393","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.347415Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:938875322f232ffdda02d4472842f48a68e8877305c34aae6df60af3af50fc79","observation_id":"31a0e640-4306-47cb-b056-5539468d0f2c","resolution":{"observed_at":"2026-08-12T21:10:47.101405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.082443Z","title":"• Description: Similar to Task 2 in L1, with the additional constraint that the specified object must be returned to it’s original state","venue":null,"work_id":"ff25c510-1b2f-44e6-a3a5-7bf730e54736","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.352383Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:b972f4729e77a6908e2fe48ba319906574861bdad395b3ac3aeaaacbc7f7ce4b","observation_id":"0a53075b-7256-4d94-ae5e-836139058ba5","resolution":{"observed_at":"2026-08-12T21:10:47.087811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.066214Z","title":"The direction can take values of north, south, east and west","venue":null,"work_id":"bd9fd074-8abb-4b83-88c8-989042c1a87a","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.356221Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:126b529006c28de0fb6eed12e8c0a4bff31f69671b98292139c8a2e178790d55","observation_id":"14f43973-96ec-4933-957b-2b1d020e1258","resolution":{"observed_at":"2026-08-12T21:10:47.073241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.052760Z","title":"daxer\", “blicker","venue":null,"work_id":"d970aab8-529e-41dc-bf1d-f7eb6cdf2f53","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.360426Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:5847b8497a9dd529ae2abd286878f4aedea02251fbae0e2843a6d3df9c2389e2","observation_id":"963af45a-90d5-4140-9b34-e0f33fbe46d5","resolution":{"observed_at":"2026-08-12T21:10:47.057392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.039478Z","title":"dax\", “blicket","venue":null,"work_id":"402081a0-05fd-4b23-8433-10188c25fb7e","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.364158Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:65ae671200b12facdd417d1b91b8246ef941ec07393da1629ebb066db8a626c5","observation_id":"ff831754-f4b8-41cc-8db7-c308a9377d6f","resolution":{"observed_at":"2026-08-12T21:10:47.043979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.026221Z","title":"This is a {noun}2 {obj:object}2","venue":null,"work_id":"a8155ba8-306c-4ab4-b037-1579239de9c5","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.367862Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:5613ad74fd9a95347cd92e41ae4ddff3da45ae252239b65be480a05c5012a43e","observation_id":"fc168c5a-682d-496f-a8de-cc1496861a94","resolution":{"observed_at":"2026-08-12T21:10:47.030704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:47.012151Z","title":"• Success Criteria: All the objects in the scene are placed at the positions specified in the scene image {ks:scene}","venue":null,"work_id":"572e3cec-cc7c-4f76-9ec0-174f41acc7fa","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.371758Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:02c36b3b9650940f58faa3ce3feed81188ced6c8a33ed665a31ba8076515a389","observation_id":"b5e8ac55-239d-4d78-ad14-194209615456","resolution":{"observed_at":"2026-08-12T21:10:47.016383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.998544Z","title":null,"venue":null,"work_id":"05268f53-f6aa-4f37-80c1-28e91a183b93","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.375298Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:24a662f937aa66c42a90c37feede85e83aeaa35ba3486bec7343b1b96a22a760","observation_id":"12fa0f3d-2383-4db3-9b2e-258d95b2eb23","resolution":{"observed_at":"2026-08-12T21:10:47.002529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.982302Z","title":"• Success Criteria: The specified object is rotated in the correct direction within 5 degrees of the specified angle","venue":null,"work_id":"fdc09927-3ca5-4bb3-83b6-74bb9dc37be9","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.378924Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:cec6b4bb40c6ca5ff1c399a1be41d8862d6150d0c07b6caeb9315fd792959d18","observation_id":"4cb0bea8-41ef-4bb5-9df7-d7bae9fcbd67","resolution":{"observed_at":"2026-08-12T21:10:46.989235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.965766Z","title":"• Success Criteria: All the objects with the specified texture are rotated by {angle} degrees in the correct {direction}","venue":null,"work_id":"90dfc963-5b71-48d3-b6bc-5191bba7b5d9","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.382589Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:eb224a95341cee3d77a60026cde981bdde297df9ccd33a502f13986bbb3e327d","observation_id":"20e856c0-5024-443e-8861-6df05086eb6e","resolution":{"observed_at":"2026-08-12T21:10:46.971508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.942357Z","title":"• Success Criteria: The objects in the scene are stacked in the correct order","venue":null,"work_id":"f9d76082-4e0b-434a-a351-2694fbd5286f","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.386342Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:456aa839d8c9cc97399ba5866f1b1a2154a1af718079d68fb58ff2152464315d","observation_id":"9db1d3da-ab9f-443e-8c8e-7546b1cf3618","resolution":{"observed_at":"2026-08-12T21:10:46.947448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.925597Z","title":"• Success Criteria: The objects in the scene are stacked in the reverse order of what is specified","venue":null,"work_id":"765417bf-0313-4502-a171-fdd55aebcd32","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.390280Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:a2b6387f63c4d5b2dc2a001847f7003fc815d1575eb57a06ed7dc818959da77d","observation_id":"3f35e8d9-66c6-4a63-8aa9-339752634e35","resolution":{"observed_at":"2026-08-12T21:10:46.930947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.911337Z","title":"• Success Criteria: All the objects are placed in the areas which have same texture as the objects","venue":null,"work_id":"240e74d1-153b-4a7d-9d6a-2b805dd62e21","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.394220Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:e974f9e3db43cb6c3e73231eb959b38a4b17c9f72a0c8ad38dd1157a6be8d48e","observation_id":"133073e8-8d7f-451f-8c5e-d3268dbabd7c","resolution":{"observed_at":"2026-08-12T21:10:46.916041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.898080Z","title":"The only way to achieve the result is to move one of the object away and then place the other object in its place and then repeating the same with the initial object","venue":null,"work_id":"7882dec3-e662-4766-9870-0ce022558a60","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.398079Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:4e06604ce60fa214fbd8cb3f3e3a6459c8f9ce49090632579d3eed211f742b16","observation_id":"ec3f1910-199e-4827-80d4-bf4cb7bce32c","resolution":{"observed_at":"2026-08-12T21:10:46.902666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.882087Z","title":"The weight of the objects is proportional to their size","venue":null,"work_id":"39071375-6da2-4f08-98f9-969e33e3dc04","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.401686Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:6e04aced4e488ecf1a3f84def4d3fe762b1b56d72bf73e10fa21f8e95e16c385","observation_id":"6ba1eefa-b4fc-4e75-a9b1-d6dc6f8cf340","resolution":{"observed_at":"2026-08-12T21:10:46.886651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.869148Z","title":"The agent here is required to sort the objects according to their texture however, instead of just placing the objects on an area, it is tasked to stack them on top of each other","venue":null,"work_id":"9909bc3d-c793-45fe-a743-adf05e31e2fe","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.405742Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:57b10df59a6566934b45bb5032375afd5b37de9ce10fc30ec797808edbbc5dba","observation_id":"2359b7ca-c027-42d1-a6c6-d445b6a081e5","resolution":{"observed_at":"2026-08-12T21:10:46.873500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.855063Z","title":"• Success Criteria: The objects are first stacked as specified in the prompt and then are toppled such that all the objects end up on the ground","venue":null,"work_id":"412ea846-77d0-4bf7-9d35-1fb236465b91","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.409601Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:7ddf4a985ab9ff619311e66f27f17432a70647901595818b40ebbd37f8f380dd","observation_id":"b537235d-f6ca-453b-ae23-4abc6d08fae9","resolution":{"observed_at":"2026-08-12T21:10:46.860099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.839074Z","title":"• Success Criteria: The positions of the two objects are swapped without the objects being grasped","venue":null,"work_id":"4961a1aa-91cb-4c99-b46f-96bf757a809c","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.413948Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:8ebb38142e6e2b965f760fd0d2e4ed509e4c665c5a49063aeec279bcfdfa56b9","observation_id":"46d0ecbe-f10b-4fbc-8eb6-8a7006cf2646","resolution":{"observed_at":"2026-08-12T21:10:46.844108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.825675Z","title":"• Success Criteria: The positions of the two objects are swapped and the objects are rotated by {angles} degrees in {direction} with respect to their initial pose","venue":null,"work_id":"615016cb-8f4e-4c79-ae76-2723303e6a41","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.417721Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:205f16747add79c5c228e283113c40b8d16f5d488ec85f7da20f8dc54b0a9a6f","observation_id":"1118ffc5-44b3-482e-aa6b-6faca5d47511","resolution":{"observed_at":"2026-08-12T21:10:46.830466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.803784Z","title":"thrown” in the areas instead of “placed","venue":null,"work_id":"548d2355-d046-456c-a1e6-6d7fc003ca73","year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.421448Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:833fdbb03c333b5ac9aa8dc804f32512c61c7464b1f70ee682ada94bb36fdf79","observation_id":"d843159d-c314-44e9-946b-d7db3bc76168","resolution":{"observed_at":"2026-08-12T21:10:46.811562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:10:46.179276Z","title":"URL https://www.amazon.de/ Thinking-Fast-Slow-Daniel-Kahneman/dp/0374275637/ref=wl_it_dp_o_pdT1_ nS_nC?ie=UTF8&colid=151193SNGKJT9&coliid=I3OCESLZCVDFL7","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.179276Z"},"links":{"citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:eb06c68687d5138474a4c6e023042a7470f4c9a34b0c5da27fe345b421c3cea8","observation_id":"2f50157d-3261-40e3-85ea-f71d76b799a3","resolution":{"observed_at":"2026-08-12T21:10:46.179276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-12T21:04:27.543922Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 2 inbound Pith citation observations for arXiv:2411.09052."}