{"as_of":"2026-08-14T09:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d82d6964fa585f9d7c7e9641bad2940516905eb4133377b644ab6fc6aa76884e","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T16:45:53.967918Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04591/citation-record","integrity":"/paper/2607.04591/integrity","json":"/paper/2607.04591/citation-record.json","paper":"/paper/2607.04591"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-08-11T15:30:01.335662Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"X-vla: Soft-prompted transformer as scalable cross-embodiment vision-language-action model.arXiv preprint arXiv:2510.10274, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:a5bc93a5d8fd8a000286aaa8d4096efa7d52f392982a280232a68830cab679e7","observation_id":"313a52c0-7026-44db-843f-5e2484a77d48","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-13T11:17:54.365190Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Smolvla: A vision-language-action model for affordable and efficient robotics.arXiv preprint arXiv:2506.01844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:f7c18c072200a67c4bdf80464507e68edf9d72d1b96dbe884781af6e6622cea4","observation_id":"8df5747b-704a-400a-bab5-479f771ccb04","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"𝜋0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:ef325feaeb5e2ea6fdbd73bc4045e833c472d3ebbb26f6199fb8f1afe425bf33","observation_id":"cc598254-cdbf-46ed-b8ad-d48bd0c583a2","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:7f0fec3caa4b18e4997a7a4a61b37e1f9e70278bab7773c47509b160cf5c3255","observation_id":"039af18f-9f18-4ba4-9cdf-4cb93af55865","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"𝜋0.5: A vision-language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:cc105e1b64bc0e410a718d3586b82ba4e7bec23bce648eb7898598799b61b952","observation_id":"aa354b34-f166-45ec-b304-f551b0cd70f5","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:63c916cd47cd2956c111d3f68edfdf780bcfe19a9acdc65f9cad7e7426131fe1","observation_id":"9316d916-16b3-401c-8cb8-fba211344a84","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Bridge data: Boosting generalization of robotic skills with cross-domain datasets.arXiv preprint arXiv:2109.13396, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:b5fed7701d9c0a45926652142df935ced4248fc4f458562d3296b78710618223","observation_id":"f6f8eec5-a9f2-460a-8afc-78f68c53c823","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-14T09:31:12.316176Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Vima: General robot manipulation with multimodal prompts.arXiv preprint arXiv:2210.03094, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:22512ae94dc49bf12fbf4c97b643e76f8891cf333a8a79451f6fe8e9fbeb3d90","observation_id":"6dd8b39e-6c8a-498b-8380-123b3402a4f5","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"What matters in learning from offline human demonstrations for robot manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:2da2f47fd60d84283203df1770b280a75687857469c00d3709a2376be8e86035","observation_id":"423d678b-0d08-442f-92f9-9f007724e024","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Imitation learning: A survey of learning methods.ACM Computing Surveys, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:aba9c46abd08044781f0e37650f4e5210674f83c95de649f210d25b980b32452","observation_id":"722f4f77-4444-4cf8-988c-d8ea7b837484","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Alvinn: An autonomous land vehicle in a neural network","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:038d06585142d4d8d553d6e03a1c033c801322ab6de68e0133df036c8ff84e49","observation_id":"f1984fc8-5717-441a-b2d1-6502b7b4dd71","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Overcoming exploration in reinforcement learning with demonstrations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:9ba9bb98d5653133e6b5826a1bb8f214be3d99747d5f69f1cc6d27e0cb2d32ca","observation_id":"40437ddf-c081-4a0c-9de4-2b1cbb7a686b","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:af2041bc96da9edbdfe31b719b70700093e187bb37b2eda227c05ee9e1096626","observation_id":"00558d34-6413-4f1f-a4a5-6784a9d6b5c8","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Robonet: Large-scale multi-robot learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:c18ced04f73a2223cf93321d55a3be1ce7af125c783610605303c328fcb6d21e","observation_id":"601c7383-88e6-4e21-8849-ff184de03e1b","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:f0f17d8c4f4c2dfad54f6b896c2f2e29837138a83c48dc2742308214208ca54f","observation_id":"61052563-a315-46e1-8524-87a3121d5c2f","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:e41deb46a86cc79c2a0f552f9c761e3e5b74095f829980e2e96df22e236a66fe","observation_id":"f45e6a8e-c63c-43b2-9fd3-587d396d0133","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Emergence of human to robot transfer in vision-language-action models.arXiv preprint arXiv:2512.22414, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:89cf33c748c768841970aaa3bf62883a42aab57f61e9e505c7dbcf8c62365fa6","observation_id":"6c8ec250-f1d1-425d-bc37-4dc5884354d9","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07820","last_updated":"2026-08-13T07:13:21Z","snapshot_observed_at":"2026-08-14T09:16:59.908929Z","submitted_at":"2025-11-11T04:37:40Z","title":"SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07820","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Sonic: Supersizing motion tracking for natural humanoid whole-body control.arXiv preprint arXiv:2511.07820, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2511.07820","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:b05c82a358c48eaf33d2df8bec64460eeab36239e761be36c6a9ec440d3ace15","observation_id":"c4ada3ac-a62c-4137-a6eb-d3940168a90a","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:0785feacfa8e12a18e220b2fb3cd32db0ec3f4a89bc5caa9f771b4788ead5770","observation_id":"82b64311-2b55-4304-b6dd-df3e40d4bc38","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Reverse curriculum generation for reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:2c614422b73e22c4099da1a75154a5097991649ad2415c0e68a625bb5bedf052","observation_id":"dfa72942-71bc-4465-8e70-1d06dec59403","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Feudal networks for hierarchical reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:7afad9b875fe2dd2abc104a16ee4ca49819e192ef40f177e880edb2b63a7f14c","observation_id":"f9ac2e84-edfb-4fd1-acc4-36766321b5a5","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:3c783371ab78790ebd96556d6abdec385b8534b0dc474b0bb1330778ff572101","observation_id":"68a4bdfd-24bf-428a-b78d-455abda9cb17","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08881","last_updated":"2026-06-07T23:39:03Z","snapshot_observed_at":"2026-07-06T23:48:21.633158Z","submitted_at":"2026-06-07T23:39:03Z","title":"Benchmarking Vision-Language-Action Models on SO-101: Failure and Recovery Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08881","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Benchmarking vision-language-action models on so-101: Failure and recovery analysis.arXiv preprint arXiv:2606.08881, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2606.08881","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:385ed2dfdc4bac928b24de852029d3a0543bfc9cf0838d57af2408e55047e4d5","observation_id":"4c1c6e72-b91f-4e54-8fd9-312d1567b0f7","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22449","last_updated":"2026-06-21T11:46:49Z","snapshot_observed_at":"2026-08-12T21:09:05.306700Z","submitted_at":"2026-06-21T11:46:49Z","title":"Self-Evolving Cognitive Framework via Causal World Modeling for Embodied Scientific Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22449","snapshot_observed_at":"2026-07-11T16:45:53.967918Z","title":"Self-evolving cognitive framework via causal world modeling for embodied scientific intelligence.arXiv preprint arXiv:2606.22449, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T16:45:53.967918Z"},"links":{"cited_paper":"/paper/2606.22449","citing_paper":"/paper/2607.04591"},"observation_digest":"sha256:26d3801e5e27103a13d57175819ca50383bbabb20d2f24054998d9e27af06167","observation_id":"c7718bf3-352e-41ff-a860-4d415c3e95b2","resolution":{"observed_at":"2026-07-11T16:45:53.967918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04591","last_updated":"2026-07-06T01:38:43Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T06:46:14.124092Z","submitted_at":"2026-07-06T01:38:43Z","title":"Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.04591."}