{"as_of":"2026-08-20T19:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c909dc74d933e88b00c760cdd53049e0be96367ad9a6e352491b829df8cab963","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:10:21.449818Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14439/citation-record","integrity":"/paper/2607.14439/integrity","json":"/paper/2607.14439/citation-record.json","paper":"/paper/2607.14439"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:15.498819Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:15.498819Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:842b35fd644dd3c454f5fbe6e509d9c80e543dcb279e8181508996c1674f2358","observation_id":"2717502b-b872-495a-bf8a-564eaf239691","resolution":{"observed_at":"2026-08-02T02:10:15.498819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:15.636991Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:15.636991Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:a9b82a32ff4522da1f4708c2995eed8886a39365c18c4568d4c79998df4215c1","observation_id":"60135adc-fa30-46b6-8c92-fd2e3cfe2f5b","resolution":{"observed_at":"2026-08-02T02:10:15.636991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:15.800708Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:15.800708Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:e8747d5efbc26d94b1217bc03ed638c2dbadaff9ec60f6a52703e262643f157f","observation_id":"20d7ca43-f7ce-49f8-9325-edeffef141bf","resolution":{"observed_at":"2026-08-02T02:10:15.800708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:15.947931Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:15.947931Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:5ce58766d776055f202628be9af7fd207fbd6558c49bbd12711af1319bfe9d25","observation_id":"259f5ae7-0e49-42f5-960a-2ac63308eea1","resolution":{"observed_at":"2026-08-02T02:10:15.947931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:16.113686Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:16.113686Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:7061842b0e2c9d05b4b0190b0951b5b5024450496de51ec5b43926e42849b277","observation_id":"76fe82a9-2d60-4ffd-b2ba-8b659bc65e7e","resolution":{"observed_at":"2026-08-02T02:10:16.113686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:16.259617Z","title":"π0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:16.259617Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:b782c4828df5562e04524769be0f4fca9090b09dd93a3fae19c22ef432c4c615","observation_id":"f630e9f0-1064-4f87-b96e-60e0334f6288","resolution":{"observed_at":"2026-08-02T02:10:16.259617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-08-13T00:59:48.824306Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-02T02:10:16.577016Z","title":"Libero-plus: In-depth robustness analysis of vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:16.577016Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:01f9d70c7194ff668634eec15e7874668477f910164e9bde09effcad08d2e11f","observation_id":"e1f25714-0caf-409e-8a5e-07fc5f9ede74","resolution":{"observed_at":"2026-08-02T02:10:16.577016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:16.795641Z","title":"Shortcut learning in generalist robot policies: The role of dataset diversity and fragmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:16.795641Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:3b538abec478d31ebce73a8a378f71a7ce9fbbf1f70d9b5670685f5d3ac32e13","observation_id":"4e517da1-f406-49e0-a56c-70a4abf82c4f","resolution":{"observed_at":"2026-08-02T02:10:16.795641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09491","last_updated":"2024-09-20T20:07:32Z","snapshot_observed_at":"2026-08-17T02:50:08.411931Z","submitted_at":"2024-09-14T17:38:04Z","title":"Robot Learning as an Empirical Science: Best Practices for Policy Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09491","snapshot_observed_at":"2026-08-02T02:10:16.906849Z","title":"Robot learning as an empirical science: Best practices for policy evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:16.906849Z"},"links":{"cited_paper":"/paper/2409.09491","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:29a225bc29343b0edb53a2daf6afe73ccd9edc1e7ef53dea98f55c662b390551","observation_id":"e0c3f8fb-d38d-4358-b160-54332bfee53d","resolution":{"observed_at":"2026-08-02T02:10:16.906849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-02T02:10:17.024506Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.024506Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:d6295e27ba5eb096f7e168586626c6a4dac0815bddce948d74ddf2d45205c21f","observation_id":"a2da5308-31b8-4006-864b-c5ed6aa02757","resolution":{"observed_at":"2026-08-02T02:10:17.024506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:17.142961Z","title":"Mujoco: A physics engine for model-based control,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.142961Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:d31a04d5044dd101ff891d652e399d6a17d8735c08edebecb7e9561daebbc3c5","observation_id":"412d22f2-ebdb-418c-bc42-0f954c0d48b0","resolution":{"observed_at":"2026-08-02T02:10:17.142961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:17.262364Z","title":"A survey on vision–language–action models for embodied ai,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.262364Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:5311ff43164a3b50f1232d34743de16de91fd1cecf1f30833a74b61e382ecbe6","observation_id":"00ee71b2-11d8-41e4-a533-f346f6451421","resolution":{"observed_at":"2026-08-02T02:10:17.262364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:17.348398Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.348398Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:89b1d8eb09affc7c18461998f301ddfac05ac3d4f6ce42298ec4a829968f9480","observation_id":"446cd3ef-44e9-416b-96fd-ac47ac13c3d8","resolution":{"observed_at":"2026-08-02T02:10:17.348398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-14T09:46:32.787845Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-02T02:10:17.438437Z","title":"A generalist agent,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.438437Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:2ad15a34de8e7f943efeb488da209f3b77b23e801b608e6db46496dcfd43b38e","observation_id":"91d41f49-feb2-4356-b3b6-15eed9e22f57","resolution":{"observed_at":"2026-08-02T02:10:17.438437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T02:10:17.485431Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.485431Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:223a50ae1edeb1d59b13add6bd0026249ac40befe5b0280bf546730efece3847","observation_id":"8d52feeb-33ea-4cba-ba5d-766d19a0f1d5","resolution":{"observed_at":"2026-08-02T02:10:17.485431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:17.579896Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x- embodiment collaboration 0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.579896Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:517b580523c08d61f57f4160e88efec21f5dfbe8ed152dd895aae43601651cac","observation_id":"ac1655d4-19fc-441c-aae0-786ce0ae8917","resolution":{"observed_at":"2026-08-02T02:10:17.579896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-02T02:10:17.640186Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.640186Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:748a177e6b5e8316825e7729d3010de0792a66b53aca25674b663ab70f094252","observation_id":"eb8ac80d-2714-44d7-8811-922e1441aa68","resolution":{"observed_at":"2026-08-02T02:10:17.640186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:17.724400Z","title":"A taxonomy for evaluating generalist robot manipulation policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.724400Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:1b15b9efd9e8ef725e9a10eebd763c697897616b8b06ec172d3111ce03ce1fb3","observation_id":"3ee9749e-5966-4d74-9688-07f2d2104745","resolution":{"observed_at":"2026-08-02T02:10:17.724400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:17.815500Z","title":"Investigating the role of instruction variety and task difficulty in robotic manipulation tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.815500Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:a30a14149a0185ad993e7c5be3a2efe4cbbd809d606d880a1ae4a8d8ebf88b12","observation_id":"f62f0d8e-e3b5-42c3-84ec-84f098f9161e","resolution":{"observed_at":"2026-08-02T02:10:17.815500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:17.870847Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learn- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.870847Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:7dd86580258c0483724ae11c98d13eec4615d7aba456bd5843fa6c3d5115e4fd","observation_id":"9a51e0d1-cf7c-4109-9122-94162d215b7d","resolution":{"observed_at":"2026-08-02T02:10:17.870847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:17.944500Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.944500Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:542f7a26b1f637f24ea336b81b5f1e67a810719c9db6c69c02849c0cc211c239","observation_id":"74b00c6b-1faf-4d91-8f6d-885bdeb4e64c","resolution":{"observed_at":"2026-08-02T02:10:17.944500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08191","last_updated":"2024-05-28T00:37:02Z","snapshot_observed_at":"2026-08-16T14:19:07.560970Z","submitted_at":"2024-02-13T03:25:33Z","title":"THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08191","snapshot_observed_at":"2026-08-02T02:10:17.999056Z","title":"The colosseum: A benchmark for evaluating generalization for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:17.999056Z"},"links":{"cited_paper":"/paper/2402.08191","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:cb80a126d0212c71f18503af30f04f6d8c53aa430619d34d7c5468d536a27290","observation_id":"04fa341f-f101-44e9-93a1-abe267567079","resolution":{"observed_at":"2026-08-02T02:10:17.999056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:18.078451Z","title":"Decomposing the generalization gap in imitation learning for visual robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.078451Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:4c032975b334a2234004698c6371b6a24565e2410d8b614086218619ba53a8e2","observation_id":"4f2dda6c-2c73-43af-b052-21f854a58096","resolution":{"observed_at":"2026-08-02T02:10:18.078451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:18.139462Z","title":"Vlabench: A large-scale benchmark for language- conditioned robotics manipulation with long-horizon reasoning tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.139462Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:6a515c9904b4f038d73f4337f65bf8ae38d33a6e8c5024e74dd23f6e34dc6b20","observation_id":"06b2cd9a-2943-4df9-af5f-0ba6e0d5c7cd","resolution":{"observed_at":"2026-08-02T02:10:18.139462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:18.237204Z","title":"Design and use paradigms for gazebo, an open-source multi-robot simulator,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.237204Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:17435bac2c7404cc3a9564ed21c15408627224b951628e88b4a7766ab90aa3fd","observation_id":"4596b6af-03bf-426b-b56f-282198df38be","resolution":{"observed_at":"2026-08-02T02:10:18.237204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:18.327715Z","title":"Evaluating real-world robot manipulation policies in simulation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.327715Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:e1b1fcf1804564cc437266c79ae0b39a06c3789e14d9ed7fddf9459e0b85ed81","observation_id":"28e6d279-942e-49f7-a272-aa3fa200d1e6","resolution":{"observed_at":"2026-08-02T02:10:18.327715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-08-17T23:29:31.642440Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-08-02T02:10:18.485823Z","title":"Reconciling reality through simulation: A real-to-sim- to-real approach for robust manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.485823Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:8e9b52195e6e815167d3bfb80f8607ca382845e05aa1737d8e51a36f6a080b3a","observation_id":"467348d3-6b37-4c34-a64e-dc831043eab2","resolution":{"observed_at":"2026-08-02T02:10:18.485823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:18.577260Z","title":"Real-to-sim robot policy evaluation with gaussian splatting simulation of soft-body interactions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.577260Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:26737a82b75a1df5580e23611961789a98fb95944bae97e6a8d70ac41aa26d77","observation_id":"30ade576-5195-401d-b3c9-d8870eaf0237","resolution":{"observed_at":"2026-08-02T02:10:18.577260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:18.660929Z","title":"Realm: A real-to-sim validated benchmark for generalization in robotic ma- nipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.660929Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:07cdc8c26d724120bbf4223b5e48e6dfe7804660f90c83d43bdcfea58b96dfa6","observation_id":"7b5d5d60-e873-4ad7-9f87-a0279dafc0c3","resolution":{"observed_at":"2026-08-02T02:10:18.660929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:18.759027Z","title":"Polaris: Scalable real-to-sim evaluations for generalist robot policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.759027Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:3f12b36faf883ed5cd1ff4a485f68b2f2cd565d1136172e1f2d6718ff53d8994","observation_id":"20674451-f08e-47fb-8ee4-c9994c9d5877","resolution":{"observed_at":"2026-08-02T02:10:18.759027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03597","last_updated":"2025-07-02T03:27:04Z","snapshot_observed_at":"2026-08-16T12:43:54.188442Z","submitted_at":"2025-04-04T17:05:56Z","title":"Real-is-Sim: Bridging the Sim-to-Real Gap with a Dynamic Digital Twin","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03597","snapshot_observed_at":"2026-08-02T02:10:18.852138Z","title":"Real-is-sim: Bridging the sim-to-real gap with a dynamic digital twin,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.852138Z"},"links":{"cited_paper":"/paper/2504.03597","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:048c122fd7ee6a4c7d3918b4513fcda95e861a4d064056900694bc819b98951d","observation_id":"a2cc74d6-68dc-4d30-80fa-587bdbd036ba","resolution":{"observed_at":"2026-08-02T02:10:18.852138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09601","last_updated":"2025-05-14T17:50:35Z","snapshot_observed_at":"2026-08-20T01:31:22.408827Z","submitted_at":"2025-05-14T17:50:35Z","title":"Real2Render2Real: Scaling Robot Data Without Dynamics Simulation or Robot Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09601","snapshot_observed_at":"2026-08-02T02:10:18.933159Z","title":"Real2render2real: Scaling robot data without dynamics simulation or robot hardware,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.933159Z"},"links":{"cited_paper":"/paper/2505.09601","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:93cd8a143627719b054e6b3a7b824ec5662300b99709f3c41429169b2e6830ac","observation_id":"90cf0fc5-aeb9-4b96-ab38-b0730084e74d","resolution":{"observed_at":"2026-08-02T02:10:18.933159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.008096Z","title":"Robotarena ∞: Scalable robot benchmarking via real-to-sim translation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.008096Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:e7979e1f3f3d1192f32c496df6e59cad89b10b97f71abe683098e39ba6083f5e","observation_id":"32e65eb9-9bf8-4753-b501-ed084d839e62","resolution":{"observed_at":"2026-08-02T02:10:19.008096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.085506Z","title":"Contrast sets for evaluating language-guided robot policies,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.085506Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:cd27c95dbaf596ae4ab876e0a7040e48004efd9cf76975f624ac4b1ce2bbb35f","observation_id":"0406c47a-9b9d-44e6-b110-0e28668d6de4","resolution":{"observed_at":"2026-08-02T02:10:19.085506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.256676Z","title":"Reliable and scalable robot policy evaluation with imperfect simulators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.256676Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:f5f967fb2b0469aba9661e6299411911e394be9fffce6b6e1d07cc1236c88f52","observation_id":"9314c1a5-6324-47f9-933f-081da43ba212","resolution":{"observed_at":"2026-08-02T02:10:19.256676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10966","last_updated":"2025-06-06T14:24:36Z","snapshot_observed_at":"2026-08-16T12:50:11.327236Z","submitted_at":"2025-03-14T00:21:48Z","title":"Is Your Imitation Learning Policy Better than Mine? Policy Comparison with Near-Optimal Stopping","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10966","snapshot_observed_at":"2026-08-02T02:10:19.334621Z","title":"Is your imitation learning policy better than mine? policy comparison with near-optimal stopping,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.334621Z"},"links":{"cited_paper":"/paper/2503.10966","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:116948b01fe9cc5f744e8b70b7c88398858de79f6ed5b24a283a6b056e5ed326","observation_id":"e1a14480-4852-460c-b5ae-176faa007a0e","resolution":{"observed_at":"2026-08-02T02:10:19.334621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.172422Z","title":"2205–2219","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.172422Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:a37ea967d1d4a2d182ff4f1b08e33427effcd6e054fe86578de2245f475a138b","observation_id":"2baaccd3-b951-4fb0-8fe4-1ba33baea9b3","resolution":{"observed_at":"2026-08-02T02:10:19.172422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.505575Z","title":"Gaussian pro- cess regression: Active data selection and test point rejection,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.505575Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:b43651f142cc63e36dcfa50ccd71dd209b6f75fab7045ecef79f50d9c10c784b","observation_id":"01960db0-43c2-4bc0-b564-92c958763188","resolution":{"observed_at":"2026-08-02T02:10:19.505575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.583395Z","title":"Active risk estimation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.583395Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:69c0bf0bc1bf884cb39110b0076f27bd9d119cebb5ec373c97b15fdda70eabac","observation_id":"61feb7af-757a-497d-91d8-79358f615c2c","resolution":{"observed_at":"2026-08-02T02:10:19.583395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.412526Z","title":"Bayesian experimental design: A review,","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.412526Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:42d6d158aa1546b793f6c5babd151dd84fe20f6cbef56de2e368a3f6213fdc28","observation_id":"182a8da6-482d-4d49-b549-f75598eeb811","resolution":{"observed_at":"2026-08-02T02:10:19.412526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.854596Z","title":"Active surrogate estimators: An active learning approach to label-efficient model evaluation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.854596Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:1fe1d37f13c96f095052058801e0e9394f09bb3ee7c16f9de1947016b35e489a","observation_id":"89a25a70-70a3-4fb6-8f83-1bf2a05c4687","resolution":{"observed_at":"2026-08-02T02:10:19.854596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.946328Z","title":"Active testing: An unbiased evaluation method for distantly supervised relation extraction,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.946328Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:0e8d9c59aa2601a0957033356e3e821e6953b9737c30c87f9693730ab6343062","observation_id":"6dfc427a-1499-40f2-b3e5-5313e51c4b25","resolution":{"observed_at":"2026-08-02T02:10:19.946328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.039843Z","title":"Efficient evaluation of multi-task robot policies with active experiment selection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.039843Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:233c13246b18f0f8f36de2492d0b70592b256271a494ccd7b44e7e4afebfbc54","observation_id":"4b4276f6-357e-4d6d-af58-e28d9bda4dad","resolution":{"observed_at":"2026-08-02T02:10:20.039843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.755595Z","title":"Active testing: Sample-efficient model evaluation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.755595Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:b655f3bab959df1c486eb5db651612a5a536289f63715f5cf4a1f3c738f720e8","observation_id":"ca2c65b4-f6c3-4a0b-975e-81aab916e725","resolution":{"observed_at":"2026-08-02T02:10:19.755595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.223059Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.223059Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:a77ebaa2f308682b2b3271f1a5d65e2e9466ec75988f1dad456698e8e3e9da06","observation_id":"5f32f806-9ce4-4690-8dc4-fab518ef3b9e","resolution":{"observed_at":"2026-08-02T02:10:20.223059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.276218Z","title":"Gaussian process regression: active data selection and test point rejection,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.276218Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:a4afb8bf167c5cad2003cb92622cb248623a45f5bdf41dca767d59330de3e529","observation_id":"410612e9-70da-4277-8715-bfc2ff382428","resolution":{"observed_at":"2026-08-02T02:10:20.276218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1112.5745","last_updated":"2011-12-24T17:53:19Z","snapshot_observed_at":"2026-08-17T04:17:54.065503Z","submitted_at":"2011-12-24T17:53:19Z","title":"Bayesian Active Learning for Classification and Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1112.5745","snapshot_observed_at":"2026-08-02T02:10:20.362649Z","title":"Bayesian active learning for classification and preference learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.362649Z"},"links":{"cited_paper":"/paper/1112.5745","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:4cdf21825f85ce398a293da878c1d2859c0bd9c5329ad1bc08c27fd96a6ab8c1","observation_id":"340856fd-cc50-4a0f-a1c5-c66842f8a93a","resolution":{"observed_at":"2026-08-02T02:10:20.362649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.131005Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.131005Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:5a2d8f241b94fb47e81b89ceb0dd8de82f96a4c6c5583142a1bc2a1493ea08cb","observation_id":"f8d779e2-87fe-42b5-a5ad-84d7fd1cb7ff","resolution":{"observed_at":"2026-08-02T02:10:20.131005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.493875Z","title":"What matters in learning from large-scale datasets for robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.493875Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:a81983866616254785a14f8e3b318d9753b1b9f8404b7a4ae23f0dcacba69dc2","observation_id":"09fbc945-354d-400b-b6e8-f3ca83e24b81","resolution":{"observed_at":"2026-08-02T02:10:20.493875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.572241Z","title":"Efficient data collection for robotic manipulation via compositional generalization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.572241Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:756c7ddd0e6703b9257644e8a3b0368ff440b6d82ee7fea7d84dd7d5b7ff4fbc","observation_id":"ab6cd159-211c-47c1-8017-29e20ffe913b","resolution":{"observed_at":"2026-08-02T02:10:20.572241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.690364Z","title":"CUPID: Curating data your robot loves with influence functions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.690364Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:74d51636914f9a4dbe432c640cd691efe637894613eee95a6467f72e7015e0ad","observation_id":"f7b6633b-4884-4916-aea6-827baad2e194","resolution":{"observed_at":"2026-08-02T02:10:20.690364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.440213Z","title":"Prediction-oriented bayesian active learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.440213Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:384b8461cdcde2b6c305051f6a555d2fff13b8be2d01781ce8586017c60164ce","observation_id":"b21ab75e-7c5c-4f6f-9783-f72b65777127","resolution":{"observed_at":"2026-08-02T02:10:20.440213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03707","last_updated":"2025-07-22T02:32:33Z","snapshot_observed_at":"2026-08-19T13:27:56.461925Z","submitted_at":"2025-03-05T17:58:16Z","title":"Curating Demonstrations using Online Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03707","snapshot_observed_at":"2026-08-02T02:10:20.805059Z","title":"Curating demonstrations using online experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.805059Z"},"links":{"cited_paper":"/paper/2503.03707","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:e19ee5f802c1cc7ef667c64cf344f8fd590abfa17833e94c87d3f5a21ae1a1c0","observation_id":"f058e837-5671-4044-a2c7-6f0147f4f44b","resolution":{"observed_at":"2026-08-02T02:10:20.805059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.876235Z","title":"Is diversity all you need for scalable robotic manipulation?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.876235Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:7b003c45480baa730688ab16f01665adec159e1b63d31ada5e151d81d1bf1429","observation_id":"fa2e06c0-e935-49f5-9ed9-a8a6c3a8e808","resolution":{"observed_at":"2026-08-02T02:10:20.876235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07728","last_updated":"2025-05-12T16:36:35Z","snapshot_observed_at":"2026-08-17T13:04:52.703421Z","submitted_at":"2025-05-12T16:36:35Z","title":"Guiding Data Collection via Factored Scaling Curves","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07728","snapshot_observed_at":"2026-08-02T02:10:20.960878Z","title":"Guiding data collection via factored scaling curves,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.960878Z"},"links":{"cited_paper":"/paper/2505.07728","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:7f8c211fc2c80c48abfb32498defceae09e307b1287a90ab2737155c1675ed94","observation_id":"0c2a9575-c9bd-4463-bd11-9b331e228d15","resolution":{"observed_at":"2026-08-02T02:10:20.960878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08623","last_updated":"2025-04-22T17:40:30Z","snapshot_observed_at":"2026-08-19T20:06:00.907176Z","submitted_at":"2025-02-12T18:23:23Z","title":"Robot Data Curation with Mutual Information Estimators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08623","snapshot_observed_at":"2026-08-02T02:10:21.047337Z","title":"Robot data curation with mutual information estimators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:21.047337Z"},"links":{"cited_paper":"/paper/2502.08623","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:d49b6f231e1dba296e5d1e70f92ca4fc6b166476b01cbc42ae4431407d7f0eae","observation_id":"23199e93-2382-4d8c-9aef-b8e736ba8646","resolution":{"observed_at":"2026-08-02T02:10:21.047337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:20.749713Z","title":"Actively testing your model while it learns: Realizing label-efficient learning in practice,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.749713Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:70ab9120ea94d12b9d7c2e17de21ef91b6757d1bb0fa3029af8ad9413c63dea2","observation_id":"d2643c9a-6c43-4856-921b-a971175f3e4f","resolution":{"observed_at":"2026-08-02T02:10:20.749713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:21.128311Z","title":"DataMIL: Selecting data for robot imitation learning with datamodels,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:21.128311Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:5ae2af48eebcf9ab2505874fb6e432e2a43f6dd0b3aa74fcf26479131a11b906","observation_id":"b0c2cec8-2b30-466a-9682-fc4995928c5b","resolution":{"observed_at":"2026-08-02T02:10:21.128311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:21.207490Z","title":"Here, we show ablations of either only acquisition functions or only surrogate models to highlight the best combination for sample-efficient evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:21.207490Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:81a0c20a212779e6b4974066a591d5d6772d27d858fd6944cd4b94b1d5b3f6bc","observation_id":"88174170-3a79-4f11-b48d-7144fc395fc7","resolution":{"observed_at":"2026-08-02T02:10:21.207490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:21.288832Z","title":"Figure 8 shows the ablation of several model design choices: 1) no noise floor,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:21.288832Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:c87e31f6de9b43576310dfbad8d9c90e4ecac2277bd849348fce85da83669b36","observation_id":"c892e487-dd7a-4eb9-ac59-d3fad7fb6090","resolution":{"observed_at":"2026-08-02T02:10:21.288832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:21.372851Z","title":"Using a noise floor of 10−1 converges the fastest","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:21.372851Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:8b61190c0323186f768de11458de677fc3b35f425b4d7793dd12449e7f910e02","observation_id":"bf867754-8223-4f10-bcf0-0c55a05ef0c5","resolution":{"observed_at":"2026-08-02T02:10:21.372851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:21.449818Z","title":"However, XWED is inappropriate for our problem for two reasons: –The output of the generalist model (actions) differs from the output of the surrogate model (outcomes)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:21.449818Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:8b7d6273700abf2e5999a8e36bcb7b666909c43f7012737f4ec074f00f539f66","observation_id":"74771b66-3c02-4c32-b166-4f701f8eace1","resolution":{"observed_at":"2026-08-02T02:10:21.449818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:18.418781Z","title":"3705–3728","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":270,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:18.418781Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:c1c80162e3492772683e39baf7c465b79cd561aa563590f3917a6640e1b715ea","observation_id":"d5b2ba6a-1538-414e-923b-930198241967","resolution":{"observed_at":"2026-08-02T02:10:18.418781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:10:19.662448Z","title":"Available: https://api.semanticscholar.org/CorpusID: 16144243","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:19.662448Z"},"links":{"citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:74616fecb65d2bcb34285bb021bada67d47d78015750df83a67235e275d2dd2f","observation_id":"63edb715-b5f4-4790-9b6f-770ea3b0507a","resolution":{"observed_at":"2026-08-02T02:10:19.662448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05110","last_updated":"2024-05-21T14:18:47Z","snapshot_observed_at":"2026-08-16T14:11:43.009256Z","submitted_at":"2024-03-08T07:15:38Z","title":"Efficient Data Collection for Robotic Manipulation via Compositional Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05110","snapshot_observed_at":"2026-08-02T02:10:20.632060Z","title":"Available: https://arxiv.org/abs/2403.05110","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:20.632060Z"},"links":{"cited_paper":"/paper/2403.05110","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:fbc3ab649d85ddef789af8efca7ce7da28b843783e915c59bbd4157eff4cf082","observation_id":"2ec2dc9b-aecc-4e25-9b42-8519e0b9d16d","resolution":{"observed_at":"2026-08-02T02:10:20.632060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T02:10:16.414799Z","title":"Available: https://arxiv.org/abs/2410.24164","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:16.414799Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.14439"},"observation_digest":"sha256:7b7c4fe689c056082b2243d04b643f4dbcbc0d909c18f9c45f0e0291e49bba5e","observation_id":"2f8dc7e8-215a-400d-af15-4327f62a8ec2","resolution":{"observed_at":"2026-08-02T02:10:16.414799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14439","last_updated":"2026-07-16T00:21:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T17:50:29.548990Z","submitted_at":"2026-07-16T00:21:54Z","title":"Active Real-World Factor-Based Evaluation for Generalist Robot Policies"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2607.14439."}