{"as_of":"2026-08-08T17:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e2088a9bf32ef6f254559dee3272b9888f17181d1352ca66d1ee4424ace035c","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:24:08.254315Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09829/citation-record","integrity":"/paper/2502.09829/integrity","json":"/paper/2502.09829/citation-record.json","paper":"/paper/2502.09829"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:09.079135Z","title":"Sim-to-real transfer for vision-and-language navigation","venue":null,"work_id":"fd52b5d4-0613-4907-8e62-f2ff39df1f34","year":2021},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.005910Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:a239958bc826ba629a2e4dfadd7fb9a82fc7a7c79f9f96c8652a08cc7fc11d98","observation_id":"26c6ca63-413b-481a-93ed-bf280aed8ed2","resolution":{"observed_at":"2026-08-07T20:24:09.084157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:09.063814Z","title":"Con- trast sets for evaluating language-guided robot policies","venue":null,"work_id":"dee66337-7f91-4e3a-999d-2536f228faa9","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.011688Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:b1c12ab2fc557ec17f77619f94dafe3e9f16d9ce03d56a16a61fc84962a2f80b","observation_id":"ed285a56-c073-4fc5-92c2-1360f2f1e3d6","resolution":{"observed_at":"2026-08-07T20:24:09.069010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:09.049308Z","title":"Remembr: Building and reasoning over long-horizon spatio-temporal memory for robot navigation","venue":null,"work_id":"bad855bc-ec2a-4684-847d-e73c7b221ee5","year":2025},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.016879Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:440a5bce7b1a4c75f26f070cb0d61395c35f6aa0583cf906914b0a23c813b173","observation_id":"a94521aa-8179-4cf4-a5a7-c1e53b0b35b7","resolution":{"observed_at":"2026-08-07T20:24:09.053902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:09.035103Z","title":"Surrogate assisted generation of human-robot interaction scenarios","venue":null,"work_id":"5d3935cb-6bb1-41ed-8caf-389531144b2e","year":2023},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.022672Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:00979fdbd4523cd46f0328ab87ddb40c15cd6682938784ca2811828bae76fcc2","observation_id":"b6c14229-43af-4668-9123-170bb3a08b9d","resolution":{"observed_at":"2026-08-07T20:24:09.039893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:09.019775Z","title":"Mixture density networks","venue":null,"work_id":"841a6d6c-8960-4abf-af57-b05b389f5ff1","year":1994},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.027904Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:1c8ae9c2db880396c77f9236e9a120f19c697b24bd0f32ae0f4ea98f41c8329d","observation_id":"cc92b23e-6d74-4a9e-a3e9-948afe2cdf3c","resolution":{"observed_at":"2026-08-07T20:24:09.025105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T20:24:08.032884Z","title":"π0: A vision- language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.032884Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:bd331e7b20323bb24cff2233b6480d410e7c9adb1338f76f05da097fc69872e8","observation_id":"db870277-d89b-4a27-89cc-73048e4422ed","resolution":{"observed_at":"2026-08-07T20:24:08.032884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1012.2599","last_updated":"2010-12-12T22:53:04Z","snapshot_observed_at":"2026-07-06T02:20:34.514024Z","submitted_at":"2010-12-12T22:53:04Z","title":"A Tutorial on Bayesian Optimization of Expensive Cost Functions, with Application to Active User Modeling and Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1012.2599","snapshot_observed_at":"2026-08-07T20:24:08.038303Z","title":"A tutorial on bayesian optimization of expensive cost functions, with application to active user modeling and hierarchical reinforcement learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.038303Z"},"links":{"cited_paper":"/paper/1012.2599","citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:18f9033d53d7cc41207a8527403b1abbb3da40f146daec906c14f07e734fa724","observation_id":"f22198aa-5c07-48af-a897-8d3fffdc7860","resolution":{"observed_at":"2026-08-07T20:24:08.038303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:09.005195Z","title":"A survey on evaluation of large language models","venue":null,"work_id":"fd83e2f1-69c9-4d5d-8358-d4493583320e","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.043968Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:35561d4ff8263259f795c78edc39038ee1f458a75d8ad44175cf0ca6fe79050c","observation_id":"a89ec4cd-1752-49f3-9edd-5370b68f058a","resolution":{"observed_at":"2026-08-07T20:24:09.010063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.991269Z","title":"Learning surrogate models for simulation-based opti- mization","venue":null,"work_id":"88bdb434-6c25-4d92-b41c-9e39f74466ce","year":2014},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.048745Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:18d575c052734a42b72931c0c3b5c85e45ec79d8bcd7b400fbec8568e6f91ca5","observation_id":"7af56f50-e073-4895-9362-7eaeeb9e849c","resolution":{"observed_at":"2026-08-07T20:24:08.995807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.977441Z","title":"RoboTHOR: An Open Simulation-to-Real Embodied AI Platform","venue":null,"work_id":"a118a46b-8119-43e0-bdd7-9630d38ddbc6","year":2020},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.053466Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:668b4c36bc38bdf3353f872838d0c1499bfccf52ee44a5121af6a656893a6142","observation_id":"2559ab78-111d-49eb-900b-57a59fde8450","resolution":{"observed_at":"2026-08-07T20:24:08.982018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.960340Z","title":"Efficient benchmarking of hyper- parameter optimizers via surrogates","venue":null,"work_id":"5e5bc6df-3716-402c-81ef-6ea783c841a6","year":2015},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.058304Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:e4f49ea84d2d38d14e9d830f4e2432c69d44eca96df9759f059a00c184d584b5","observation_id":"7cf5f8fa-e923-4c70-9727-6bfae3fff535","resolution":{"observed_at":"2026-08-07T20:24:08.964796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.945674Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":"aa82a31b-4ab0-40ff-8be8-4638c6062597","year":2016},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.063294Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:1a83e9d78af78a568c8a2a9873dcf442d3d4c8b28d4c894eb0b6eb6b2f81f065","observation_id":"55e5f08b-1cff-4d78-a5ab-059acbd87550","resolution":{"observed_at":"2026-08-07T20:24:08.950854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.932160Z","title":"Efficient Data Collection for Robotic Manipulation via Compositional Generalization","venue":null,"work_id":"1d5a308e-50d4-4824-b6b6-fac4729f4988","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.067842Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:2d2a8e46393d87152c58b75376ea45be4835a32ac4f887f0e0ba235af550995e","observation_id":"fadbd227-7ddb-47a9-b67b-8ce59014fc0e","resolution":{"observed_at":"2026-08-07T20:24:08.936588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.918071Z","title":"Liu, Phoebe Mul- caire, Qiang Ning, Sameer Singh, Noah A","venue":null,"work_id":"064ac01f-fc9e-452f-81b2-594424e54830","year":2020},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.072828Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:b7892ab22e8acc0102b148763a2da466c7d1944ac6018ea9904c45a21b1d39ad","observation_id":"663b53e1-19c5-4ca3-abaf-0fcec1a5f52b","resolution":{"observed_at":"2026-08-07T20:24:08.922623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.903853Z","title":"Navigating to objects in the real world","venue":null,"work_id":"8ab2ae72-80d3-4b61-805e-d2c6b5e3fa19","year":2023},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.077336Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:9c588bc83b7d1e60476a481a591605107224d2feab74350d936af58c8c93edd3","observation_id":"f9ebe5db-34ae-4c54-8d89-1eb480d460c8","resolution":{"observed_at":"2026-08-07T20:24:08.908659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.889882Z","title":"Minillm: Knowledge distillation of large language mod- els","venue":null,"work_id":"e4811384-ba97-4045-8dfe-d72dfa751023","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.081928Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:652f48020f1d84fdae6dffcafa8c0749f51531140652d30d9f23a89a60ef7db8","observation_id":"7b9e03f1-767c-4715-9a1e-7908ecd69939","resolution":{"observed_at":"2026-08-07T20:24:08.894585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.876062Z","title":"World models","venue":null,"work_id":"c525a822-1539-4d8e-8897-2c501235d587","year":2018},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.086506Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:7429e4b32d93fa8692bdb3a34d5bbfc2a46c41afbcfd1714852fdc7ffa48948a","observation_id":"40d46ed5-1ef9-438f-b1ce-3ad86553ddaa","resolution":{"observed_at":"2026-08-07T20:24:08.880292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.862044Z","title":"Benchmarking neural network robustness to common corruptions and perturbations","venue":null,"work_id":"45df8f14-fe22-4fa5-872e-91712a8b57e2","year":2019},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.091677Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:e9d09b7f52c2253b94a2b9f84c7d28b2ad2dd51ea88806e8d5514707643c9f04","observation_id":"ae60c01c-38bb-4eab-bda8-933256a9e198","resolution":{"observed_at":"2026-08-07T20:24:08.866591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.848134Z","title":"Pretrained transformers improve out-of-distribution robustness","venue":null,"work_id":"a5651bd0-b23c-4cd7-a872-ec6bbb77b566","year":2020},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.096785Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:f6e26bd3fa3ccfa641d2cb9c87c3b064b8931bdfc73620ec285e2d2ac92715d4","observation_id":"3c0329c7-1abc-44ab-923c-bd8c08fd8085","resolution":{"observed_at":"2026-08-07T20:24:08.852914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1112.5745","last_updated":"2011-12-24T17:53:19Z","snapshot_observed_at":"2026-07-06T02:40:01.191970Z","submitted_at":"2011-12-24T17:53:19Z","title":"Bayesian Active Learning for Classification and Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1112.5745","snapshot_observed_at":"2026-08-07T20:24:08.101849Z","title":"Bayesian active learning for classification and preference learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.101849Z"},"links":{"cited_paper":"/paper/1112.5745","citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:fcfc6fe8d611bb5abe8c704c4f01c9c617c7a9952db8551de770657fb342bada","observation_id":"c923236e-2c6a-4d33-9749-448d587481be","resolution":{"observed_at":"2026-08-07T20:24:08.101849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.833490Z","title":"Deploying and Evaluating LLMs to Program Service Mobile Robots","venue":null,"work_id":"91da3bd9-ceb1-4338-bdd5-83a9da1d1d6b","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.107159Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:07293f45d99f212e5c56a9a4e68d103a7ca00160a20c63d0e31de95adb0f67b5","observation_id":"60d4b5d4-e7a8-4930-b747-99cbbc76109a","resolution":{"observed_at":"2026-08-07T20:24:08.838641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.818877Z","title":"Sim2Real Predictivity: Does Evaluation in Simulation Predict Real- World Performance? IEEE Robotics and Automation Letters (RA-L), 2020","venue":null,"work_id":"c1a6acdf-2988-43b1-96dc-78159ef47258","year":2020},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.111866Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:7b27e4b1f803b80fdcb1381bc8376bb23df2bcc70dbd359057b604dfd5550c9d","observation_id":"fd54f599-94bd-4af1-a767-60d7402d995f","resolution":{"observed_at":"2026-08-07T20:24:08.823846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.803870Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"f4036a6c-bac5-42a5-a2a1-d32afe1a303c","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.116672Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:9338f8d8dc91a38e09ab4d9fb003362372fbe5e8b3f0536f3fdf241cdd2f67f4","observation_id":"0220736c-de73-4e23-a708-e1c0eed7aebe","resolution":{"observed_at":"2026-08-07T20:24:08.808906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.789080Z","title":"Active testing: Sample-efficient model eval- uation","venue":null,"work_id":"84da4271-4020-4c1a-90dc-dc0b294d9657","year":2021},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.121494Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:6cfcac3dc90efb7a82430fd24b9e0d01d0cb8cc08a0b0b010ff70399526639e4","observation_id":"7254eecc-6edb-4afd-b687-2409a6c5afb6","resolution":{"observed_at":"2026-08-07T20:24:08.794038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.773351Z","title":"Robot learn- ing as an empirical science: Best practices for policy evaluation","venue":null,"work_id":"aa885550-1e3e-4968-9583-e8cbd9f5be18","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.126153Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:39ba734d70ffc8e53c713c976f03eacc36c1c6cbb7371f86c068a90be63caf16","observation_id":"345be716-df4f-4671-a31c-23085459e484","resolution":{"observed_at":"2026-08-07T20:24:08.778709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.759223Z","title":"Dropout injection at test time for post hoc uncertainty quantification in neural networks","venue":null,"work_id":"5cb4e129-c3c5-454b-92ad-96675bc51a06","year":2023},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.132137Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:1123085bcefa69a0a6df036885a8cccd79825b5a9bede1e787414dd4ae5054f9","observation_id":"f273a139-e0bd-4c76-be64-b1bd2191dfd9","resolution":{"observed_at":"2026-08-07T20:24:08.763886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10870","last_updated":"2020-03-22T14:51:04Z","snapshot_observed_at":"2026-07-06T09:06:58.966574Z","submitted_at":"2020-03-22T14:51:04Z","title":"Cost-aware Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10870","snapshot_observed_at":"2026-08-07T20:24:08.136868Z","title":"Cost-aware bayesian optimization","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.136868Z"},"links":{"cited_paper":"/paper/2003.10870","citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:8fed12a4156283a85c6eb8f4478ec437dd0589c801d358c2b8f203dbe83512a6","observation_id":"b966978c-e2d1-485a-9ba5-56afc1409e74","resolution":{"observed_at":"2026-08-07T20:24:08.136868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.744851Z","title":"Evaluating real-world robot manipulation policies in sim- ulation","venue":null,"work_id":"dd208ba8-474a-41bb-b12e-0028b1672cee","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.141947Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:b4484a040ddd4754b752436a823a178fdb1bc64aa94c19399e7a0187c00089d7","observation_id":"f9782aab-e785-462e-9e64-ba8d3e0c759b","resolution":{"observed_at":"2026-08-07T20:24:08.749435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.730212Z","title":"Ham- ster: Hierarchical action models for open-world robot manipulation","venue":null,"work_id":"c4698a7c-fcc4-4c11-94a6-72460d622ba4","year":2025},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.146913Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:b0d5a886b4c454288a5e618b5f948e5290f55c73cb120d179cb330885c9f118f","observation_id":"e6f2b0d9-07de-42b5-b5a7-47db44b4efdd","resolution":{"observed_at":"2026-08-07T20:24:08.735234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.715751Z","title":"Holistic evaluation of language models","venue":null,"work_id":"04a6bbdc-ecce-4b0c-b34f-6d0a54369462","year":2022},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.151565Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:161d315425310ff005502d0e019c44e61b5f68a6a9d654051ebaefb836709f11","observation_id":"b9cab6f8-e7db-4cfb-96e6-2392c58d760a","resolution":{"observed_at":"2026-08-07T20:24:08.720648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.701364Z","title":"A general framework for uncertainty estimation in deep learning","venue":null,"work_id":"3ae512a9-4e26-4d89-bd76-68dd8dc43a94","year":2020},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.155969Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:6043fa5325c1c5ae204992f5027e0ec9d79c1473ddcecdc7c3970b62b8ff33f6","observation_id":"e4d9510a-19ce-4c7c-b63d-7146c9900ee1","resolution":{"observed_at":"2026-08-07T20:24:08.706028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.687097Z","title":"Probabilistic matrix factorization","venue":null,"work_id":"05d8f93d-33b1-44b1-885b-44478cefc3d4","year":2007},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.160717Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:02c135bf12c080490eb72885f116182388a9c6ea8ad1f7cbcc13a31004729053","observation_id":"ec8a53fe-460d-453b-9e82-7eda7d2072d0","resolution":{"observed_at":"2026-08-07T20:24:08.691595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.672368Z","title":"Differential assessment of black-box ai agents","venue":null,"work_id":"fa715cc6-2f12-4f12-b9be-2796329605fe","year":2022},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.165429Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:578d3be4f470ebca937260030b762bf70a07198d479a9f7424620294000291f8","observation_id":"0510ec4a-e5a2-4c0a-8277-218380b6ea71","resolution":{"observed_at":"2026-08-07T20:24:08.677074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.657034Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"8eebeb08-898b-4a1b-80bc-8a1923e82b06","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.170063Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:7999ddb1735ba49f6c0d8f0e01ee4fa07f3e1adba7f89d131ba8ceae797ffa3e","observation_id":"8d361def-f9ec-4b91-bbb9-e2cf162c2127","resolution":{"observed_at":"2026-08-07T20:24:08.661880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.641377Z","title":"Investigating the Role of Instruction Variety and Task Difficulty in Robotic Manipulation Tasks","venue":null,"work_id":"4cbf36f6-f44f-403d-b5c3-797c3c0b5085","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.174469Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:65e3c323f94da93e7c55383e72896c1fb89e885ad7002b39264601b9f94ab9f4","observation_id":"485d3982-4785-4bc9-9df6-b9ca7e4476ac","resolution":{"observed_at":"2026-08-07T20:24:08.646307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.625055Z","title":"Cost-aware bayesian optimization via information directed sampling","venue":null,"work_id":"3e901f62-e78c-4eef-a484-60a3ed86a3ca","year":2020},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.179124Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:b4033e84468c5bb41f06c4b52f3db40935d57fb309e29156aa96703f4feb8063","observation_id":"6485b935-0ae8-457b-b4bb-7a710568aac7","resolution":{"observed_at":"2026-08-07T20:24:08.630414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.607903Z","title":"THE COLOS- SEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation","venue":null,"work_id":"6988d097-1167-4722-9919-4e8d62cb9d85","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.183537Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:52093d25fe2d918e0ec5971a277452893509d0d2d11f871648809bca15a59521","observation_id":"c4a3c133-140d-4825-a647-ecf73f7f4213","resolution":{"observed_at":"2026-08-07T20:24:08.613142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.591662Z","title":"Building surrogate models based on detailed and approximate simulations","venue":null,"work_id":"b54a2f65-bffa-4139-aefe-0a438ee7e574","year":2006},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.187971Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:3b08272bcec40b135a412d03787b21bbc1891ea3b7498054fc8daa86b90438a1","observation_id":"c1c848a8-6bb5-4efd-bc03-dc74cf668a9a","resolution":{"observed_at":"2026-08-07T20:24:08.596637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.577129Z","title":"Modern bayesian experimental design","venue":null,"work_id":"94087729-b3d7-4d2d-9fa4-605ce87ad307","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.192597Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:c16688275ad263b59ded2ce1ec53eb659a6aef66131738c37407f21941cb6c73","observation_id":"5fcfeaf2-47ed-4286-8fa4-f33c7eec3645","resolution":{"observed_at":"2026-08-07T20:24:08.581857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.562374Z","title":"Do imagenet classifiers generalize to imagenet? In International Conference on Machine Learning (ICML), 2019","venue":null,"work_id":"ed9dd237-714e-44cd-af10-08bcaf0f0275","year":2019},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.197577Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:223b2455295a8cf284803964ad6ab3bdfbe46c04c6517e8228df5dc7a1a0d0a0","observation_id":"7bb24d94-39b3-4b04-bf42-c0f64301c6d9","resolution":{"observed_at":"2026-08-07T20:24:08.567419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.546297Z","title":"Active risk estimation","venue":null,"work_id":"476c92d6-7ee3-4b56-b05d-fa86b44aa95b","year":2010},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.202262Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:97c67c9a26840b71dc8e6eff55b7f05380bfb9ce2e65c304a66de4acedc6ae33","observation_id":"3baddab0-c4cb-423c-bb0a-c2b21ac47fdf","resolution":{"observed_at":"2026-08-07T20:24:08.550901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.529862Z","title":"Vint: A foundation model for visual navigation","venue":null,"work_id":"10409e69-021c-401c-928f-308a1136c311","year":2022},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.206920Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:8ea24e3ab889556ae855087093dc38690963fb431f22a2e4e23a0f54b26953a1","observation_id":"35f8747c-1dc2-4f35-b18a-4273c8bf4a8f","resolution":{"observed_at":"2026-08-07T20:24:08.535117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.513113Z","title":"Lm- nav: Robotic navigation with large pre-trained models of language, vision, and action","venue":null,"work_id":"6b851ac5-7db0-4bc5-9c72-a957ad31b8d0","year":2023},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.211508Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:2bfa17f88ae55c57e711202156c8aa5d61e3d17a5250ddc1af1c5844ed41fc98","observation_id":"6e72152f-c96f-4b56-89ea-b38137f396d2","resolution":{"observed_at":"2026-08-07T20:24:08.518129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.497513Z","title":"Taking the human out of the loop: A review of bayesian optimization","venue":null,"work_id":"970b0fd9-28a4-4c41-90ec-358fb323ae11","year":2015},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.216126Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:190431ef8e62a41fd0ee1b664d889afe8b200975ccca8906f526720b6124e5c2","observation_id":"dc026d25-b7dd-4277-90d1-d17e9346d0c1","resolution":{"observed_at":"2026-08-07T20:24:08.502523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12122","last_updated":"2022-10-21T17:22:03Z","snapshot_observed_at":"2026-07-06T14:08:49.704572Z","submitted_at":"2022-10-21T17:22:03Z","title":"Targeted active learning for probabilistic models","version":1},"cited_work":{"arxiv_id":"2210.12122","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.12122","snapshot_observed_at":"2026-08-07T20:24:08.313829Z","title":"Targeted active learning for probabilistic models","venue":"cs.LG","work_id":"f2f532ef-7d74-4c08-ab6b-50a2c752a730","year":2022},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.220721Z"},"links":{"cited_paper":"/paper/2210.12122","citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:88fd516ea980b06add0b17e90fd29729452a44a3951c7ee500fe19c29bd66222","observation_id":"53efac60-5367-47f7-b1ca-6fe513fef398","resolution":{"observed_at":"2026-08-07T20:24:08.321102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.481028Z","title":"Discovering user-interpretable capabilities of black-box planning agents","venue":null,"work_id":"bfcfc028-1c30-411a-b358-abe2fda51da8","year":2021},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.225896Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:9838148e8a0e0e212327675622067fb115278cd10edbe9a5552de0d5c5bd6552","observation_id":"fe7e84a9-ab7e-4e51-acb8-099f44cdbdb4","resolution":{"observed_at":"2026-08-07T20:24:08.486723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.463640Z","title":"Autonomous capability assessment of sequen- tial decision-making systems in stochastic settings","venue":null,"work_id":"694539cb-e952-4af0-9a16-c05b2062e6ce","year":2023},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.230274Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:2af12f5b50645b8b576e3be39e72a11fffe635506951d5e1abea72cc78041f71","observation_id":"899f423e-4ef5-44af-82b2-1b9f420132ad","resolution":{"observed_at":"2026-08-07T20:24:08.469447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.447219Z","title":"How Generalizable Is My Behavior Cloning Policy? A Statis- tical Approach to Trustworthy Performance Evaluation","venue":null,"work_id":"008ec71e-edd8-4ad8-a434-33096a79eb2c","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.234744Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:fcb28ecce21d3106094bdde2098351ba4401b706ad1bf3198ada34a834bd6744","observation_id":"b8e12e8f-c18d-43fb-bbde-97d163b158a2","resolution":{"observed_at":"2026-08-07T20:24:08.452435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.430992Z","title":"CLINE: Contrastive Learning with Semantic Negative Examples for Natural Language Understanding","venue":null,"work_id":"edbc9ca0-74dd-43dd-b120-2a73d57e4460","year":2021},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.239673Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:54b12edda312ae3124d6390f882eeab08234677c2f820edb4b71dadf50763d91","observation_id":"e85d0b1b-4eb4-4f05-8848-d96ae0fd9673","resolution":{"observed_at":"2026-08-07T20:24:08.436050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.413862Z","title":"Decomposing the generalization gap in imitation learning for visual robotic manipulation","venue":null,"work_id":"52bf7a18-97bb-4a16-a4af-0cc3b8e5b918","year":2024},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.244153Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:da70a261ba57d4e8881c7b2b748e848dc8ef2e8530c6cccac9b2bd724683818a","observation_id":"b65b5839-f159-4f26-a717-7a1f269544a3","resolution":{"observed_at":"2026-08-07T20:24:08.419828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.12043","last_updated":"2021-09-24T16:03:58Z","snapshot_observed_at":"2026-08-01T20:09:52.794507Z","submitted_at":"2021-09-24T16:03:58Z","title":"Sample Efficient Model Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.12043","snapshot_observed_at":"2026-08-07T20:24:08.248881Z","title":"Sample efficient model evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.248881Z"},"links":{"cited_paper":"/paper/2109.12043","citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:65c99bda588d8ad26e2506abd17a8c6e56b8ecb4885db0de32ae67b4538a9bab","observation_id":"27c5d9c3-fc00-4aff-b267-6a8fa47ed7a5","resolution":{"observed_at":"2026-08-07T20:24:08.248881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:24:08.398030Z","title":"Meta- world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"455fa2fb-ae5c-46bb-a07f-24beab9b94b9","year":2020},"citing_paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T20:24:08.254315Z"},"links":{"citing_paper":"/paper/2502.09829"},"observation_digest":"sha256:68cb0161bd8f460a4f35211a59bc289cbf9872513e9f17118c02174bb5febd4c","observation_id":"b321e13e-317e-4693-8189-37ef7d9bdfca","resolution":{"observed_at":"2026-08-07T20:24:08.403255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.09829","last_updated":"2025-02-14T00:07:02Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T20:18:15.459594Z","submitted_at":"2025-02-14T00:07:02Z","title":"Efficient Evaluation of Multi-Task Robot Policies With Active Experiment Selection"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":46},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2502.09829."}