{"as_of":"2026-08-14T01:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eca09b17922bc3338ea0d05076a330eddb30c86a5858b82a0dfcdb1003a40239","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:48:54.233217Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.05147/citation-record","integrity":"/paper/2603.05147/integrity","json":"/paper/2603.05147/citation-record.json","paper":"/paper/2603.05147"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:51.342213Z","title":"Robotic control via embodied chain-of-thought reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:51.342213Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:a2b749f69834d0577e1d2dcfa472ea0ffaefad8ce403ea389a7b2ba14e5052f8","observation_id":"f2db258e-e7c0-4e4d-8348-5ca9f54cb7cf","resolution":{"observed_at":"2026-08-02T18:48:51.342213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:51.431250Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:51.431250Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:6e390227e39c759be87830dd60077a7dd30e643077715d5e0347fc617e366193","observation_id":"24964ee5-06f2-4113-bc0e-76975f88b8d7","resolution":{"observed_at":"2026-08-02T18:48:51.431250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:51.539689Z","title":"Fast ecot: Efficient embodied chain-of-thought via thoughts reuse,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:51.539689Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:8778393adfff354446e0da680ac6a4d6a0eb06d79cd00b4d6f51c76ab19a466b","observation_id":"3b1ef08a-15bf-4565-a708-c708f6643013","resolution":{"observed_at":"2026-08-02T18:48:51.539689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:51.625938Z","title":"What matters in building vision–language– action models for generalist robots,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:51.625938Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:8e024842971fdb3e070193ec29e09c823f45d40188ce53e64613b4b2c5915526","observation_id":"6f98cfc5-8a08-4985-a5e5-d3a24d0d8305","resolution":{"observed_at":"2026-08-02T18:48:51.625938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:51.722517Z","title":"Bridgedata v2: A dataset for robot learning at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:51.722517Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:0c169f1b2d6d0c18e450c59f8918da2c8ad87f6de7a5f9a3d10f1decbab3a71f","observation_id":"a05419c4-9e03-4566-9c81-759097979ccc","resolution":{"observed_at":"2026-08-02T18:48:51.722517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:51.844145Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x- embodiment collaboration 0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:51.844145Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:8d6b7d9f43c6d3b4f49c529383bbcbc88d6bf3dd5c21f53c9d4d1ab216c38041","observation_id":"6d9a28d0-581e-44b9-9ee3-631407d90cc5","resolution":{"observed_at":"2026-08-02T18:48:51.844145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:51.936566Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:51.936566Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:154c9df2b1bfd58abac60fcf2d513774cdd0b57a1069c19a6f050b4eee34e194","observation_id":"944a38e9-5f64-4e69-9ceb-bd0979ed8521","resolution":{"observed_at":"2026-08-02T18:48:51.936566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T18:48:52.069550Z","title":"Open- vla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.069550Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:32eeb5d82a7bf3e7b980d07475cc4eb789df15390df6592f800715ca0c58f7c2","observation_id":"ae8431e6-7195-4066-9964-bcf1e8d8736c","resolution":{"observed_at":"2026-08-02T18:48:52.069550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T18:48:52.167088Z","title":"pi_0: A vision- language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.167088Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:c572bcb6a623ee20ba43d362f3c2f6dbf4becf976c7c2e3dba40e61424f6386f","observation_id":"423453be-298b-4b5d-b5ba-3d088f9b4197","resolution":{"observed_at":"2026-08-02T18:48:52.167088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T18:48:52.236235Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.236235Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:9af98e61dbdd406bd15b2071059ce4782fed9b692aee3b7d7145365cc6daf32a","observation_id":"f0589c35-40dd-4b9d-8a10-16b87376a1de","resolution":{"observed_at":"2026-08-02T18:48:52.236235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:52.321488Z","title":"π ∗ 0.6: a vla that learns from experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.321488Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:35cb3c059b9dd1320e2d262f053a17d7361b9d645103ae8126d41700d7025de4","observation_id":"b7755610-7e70-4994-87d7-d40accde8d50","resolution":{"observed_at":"2026-08-02T18:48:52.321488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-08-14T01:02:35.686274Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-02T18:48:52.392191Z","title":"Vla-rl: Towards masterful and general robotic ma- nipulation with scalable reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.392191Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:e77b2f837d3b31fe207d13471eb95ebef0e37648bc59275e880c21b01f8f7cec","observation_id":"71402313-8f76-4efc-a5be-c6222c35c19a","resolution":{"observed_at":"2026-08-02T18:48:52.392191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:52.509812Z","title":"Smolvla: A vision-language-action model for affordable and efficient robotics,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.509812Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:7e224ec5ba58c46e2536c2e3ba55cbce928d5c72f4f54f79d22469f228cf9ada","observation_id":"ba4bc401-fab4-48ee-8754-4ba42047d549","resolution":{"observed_at":"2026-08-02T18:48:52.509812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:52.685186Z","title":"Tinyvla: Towards fast, data-efficient vision- language-action models for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.685186Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:deb587ff4f506387ce1d63b8c3a6c0516a9383ee122abf22e4594d86b4b1514f","observation_id":"9d7e39c7-d0fa-47a4-8a04-aa18ad26340f","resolution":{"observed_at":"2026-08-02T18:48:52.685186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:52.777610Z","title":"Instructvla: Vision-language-action instruction tuning from understanding to manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.777610Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:7e9af3d076f465808436579d24114ec700a4853f9f4b42e0d9427a02efd9795f","observation_id":"efb29793-8700-4c0d-b4e4-e7c8cee26164","resolution":{"observed_at":"2026-08-02T18:48:52.777610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-08-11T00:39:38.533421Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.13193","snapshot_observed_at":"2026-08-02T18:48:52.849158Z","title":"Steerable vision-language- action policies for embodied reasoning and hierarchical control,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.849158Z"},"links":{"cited_paper":"/paper/2602.13193","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:46850b5fa4f02fab79f11189796120612f63cfbddab2f1e414d80688f4ebe6ac","observation_id":"a0d047ee-566a-446d-b825-7676369d0279","resolution":{"observed_at":"2026-08-02T18:48:52.849158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:52.933599Z","title":"Onetwovla: A unified vision-language-action model with adaptive reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.933599Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:51c5966c1fa6f103af0a3b88df316961837c88df39cf0e86ef65b76eddf66ac3","observation_id":"b709fa55-c3e7-4efd-ae11-97c23f2140f5","resolution":{"observed_at":"2026-08-02T18:48:52.933599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:53.033786Z","title":"Safe: Multitask failure detection for vision-language- action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:53.033786Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:a4c91e730f59532e8c07d0bcd31a441f1212d3619956bcc17e92a9a5a4c38914","observation_id":"6c97d867-f5df-4a45-9579-1bea54c45a00","resolution":{"observed_at":"2026-08-02T18:48:53.033786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-02T18:48:53.101905Z","title":"Smolvlm: Redefining small and efficient multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:53.101905Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:2f458e53c1a85f3abe0ddff0f57d93997c32e483c1dc6d02b5ca4303e578a882","observation_id":"0cb36279-bc22-4038-bd8a-8f48011192a7","resolution":{"observed_at":"2026-08-02T18:48:53.101905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:53.309315Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:53.309315Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:fbc4932b5f42ab1dab65ebcf08fa57c9da73b8714830fe2cee9e9838ae29aef9","observation_id":"1d2a65e5-348e-4ee3-a952-5440288eca47","resolution":{"observed_at":"2026-08-02T18:48:53.309315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T18:48:53.460763Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:53.460763Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:a7993f1fd3be70be4dce518b91c119bfbe718b80d664c29bbb98547e7e6f0f58","observation_id":"e3ab23f1-9163-4fa2-907d-6c58b8fe9beb","resolution":{"observed_at":"2026-08-02T18:48:53.460763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:53.619512Z","title":"Gaussian mixture models","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:53.619512Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:796fd7302a60078f14061e2e7952da9e2efb317f70ff27aa38516b0a61f11d26","observation_id":"4e859834-cb50-4da4-b9bf-4cacc0b97dd6","resolution":{"observed_at":"2026-08-02T18:48:53.619512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:53.716648Z","title":"The ma- halanobis distance,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:53.716648Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:2d4e3c304fb82867819e09684abe06aa25497fe89519b2dd33c407bdc4a4d83f","observation_id":"d3ad6f08-25c5-49e5-9cd6-ff58e53d7c47","resolution":{"observed_at":"2026-08-02T18:48:53.716648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:53.857715Z","title":"A well-conditioned estimator for large- dimensional covariance matrices,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:53.857715Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:f78ea048885d243b639e70c6ff48c76d03cd3b72252ee7713d836f014f112ff9","observation_id":"ad71fbf7-8820-4815-85f7-70ee195fca93","resolution":{"observed_at":"2026-08-02T18:48:53.857715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:54.012491Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learn- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:54.012491Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:15d0dbd303c3e8751f1b3d770146b026b338ac6c4eef384ebccf99fa546d9298","observation_id":"37e1eb46-4955-49ad-a21d-4cecec6ec22b","resolution":{"observed_at":"2026-08-02T18:48:54.012491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03827","snapshot_observed_at":"2026-08-02T18:48:54.118494Z","title":"Libero-pro: Towards robust and fair evaluation of vision-language-action models beyond memorization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:54.118494Z"},"links":{"cited_paper":"/paper/2510.03827","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:a3b683ea3fc0aec71e4d9a83125a6cd967e0351900f8596acab2643e056415aa","observation_id":"55b79511-27f2-49c5-92f6-f3e19302baa5","resolution":{"observed_at":"2026-08-02T18:48:54.118494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:48:54.233217Z","title":"mixup: Beyond empirical risk minimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:54.233217Z"},"links":{"citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:62f6792c2d52a29eb2f627aac17973ecdf397cc49f256d7ccb8de6a1e21d47c4","observation_id":"224d4ea4-6cbf-45bd-b00a-c6be90abfeb6","resolution":{"observed_at":"2026-08-02T18:48:54.233217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-13T11:17:54.365190Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-02T18:48:52.616387Z","title":"Available: https://arxiv.org/abs/2506.01844","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.616387Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:3202a776802182ebc2ef57c9897ccee7acd7c02c3b5e28748861e1e383380ba7","observation_id":"0aa0d5b0-414a-4e09-a3d6-7684c7023ea6","resolution":{"observed_at":"2026-08-02T18:48:52.616387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T21:03:55.554760Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2603.05147."}