{"as_of":"2026-08-12T05:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01975a6842beb984ffe6ea670e66087620ce24b374c47d07df6ec26f46fcd7e9","coverage":[{"denominator":152,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:18:34.990563Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06756/citation-record","integrity":"/paper/2608.06756/integrity","json":"/paper/2608.06756/citation-record.json","paper":"/paper/2608.06756"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.427180Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.427180Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:250f3d480dc32087ff796a072c50017527dc14a5579040b2dde673ceb6697b29","observation_id":"86fa4e9e-bea2-4d0e-bafb-9151c55c7ede","resolution":{"observed_at":"2026-08-10T21:18:32.427180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.508527Z","title":"Flamingo: a visual language model for few-shot learning.Advances in Neural Information Processing Systems (NeurIPS), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.508527Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:c8f96afa3f0aa206e2bfa3430350150451c60c9b268a29409effba45e57999e2","observation_id":"1b686d8d-8975-4482-80e0-a87d317f2e8d","resolution":{"observed_at":"2026-08-10T21:18:32.508527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.550014Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.550014Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0b5f14e45174b421138cbb1434da1c0ba4c0f5f551fe5682475515bc6c7fd223","observation_id":"9558b71e-665b-4a39-81e4-c7be360f62ec","resolution":{"observed_at":"2026-08-10T21:18:32.550014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.555035Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.555035Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:036d6c4d67b3f526293cdaa22c83938dc17cbe9da1b8bf88e8c61da6a792a174","observation_id":"dd610574-b780-475c-8b93-737ddcbab4ae","resolution":{"observed_at":"2026-08-10T21:18:32.555035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.560003Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.560003Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:7a0500e1fdb7c1f20413f8ecfe20d200dc4aca04539519ca591c09dbe9435531","observation_id":"a1ce5d4f-fff2-4c7f-9659-dbf2835af667","resolution":{"observed_at":"2026-08-10T21:18:32.560003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-10T21:18:32.564957Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.564957Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a60e39523a29d053e92e5912acefc9c9ef20637010dfc760c4036d77b353431b","observation_id":"8c9e1efe-c2f4-413e-8834-fd4ec95c0b55","resolution":{"observed_at":"2026-08-10T21:18:32.564957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-10T21:18:32.571389Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.571389Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:bfc4fc3d13c7d85f5a71c019869e3da3136fefbb84648010d27b67cb24f9d931","observation_id":"03b4107f-aab0-430a-a07c-e806c9b72ab6","resolution":{"observed_at":"2026-08-10T21:18:32.571389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-10T21:18:32.575729Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.575729Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:546e4a971bed00a2900ef34baf6d4e9a2ff960feb0e1ed1e0560285a2767abab","observation_id":"ef7ecffc-478c-4a73-9003-862bf182fa39","resolution":{"observed_at":"2026-08-10T21:18:32.575729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-10T21:18:32.628607Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.628607Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1ea63b1fe173b00fefb4fa5e17d2194d9e95ec37b8ef20f963052bc8fa35905b","observation_id":"6128c3a3-393b-43dd-afa6-abb521a80b06","resolution":{"observed_at":"2026-08-10T21:18:32.628607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-08-05T02:35:14.331933Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07753","snapshot_observed_at":"2026-08-10T21:18:32.705999Z","title":"Code as policies: Language model programs for embodied control.arXiv preprint arXiv:2209.07753, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.705999Z"},"links":{"cited_paper":"/paper/2209.07753","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:3ced1d7958ece7841b50f60f2bf2e50395f0b58bdd7a93f01dbefa412f824191","observation_id":"0aefddd6-7be9-4181-b512-9e4dea5b8264","resolution":{"observed_at":"2026-08-10T21:18:32.705999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-10T21:18:32.752781Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models.arXiv preprint arXiv:2307.05973, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.752781Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0edf1216b7cd814f7d41e8e9d64bf62d61f94f39357a708a5d131f1e8534e570","observation_id":"cc13936a-121e-42ec-afe3-48b8ee51cafa","resolution":{"observed_at":"2026-08-10T21:18:32.752781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-10T15:50:18.915523Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-10T21:18:32.841005Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.841005Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:60b0697d23f13bfbc16f6211781f2d95c808a0bfa51bfa49299db26f1db8428e","observation_id":"13aa88af-1dcc-432a-9a86-1f8f00e72e8d","resolution":{"observed_at":"2026-08-10T21:18:32.841005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-08-10T12:41:05.968400Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-10T21:18:32.953272Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.953272Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:c68576f6f33a6f77d014f4ef6fb1f96e50052f9246e7b928696d6a98e5acfa81","observation_id":"6bb8a24e-72ac-4260-b6c5-6e26a666a9a2","resolution":{"observed_at":"2026-08-10T21:18:32.953272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-11T07:58:41.762570Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-10T21:18:32.957799Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete.arXiv preprint arXiv:2502.21257, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.957799Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:cfb66e57d8e90839a1aac528df8f98273fd4d674e8261fdeaaf13ba5ea5dcf6e","observation_id":"5666ebd1-4296-40d0-b628-97027be56e0f","resolution":{"observed_at":"2026-08-10T21:18:32.957799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.962774Z","title":"Robobrain 2.5: Depth in sight, time in mind.arXiv preprint arXiv:2601.14352, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.962774Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:08717a8e132346b820b586f895baa225bbee03263a5671e1aee9539eee70a519","observation_id":"d8e06185-f056-48cb-acf6-b044c6e7f7cd","resolution":{"observed_at":"2026-08-10T21:18:32.962774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:32.966568Z","title":"Rynnbrain: Open embodied foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.966568Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:89d57fd4a9e1b478678143952d924904559a418b9c7fa6915d8704fcb27f63ee","observation_id":"6dbc5041-6eaf-442d-9b12-5593da0039ea","resolution":{"observed_at":"2026-08-10T21:18:32.966568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.12894","last_updated":"2026-07-14T15:34:17Z","snapshot_observed_at":"2026-08-07T10:23:48.382064Z","submitted_at":"2026-07-14T15:34:17Z","title":"Hy-Embodied-VLM-1.0: Efficient Physical-World Agents","version":1},"cited_work":{"arxiv_id":"2607.12894","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.12894","snapshot_observed_at":"2026-08-10T21:18:37.603457Z","title":"Hy-Embodied-VLM-1.0: Efficient Physical-World Agents","venue":"cs.CV","work_id":"174fa6d8-b995-4b30-a16c-3b5ecdb3d850","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.978898Z"},"links":{"cited_paper":"/paper/2607.12894","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:6b27e72be9905f9df2273bcadd18abbc086807ed7c2a7021ba6e8aa553ae80af","observation_id":"162a4f34-dbd6-4735-a7cb-c240bb768c4b","resolution":{"observed_at":"2026-08-10T21:18:37.637598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-10T21:18:32.991114Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:32.991114Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:ba5e7a854f3e72275993a011fc2d6c6bf9728205ed0c7c29eb4ec5a267b8ff17","observation_id":"f8b0690c-20b7-4e47-9f58-65448b0824d2","resolution":{"observed_at":"2026-08-10T21:18:32.991114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16518","snapshot_observed_at":"2026-08-10T21:18:33.096528Z","title":"Mimo-embodied: X-embodied foundation model technical report.arXiv preprint arXiv:2511.16518, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.096528Z"},"links":{"cited_paper":"/paper/2511.16518","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:5164ca45429c7a59ab855d3a52e7a29167f330d7a33d640b8267587cfebce551","observation_id":"144621a8-978e-4ce9-85a6-2f52b3fead21","resolution":{"observed_at":"2026-08-10T21:18:33.096528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11324","snapshot_observed_at":"2026-08-10T21:18:33.155569Z","title":"Embodied-r1.5: Evolving physical intelligence via embodied foundation models.arXiv preprint arXiv:2606.11324, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.155569Z"},"links":{"cited_paper":"/paper/2606.11324","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:e5b2ab9eee38492a66f40837b2a7325d13350fb9ab9fdfec1fd25c8da023bca9","observation_id":"e1a0f103-d737-4b61-a4bb-243c9b4052bf","resolution":{"observed_at":"2026-08-10T21:18:33.155569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"cited_work":{"arxiv_id":"2606.20905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.20905","snapshot_observed_at":"2026-08-10T21:18:37.535755Z","title":"Vesta: A Generalist Embodied Reasoning Model","venue":"cs.RO","work_id":"debd2259-e710-4e43-8787-dd72fba6b99e","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.160307Z"},"links":{"cited_paper":"/paper/2606.20905","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a0caf1e808c41f031e50ca679af67c1bf4c6b19f83883952620e3df8bd7183a6","observation_id":"f05fbe3c-af8b-4870-84d2-0542e86cb1fb","resolution":{"observed_at":"2026-08-10T21:18:37.541187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"cited_work":{"arxiv_id":"2607.04426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.04426","snapshot_observed_at":"2026-08-10T21:18:37.447702Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","venue":"cs.RO","work_id":"74fc0c93-7d14-47fa-bcfe-8f9b93234ce8","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.164594Z"},"links":{"cited_paper":"/paper/2607.04426","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:3a24757e6c85d1c5d7882aeafc2f212797e838c984c19f35d1d08a1d295d8e3c","observation_id":"7f6474f4-f9c4-455f-9091-189374bf72e2","resolution":{"observed_at":"2026-08-10T21:18:37.517943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-10T21:18:33.169445Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.169445Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1785620b5cb30c0a4331664c84d1f132d2bd10811ab783a4e6fd9a15e5d764ea","observation_id":"92858ee1-ad6a-492e-9752-bfa56571f301","resolution":{"observed_at":"2026-08-10T21:18:33.169445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.249748Z","title":"Towards embodied agentic ai: Review and classification of llm-and vlm-driven robot autonomy and interaction.arXiv preprint arXiv:2508.05294, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.249748Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:6d90581abb1c47fd3093d12204358f4e7b83f5f5e28eb6e8bdb2fe51e92a7390","observation_id":"c68e0c8e-7b94-4b0c-97be-348dbf7ff35e","resolution":{"observed_at":"2026-08-10T21:18:33.249748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.279788Z","title":"Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation.Conference on Robot Learning (CoRL), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.279788Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:ffdc7650a19f5b1eb2e5c343ff32f04712e2e47a9d2a60a50ca88c288e2c0740","observation_id":"33640b2c-5173-4717-a65f-a80b96a4e93f","resolution":{"observed_at":"2026-08-10T21:18:33.279788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30406","last_updated":"2026-06-29T14:51:28Z","snapshot_observed_at":"2026-08-10T09:37:40.339025Z","submitted_at":"2026-06-29T14:51:28Z","title":"MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30406","snapshot_observed_at":"2026-08-10T21:18:33.285071Z","title":"Mopd: Multi-teacher on-policy distillation for capability integration in llm post-training.arXiv preprint arXiv:2606.30406, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.285071Z"},"links":{"cited_paper":"/paper/2606.30406","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:7eed589a0276a1d90f5f3624050b45c04bfb4ec45d576abf959f0bc00aa419d3","observation_id":"d089a960-b2e9-4632-bf07-7fa6250fedd9","resolution":{"observed_at":"2026-08-10T21:18:33.285071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.332402Z","title":"To mix or to merge: Toward multi-domain reinforcement learning for large language models.arXiv preprint arXiv:2602.12566, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.332402Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1dd83f8822102d997875e7f05cf4797ba13147572d9bd69a6fcf9ef67b218e26","observation_id":"fdf9a712-d270-4e65-9028-fbeea8192e53","resolution":{"observed_at":"2026-08-10T21:18:33.332402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01708","last_updated":"2023-10-27T01:09:31Z","snapshot_observed_at":"2026-07-06T15:37:16.278040Z","submitted_at":"2023-06-02T17:31:32Z","title":"TIES-Merging: Resolving Interference When Merging Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01708","snapshot_observed_at":"2026-08-10T21:18:33.474080Z","title":"Ties-merging: Resolving interference when merging models.arXiv preprint arXiv:2306.01708, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.474080Z"},"links":{"cited_paper":"/paper/2306.01708","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:2c68f154df0e4b808ee8cc1871280a427d2d34e4c9edd59ae797767c704df93c","observation_id":"d008e851-84b8-4f50-9a8f-ce16372ed5d0","resolution":{"observed_at":"2026-08-10T21:18:33.474080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.478764Z","title":"Qwen3.6-35B-A3B: Agentic coding power, now open to all, April 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.478764Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:2f02d7ac0ad26b8a0b89b615a0df2b8e30849cc1ef8c6efbac1525d9bc854e3c","observation_id":"91755aff-dbcc-4616-982a-abbdcaf6c7fe","resolution":{"observed_at":"2026-08-10T21:18:33.478764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.484070Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.484070Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:ac24217ea1f1e6d6c3170a0e3a4df38a851aba7b1c9fc2934d35ae62c5ce294b","observation_id":"c92e48b1-89bd-47a5-9d7d-306aaa57feb6","resolution":{"observed_at":"2026-08-10T21:18:33.484070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08747","last_updated":"2026-05-14T03:36:04Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T07:24:07Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","version":3},"cited_work":{"arxiv_id":"2605.08747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08747","snapshot_observed_at":"2026-08-10T21:18:37.147117Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","venue":"cs.AI","work_id":"3b75c89a-117d-4dbf-87e0-93bb2390f9d9","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.489323Z"},"links":{"cited_paper":"/paper/2605.08747","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:fee75660834a576e3bb75630cb732c8078fc16988363ce1c1a1e71e6f1212053","observation_id":"4b70de19-d3b2-4d1b-a254-93af939ef572","resolution":{"observed_at":"2026-08-10T21:18:37.153623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.493556Z","title":"Spatial intelligence in vision-language models: A comprehensive survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.493556Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:1689d7156827479cf47653a0f6959885e71e16edc76282517b69415bf767456b","observation_id":"49450709-1715-47a5-92fb-5aa070fb0f64","resolution":{"observed_at":"2026-08-10T21:18:33.493556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.595378Z","title":"Scaling spatial intelligence with multimodal foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.595378Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:9c273509e27e33afdcc71a2ea5ed4f2e5bb6a17c2af1b1e7affc4c58ffd35ab6","observation_id":"ac357ebb-62a5-4f01-a8bc-6f133836dfbb","resolution":{"observed_at":"2026-08-10T21:18:33.595378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.681742Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.681742Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:cd4cab094d2707d19e2b5f80a1fa8e4046aed8b5a10ab87ef4cccaf486cd51f9","observation_id":"0e8ac789-c608-44cd-9679-15df91d82e69","resolution":{"observed_at":"2026-08-10T21:18:33.681742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.686415Z","title":"Mindcube: Spatial mental modeling from limited views.arXiv preprint arXiv:2506.21458, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.686415Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:cbc7d0eb8aeb44385e6cb1c63c04bf6a42ea1e38f627eab11b886507734b9140","observation_id":"48f5a9d4-5ba1-46ac-9242-143276a5bb77","resolution":{"observed_at":"2026-08-10T21:18:33.686415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05756","last_updated":"2024-06-09T12:23:14Z","snapshot_observed_at":"2026-08-10T20:10:34.385344Z","submitted_at":"2024-06-09T12:23:14Z","title":"EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05756","snapshot_observed_at":"2026-08-10T21:18:33.691153Z","title":"Embspatial-bench: Benchmarking spatial understanding for embodied tasks with large vision-language models.arXiv preprint arXiv:2406.05756, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.691153Z"},"links":{"cited_paper":"/paper/2406.05756","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:ba4471565780d7e9fe162f21bc6c3a177846eb6226fedf09e660d3880b890bb7","observation_id":"ed101fe9-12c4-4e51-9dc3-2a8c2c769b54","resolution":{"observed_at":"2026-08-10T21:18:33.691153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-10T21:18:33.697230Z","title":"Clevrer: Collision events for video representation and reasoning.arXiv preprint arXiv:1910.01442, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.697230Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:98f90fa129e7d77db60e956eb5c69b672f012bacaaf9cc3a4f8ab393a36e4e0e","observation_id":"15588c70-3e8d-42c5-b43b-e8105dab5da8","resolution":{"observed_at":"2026-08-10T21:18:33.697230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.742687Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.742687Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:4bf2c5cd91da2449f31ed56a87c3937539acd8e6bc2bbe12e90c530c5fdcbd28","observation_id":"52943f18-0a9c-492e-a782-7b40631aba5b","resolution":{"observed_at":"2026-08-10T21:18:33.742687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.806130Z","title":"Perception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Systems, 36: 42748–42761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.806130Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:eb9fbd9eb241dc49b7dae4308844319e1a5bd45f4d1c614c293c6c7bc6b64f2b","observation_id":"7e34d14b-8972-44f2-8160-102057ebd74e","resolution":{"observed_at":"2026-08-10T21:18:33.806130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-10T21:18:33.811024Z","title":"Star: A benchmark for situated reasoning in real-world videos.arXiv preprint arXiv:2405.09711, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.811024Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:bfef8bfb5e6885ed906e618993c65b74784d473d7e2d55ff8048cf5d0c0a7952","observation_id":"21664cc2-0118-4b40-a07f-dec0158dd4de","resolution":{"observed_at":"2026-08-10T21:18:33.811024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-10T21:18:33.815978Z","title":"Llava-video: Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.815978Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:c88ffbf292eb0d8b316c29da2466203bab97d4fd1cf5e9452ccea895230cc67e","observation_id":"50b4cbe8-816b-4771-bd03-26e64f07a985","resolution":{"observed_at":"2026-08-10T21:18:33.815978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.820656Z","title":"Scaling rl to long videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.820656Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:244147e01acd7d063a546019561eb625e6182b3fae7169e204d4ca831e64ccff","observation_id":"9a915b03-7cc8-4b4c-9167-2d8e39b2fad8","resolution":{"observed_at":"2026-08-10T21:18:33.820656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.963434Z","title":"Sigurdsson, Gul Varol, Xiaolong Wang, Ali Farhadi, Ivan Laptev, and Abhinav Gupta","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.963434Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:98cb42983c98215b8ce4d72b71abe480f86f6d22dbb71053b7cca12c41859730","observation_id":"83b37b98-f0f9-4a27-b8fc-3630fc025293","resolution":{"observed_at":"2026-08-10T21:18:33.963434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:33.967117Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:33.967117Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:278d4006564d22cabee917e5e5f1774513e6971469a9ef47fe44a47708df527f","observation_id":"2092ae7e-27ce-46de-8f73-cfb520dd1326","resolution":{"observed_at":"2026-08-10T21:18:33.967117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.035589Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.035589Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:df6d5123b42a37d92c5d5e672ea55b5cedd5652e6528ecf3282a504d0c663b0a","observation_id":"e239d02d-f01f-4552-8eea-1acabe332c49","resolution":{"observed_at":"2026-08-10T21:18:34.035589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.097731Z","title":"Queryd: A video dataset with high-quality text and audio narrations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.097731Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:906a3c248711ae0610135a1a44f291713bead67dcb9e066a5682e43b7d41c8fd","observation_id":"eee2537f-48ac-4f0c-a942-aee7a7f2a935","resolution":{"observed_at":"2026-08-10T21:18:34.097731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08282","last_updated":"2025-06-01T17:32:19Z","snapshot_observed_at":"2026-08-10T20:26:47.812479Z","submitted_at":"2025-01-14T17:58:12Z","title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08282","snapshot_observed_at":"2026-08-10T21:18:34.103487Z","title":"Llava-st: A multimodal large language model for fine- grained spatial-temporal understanding.arXiv preprint arXiv:2501.08282, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.103487Z"},"links":{"cited_paper":"/paper/2501.08282","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:3cdb308c7e21288200742649544054d22074b7ff15897beeda33198be94dea1e","observation_id":"4a3cba58-04d7-4264-a127-c786019291ed","resolution":{"observed_at":"2026-08-10T21:18:34.103487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-10T21:18:34.108407Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.arXiv preprint arXiv:2406.04325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.108407Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:c67a5759a401c1fbc0535ec2179a164cabeb80a237711dbceff75a316362b4ad","observation_id":"581d0e6d-922b-493d-957d-1ec240bfe891","resolution":{"observed_at":"2026-08-10T21:18:34.108407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.141816Z","title":"Videoespresso: A large-scale chain-of-thought dataset for fine-grained video reasoning via core frame selection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.141816Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:4df88badf408f0281a04b6eb1755685c8bfc33dcccaba178aff9ae3e18467423","observation_id":"a9271ed1-8430-4575-b124-4d6abe3a7614","resolution":{"observed_at":"2026-08-10T21:18:34.141816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-10T21:18:34.146624Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning.arXiv preprint arXiv:2503.15558, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.146624Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:e0ebd4835e1fe84df21318a1997bbabbf504b3bb94918443d27f442e4a1fa20e","observation_id":"5134f1df-a2ad-4d25-a522-232b9379943d","resolution":{"observed_at":"2026-08-10T21:18:34.146624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-10T21:18:34.152165Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.152165Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:8e6be650edd5e9ad0f6bdf469762736c2487681bae77a39c600f16c4db1c0dc5","observation_id":"c77499d7-845c-43eb-8b61-5b6eb9cc16a7","resolution":{"observed_at":"2026-08-10T21:18:34.152165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-10T21:18:34.157336Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.157336Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:87ccfc714b38ada6d24727fc6f030796bc8a65962414175e6dd15a896d7e0ef3","observation_id":"a475d797-c9c9-496f-be8d-66ef66f0f527","resolution":{"observed_at":"2026-08-10T21:18:34.157336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-10T21:18:34.161372Z","title":"Agibot world colosseo: A large-scale ma- nipulation platform for scalable and intelligent embodied systems.arXiv preprint arXiv:2503.06669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.161372Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:3f393a4b4a3e37374cc65542d20f8c67ecb55d0c43995785e8d941d1a5920cf5","observation_id":"d7cec257-041a-42a8-b470-45aa21c02dc3","resolution":{"observed_at":"2026-08-10T21:18:34.161372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.165396Z","title":"Robomind 2.0: A multimodal, bimanual mobile manipulation dataset for generalizable embodied intelligence.arXiv preprint arXiv:2512.24653, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.165396Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:966f525af55b3ea24295d932e08442df708cf4db6ab0d9c10804df25a239bcf8","observation_id":"7685dd33-d366-4b69-aa92-7fa57addc942","resolution":{"observed_at":"2026-08-10T21:18:34.165396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08548","last_updated":"2026-04-05T00:57:47Z","snapshot_observed_at":"2026-07-06T21:23:14.666121Z","submitted_at":"2025-05-13T13:20:46Z","title":"From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08548","snapshot_observed_at":"2026-08-10T21:18:34.169970Z","title":"From seeing to doing: Bridging reasoning and decision for robotic manipulation.arXiv preprint arXiv:2505.08548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.169970Z"},"links":{"cited_paper":"/paper/2505.08548","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a746bc3c17106f45b163a83a2d1d67aebeb0ae20b181f50df5f51afab7a843c3","observation_id":"cfeac7ad-05ee-473a-ba1f-c75afb3ad17e","resolution":{"observed_at":"2026-08-10T21:18:34.169970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00899","last_updated":"2023-11-01T23:40:07Z","snapshot_observed_at":"2026-07-06T16:41:56.099361Z","submitted_at":"2023-11-01T23:40:07Z","title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00899","snapshot_observed_at":"2026-08-10T21:18:34.174958Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics.arXiv preprint arXiv:2311.00899, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.174958Z"},"links":{"cited_paper":"/paper/2311.00899","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0c6520a025f596b292b920cf18ad8cf1784ec3ca5aac989da1516be869586baa","observation_id":"ea4dbfdc-93a9-4a2e-a591-a17284b2caad","resolution":{"observed_at":"2026-08-10T21:18:34.174958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-09T16:41:48.099661Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-10T21:18:34.179159Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.179159Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:efb84db88da4ea30041265b3870ba6c656c0a8a29b0f84a496e94a98cccddeb9","observation_id":"2b0413ca-47bc-4422-a25a-fed4ca82253d","resolution":{"observed_at":"2026-08-10T21:18:34.179159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.269327Z","title":"Roboafford++: A generative ai-enhanced dataset for multimodal affordance learning in robotic manipulation and navigation.arXiv preprint arXiv:2511.12436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.269327Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:4e65304b221b1e9ad84aa394d185b81e8a0a60bdfe701c415f00b9c716cb5ceb","observation_id":"28ab7762-b38e-4f95-b268-f111e381a36c","resolution":{"observed_at":"2026-08-10T21:18:34.269327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.348952Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d.arXiv preprint arXiv:2503.22976, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.348952Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a5748e3d50c35dca5a06b989d021a532a7b52c05e66179fb473bed552a30098c","observation_id":"ae3bc33e-e223-41ac-bcf5-b6e32a498d83","resolution":{"observed_at":"2026-08-10T21:18:34.348952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-10T21:08:10.223339Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03043","snapshot_observed_at":"2026-08-10T21:18:34.360274Z","title":"Onethinker: All-in-one reasoning model for image and video.arXiv preprint arXiv:2512.03043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.360274Z"},"links":{"cited_paper":"/paper/2512.03043","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:cb90bfa8dfa105073b59d7d63ff63b6a96571c5d426dee1887bfebae4b235c05","observation_id":"2ac471f3-3385-4990-b3f4-0f97783f9428","resolution":{"observed_at":"2026-08-10T21:18:34.360274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-10T21:18:34.364746Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.364746Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:6f029968960b849f78adb82d70311c0daeddf297810eab84ee06ab077c46c17c","observation_id":"7c7f7a20-bed4-4527-abc6-eecd1df2401c","resolution":{"observed_at":"2026-08-10T21:18:34.364746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T21:18:34.371034Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.371034Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:ef4436dc87ffbcc6b81b0b0337ea8933514b5505461a7a60c647c94fb2724733","observation_id":"c7902afc-23c1-4703-971f-b8c6c196d616","resolution":{"observed_at":"2026-08-10T21:18:34.371034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.375958Z","title":"Thinking with visual primitives.Technical report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.375958Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:91a2bab9ec08720d184b5fcf7ca5c9da9924007ff536fe6fe6d58a27b549f293","observation_id":"da04dddd-e6f9-4246-83c3-73792ffe8c6d","resolution":{"observed_at":"2026-08-10T21:18:34.375958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13998","last_updated":"2026-04-06T03:29:44Z","snapshot_observed_at":"2026-08-03T11:31:47.613184Z","submitted_at":"2025-08-19T16:50:01Z","title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13998","snapshot_observed_at":"2026-08-10T21:18:34.422610Z","title":"Embodied-r1: Reinforced embodied reasoning for general robotic manipulation.arXiv preprint arXiv:2508.13998, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.422610Z"},"links":{"cited_paper":"/paper/2508.13998","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a7b70ecd28af62b9b0cd5647216a06012ae626d5455d635962ea9b2d7b12f219","observation_id":"16b43f36-a6d6-4399-b2f8-b37f383835c5","resolution":{"observed_at":"2026-08-10T21:18:34.422610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.467999Z","title":"Computing discrete fréchet distance","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.467999Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:d756527e6f13254ebd6dc75b64a24632c5245edb7fb7e1026accb4225500e72a","observation_id":"c0505013-0f33-46c6-9863-ed86be8aca6b","resolution":{"observed_at":"2026-08-10T21:18:34.467999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.519320Z","title":"Editing models with task arithmetic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.519320Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:79128535b23868606e0fc3268c83d67fdc6395afcf9197c4f97a94f6c6c852be","observation_id":"66a70d7f-1737-4421-a885-58eda448e264","resolution":{"observed_at":"2026-08-10T21:18:34.519320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-10T21:18:34.522970Z","title":"On-policy distillation of language models: Learning from self-generated mistakes.arXiv preprint arXiv:2306.13649, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.522970Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:b461a34d951ed6d841375f783c92281ce074ca923a2637ae7e6304685126cd07","observation_id":"b3e6ddeb-108c-43ba-8aaa-8f31591712ce","resolution":{"observed_at":"2026-08-10T21:18:34.522970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.527373Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.527373Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a8bbd2bbc814d5f00ef508e278117180a99837c2e1c10ec2eaca75a700a6d21b","observation_id":"9240bcc3-d422-4ac5-b089-cfa9a1000620","resolution":{"observed_at":"2026-08-10T21:18:34.527373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.531761Z","title":"Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models.arXiv preprint arXiv:2506.03135, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.531761Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:b4bbad221e8711d1ba0a56adf3297e99a0acd9ddc62f96bf2c184bc89dbf2ebc","observation_id":"c2b34af9-5341-4fc5-b015-cbd3944e1baa","resolution":{"observed_at":"2026-08-10T21:18:34.531761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.535818Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics.arXiv preprint arXiv:2411.16537, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.535818Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:2a1701e7b2a8130df0a336e0102eecdbfd162b9338530c544821b56858fe3fe4","observation_id":"95287c8b-3854-4d03-bffc-13c3dcd6c0b9","resolution":{"observed_at":"2026-08-10T21:18:34.535818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15280","last_updated":"2025-04-27T00:11:00Z","snapshot_observed_at":"2026-08-07T16:00:30.486496Z","submitted_at":"2025-04-21T17:59:53Z","title":"Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15280","snapshot_observed_at":"2026-08-10T21:18:34.554776Z","title":"Seeing from another perspective: Evaluating multi-view understanding in mllms.arXiv preprint arXiv:2504.15280, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.554776Z"},"links":{"cited_paper":"/paper/2504.15280","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:f6322e01da2936b148297c7e1369cfce161f449efa1d5061a01fc6fe3e3fff71","observation_id":"919792d0-af6c-420c-908a-63c095ce76b0","resolution":{"observed_at":"2026-08-10T21:18:34.554776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.579247Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.579247Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a1d1ff3d0c6355025ab566a6222224f0a910f44449f1877948e03b5bdd38cfe2","observation_id":"398ecf40-eb65-45f4-905d-5072113e88ba","resolution":{"observed_at":"2026-08-10T21:18:34.579247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.626969Z","title":"Omnia de egotempo: Benchmarking temporal understanding of multi-modal llms in egocentric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.626969Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:00fd9122b79b65a473ec20cd555f7742e8eeb55b06f2baf4941b67b5a2caa7aa","observation_id":"4fd7c8d5-a0d7-4fa5-90c2-3f5c95f42a2b","resolution":{"observed_at":"2026-08-10T21:18:34.626969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.631324Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.631324Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a7004403268aa0db15bb40a9255b670716e5767b614925979fab13d1a5515847","observation_id":"8322d1ec-0c1b-41f0-9e61-bb31e74c71f9","resolution":{"observed_at":"2026-08-10T21:18:34.631324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-10T21:18:34.635521Z","title":"Mvbench: A comprehensive multi-modal video under- standing benchmark.arXiv preprint arXiv:2311.17005, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.635521Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:655274f95764df079704f46b4abe28187834cd127180f1dd141c9e313b289af1","observation_id":"bd18a110-790c-4eee-bddb-ff6638e71253","resolution":{"observed_at":"2026-08-10T21:18:34.635521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-10T21:18:34.640153Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.arXiv preprint arXiv:2407.15754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.640153Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:4f6b875e6c80e4426093ee349b4b32c54237d03f6c873b820ad8bb8e4b0ee7dd","observation_id":"d88f57ac-3e11-4f7a-b937-26d411effd17","resolution":{"observed_at":"2026-08-10T21:18:34.640153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.644370Z","title":"Timelens: Rethinking video temporal grounding with multimodal llms.arXiv preprint arXiv:2512.14698, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.644370Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:883d0ad274076dc1beaeba39f3c2b763a0ae8bef082a0082b45bd236a41b4812","observation_id":"9b8217a6-8b99-4e16-b871-02f201571e3e","resolution":{"observed_at":"2026-08-10T21:18:34.644370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00640","last_updated":"2023-08-01T16:13:35Z","snapshot_observed_at":"2026-07-06T16:01:18.530479Z","submitted_at":"2023-08-01T16:13:35Z","title":"VL-Grasp: a 6-Dof Interactive Grasp Policy for Language-Oriented Objects in Cluttered Indoor Scenes","version":1},"cited_work":{"arxiv_id":"2308.00640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00640","snapshot_observed_at":"2026-08-10T21:18:36.222695Z","title":"VL-Grasp: a 6-Dof Interactive Grasp Policy for Language-Oriented Objects in Cluttered Indoor Scenes","venue":"cs.RO","work_id":"ab7fb05f-4e1c-41d7-8ea7-ae334fd0ac96","year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.648497Z"},"links":{"cited_paper":"/paper/2308.00640","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:dbff476132ec9f19952c751ded3b81ed4d9e64869badf7ddc99c8a6de3a97187","observation_id":"40616467-1d5b-42e1-ad5a-19fd41f99973","resolution":{"observed_at":"2026-08-10T21:18:36.252207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03342","last_updated":"2025-11-28T18:57:04Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-02T14:32:45Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03342","snapshot_observed_at":"2026-08-10T21:18:34.676111Z","title":"Gemini robotics 1.5: Pushing the frontier of generalist robots with advanced embodied reasoning, thinking, and motion transfer.arXiv preprint arXiv:2510.03342, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.676111Z"},"links":{"cited_paper":"/paper/2510.03342","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:0d763adabbc7aaad1e998168f681322039190cbfe6b8b8757a3f903a3ac0ee29","observation_id":"4f568cba-cfae-46ec-905e-d54e13e39fab","resolution":{"observed_at":"2026-08-10T21:18:34.676111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.719268Z","title":"Point-it-out: Benchmarking embodied reasoning for vision language models in multi-stage visual grounding.arXiv preprint arXiv:2509.25794, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.719268Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:8942abb740d4758727316d32926b223c5750db55c7b42fc8f7479b67d2da5d7f","observation_id":"27cbe886-8340-4e8e-af68-7b37eaf1ebf1","resolution":{"observed_at":"2026-08-10T21:18:34.719268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.744188Z","title":"Navitrace: Evaluating embodied navigation of vision- language models.arXiv preprint arXiv:2510.26909, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.744188Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:acd3d78b475c077e4b02f050ef062f0dfc7d2ec770c50d5724e6d2e7ec6bf02a","observation_id":"71d4f895-b6d9-4a10-bc89-7c27ae3ce6bb","resolution":{"observed_at":"2026-08-10T21:18:34.744188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.749228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.749228Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:2568186018b53b11a8660a31fdb220ae93bcd74a250a4598a88f95d382428a4d","observation_id":"d7558b24-56da-4a40-869e-fc62c065f7c0","resolution":{"observed_at":"2026-08-10T21:18:34.749228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-10T21:18:34.753811Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.753811Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:6bf4f7cbf820b95d5ca18e8f79a1005ec0c956d883c34a7d0a28b74df9c69fcc","observation_id":"c5273e05-751c-4c42-bcde-3cca43a00d34","resolution":{"observed_at":"2026-08-10T21:18:34.753811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.758326Z","title":"Grok-1.5 vision preview and realworldqa","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.758326Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:b4d8a661d13ac08f7bbcf6b5b8aa6cbcdf2be03998f7a3bdb91a5a97359262eb","observation_id":"ca55d428-8b33-4f4a-b722-7ec2ef0e057e","resolution":{"observed_at":"2026-08-10T21:18:34.758326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-10T21:18:34.762841Z","title":"Mmbench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.762841Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:e481884bf92a05ad78d2ff1beedeb92804a2560e3b24ded91528dd185ac28900","observation_id":"4e99aed2-a855-4603-85e5-e2604a61e274","resolution":{"observed_at":"2026-08-10T21:18:34.762841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-10T21:18:34.767697Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.767697Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:947c3af5288a9fa5bd51ac625dba59d1117d52d38db0e97ffa7f4e40e47d45e7","observation_id":"7f21dbfd-f9ab-4a8e-b851-747d9f020d6c","resolution":{"observed_at":"2026-08-10T21:18:34.767697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.773055Z","title":"MMLU-Pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.773055Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:2a108cebb803f5853dcd2dc8245a3fc91c20affc69cab3e45658cbaa1d1cf0b9","observation_id":"0d32e7c7-a8aa-43a4-967e-aa660d459f69","resolution":{"observed_at":"2026-08-10T21:18:34.773055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.777235Z","title":"Patil, Huanzhi Mao, Charlie Cheng-Jie Ji, Fanjia Yan, Vishnu Suresh, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.777235Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:c1c92104683b5312ba3c66d8bd1d293e5376189b4ab75f59d7efea5ef4de6c97","observation_id":"085afeb7-cc38-4aa6-89b7-a271d3b69cc2","resolution":{"observed_at":"2026-08-10T21:18:34.777235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-10T21:18:34.781389Z","title":"LiveCodeBench: Holistic and contamination-free evaluation of large language models for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.781389Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:cdeb23614ed81b65c0bce7b6c7698a30cce15e6a0eed0c38ac3a5065c1379392","observation_id":"4fc0a1cc-53b9-41f7-be0a-3015c08d04e7","resolution":{"observed_at":"2026-08-10T21:18:34.781389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17574","last_updated":"2026-06-16T06:22:09Z","snapshot_observed_at":"2026-08-02T05:34:30.444420Z","submitted_at":"2026-06-16T06:22:09Z","title":"DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack","version":1},"cited_work":{"arxiv_id":"2606.17574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.17574","snapshot_observed_at":"2026-08-10T21:18:35.953424Z","title":"DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack","venue":"cs.AI","work_id":"71a91e62-fe02-4d4f-8622-46ff6ab1ad80","year":2026},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.803552Z"},"links":{"cited_paper":"/paper/2606.17574","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:a07cdd8a8ab4fee460988c40c743e740df530c898ef18cc3b6c5f96a0e0949d6","observation_id":"8f25946d-13b1-45f8-bec8-487fea92ac0d","resolution":{"observed_at":"2026-08-10T21:18:35.961548Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-10T21:18:34.858442Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.858442Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:9b3897a82a011a0a5efb81a7da86b547083bfbf390ed468663e50e9cd1533034","observation_id":"75ba6374-2fd7-4256-900b-3abf96f374ab","resolution":{"observed_at":"2026-08-10T21:18:34.858442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-10T21:18:34.918689Z","title":"Ai2-thor: An interactive 3d environment for visual ai.arXiv preprint arXiv:1712.05474, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.918689Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:f66d68cf0ade8f4189fa8483e332ad658c23018a8bdf307d566708f48c63a568","observation_id":"40d43281-44b5-4d7c-9c6e-d0f7b39db8b8","resolution":{"observed_at":"2026-08-10T21:18:34.918689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.954091Z","title":"Procthor: Large-scale embodied ai using procedural generation.Advances in Neural Information Processing Systems (NeurIPS), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.954091Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:ee9cd382d69bf32dc3617398823b1f2dc652abb7b4bfbe4406da61405147f5e0","observation_id":"3a4aafdf-5e88-4e14-be9a-8312c51e3e0f","resolution":{"observed_at":"2026-08-10T21:18:34.954091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-10T21:18:34.958615Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.958615Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:371997c1d10a24ebb9bdea4ea9bb4b1a771994fae731051c9ba323eefa9ee9d9","observation_id":"245f033b-dc99-4955-b21a-bbbd6393cd3a","resolution":{"observed_at":"2026-08-10T21:18:34.958615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T21:18:34.963819Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.963819Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:04ca31981cc6ab0b61fa8ec9c79f3a046df2373e0f496e614cadebd6b84706dc","observation_id":"143c72bf-dc07-436f-8035-c98e13d32153","resolution":{"observed_at":"2026-08-10T21:18:34.963819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.969726Z","title":"bbox_2d\": [x1, y1, x2, y2],","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.969726Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:2c521c7020b45d55b5a221affb1033f4734c6da215ca48865e443adef894951a","observation_id":"20da74c3-02f5-482f-a03e-a66a0670e512","resolution":{"observed_at":"2026-08-10T21:18:34.969726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.976635Z","title":"The left hand is holding a green lighter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.976635Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:2fc2e5faecf779e0e4a3b0f4e69fda3d68bbea683f95738b7632ff0a979b8343","observation_id":"6d543b52-9bfc-4277-9c69-ab14ab36e936","resolution":{"observed_at":"2026-08-10T21:18:34.976635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.981728Z","title":"The top of the lighter is now glowing red/orange, indicating it’s hot or just used, but crucially, there is no flame coming out of it","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.981728Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:171d03780935d5cad673ca16c7f5dc00b5b329c2b6a8170fab5ac12b340e4dfd","observation_id":"8531c9ee-2c0b-4f8a-97d7-3d689f2ad37c","resolution":{"observed_at":"2026-08-10T21:18:34.981728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.985997Z","title":"Based on observations, is the lighter on or off?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.985997Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:5a571819408c04fbd90b0017858f8f6955d3ddf1fe8e81833e6a9ea81366916f","observation_id":"39cffba3-a8fb-4858-ae55-44c03298c32e","resolution":{"observed_at":"2026-08-10T21:18:34.985997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:34.990563Z","title":"* The club sandwich must be inside the packing box","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:34.990563Z"},"links":{"citing_paper":"/paper/2608.06756"},"observation_digest":"sha256:4690a4cc5fbc0089ab98179c9a5882e3e8df84c2cf69800b80982eb74438c11a","observation_id":"e5b9aa84-f903-4067-a1e5-8c134fc50d35","resolution":{"observed_at":"2026-08-10T21:18:34.990563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06756","last_updated":"2026-08-07T03:24:25Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T05:11:07.658090Z","submitted_at":"2026-08-07T03:24:25Z","title":"Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":152},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 152 outbound references and 0 inbound Pith citation observations for arXiv:2608.06756."}