{"as_of":"2026-08-15T15:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b27abff2769b7160f867866e1ad728699753b878c52d0d8d5ce263fb191f2fb3","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:43:02.678992Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.18685/citation-record","integrity":"/paper/2511.18685/integrity","json":"/paper/2511.18685/citation-record.json","paper":"/paper/2511.18685"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-03T20:42:52.881712Z","title":"Cosmos world foun- dation model platform for physical ai.arXiv preprint arXiv:2501.03575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:52.881712Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:741e95c36d4a332cacb7fa0c8a1c65f4e6478c826db20fb1fe55dd86e1565c83","observation_id":"a1cd09db-40be-48b9-9554-72809d1f5f1f","resolution":{"observed_at":"2026-08-03T20:42:52.881712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T20:42:52.945268Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:52.945268Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:b94953ba025564dd5a441bf17fb4cebb7af74a8beb164bc0fd37a2daf6927e2e","observation_id":"4d5e6394-e32e-40db-a150-9bc26ea042d4","resolution":{"observed_at":"2026-08-03T20:42:52.945268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:52.984400Z","title":"Crc Press, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:52.984400Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:505d64a517d4334646787a9362f4497e84da4b4175a99a2f14d167e12239a4d3","observation_id":"58751017-66f6-4560-9cfa-3a575b97ad4a","resolution":{"observed_at":"2026-08-03T20:42:52.984400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:53.054798Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:53.054798Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:440f8c3e511b84417a1e375ae3489ecb648ac7b40036bcf385df2e261f43938b","observation_id":"3c2eb00f-9db3-47ef-8c19-bbdbdc3445df","resolution":{"observed_at":"2026-08-03T20:42:53.054798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:53.225228Z","title":"Egothink: Evalu- ating first-person perspective thinking capability of vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:53.225228Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:a48f21e17ca5ccf0e0115090b81a1091455930636696c9c2dfa0f3fc802d87f3","observation_id":"43b2221d-ecd6-4bc7-82ea-067a575f7f2c","resolution":{"observed_at":"2026-08-03T20:42:53.225228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11858","last_updated":"2025-04-11T04:26:42Z","snapshot_observed_at":"2026-08-10T22:27:13.074345Z","submitted_at":"2025-01-21T03:22:10Z","title":"EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11858","snapshot_observed_at":"2026-08-03T20:42:53.353480Z","title":"Embodiedeval: Evaluate multimodal llms as embodied agents.arXiv preprint arXiv:2501.11858, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:53.353480Z"},"links":{"cited_paper":"/paper/2501.11858","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:bd498a34be7af90fab573d4a24621c960be28ce8086864ba75c8e400d8113ff3","observation_id":"da282c5d-c3c2-455b-b77a-f42e637e0ae8","resolution":{"observed_at":"2026-08-03T20:42:53.353480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T20:42:53.465936Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:53.465936Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:8696efb9c4aeebe92ab10c9740b63ab4d213409420f3f8bba2fc83d133ee656b","observation_id":"92282564-3815-463b-974a-84ded03b180c","resolution":{"observed_at":"2026-08-03T20:42:53.465936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10047","last_updated":"2022-12-15T23:47:39Z","snapshot_observed_at":"2026-08-14T10:34:39.390956Z","submitted_at":"2022-10-18T17:59:55Z","title":"From Play to Policy: Conditional Behavior Generation from Uncurated Robot Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10047","snapshot_observed_at":"2026-08-03T20:42:53.623875Z","title":"From play to policy: Conditional be- havior generation from uncurated robot data.arXiv preprint arXiv:2210.10047, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:53.623875Z"},"links":{"cited_paper":"/paper/2210.10047","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:029660082e15b9ed3221404fa6703d7e9926a2727d5a1380c6f6847cb098cb84","observation_id":"e623b3b8-fb29-420b-83f6-18b391fcd7b5","resolution":{"observed_at":"2026-08-03T20:42:53.623875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:53.745399Z","title":"Ecbench: Can multi-modal foundation models understand the egocentric world? a holistic embod- ied cognition benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:53.745399Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:5352aba0f1347bf827f5d4d394d9c0a95a36c5034120fe6a3f411c0937b1de5d","observation_id":"86697852-79d7-4ab2-9477-f2b9809700e1","resolution":{"observed_at":"2026-08-03T20:42:53.745399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:53.887733Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:53.887733Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:b364c1c69ad341282103611627329364e139c91a18a01899202a18547836f8b4","observation_id":"7c121a0c-fa4a-464f-94ce-1a887a206e80","resolution":{"observed_at":"2026-08-03T20:42:53.887733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:53.959268Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:53.959268Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:e705daaeae9deafa9fd13716c4c6d25e8fe5939e7eb25224911a620ccc20a7a8","observation_id":"ad1ade03-1565-4c7c-9367-b36f30a661c5","resolution":{"observed_at":"2026-08-03T20:42:53.959268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:54.060123Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.060123Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:d51a0dc6f941e7e7ebe031633d03f7b828e3899c61e1be3e06087d77b2049cbc","observation_id":"2e9773aa-d47d-4f71-9b05-84a6705cf55b","resolution":{"observed_at":"2026-08-03T20:42:54.060123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T20:42:54.122419Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.122419Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:4636452a70565539f1be439706fa385644d57a98e2a26f9f82220bb3e1000335","observation_id":"793ef3b3-7158-41d4-a389-df8a9c74f531","resolution":{"observed_at":"2026-08-03T20:42:54.122419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:54.233928Z","title":"Multimodal fusion and vision- language models: A survey for robot vision.Information Fusion, page 103652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.233928Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:1135e217dd6844f9e8700e0061728e65745d3442887126b033ffaaf069eae468","observation_id":"503a3703-c82c-4203-bf46-06beb9e69ab8","resolution":{"observed_at":"2026-08-03T20:42:54.233928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:54.308177Z","title":"Motionbench: Benchmarking and improving fine-grained video motion understanding for vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.308177Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:996d5c7d23b9effcbd599add548aced7dbc99fdb5f9f849ab29d9f87be92b7c5","observation_id":"e945409e-f80d-4820-9000-8e37eb950917","resolution":{"observed_at":"2026-08-03T20:42:54.308177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T20:42:54.375087Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.375087Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:d690043e41f0e0a5d575e20d6df07d4ae49c3d1f5709233cd981924583fa4810","observation_id":"58403288-0fa4-4c50-8ba5-08964f4fd030","resolution":{"observed_at":"2026-08-03T20:42:54.375087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:54.441911Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.441911Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:44366b0cc9c2023d4a25f2f85d4c57194e76b596a1f417df30a1e3fc9f375b9f","observation_id":"64143267-46e2-411a-86ff-38945e29b974","resolution":{"observed_at":"2026-08-03T20:42:54.441911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:54.496889Z","title":"Egotaskqa: Understanding human tasks in egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.496889Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:3b45bfcfcbd91ad40eea337a9bca294e6054e117afcb03b3d3348d27f0da43fa","observation_id":"3e111a8e-bc3c-4cf5-91af-fcc3a7ff77c0","resolution":{"observed_at":"2026-08-03T20:42:54.496889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06798","last_updated":"2024-10-15T05:15:38Z","snapshot_observed_at":"2026-08-14T17:35:20.176652Z","submitted_at":"2024-02-09T21:48:19Z","title":"Reasoning Grasping via Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06798","snapshot_observed_at":"2026-08-03T20:42:54.576971Z","title":"Rea- soning grasping via multimodal large language model.arXiv preprint arXiv:2402.06798, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.576971Z"},"links":{"cited_paper":"/paper/2402.06798","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:54358bd9da9ac09730b87291c930fef7572bae57bdbc53bd2c2f2eb0b85c513b","observation_id":"5923b7c1-8962-479a-bab7-ce755340f02b","resolution":{"observed_at":"2026-08-03T20:42:54.576971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:54.650372Z","title":"Sage publications, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.650372Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:352a8653c4b6da92a666d53d54ba41fb6205281f9b74ddb6d2d9b6e652a5557c","observation_id":"7a7d57e5-2fb2-40bf-95ee-a87400d4356f","resolution":{"observed_at":"2026-08-03T20:42:54.650372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:54.715705Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.715705Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:f8f18e9575f44f58284a83857ee7963fcf6bc219fc488bb4c3cf529e80daab9d","observation_id":"cd634841-892a-4841-888e-536e13e0e559","resolution":{"observed_at":"2026-08-03T20:42:54.715705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-08-14T13:06:41.783915Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07753","snapshot_observed_at":"2026-08-03T20:42:54.778196Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.778196Z"},"links":{"cited_paper":"/paper/2209.07753","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:d78f2027f77b51f8c3c710a47cadb0a06124765f0a12265803be7dd996690045","observation_id":"fb0fba56-4831-4953-9efd-b2655762d1c0","resolution":{"observed_at":"2026-08-03T20:42:54.778196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:54.916568Z","title":"Fineaction: A fine-grained video dataset for temporal action localization.IEEE transactions on image processing, 31: 6937–6950, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:54.916568Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:5d17acdb21be0d2d531f88f9b3bc2fdaa39b787b6895fecd8388322daed1e631","observation_id":"436596d5-da34-4bbf-a68b-8b48d46399e3","resolution":{"observed_at":"2026-08-03T20:42:54.916568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:55.029637Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding.Advances in Neural In- formation Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.029637Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:edeaca4853f5fd940a78fac32895ae2e5691b862bfd801d78fbce1db14f07c83","observation_id":"90e47fc4-a5a6-4b98-a74d-894db42073d9","resolution":{"observed_at":"2026-08-03T20:42:55.029637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:55.115197Z","title":"Harvard University Press, 1988","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.115197Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:82ae1fe3075ae5f3dc2eba081219d6c0da57adce74033de2fa02a3355e416deb","observation_id":"c7cdc420-e238-49b8-881c-78f8df507e4b","resolution":{"observed_at":"2026-08-03T20:42:55.115197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:55.185571Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought.Advances in Neural Information Processing Systems, 36:25081–25094, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.185571Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:23cdb2d81767baabfc9b020dcebfd5bb1eff7a4b6866371327567758ca000450","observation_id":"26a5506c-ec3b-4052-ba35-f633337c15fd","resolution":{"observed_at":"2026-08-03T20:42:55.185571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:55.259175Z","title":"Gpt-5 system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.259175Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:6f5bdb600b1681d39919c4032978a6fe2fd6490c6f56be7a10fbbeba36dda40f","observation_id":"ade0e9a3-e64b-4e27-b899-c49089022959","resolution":{"observed_at":"2026-08-03T20:42:55.259175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13073","snapshot_observed_at":"2026-08-03T20:42:55.366868Z","title":"Large vlm-based vision- language-action models for robotic manipulation: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.366868Z"},"links":{"cited_paper":"/paper/2508.13073","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:b936eb3ae6954c7844c5ff542a98eef42c39bea1e7c17484c8e0a0da9fc5e324","observation_id":"437eac7c-1bea-42dc-8cce-08dae92534a1","resolution":{"observed_at":"2026-08-03T20:42:55.366868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:55.476704Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.476704Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:ea77f818166cd8d27b63fbe37c3974e6d39c96053820d3d63d7ca7d608681230","observation_id":"c792aee3-ddcf-4171-8b69-2efd9e10358f","resolution":{"observed_at":"2026-08-03T20:42:55.476704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:55.563140Z","title":"Hollywood in homes: Crowdsourcing data collection for activity under- standing","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.563140Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:53addede68fb899c91ab476d5a0355eeb205c752ad5bd0ddc96ec8e422c4e85f","observation_id":"6fce1b16-b8f2-47b6-b09e-dd4b60aa1bec","resolution":{"observed_at":"2026-08-03T20:42:55.563140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11302","last_updated":"2022-09-22T20:29:49Z","snapshot_observed_at":"2026-08-14T05:51:18.301662Z","submitted_at":"2022-09-22T20:29:49Z","title":"ProgPrompt: Generating Situated Robot Task Plans using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11302","snapshot_observed_at":"2026-08-03T20:42:55.667893Z","title":"Progprompt: Generating situated robot task plans using large language models.arXiv preprint arXiv:2209.11302, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.667893Z"},"links":{"cited_paper":"/paper/2209.11302","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:824b0de06e838b2be9f39359481b07933a5603c64150edac940dd78057c4d5e8","observation_id":"e1847be0-0305-406f-bd91-965e0246e153","resolution":{"observed_at":"2026-08-03T20:42:55.667893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:55.759273Z","title":"Llm-planner: Few-shot grounded planning for embodied agents with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.759273Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:1217fc418eee72afada9bebc34f2f9c44959927965a2084bb2d5411138788849","observation_id":"9993e5f6-b12e-4671-bfdb-eff034466faa","resolution":{"observed_at":"2026-08-03T20:42:55.759273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:55.852606Z","title":"Behav- ior: Benchmark for everyday household activities in virtual, interactive, and ecological environments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:55.852606Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:f274ae4196fed3d895ef4657328839341736ce6340adee12e1ea7f098de5a9e9","observation_id":"4b78d67f-443b-483b-8bc3-1ceb621a6249","resolution":{"observed_at":"2026-08-03T20:42:55.852606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:56.008775Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.008775Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:3b63cb945ba63647a828721d36a9bc864a6a7be0e1ec676042a358256b1a1c67","observation_id":"e6d2c317-71db-4a4c-95e1-e60c5fd4720e","resolution":{"observed_at":"2026-08-03T20:42:56.008775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-03T20:42:56.199932Z","title":"Robobrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.199932Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:9a65265ec0c61ce893af19cf69486c434a09f494a560bff42511a3a2539cff7c","observation_id":"d3cd3b4f-b244-4860-961c-2e6fc1eb8c58","resolution":{"observed_at":"2026-08-03T20:42:56.199932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-03T20:42:56.331991Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.331991Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:b791c85d2d97fbbc5ca7f227341be45e200f431e65ac73fa14da2d5e2f9f1d1c","observation_id":"e8e5912e-bbea-468c-b10b-75689a51a1ae","resolution":{"observed_at":"2026-08-03T20:42:56.331991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14935","last_updated":"2025-03-19T06:42:32Z","snapshot_observed_at":"2026-08-15T02:43:47.557000Z","submitted_at":"2025-03-19T06:42:32Z","title":"FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14935","snapshot_observed_at":"2026-08-03T20:42:56.435217Z","title":"Favor-bench: A comprehensive benchmark for fine-grained video motion understanding.arXiv preprint arXiv:2503.14935, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.435217Z"},"links":{"cited_paper":"/paper/2503.14935","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:6c18c2fbf043a0cdd72610df0d7ee9a09556b7f8c04e049a479056e1d1ec2f7f","observation_id":"4a16d858-a090-4ad3-8b14-09060d216f9b","resolution":{"observed_at":"2026-08-03T20:42:56.435217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12422","last_updated":"2023-10-13T05:44:37Z","snapshot_observed_at":"2026-08-15T13:49:13.527807Z","submitted_at":"2023-02-24T02:54:15Z","title":"MimicPlay: Long-Horizon Imitation Learning by Watching Human Play","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12422","snapshot_observed_at":"2026-08-03T20:42:56.557302Z","title":"Mim- icplay: Long-horizon imitation learning by watching human play.arXiv preprint arXiv:2302.12422, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.557302Z"},"links":{"cited_paper":"/paper/2302.12422","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:2ebf058361827e06f69d19edc3288fa79dbc42cc87047e4121ab5fe7ed2cd3d1","observation_id":"42a05bb8-1332-4f90-98a1-769241d1563f","resolution":{"observed_at":"2026-08-03T20:42:56.557302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T20:42:56.673348Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.673348Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:2233fa75748a5e85f3b1ee2a0bddde30fdfa893086690883e018a4830923bb00","observation_id":"b3ec28d1-c2b0-4b79-addf-f5bfb09538cd","resolution":{"observed_at":"2026-08-03T20:42:56.673348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:56.817033Z","title":"Thinking in space: How mul- timodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.817033Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:e80ac06b8852a1073522dc96d0d128f92c92d496c7524948d96bc431aa87828c","observation_id":"c260459f-63e5-445a-9e86-a4c9aa671f15","resolution":{"observed_at":"2026-08-03T20:42:56.817033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-08-15T10:11:58.661690Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-03T20:42:56.921728Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.921728Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:0e974a61fc23bf099a779dcee9704a7de7322c6cda9421a2ed8f6e1b78e8cca0","observation_id":"e46753b1-8384-4fb1-8788-a17ba1a5348e","resolution":{"observed_at":"2026-08-03T20:42:56.921728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:57.072006Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:57.072006Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:eac933c64163009a574449d2d13faa98a912671cd230fc96e43b974906191947","observation_id":"c9aea928-32da-4875-9810-ee7d88fd72a1","resolution":{"observed_at":"2026-08-03T20:42:57.072006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-03T20:42:57.209755Z","title":"Videollama 3: Frontier multi- modal foundation models for image and video understand- ing.arXiv preprint arXiv:2501.13106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:57.209755Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:e7b645affc39851cfb1e5d5dcef32f89a28c107c24dedc549f473338c1a7086e","observation_id":"093c2e2e-4f54-4dfc-b41a-395fcfe91e10","resolution":{"observed_at":"2026-08-03T20:42:57.209755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:57.330629Z","title":"Task-oriented sequential grounding in 3d scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:57.330629Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:3dd1491364b3da127d8f2fec8d1112d98d30c2c8148aed75a00b224c306bd043","observation_id":"359baa0c-d71f-4295-b622-f413f81d75b5","resolution":{"observed_at":"2026-08-03T20:42:57.330629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:57.421387Z","title":"Mlvu: A comprehensive benchmark for multi- task long video understanding.arXiv e-prints, pages arXiv– 2406, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:57.421387Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:cb02ae8aa654a7d882dd4563807c41111542a63dc36e7384929216ef849278db","observation_id":"9b6e872e-d911-47c3-bc04-e891183f6169","resolution":{"observed_at":"2026-08-03T20:42:57.421387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T20:42:57.542070Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:57.542070Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:020b213a9dbe874263dd3e8c78eb1c7a7f305052fe208eb8eab53d28864257f0","observation_id":"5e71763b-ad42-4252-9bb7-dfc50c951488","resolution":{"observed_at":"2026-08-03T20:42:57.542070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:58.072233Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:58.072233Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:76a7a39bf5f09af538222e6a0356a2b6dfd48887da846426811eae8972772e12","observation_id":"0e7e86c9-a392-4473-ab9f-21edd37a4fff","resolution":{"observed_at":"2026-08-03T20:42:58.072233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:58.492502Z","title":"• The distractors must be physically plausible and context-appropriate for the video scene","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:58.492502Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:d514466931dcf5d6b61b5cfd250d541e1d81c04b70341c68163e7b099932c596","observation_id":"b3732bb0-7ede-4289-a4e2-fc075d0a1694","resolution":{"observed_at":"2026-08-03T20:42:58.492502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:58.561055Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:58.561055Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:b7b18b3af9bc008bc81d30e718f7eba7222842ad09b7412ccbe3c7c903fb2b1f","observation_id":"64e563a0-e724-4174-97b7-3cb0f8f682f8","resolution":{"observed_at":"2026-08-03T20:42:58.561055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:59.051147Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:59.051147Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:90f1ffb73879a9ca49598f534ec32997850c28372fe0da066da366f7a8adbe23","observation_id":"be708270-9412-4aab-8fc9-9feb6c5412ca","resolution":{"observed_at":"2026-08-03T20:42:59.051147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:59.624964Z","title":"• Distractors can involve: order swap, misplaced insertion/omission or wrong simultaneity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:59.624964Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:d644277f90c9d095dda91f2d1eb0e0b7f24b2c5429372cf490874bb682ac8be0","observation_id":"b023fe30-d63c-4a90-a7f3-789aeb550e93","resolution":{"observed_at":"2026-08-03T20:42:59.624964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:59.737077Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:59.737077Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:2f69bb250af55073855990bf4bb457ce50a023cfbaa048895dfdcd83aec13913","observation_id":"a4491209-075c-44d8-93b3-8e7401c10a80","resolution":{"observed_at":"2026-08-03T20:42:59.737077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:42:59.855867Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:59.855867Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:621ec4020f6939baf2d343a5425e01003572ee6d994377d48d2f8b82452071e7","observation_id":"e4dfd59e-41ea-4e2e-b571-d7b7a0c587d4","resolution":{"observed_at":"2026-08-03T20:42:59.855867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:00.236349Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:00.236349Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:eb2fdb9e5ed05c1d76d038d085d40a9446120407e3d4c2f5aa958e74a5752106","observation_id":"579542ba-b64b-4b1f-8834-cd00da2f6fb8","resolution":{"observed_at":"2026-08-03T20:43:00.236349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:00.572585Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:00.572585Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:b2175261cdc16fe5c3e99d01e0739b1b5904107b67d4c70baff77f48c6139753","observation_id":"eb55a057-a758-4934-bb27-e758a857ba1c","resolution":{"observed_at":"2026-08-03T20:43:00.572585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:00.657999Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:00.657999Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:1c13ca56c3739f9354b9d3c9ea16277037b7088d2930fac5c29a998c823345c3","observation_id":"eb4fb8d9-9939-40d6-84fc-f3d193a20cc4","resolution":{"observed_at":"2026-08-03T20:43:00.657999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:00.771327Z","title":"Prompt template for Intentional Understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:00.771327Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:6352478e13d25bdc56a1d37ddf1e582e0c8b1497b060066c52740310c9b4f317","observation_id":"0da865e3-f7dc-40d2-b5d5-c43cb7d032a5","resolution":{"observed_at":"2026-08-03T20:43:00.771327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:00.838910Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:00.838910Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:402d0e946b813e47aa57ff1c66de123f28388dcb3e573c056a934ae89710d224","observation_id":"8884b286-9435-419e-ac05-6dbed54e9ecc","resolution":{"observed_at":"2026-08-03T20:43:00.838910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:00.911346Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:00.911346Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:a019884377bda71a4123c6ad822ffc446d6bd9e4a1d21fc2bed189b87435424c","observation_id":"7bd61abc-11e3-4aad-9b02-1122fdcf521c","resolution":{"observed_at":"2026-08-03T20:43:00.911346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:00.995050Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:00.995050Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:3e56111a255c35edf94e8f38901199a0b9aeba896e1cacfa31d77a04739008bc","observation_id":"224b48b5-0b97-45c1-964e-4d340c8ffe66","resolution":{"observed_at":"2026-08-03T20:43:00.995050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:01.050362Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:01.050362Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:969f88d6e0ae6b9856b3df24ced30a955a5d5926d7fd8ea4b1b42e27522dabe7","observation_id":"3e88d8d9-d22c-4e7f-adff-09f7edccef60","resolution":{"observed_at":"2026-08-03T20:43:01.050362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:01.180436Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:01.180436Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:1f3a55cfa89dbfbfbd5a35c1957c1c3ea7a3574b8b30b4a09e413f06be5e186b","observation_id":"b9df746d-e3d1-4e01-9090-1ac8d0150890","resolution":{"observed_at":"2026-08-03T20:43:01.180436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:01.353279Z","title":"caption”, “annotation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:01.353279Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:c6b081bd5e2cc225e74617d1ade19d5ba44bf0efd3535ba447bf758b7396843e","observation_id":"77d486f0-c9d1-4fc1-aa87-af2576010922","resolution":{"observed_at":"2026-08-03T20:43:01.353279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:01.532003Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:01.532003Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:06f34b7dbef9e6f3c2ad4a6d0573d40477702b9d186bf748f7457f68189f2ad7","observation_id":"77a6e97b-8e55-4bc5-9db3-4e23c9ac48b0","resolution":{"observed_at":"2026-08-03T20:43:01.532003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:01.654088Z","title":"[Question Types]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:01.654088Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:38c93f9a870030f948293b0b51d064fdb368e7a6acf77f3620adba065cbdcfa5","observation_id":"a012a6e8-6c3f-408f-9e29-afee68b19c40","resolution":{"observed_at":"2026-08-03T20:43:01.654088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:01.719764Z","title":"• Identify whether progress is smooth, temporarily obstructed, failed, completed, or interrupted","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:01.719764Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:5e0d4579c87b77a1f059f7f9661ba7b3a93f5d805e0829bc6e147def1f754f68","observation_id":"1c27de4f-e5dd-4f68-a24f-e0375fc678c4","resolution":{"observed_at":"2026-08-03T20:43:01.719764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:01.785201Z","title":"• Questions should analyze how well the chosen method fits the physical constraints, and how effectively it balances coordination and efficiency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:01.785201Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:3f39c909562dbf5b6c0c5e8c5dd573f88eea838e485e3a48c5593349b9ea4f18","observation_id":"9f835528-65cb-481c-ba2a-a657aa3a57e3","resolution":{"observed_at":"2026-08-03T20:43:01.785201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:01.844940Z","title":"VideoCaption","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:01.844940Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:f8573031a6456b696cf95275ed4a6e13af401d3c440782ade1291145541f96bb","observation_id":"52915216-600c-41b4-b385-2c3eb4debd2e","resolution":{"observed_at":"2026-08-03T20:43:01.844940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:01.937042Z","title":"Check whether the answer points out the error in the question and explains the correct way of execution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:01.937042Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:894e9806df891981b5eb5f286f517853916e8ad6a6516c070392c22f63042cef","observation_id":"79496d9e-4840-4f0b-b94c-b95f13abe1c4","resolution":{"observed_at":"2026-08-03T20:43:01.937042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:02.038065Z","title":"Check whether the answer identifies the error and provides the correct sequence and outcome","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:02.038065Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:775b6cbca3388d44ef9816c3506a05bfb8666bc0cff77132a27001594367d3a8","observation_id":"3181b811-220d-40bd-a61f-8f0cc3d2f0cb","resolution":{"observed_at":"2026-08-03T20:43:02.038065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:02.134557Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:02.134557Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:3000ed91b5827adf16d0f2505577968488a5f0a6d25c58c46069c607f69f5d33","observation_id":"3105817e-f281-4e56-9f9c-64f1672d5447","resolution":{"observed_at":"2026-08-03T20:43:02.134557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:02.173962Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:02.173962Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:b079b47f15ff80011680c3742231e99560e8f9831de69b8fe0c58b08af51df40","observation_id":"6f3e24c0-3b4b-4a28-8715-6ac1be9a7b64","resolution":{"observed_at":"2026-08-03T20:43:02.173962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:02.327754Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:02.327754Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:426157bc090b63c597acd1dac6d0d6351a3f9829e473f70c0f110f9efd1758ee","observation_id":"1300b0be-db1f-4fda-b484-7d1631d8789f","resolution":{"observed_at":"2026-08-03T20:43:02.327754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:02.409788Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:02.409788Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:9e46717cc649ca661d908e0c77333f28446a796821c22a5b6211665e3da1bad1","observation_id":"ac8715a7-2609-4a07-a00e-fc932366c821","resolution":{"observed_at":"2026-08-03T20:43:02.409788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:02.489175Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:02.489175Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:682f6125e2affe066f985176315566503297953b48685675ce98aab085e372c4","observation_id":"40affa28-acda-40e3-878e-d3d2e0912f6f","resolution":{"observed_at":"2026-08-03T20:43:02.489175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:43:02.678992Z","title":"The question describes this incorrectly because X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T20:43:02.678992Z"},"links":{"citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:58a06c6b83f74b818f8c725ede4975ebba4386b0231750d57d813a57bd1d4e02","observation_id":"cda20c67-ea59-436c-a00f-8d4832ff325e","resolution":{"observed_at":"2026-08-03T20:43:02.678992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T11:19:24.415511Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2511.18685."}