{"as_of":"2026-08-14T14:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ad5c33d0f0444d30eec497fb50091f5504371c05aec9d2bd605b042ab96b4c9","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:52:53.391666Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:50:27.195699Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T11:18:13.651125Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18242","snapshot_observed_at":"2026-08-04T05:50:27.195699Z","title":"arXiv preprint arXiv:2511.18242 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12147","last_updated":"2026-08-03T09:43:55Z","snapshot_observed_at":"2026-08-08T20:08:07.326425Z","submitted_at":"2026-03-12T16:46:01Z","title":"EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T05:50:27.195699Z"},"links":{"cited_paper":"/paper/2511.18242","citing_paper":"/paper/2603.12147"},"observation_digest":"sha256:950c8cec713b8fbaa9eb3603a6a1b24638f417bca565803e78b32229f972d41c","observation_id":"bc9ff278-d190-4f99-9b94-174c6c0ee4d6","resolution":{"observed_at":"2026-08-04T05:50:27.195699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18242","snapshot_observed_at":"2026-07-14T21:03:25.012299Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14661","last_updated":"2026-08-10T17:32:28Z","snapshot_observed_at":"2026-08-13T23:48:47.469225Z","submitted_at":"2026-03-15T23:34:49Z","title":"AtlasRAN: Timing-Aware Evaluation of Open-source 5G Platforms for Integrated Wireless Testbeds","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T21:03:25.012299Z"},"links":{"cited_paper":"/paper/2511.18242","citing_paper":"/paper/2603.14661"},"observation_digest":"sha256:1c1f8d5ea4462a268c5c83df2ae3aebde368eb0204dfedefaa07c2783ee17f42","observation_id":"bd543f13-b0ca-42e6-9c8a-99855c4d417b","resolution":{"observed_at":"2026-07-14T21:03:25.012299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"cited_work":{"arxiv_id":"2511.18242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.18242","snapshot_observed_at":"2026-07-01T02:16:55.895474Z","title":"EgoVITA: Learning to plan and verify for egocentric video reasoning","venue":null,"work_id":"f436fd5f-74c2-42bb-906e-7edabbba007f","year":2025},"citing_paper":{"arxiv_id":"2605.18734","last_updated":"2026-07-08T07:29:12Z","snapshot_observed_at":"2026-07-12T16:32:44.087566Z","submitted_at":"2026-05-18T17:54:55Z","title":"EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T11:18:05.563078Z"},"links":{"cited_paper":"/paper/2511.18242","citing_paper":"/paper/2605.18734"},"observation_digest":"sha256:69eecd68060d4f2132f83e736d53bc8457ee4df01f788a9dc659a513becef4bc","observation_id":"7d836a17-f80d-4826-891a-20998ff29da9","resolution":{"observed_at":"2026-07-01T02:16:55.895474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18242","snapshot_observed_at":"2026-08-01T06:17:33.377659Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21944","last_updated":"2026-07-24T03:42:44Z","snapshot_observed_at":"2026-08-01T06:17:28.914488Z","submitted_at":"2026-07-24T03:42:44Z","title":"VisionPulse: A Virtual Reality System Enabling Accessible Discovery and Navigation for Blind and Low Vision Users","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T06:17:33.377659Z"},"links":{"cited_paper":"/paper/2511.18242","citing_paper":"/paper/2607.21944"},"observation_digest":"sha256:d6461329bab4857d6db6d6702c6fa1078376701c823380a60bc2199c033714bc","observation_id":"9aab3d8e-f97b-4296-b64b-a05dede07805","resolution":{"observed_at":"2026-08-01T06:17:33.377659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.18242/citation-record","integrity":"/paper/2511.18242/integrity","json":"/paper/2511.18242/citation-record.json","paper":"/paper/2511.18242"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T20:52:47.433429Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:47.433429Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:fcbf1822ca12f87fc53e6a68962f772a689662bd1894baf214c24b26a3d8edc5","observation_id":"a316127b-0272-4d18-b62d-9fcfa4967d81","resolution":{"observed_at":"2026-08-03T20:52:47.433429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:47.499513Z","title":"My view is the best view: Procedure learning from egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:47.499513Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:8062b8304272d3c1cfb659530059a7b35a68bbeeba94bfdfc3e5120c6d17f166","observation_id":"02503935-df9f-4e10-9fa5-8f02ecf73b46","resolution":{"observed_at":"2026-08-03T20:52:47.499513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:47.595016Z","title":"Wear: An outdoor sports dataset for wear- able and egocentric activity recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:47.595016Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:4e5ad1d5e52ef2a039af7e8c1a0cc171e8eedb687490344c472d96af5ef0dec4","observation_id":"2cbe5a61-a43d-4e5d-a458-8f21f7e5e1e5","resolution":{"observed_at":"2026-08-03T20:52:47.595016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-08-13T05:05:27.544105Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-03T20:52:47.715368Z","title":"Egoplan- bench: Benchmarking multimodal large language models for human-level planning.arXiv preprint arXiv:2312.06722,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:47.715368Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:90dfdced9db6e949859718b4fe6ed1f9eb0e86a2d03bfcba675d68b05c9ff38c","observation_id":"65a13eeb-d908-48e3-81b1-5e80969c75f0","resolution":{"observed_at":"2026-08-03T20:52:47.715368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:47.929876Z","title":"Egothink: Evaluating first- person perspective thinking capability of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:47.929876Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:86bf42f2c157611089d86cf511a6ddcfd6507a9ae45f3e3cc2e86e4607fffb4f","observation_id":"22faff4c-633e-4515-ad09-d827bc65d746","resolution":{"observed_at":"2026-08-03T20:52:47.929876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:48.057452Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:48.057452Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:78e4683e370428e7c9299259ca12c60477c75bff17110cde5718527485adc4e1","observation_id":"4af97698-504c-4b6e-a89f-a372829e9521","resolution":{"observed_at":"2026-08-03T20:52:48.057452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:48.215290Z","title":"Spatial reasoning with vision- language models in ego-centric multi-view scenes.arXiv preprint arXiv:2509.06266, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:48.215290Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:b17309f663104c043f3c4a9ad258c7f0abdee1f7fab64204447d1c80afac59b0","observation_id":"f109dfc5-d405-49aa-a65e-17742a4499d4","resolution":{"observed_at":"2026-08-03T20:52:48.215290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T20:52:48.388316Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:48.388316Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:a4278d704f792220635839c84a44420e397bfe1b30f2c158920433e22fcf5df1","observation_id":"ede160d2-e1ff-4ae3-b5fa-5e88d626d7e4","resolution":{"observed_at":"2026-08-03T20:52:48.388316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:48.482207Z","title":"Egoexobench: A benchmark for first- and third-person view video understanding in mllms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:48.482207Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:77d74066230b45da52b74015482a286e474d5b39356176cc2a148df458abfa97","observation_id":"56246759-7556-49b0-ac9f-e466fe584a89","resolution":{"observed_at":"2026-08-03T20:52:48.482207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:48.615408Z","title":"Sound bridge: Associating ego- centric and exocentric videos via audio cues","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:48.615408Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:3b34978c51d1999066a73a8f85afc67101623ec00714237696f6dd9028a9a0c3","observation_id":"4f78bd98-ccfd-4ef3-a17a-8da734e48fc1","resolution":{"observed_at":"2026-08-03T20:52:48.615408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T20:52:48.715659Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:48.715659Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:7bda13ffd66f92c641d1020e1294c12996182362256662e43a77209627b86477","observation_id":"230b0fac-6c4a-4d9f-97fc-10f075b5b16f","resolution":{"observed_at":"2026-08-03T20:52:48.715659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:48.833152Z","title":"Is ‘right’right? enhancing object orientation understanding in multimodal large language models through egocentric instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:48.833152Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:89fbf9e68af38dbf17d5830e23bccc3575b4accb8e2d52520a22e4f4c5d9dac6","observation_id":"84e12001-e894-4fc1-b770-80a685b7f5fd","resolution":{"observed_at":"2026-08-03T20:52:48.833152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-14T06:35:00.787798Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26113","snapshot_observed_at":"2026-08-03T20:52:48.921328Z","title":"Egoexo-con: Exploring view- invariant video temporal understanding.arXiv preprint arXiv:2510.26113, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:48.921328Z"},"links":{"cited_paper":"/paper/2510.26113","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:390cbfe219a7dbae13d4ec72e44a8bc1d9fc0d7bc3c2e2db0f42fe3d65e6b8d1","observation_id":"886e0750-ebdb-4523-9acd-ecf55f158a3e","resolution":{"observed_at":"2026-08-03T20:52:48.921328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12844","last_updated":"2026-04-30T06:09:00Z","snapshot_observed_at":"2026-08-08T09:47:04.204560Z","submitted_at":"2025-03-17T05:43:40Z","title":"GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12844","snapshot_observed_at":"2026-08-03T20:52:49.105373Z","title":"Guidedog: A real-world egocentric multimodal dataset for blind and low-vision accessibility-aware guidance.arXiv preprint arXiv:2503.12844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:49.105373Z"},"links":{"cited_paper":"/paper/2503.12844","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:4fb2ec44cdb5453ad1177bb82435c3166e18e00eec1ef50ff636d3d4abf3b7e3","observation_id":"6bf2cee1-3ee3-4de2-a84a-f68d146443e8","resolution":{"observed_at":"2026-08-03T20:52:49.105373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:49.208449Z","title":"Videosavi: Self-aligned video language models without human supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:49.208449Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:2d645feb4932fc9cccaf467d8d0f4bf73971806fcae0f3c5686ba3a16c04a906","observation_id":"fe1a15e0-392f-4785-8544-cb5b5d4596ee","resolution":{"observed_at":"2026-08-03T20:52:49.208449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:49.256253Z","title":"Avatar: Reinforcement learning to see, hear, and reason over video.arXiv preprint arXiv:2508.03100, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:49.256253Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:975ce2ae5a83204f512985b406b54fa7c1d76153d5ef102614f6ba356f3424bb","observation_id":"e7e5ca43-8217-4bcd-9dbc-a76df5182e54","resolution":{"observed_at":"2026-08-03T20:52:49.256253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:49.334742Z","title":"Videopasta: 7k prefer- ence pairs that matter for video-llm alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:49.334742Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:32f7cbefce275c4ac4fbe5d88dc8d77a3a7e85cb74f2acd34f74c69def68fec4","observation_id":"95755827-d45b-4120-b870-99e37499c616","resolution":{"observed_at":"2026-08-03T20:52:49.334742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:49.436803Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:49.436803Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:4948544555f25fbd99cdf78fa5a07a63dfd3c2bdf653fe918bf376ce2d98b3bf","observation_id":"497d3202-648d-4ad7-bc68-716372af3913","resolution":{"observed_at":"2026-08-03T20:52:49.436803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22152","last_updated":"2025-03-28T05:10:59Z","snapshot_observed_at":"2026-08-07T16:31:01.637325Z","submitted_at":"2025-03-28T05:10:59Z","title":"EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22152","snapshot_observed_at":"2026-08-03T20:52:49.541007Z","title":"Egotom: Benchmarking theory of mind reasoning from egocentric videos.arXiv preprint arXiv:2503.22152, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:49.541007Z"},"links":{"cited_paper":"/paper/2503.22152","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:194f1821f9ebb3e0dfc43af387cb01fdfc0b05416beb26bf9b3e4af26a61e398","observation_id":"b90c7f6f-cf9f-4e9a-8814-10e5ecf56abb","resolution":{"observed_at":"2026-08-03T20:52:49.541007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:49.651217Z","title":"Fine-grained spatiotemporal grounding on egocen- tric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:49.651217Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:9ac56f4cf970619dc15d68161f3fa9d0e9b1ec24500d39c827cb5363c2c94244","observation_id":"12945dc5-8410-4d36-a379-b30cb8414be9","resolution":{"observed_at":"2026-08-03T20:52:49.651217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:49.794004Z","title":"Fine-grained spatiotemporal grounding on egocen- tric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:49.794004Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:8208bca152abb9e4d89f0a428e3c63b88cbab48f1fdd4b8029a5ada7764d23e9","observation_id":"00680818-7a73-40ee-a3a0-05136e35431b","resolution":{"observed_at":"2026-08-03T20:52:49.794004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:49.924795Z","title":"Dora: Weight-decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:49.924795Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:6a7b34c825974ace0801cf65f096343d73d1860f99f2a31491ccac31d96c88ee","observation_id":"df53e899-e0de-4161-bfbc-1335856acc83","resolution":{"observed_at":"2026-08-03T20:52:49.924795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:50.004415Z","title":"Viewpoint rosetta stone: Unlocking unpaired ego-exo videos for view-invariant representation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.004415Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:490f233641d2363b71c42c710aa899e294b8ec49adad51bb81cc4da19244b52b","observation_id":"e39889bc-509d-4938-9efd-75602fe5bf8c","resolution":{"observed_at":"2026-08-03T20:52:50.004415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:50.146602Z","title":"Guerrero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.146602Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:d6726131076ec790234b1522ccae9767be8963e2d2841597d0333edad4b7b332","observation_id":"07b0655f-26ca-4281-80dd-f6699b34dc35","resolution":{"observed_at":"2026-08-03T20:52:50.146602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:50.219556Z","title":"Egothinker: Unveiling egocentric reasoning with spatio-temporal cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.219556Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:c81b52297e7d66b1c5cc30463d2258bd7a78d31e9611867dc23f33995d10abea","observation_id":"c3e69748-d34a-4459-9d5a-ebad4517cccb","resolution":{"observed_at":"2026-08-03T20:52:50.219556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:50.301820Z","title":"In the eye of mllm: Benchmarking egocentric video intent under- standing with gaze-guided prompting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.301820Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:b1c6952f0ddc828c3720b369cf8f068033d81e2e3c6035e1c076e93fca1fdf7d","observation_id":"9ebbfed1-90c6-4162-aaf1-7fecd9362001","resolution":{"observed_at":"2026-08-03T20:52:50.301820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:50.389982Z","title":"Hd-epic: A highly- detailed egocentric video dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.389982Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:fbf21c882315271c169e53798df902d930789ea534ee6d052041f1930c908232","observation_id":"3b798628-f5c6-4387-9412-a82b9a860f56","resolution":{"observed_at":"2026-08-03T20:52:50.389982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:50.481927Z","title":"Omnia de egotempo: Bench- marking temporal understanding of multi-modal llms in ego- centric videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.481927Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:e617309be447080d3bd94983d30cf4648318597b0a1d1a5a2b117f5b9505172d","observation_id":"260763a3-9b3b-4b50-8244-272d4d468426","resolution":{"observed_at":"2026-08-03T20:52:50.481927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:50.579946Z","title":"Direct prefer- ence optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.579946Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:53b9d844d757973275a92f1c9cb2ce3b6090035406eac7f8b95eaebf115e7d67","observation_id":"2cba922d-af8e-4f6d-8502-5a8e20a69a73","resolution":{"observed_at":"2026-08-03T20:52:50.579946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:50.694440Z","title":"Egoil- lusion: Benchmarking hallucinations in egocentric video un- derstanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.694440Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:09147a90d1e195f7ea8f9c1b74b4d959f9e687880f2371faa507131d7c211798","observation_id":"d3c0b84c-83be-4489-9699-5c3a53ba3d76","resolution":{"observed_at":"2026-08-03T20:52:50.694440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:50.788341Z","title":"Tomato: As- sessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.788341Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:59195972f0f22dc2d39a3e749cff266d152ca5aea1583e3ceedd005b9cee4194","observation_id":"44ede36a-2394-4f74-b7dd-19a8dd79b681","resolution":{"observed_at":"2026-08-03T20:52:50.788341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13621","last_updated":"2026-08-06T13:34:44Z","snapshot_observed_at":"2026-08-13T23:28:26.625726Z","submitted_at":"2025-04-18T10:54:52Z","title":"Visual Intention Grounding for Egocentric Assistants","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13621","snapshot_observed_at":"2026-08-03T20:52:50.844987Z","title":"Visual intention grounding for egocentric assistants","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.844987Z"},"links":{"cited_paper":"/paper/2504.13621","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:b7d2bc3f8b77613622179a97cd73b288ef19e9df030fe33da5151a8533519b2a","observation_id":"71740667-4a97-4d60-9d93-2e9c3c30002f","resolution":{"observed_at":"2026-08-03T20:52:50.844987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-03T20:52:50.977196Z","title":"Ego-r1: Chain-of-tool- thought for ultra-long egocentric video reasoning.arXiv preprint arXiv:2506.13654, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.977196Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:f0fd17f600dbdb9a40a8c9b7be78c133f3a4a20ebb9956cad677edb37b9d682c","observation_id":"2022245b-8ebf-44c5-a174-e9fc4f57cea2","resolution":{"observed_at":"2026-08-03T20:52:50.977196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-12T19:55:27.838188Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-08-03T20:52:51.049418Z","title":"Egovlm: Policy optimization for egocentric video understand- ing.arXiv preprint arXiv:2506.03097, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.049418Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:daaa98e9871693f244b86c94415b3c578cbb7dbf000ab79653e385c41cd8300c","observation_id":"358e3010-f86b-4f49-a0c8-0dcd3bb9fe7c","resolution":{"observed_at":"2026-08-03T20:52:51.049418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T20:52:51.141957Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.141957Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:c9ec22c29ef632897cedcb3ab7dbd3782cab73984a80dce5d109046a46514185","observation_id":"7171bb7d-d583-49dc-87a5-38365e9ef064","resolution":{"observed_at":"2026-08-03T20:52:51.141957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:51.299354Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.299354Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:bc4c8e00b1f3bfb4d610bddd7ecc4e7e4eda3c289f5200dd82f7a89fcf9028ce","observation_id":"0a311ef8-2c24-47ba-8164-a69d8a5528c0","resolution":{"observed_at":"2026-08-03T20:52:51.299354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:51.378188Z","title":"Egoblind: To- wards egocentric visual assistance for the blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.378188Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:6b9372c22fb1049b2b30fc11f4bc07b6cb559aede56b43248387b9e8c6106f44","observation_id":"702a868d-ce7b-4a04-8dc3-5e052e00f0ad","resolution":{"observed_at":"2026-08-03T20:52:51.378188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:51.439844Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.439844Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:4bdd4b48392b90ffeaf4226e9a009707c5aab06a6301248c2b54e2afc1432ad6","observation_id":"f57696b2-0c08-48fd-9ba9-56fce6a70c8f","resolution":{"observed_at":"2026-08-03T20:52:51.439844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:51.536027Z","title":"Egoexo- gen: Ego-centric video prediction by watching exo-centric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.536027Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:fdce2b0f113c85d6e4edaecafb4fc6f56cfec19b4fff6c7e2a750754a35834bc","observation_id":"ba674106-7b61-4271-bdd6-ae290f5660df","resolution":{"observed_at":"2026-08-03T20:52:51.536027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:51.625247Z","title":"Egolife: Towards egocentric life assistant","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.625247Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:6c004aec37572e529355c5624d03aad200ceb0707063fd66c704bd5929304ddb","observation_id":"fc22da37-dd89-4343-8a16-e417953e2749","resolution":{"observed_at":"2026-08-03T20:52:51.625247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:51.691014Z","title":"Mm-ego: Towards building egocentric multimodal llms for video qa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.691014Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:a2bbbd5fb7bc5d54933f410fe3484312fa56505949c037e760b4d064b0d1acf9","observation_id":"7796c293-659d-452d-8e9a-de7681793d9a","resolution":{"observed_at":"2026-08-03T20:52:51.691014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:51.794261Z","title":"Eoc-bench: Can mllms identify, recall, and forecast objects in an egocentric world? InAdvances in Neural Information Processing Systems (NeurIPS), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.794261Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:e95f24fd0901973390ee6ed4b06ebaaac3ab77ace85ee2b9489edd9ba4422e7c","observation_id":"37beb6bd-612e-4014-8017-78d918ea17e8","resolution":{"observed_at":"2026-08-03T20:52:51.794261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:51.857416Z","title":"Exo2ego: Exocentric knowledge guided mllm for egocentric video understanding.arXiv preprint arXiv:2503.09143, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.857416Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:97af64195147d4cb5b39c7d50abdd42a6afd97e82a511066c8aa9942e47b0f61","observation_id":"179a52b6-c1ea-4a9f-bce4-3f9b7a6c72a1","resolution":{"observed_at":"2026-08-03T20:52:51.857416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:51.953130Z","title":"Twigg, and Robert Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.953130Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:cb768cba0867d09df8ef58b9a21737e10e0cd41d6aa64a93ab737ea7bb6a56f1","observation_id":"856c291b-1151-4d41-a44d-8fa291a2c610","resolution":{"observed_at":"2026-08-03T20:52:51.953130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.028841Z","title":"Swift: a scalable lightweight infrastructure for fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.028841Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:32fdfb96898d03df618bdb40b811fea40b10dd10b6bf86f051760c8b5d50c50b","observation_id":"591daa08-ccaa-4cbd-83c5-6080e18b7d7b","resolution":{"observed_at":"2026-08-03T20:52:52.028841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.098439Z","title":"Egotextvqa: Towards egocentric scene-text aware video ques- tion answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.098439Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:0aa7835d2f6966794a886057087d4c1e5d9071a6e7f62c2c879519965c2c2c67","observation_id":"9ef62f62-cfb7-410d-b7fc-464ec57874c3","resolution":{"observed_at":"2026-08-03T20:52:52.098439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.166116Z","title":"walk to the bus stop","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.166116Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:283199a558db82cb73fec0064e57cd0a7d3b9eafa4ebe74c1b977be1a528a76f","observation_id":"049f2389-f2ab-4d21-b982-d1940f65a3ad","resolution":{"observed_at":"2026-08-03T20:52:52.166116Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.237112Z","title":"How do I make brownies?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.237112Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:e6a93dc922a72e626e5a2dbac65b9d6c8f54739cc6d077d9269b84d7dd6c6cf3","observation_id":"8ab60e58-f13b-453f-bb12-97ea6bc603ee","resolution":{"observed_at":"2026-08-03T20:52:52.237112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.343657Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.343657Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:7edf618cae3c3de3dc2dba34c7c7a59a83e9b7458d0197fe3020f0bbd0fc5fdb","observation_id":"88772281-64d7-4525-ace8-3a8bd3d798fc","resolution":{"observed_at":"2026-08-03T20:52:52.343657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.451668Z","title":"5.Construct the Response:Generate the target output using the following strictly enforced format: 6.<ego plan>: A numbered, step-by-step plan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.451668Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:aec4bf2e0005f93ace0abc31db66b66865687439cf5e204bd315c5b50c71303a","observation_id":"b3ba8825-cc18-4003-9c6e-f998dbc9dacd","resolution":{"observed_at":"2026-08-03T20:52:52.451668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.589338Z","title":"Input Annotations:{50.48-54.7: break egg},{64.19-76.3: mix eggs},{87.13-91.1: add water},","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.589338Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:8fd3d002dc41aa88daf923fd3167b0623b8b27bec03105ee39bec7a7a05e3250","observation_id":"6b76889b-0dec-4c3f-9421-31df27d76006","resolution":{"observed_at":"2026-08-03T20:52:52.589338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.651155Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.651155Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:32839086793b3a44c5c7bb6a9a0d05d6285c386508b97c108208ff0ed2dfd941","observation_id":"22494f08-bd00-4003-89c9-a54469155868","resolution":{"observed_at":"2026-08-03T20:52:52.651155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.717173Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.717173Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:ca2ba46cbd74e4eb208bb82cc060bcb31d5540cc69ed9280134238f31c6d9679","observation_id":"51115e85-3878-4709-825e-306e50b64d62","resolution":{"observed_at":"2026-08-03T20:52:52.717173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.858809Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.858809Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:434441cd9ed4d9ce8838f10eec34ccbe067fe09d7d76fd17a2e8db8c1711f25b","observation_id":"f1a0b9f5-c6e8-4210-a88a-c27c6928b844","resolution":{"observed_at":"2026-08-03T20:52:52.858809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:52.968740Z","title":"13.73-14.11: flip the bottom part of the coffee machine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:52.968740Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:c9b09b73dae9ebc5f626ae181fb3ceccadf6d546e74289d26286c27cca6b969d","observation_id":"bee4c1b9-3959-4649-a18a-fe45fc6dbe60","resolution":{"observed_at":"2026-08-03T20:52:52.968740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:53.124694Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:53.124694Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:d17c8c1a8f9244b986a71520b3bb89905385c0f7c8e6dc3bf4bb45e759af87a8","observation_id":"b811c922-c6d8-4c12-9114-9cb30f0fd870","resolution":{"observed_at":"2026-08-03T20:52:53.124694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:53.281933Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:53.281933Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:a4424b7894e7139c8b412deff0b64d9351686bc96b274babb5fe0f043e36c3d8","observation_id":"443bc705-de94-4d71-9efb-a99e93d336ed","resolution":{"observed_at":"2026-08-03T20:52:53.281933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:52:53.391666Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:53.391666Z"},"links":{"citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:ffe2f014726432b0dfebffee24cb9706c060b06c5ec67f449ce56ed9cb0b555f","observation_id":"4acebfea-c3ea-46d9-aee7-04b564425bcb","resolution":{"observed_at":"2026-08-03T20:52:53.391666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:18:40.799359Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 4 inbound Pith citation observations for arXiv:2511.18242."}