{"as_of":"2026-08-05T12:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0b79f3831cb8d4db198e09dc3162203833d92acba91409352ddabc192be5bd1","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:23:09.304749Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:52:48.921328Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T11:18:13.630096Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26113","snapshot_observed_at":"2026-08-03T20:52:48.921328Z","title":"Egoexo-con: Exploring view- invariant video temporal understanding.arXiv preprint arXiv:2510.26113, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-04T17:27:16.720381Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:48.921328Z"},"links":{"cited_paper":"/paper/2510.26113","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:cf330f54b663e34bbd77d00449d5ef5fe8c86e52e047875a6906d04cfd80d36c","observation_id":"886e0750-ebdb-4523-9acd-ecf55f158a3e","resolution":{"observed_at":"2026-08-03T20:52:48.921328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"cited_work":{"arxiv_id":"2510.26113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.26113","snapshot_observed_at":"2026-06-23T02:11:59.295007Z","title":"EgoExo-Con: Exploring view-invariant video temporal understanding","venue":null,"work_id":"530c51cf-4a1b-4318-ba93-833f78886f72","year":2025},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-02T10:58:24.692632Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2510.26113","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:28cc3791e92490cb93b32ad56e0b0fc6fd71d7d3b101735b031447816583c048","observation_id":"109af9ed-c9ae-4cbe-83e4-953f092c6891","resolution":{"observed_at":"2026-06-23T02:11:59.295007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"cited_work":{"arxiv_id":"2510.26113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.26113","snapshot_observed_at":"2026-06-23T02:11:59.295007Z","title":"EgoExo-Con: Exploring view-invariant video temporal understanding","venue":null,"work_id":"530c51cf-4a1b-4318-ba93-833f78886f72","year":2025},"citing_paper":{"arxiv_id":"2605.18431","last_updated":"2026-05-19T05:12:41Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:04:26Z","title":"Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T10:36:20.388169Z"},"links":{"cited_paper":"/paper/2510.26113","citing_paper":"/paper/2605.18431"},"observation_digest":"sha256:43ca89b8c94aa8f8082dcf2808e1c3cf97b0d34f52c4056d94de815efda6ef70","observation_id":"765d3134-f777-456a-9bb8-1b59c2d926c8","resolution":{"observed_at":"2026-06-23T02:11:59.295007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"cited_work":{"arxiv_id":"2510.26113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.26113","snapshot_observed_at":"2026-06-23T02:11:59.295007Z","title":"EgoExo-Con: Exploring view-invariant video temporal understanding","venue":null,"work_id":"530c51cf-4a1b-4318-ba93-833f78886f72","year":2025},"citing_paper":{"arxiv_id":"2605.18734","last_updated":"2026-07-08T07:29:12Z","snapshot_observed_at":"2026-07-12T16:32:44.087566Z","submitted_at":"2026-05-18T17:54:55Z","title":"EgoExoMem: Cross-View Memory Reasoning over Synchronized Egocentric and Exocentric Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T11:18:05.563078Z"},"links":{"cited_paper":"/paper/2510.26113","citing_paper":"/paper/2605.18734"},"observation_digest":"sha256:48b3b84df2e3f1f37ce7687ed0192ad98b40edcc50043e8983eecf054425bd17","observation_id":"883e2ed7-8b35-4b16-afe6-26bb39d7abb0","resolution":{"observed_at":"2026-06-23T02:11:59.295007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.26113/citation-record","integrity":"/paper/2510.26113/integrity","json":"/paper/2510.26113/citation-record.json","paper":"/paper/2510.26113"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:03.151058Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.151058Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:8778800051c43d34b1d975e75435a0d3913e0b2e75c793d839da451ebfccafb6","observation_id":"c67ea8dd-45f5-495f-ab41-260ab92a9656","resolution":{"observed_at":"2026-08-04T07:23:03.151058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T07:23:03.206596Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.206596Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:aea0b2fedfca6a400439672433d366bbdcc58bbe1cc43faa95f93bf6dc8b4c25","observation_id":"d6ba7251-ab3b-4e11-bf02-140b50c8fb7b","resolution":{"observed_at":"2026-08-04T07:23:03.206596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T07:23:03.289185Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.289185Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:63d27a16e7eacb740b8f06173db5e698a5a985f6a3b964e1b1cb2b4209c17062","observation_id":"818ad9fd-dacf-47d6-baf8-31ac7beebc4c","resolution":{"observed_at":"2026-08-04T07:23:03.289185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:03.338324Z","title":"Egothink: Evaluating first-person perspective thinking capability of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.338324Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:3ee2e131b6aa2ed92dac67c171fd3c57774b396aa3f928e53b2cabc1a6e5f474","observation_id":"4362ca1e-a179-4a0b-bbd6-3a949bbea7b0","resolution":{"observed_at":"2026-08-04T07:23:03.338324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-04T07:23:03.416590Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.416590Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:e2bb3a96ff24ea63655dc4afa3afbb462aa533226528197cdfcc29020e7745fe","observation_id":"924251dc-ef6d-422f-9cfc-fcf651a4d180","resolution":{"observed_at":"2026-08-04T07:23:03.416590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T07:23:03.493511Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.493511Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:a5c0a4fb2e55bd329989078859fbabbdc86cdab84ebac33c9dd6473bec8a5689","observation_id":"65aeb1ee-2fe7-48cd-a543-de5a1b93bcda","resolution":{"observed_at":"2026-08-04T07:23:03.493511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-07-06T19:31:00.754487Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-04T07:23:03.592902Z","title":"Lost in time: A new temporal benchmark for videollms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.592902Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:086870356f61320265e08feb6d8a84dd9cd121071abbc19b9582dcd1e4c2e150","observation_id":"8bda65d5-9efd-44e8-89ea-24f8062f3b04","resolution":{"observed_at":"2026-08-04T07:23:03.592902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:03.674055Z","title":"Grounded question-answering in long egocentric videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.674055Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:39f14730cd5390d071cb7794461b6cc2ec8efbf1994039cb34b95e726a9918b8","observation_id":"e1cdb779-09db-4959-a7cf-87bfa3f5cdb8","resolution":{"observed_at":"2026-08-04T07:23:03.674055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-04T07:23:03.858602Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.858602Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:5804d7dffd3baea5ed79007e47d61a4380274eced91b3fd5afa09dda6361f4c2","observation_id":"00828e5b-4d62-4af0-8a61-3127e25064f2","resolution":{"observed_at":"2026-08-04T07:23:03.858602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-04T07:23:03.904036Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:03.904036Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:ac078818aed4726763de02b64403d10235e96cc7c4b5660f693b77581c610564","observation_id":"24f6e97c-0632-4ae9-967e-a0d4b26fa599","resolution":{"observed_at":"2026-08-04T07:23:03.904036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.050513Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.050513Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:6d1ec27704cb9b088d8e5f3ee068b9c61583a3f3190d61d728d1772080c994bd","observation_id":"e522de50-7231-4245-8e73-fed5048b2eec","resolution":{"observed_at":"2026-08-04T07:23:04.050513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T07:23:04.132173Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.132173Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:d3594e65bf9b1984a8d1e059046c4fcabf46032e08aa75d7874140bc1279f204","observation_id":"9b0f31df-a307-4b22-a7c5-068bec89bbaa","resolution":{"observed_at":"2026-08-04T07:23:04.132173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.198631Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.198631Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:81d3cbe0c865c70ae35561de3e64bada639f39a8b7ce1d0757fc6ade108ab9db","observation_id":"40da9d03-56e1-44bc-8e62-0621b546d254","resolution":{"observed_at":"2026-08-04T07:23:04.198631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.272054Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.272054Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:dfbb05b4203b63647edc01aec1b966f6e1c888ce46eab0c3a4146bfe3e3ba284","observation_id":"6230194e-7128-41ae-9e16-2bf574635c34","resolution":{"observed_at":"2026-08-04T07:23:04.272054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13382","last_updated":"2025-02-01T03:55:30Z","snapshot_observed_at":"2026-07-06T18:17:46.369537Z","submitted_at":"2024-05-22T06:31:42Z","title":"VTG-LLM: Integrating Timestamp Knowledge into Video LLMs for Enhanced Video Temporal Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13382","snapshot_observed_at":"2026-08-04T07:23:04.331779Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.331779Z"},"links":{"cited_paper":"/paper/2405.13382","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:5ae0a8ada140c3464004abc17dcd5ad6506c7162563af1a3a8c727566370f77d","observation_id":"204b3c85-64a2-4538-ab67-1203535fc192","resolution":{"observed_at":"2026-08-04T07:23:04.331779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18342","last_updated":"2025-07-24T12:14:49Z","snapshot_observed_at":"2026-07-06T22:02:13.646335Z","submitted_at":"2025-07-24T12:14:49Z","title":"EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18342","snapshot_observed_at":"2026-08-04T07:23:04.393109Z","title":"Egoexobench: A benchmark for first-and third-person view video understanding in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.393109Z"},"links":{"cited_paper":"/paper/2507.18342","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:c815d9143270cfdcc46734ae8d568369393d86c20493592cadd378f38438872c","observation_id":"ded4086a-74cc-4ade-a563-ab2d0cdba6ca","resolution":{"observed_at":"2026-08-04T07:23:04.393109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.467417Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.467417Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:38e3817a06998b103e7ec7e48153bffd9510decf3a7552aea6712e406ef4ea2c","observation_id":"f04e3edc-26d8-48cc-9088-56a511600f8b","resolution":{"observed_at":"2026-08-04T07:23:04.467417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.548784Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.548784Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:b6dd1473a5510d547e4727c9941eddee9bde1e8a9c64dc1d5847f5d4523eeb81","observation_id":"a3bcb6c2-a76f-4a19-99c6-c2d2e8cfc221","resolution":{"observed_at":"2026-08-04T07:23:04.548784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.625353Z","title":"Lemma: A multi-view dataset for le arning m ulti-agent m ulti-task a ctivities","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.625353Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:900f7768772c0eef5615106ef4bc60ea8ee61c94d9ab64863e9019305434468e","observation_id":"a9995c41-a9e8-4e83-9bf5-67a22059a791","resolution":{"observed_at":"2026-08-04T07:23:04.625353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.678137Z","title":"Background-aware moment detection for video moment retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.678137Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:79809e2df4c66c9030dcdbb15f369cc1742c4c3a49514fcf52098578a84e6534","observation_id":"efe5f9e7-559c-47b5-981e-e66e4ce67e81","resolution":{"observed_at":"2026-08-04T07:23:04.678137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.783148Z","title":"On the consistency of video large language models in temporal comprehension","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.783148Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:a8b5774249fd86fae8127fe12e0ad05b1dca3f2d7e050dc5896c21e76cf08ca9","observation_id":"72182d6e-0cb4-4c48-8c12-713a858c1fd5","resolution":{"observed_at":"2026-08-04T07:23:04.783148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.846166Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.846166Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:07ccc053c1471680d967354bbdde03b9b393e3f022e39281d67ec6ae1176fa40","observation_id":"7b956a3b-ee12-4fd9-9ec4-217354adda91","resolution":{"observed_at":"2026-08-04T07:23:04.846166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.923689Z","title":"Ego-exo: Transferring visual representations from third-person to first-person videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.923689Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:61f67eb710269bbc8be8b84e2b8a6b7f0a9f18abc95c3d934290e9e3b4789748","observation_id":"b7eb983c-3338-409c-9783-3fcefa8a01d5","resolution":{"observed_at":"2026-08-04T07:23:04.923689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:04.994341Z","title":"Egoexo-fitness: Towards egocentric and exocentric full-body action understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:04.994341Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:162f3a2fbb782bcec6be8803c9caad8025d118aee8f41a0632ae9539b08c9791","observation_id":"b9ea4eec-9311-461a-8e4c-a37c6bb2a7d6","resolution":{"observed_at":"2026-08-04T07:23:04.994341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:05.004849Z","title":"Universal video temporal grounding with generative multi-modal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.004849Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:f9c3a0d56768106326f8b0d0aa8c47f0bfef66e49dde5e73959113835cd33d01","observation_id":"b220119e-658b-4c3a-b551-f46cb3136cad","resolution":{"observed_at":"2026-08-04T07:23:05.004849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-07-06T21:02:28.100677Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-08-04T07:23:05.079698Z","title":"Improved visual-spatial reasoning via r1-zero-like training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.079698Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:1de9582250607cfe6272a75edfe99bb20a8f1ce42ed36d1f11f03846b72afbbd","observation_id":"85ebea19-bc89-4b8f-a73c-c97ba66a00b4","resolution":{"observed_at":"2026-08-04T07:23:05.079698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05977","last_updated":"2025-03-07T23:17:59Z","snapshot_observed_at":"2026-07-06T20:48:55.297689Z","submitted_at":"2025-03-07T23:17:59Z","title":"Is Your Video Language Model a Reliable Judge?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05977","snapshot_observed_at":"2026-08-04T07:23:05.208635Z","title":"Is your video language model a reliable judge? arXiv preprint arXiv:2503.05977, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.208635Z"},"links":{"cited_paper":"/paper/2503.05977","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:2fb970778aad3adac5fcc788adfb6550dee155f217f4483197beb2aa9d1053fa","observation_id":"1e29ac5f-6fcf-45c7-a84d-1367cdd3281a","resolution":{"observed_at":"2026-08-04T07:23:05.208635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:05.325842Z","title":"Put myself in your shoes: Lifting the egocentric perspective from exocentric videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.325842Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:24c13004db8f560fe16b45b4fefbf57eaccc857deeed7952b7fe0d0049a54168","observation_id":"576e35da-897f-4682-987b-2841d57b5bef","resolution":{"observed_at":"2026-08-04T07:23:05.325842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:05.453908Z","title":"Viewpoint rosetta stone: Unlocking unpaired ego-exo videos for view-invariant representation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.453908Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:9b93cd9e39cdbdef5e26d4e4abd6c54e6371d2c62569de9955a33de2232dfd22","observation_id":"28cdc54f-0505-495b-b2ab-f5e82d964198","resolution":{"observed_at":"2026-08-04T07:23:05.453908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:05.578638Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.578638Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:040e44ab8be86fe28f7f879972eff4e5f04625d594d1c45a75ee9cac8535d69b","observation_id":"bc64ff55-0d78-41f6-ac22-f0bb340aafde","resolution":{"observed_at":"2026-08-04T07:23:05.578638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:05.660746Z","title":"Chrono: A simple blueprint for representing time in mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.660746Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:078c463742a38770139dac01e59a465256bd6962276c4e43864b7b076e0e2a6d","observation_id":"afac3c60-b6db-49b0-b1f4-a3103d8b5ea1","resolution":{"observed_at":"2026-08-04T07:23:05.660746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:05.765100Z","title":"Introducing gpt-5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.765100Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:65ec206c639003f6a5d2c23eee3ce155a464a2f72e1b08840056d24f36f3a103","observation_id":"398e02e3-7de2-4b68-b19a-4efd16ad01ba","resolution":{"observed_at":"2026-08-04T07:23:05.765100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24287","last_updated":"2025-05-30T07:02:00Z","snapshot_observed_at":"2026-07-06T21:33:31.469620Z","submitted_at":"2025-05-30T07:02:00Z","title":"EgoExOR: An Ego-Exo-Centric Operating Room Dataset for Surgical Activity Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24287","snapshot_observed_at":"2026-08-04T07:23:05.886731Z","title":"Egoexor: An ego-exo-centric operating room dataset for surgical activity understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.886731Z"},"links":{"cited_paper":"/paper/2505.24287","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:a281004263ff3fc7850b84f5fe6b7184c9cb1346b9c096701cf05c9f0115b3b5","observation_id":"b0d565e6-f2a1-4b25-91ef-a253ef8806e0","resolution":{"observed_at":"2026-08-04T07:23:05.886731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11435","last_updated":"2024-06-02T05:40:18Z","snapshot_observed_at":"2026-08-03T13:43:01.554891Z","submitted_at":"2024-02-18T03:04:38Z","title":"Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11435","snapshot_observed_at":"2026-08-04T07:23:05.997667Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:05.997667Z"},"links":{"cited_paper":"/paper/2402.11435","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:9723baf0f34dbff2056242611f4d77c6ec35bc0623793abbae8a9f086ec4e1bf","observation_id":"3a1bc3f7-50ca-4392-8f64-b594b993cd5a","resolution":{"observed_at":"2026-08-04T07:23:05.997667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:06.099820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:06.099820Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:483e1fcee036f42abc4a0e20025b99ec623ad8fec4fbd92ae4acfeb278100ccc","observation_id":"a609b8e1-bbcd-48cf-955f-ee55acf01d50","resolution":{"observed_at":"2026-08-04T07:23:06.099820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:06.211860Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:06.211860Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:dc6886006bf4feea07da1e2afd18491a6eb3ae4673c767e83fc6dc5e6d509436","observation_id":"d7998972-807d-446f-a68c-d266f04d7fc0","resolution":{"observed_at":"2026-08-04T07:23:06.211860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:06.284683Z","title":"Assembly101: A large-scale multi-view video dataset for understanding procedural activities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:06.284683Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:371a0810c83f1ab355b37eb08fd3aeaab832f54cc00034c90f57295f4213b5ba","observation_id":"62aa2089-f183-4bf9-adaa-b73f4c9b87ad","resolution":{"observed_at":"2026-08-04T07:23:06.284683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T07:23:06.372618Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:06.372618Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:c3c17e2e2e0ad51e905c48d8a2c9b9baea6a6bb2711ca3c90943d45ddcd4afb7","observation_id":"07c9a36e-0566-4394-bdbe-94e24e9b92c1","resolution":{"observed_at":"2026-08-04T07:23:06.372618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-04T07:23:06.466398Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:06.466398Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:571dcf51ffe39f5b0fcc9bfc47322efc07ec93d0164729b61df0e98dd882dae5","observation_id":"058739ef-4f61-4791-94b1-27af30bbb50d","resolution":{"observed_at":"2026-08-04T07:23:06.466398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:06.616649Z","title":"Actor and observer: Joint modeling of first and third-person videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:06.616649Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:31834324b4dde7ad7059babb2e2da34b96c41f7acb544384c151e9a745a69d61","observation_id":"ebf6d6a1-6ad0-4b0a-aa6d-c88e799f7210","resolution":{"observed_at":"2026-08-04T07:23:06.616649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:06.803270Z","title":"Learning from semantic alignment between unpaired multiviews for egocentric video recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:06.803270Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:04bfbbcae8654a27b0b7e83a2016e61eb21c362c8db1c2ecef0a55a0ca43a057","observation_id":"75fc005a-618e-4748-866b-52ccca80e918","resolution":{"observed_at":"2026-08-04T07:23:06.803270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-04T07:23:06.927026Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:06.927026Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:592c79fa6c792c9883395ebfa0a9329b6f17a2fce66935c7870b90b9193c8f69","observation_id":"451f6820-401e-48a2-80a4-a0c50b14720d","resolution":{"observed_at":"2026-08-04T07:23:06.927026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-07-06T17:45:23.748539Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-04T07:23:07.036700Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.036700Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:5440451e33bcc79549b43b5b0547a87f2f6b49b4fd3dd1a45a309f3e12c41f5b","observation_id":"c1154590-e902-4fc2-94e3-dfcfe8eeecbe","resolution":{"observed_at":"2026-08-04T07:23:07.036700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-04T07:23:07.108809Z","title":"Time-r1: Post-training large vision language model for temporal video grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.108809Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:880a067c91f8688a0394712383e39a0c44022448b9525da698cbffaae6ac0349","observation_id":"092dee13-de5c-4c06-89c5-20e794ea9026","resolution":{"observed_at":"2026-08-04T07:23:07.108809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-05T00:52:07.112592Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-04T07:23:07.235364Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.235364Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:d4b1293208fe660099150e53411c5a83ae722a424799a38e88d36f179bedd6fe","observation_id":"5b064333-15cc-4f7f-9284-4c40a6317838","resolution":{"observed_at":"2026-08-04T07:23:07.235364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-07-06T17:45:11.343569Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-04T07:23:07.344850Z","title":"Hawkeye: Training video-text llms for grounding text in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.344850Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:e753736561f2787938299c1cb548b9f4c002b35f94b672d2c7c3487e7be992b8","observation_id":"8fa2f2a3-cd9b-42d7-ba04-97b5d38e51c1","resolution":{"observed_at":"2026-08-04T07:23:07.344850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:07.484753Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.484753Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:355109e1d6927355bc627ab1752b53971d482a42104cd876bf0ceaab99d77260","observation_id":"21ea69d5-bc46-41b4-9c8f-a27a96bdae55","resolution":{"observed_at":"2026-08-04T07:23:07.484753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:07.609169Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.609169Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:5bcb61389da2969829e5bc16a0dfb05d7041e44223dc4f4e580edd21afcb1ad5","observation_id":"c7089af4-5a67-4c21-b09b-25ae1ad9482c","resolution":{"observed_at":"2026-08-04T07:23:07.609169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:07.649531Z","title":"Can i trust your answer? visually grounded video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.649531Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:60a3582c32a9ac3ea5f3174fc89604ed418894cd6ed5be65a55c9a38f4119e3d","observation_id":"538d22a1-53db-4d21-a70a-015b0e21c93e","resolution":{"observed_at":"2026-08-04T07:23:07.649531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:07.699810Z","title":"Egoblind: Towards egocentric visual assistance for the blind people","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.699810Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:af55f699646f658391623da42783ec97a44ab7a83963e7f90c56b2295925bc03","observation_id":"d49cc283-871f-40cb-8554-8c45fbb62f66","resolution":{"observed_at":"2026-08-04T07:23:07.699810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-07-06T16:21:25.401345Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T07:23:07.784752Z","title":"Text2reward: Reward shaping with language models for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.784752Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:8853360e366d72dcbeef495b7333de05cf1b527daa4ba77508c0803e3a08c7c8","observation_id":"7b3121aa-73da-422d-9565-dc6e6dfe64e0","resolution":{"observed_at":"2026-08-04T07:23:07.784752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:07.882110Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.882110Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:f34253e9e913d75f71e5d8fed4d2b09a4fa92936f07c091a8b773f99b207ee89","observation_id":"f3c79df9-f7ee-4172-89b7-79e38a469b74","resolution":{"observed_at":"2026-08-04T07:23:07.882110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:07.961142Z","title":"Learning fine-grained view-invariant representations from unpaired ego-exo videos via temporal alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.961142Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:6712347b9b118d6f7e3b8e0723168797c7ae9f956a795b9b17341b70ef2bea71","observation_id":"ec8daf29-db2e-48ef-a8c7-c7a745bd8571","resolution":{"observed_at":"2026-08-04T07:23:07.961142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T07:23:08.030046Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:08.030046Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:79bca7c6065574ed3209c91332f06d42a684752989c6d934db4dc932f3cc29bb","observation_id":"da52ac15-2194-4fb7-adb0-42283e78c112","resolution":{"observed_at":"2026-08-04T07:23:08.030046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:08.145926Z","title":"Mmego: Towards building egocentric multimodal llms for video qa","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:08.145926Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:c0957b4cc73749ad85825bc88215b2558c7b15bd32a2338cfb26ddf1bc910fe9","observation_id":"7e57d479-bd9e-4d1f-9d1e-c94d17e07899","resolution":{"observed_at":"2026-08-04T07:23:08.145926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:08.224753Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:08.224753Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:150e992d06345703f119a4b1e1a62f46d1553e0266b67511496ac1d5fd9ef639","observation_id":"d68df159-68ed-458a-89c6-b4686498c6a7","resolution":{"observed_at":"2026-08-04T07:23:08.224753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19702","last_updated":"2025-02-12T16:47:30Z","snapshot_observed_at":"2026-08-03T13:09:34.548121Z","submitted_at":"2024-10-25T17:19:55Z","title":"TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19702","snapshot_observed_at":"2026-08-04T07:23:08.354942Z","title":"Timesuite: Improving mllms for long video understanding via grounded tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:08.354942Z"},"links":{"cited_paper":"/paper/2410.19702","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:0d815dd27613802c268b977f5d97771b17a9d7d072578d98c0c5d25ac4c02501","observation_id":"a5502050-69e0-428c-8a3b-03e29de7de9a","resolution":{"observed_at":"2026-08-04T07:23:08.354942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-04T07:23:08.454785Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:08.454785Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:23d110a907d29d3090bac645bcdb91d80fc83b9d7d4606be30a7f35f1794af92","observation_id":"8a4eb131-d608-4e6a-b021-23fcbd145c25","resolution":{"observed_at":"2026-08-04T07:23:08.454785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:08.584753Z","title":"Exo2ego: Exocentric knowledge guided mllm for egocentric video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:08.584753Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:502927e2fea878a3239581bac24db518695284e57c2877d3f688bf92461421a6","observation_id":"c6803488-262b-4bec-b68a-a90d1ae860ff","resolution":{"observed_at":"2026-08-04T07:23:08.584753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-04T07:23:08.764864Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:08.764864Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:619cc6b2efd90e2037d665b4671ac7dd57b9449e15f9afd3722768d7ad5742b2","observation_id":"738943dd-7f6f-4f19-83b6-12b008fa9194","resolution":{"observed_at":"2026-08-04T07:23:08.764864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09641","last_updated":"2025-04-13T16:32:49Z","snapshot_observed_at":"2026-08-05T02:09:19.150032Z","submitted_at":"2025-04-13T16:32:49Z","title":"TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09641","snapshot_observed_at":"2026-08-04T07:23:08.954750Z","title":"Tinyllava-video-r1: Towards smaller lmms for video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:08.954750Z"},"links":{"cited_paper":"/paper/2504.09641","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:0712332df6d280169ad9c1f197d4285b43722ee797fb8022724b55c1e540dd8b","observation_id":"f503adc7-1cf5-4832-9b23-ae3118e44777","resolution":{"observed_at":"2026-08-04T07:23:08.954750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-04T07:23:09.070998Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:09.070998Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:9bb5b635485047a41a93e9bc8c527f5d3072c4db84d02c1b44325837f7e3f0ce","observation_id":"6eaca711-a83a-4a5a-a29c-ad30b18f7463","resolution":{"observed_at":"2026-08-04T07:23:09.070998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:09.184170Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:09.184170Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:aa4ee507620ad54311594a0ce0366effe247c5e73067696dc01d03227015fb78","observation_id":"510b3cf6-f4ea-4ced-8f42-9f164f620dfd","resolution":{"observed_at":"2026-08-04T07:23:09.184170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:23:09.304749Z","title":"Mlvu: Benchmarking multi-task long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:09.304749Z"},"links":{"citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:9f6efd2a97f0570ce15c678fbb5c78dbdbbc72876359fd28df269b01756a2ceb","observation_id":"e63d3dd1-f44a-4a8c-b06f-f90c0545d318","resolution":{"observed_at":"2026-08-04T07:23:09.304749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T07:22:42.765437Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 4 inbound Pith citation observations for arXiv:2510.26113."}