{"as_of":"2026-08-08T21:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a6eb6efd9befdf69fe54d828125eb849470c2aa2e7588f47f458c84b6278c5b","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:34:39.654749Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:44:30.600425Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.209497Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-04T16:07:41.188704Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:41.188704Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:fd694d7d1b27e8a191e9b81f68f081b2e06cafbef549496f92584a567b2d034a","observation_id":"c25419ac-312a-4ceb-9052-c9ddd08b8728","resolution":{"observed_at":"2026-08-04T16:07:41.188704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-03T20:52:50.977196Z","title":"Ego-r1: Chain-of-tool- thought for ultra-long egocentric video reasoning.arXiv preprint arXiv:2506.13654, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-07T23:32:07.863489Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:50.977196Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:8882f4c797ae13d0e6b63098db622e8ec2ff04fc17fe650d5a480f25194b61f4","observation_id":"2022245b-8ebf-44c5-a174-e9fc4f57cea2","resolution":{"observed_at":"2026-08-03T20:52:50.977196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:cbef598d3ee949778bf6eccfacaee4deeef8202123273596990379b06f07e16b","observation_id":"25424899-9b6f-4a06-8cc5-23aa0f89dd3c","resolution":{"observed_at":"2026-05-22T12:31:32.236221Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T03:09:31.161760Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:d3778c75f5314833c1e8bb2ba8160c0d331700653118b6d6324ee68decb3cd11","observation_id":"b03987c0-a1a7-4d17-b4a9-0ae72a77f23b","resolution":{"observed_at":"2026-05-17T03:11:30.127539Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-03T18:51:47.364014Z","title":"Ego-r1: Chain-of-tool- thought for ultra-long egocentric video reasoning.arXiv preprint arXiv:2506.13654, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:47.364014Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:c0c3650c192c1b540a7aa3bce1a08421b076391b7c776835a84769f9544c02c2","observation_id":"366d7f97-a531-4eea-8862-d05cbf46d5bc","resolution":{"observed_at":"2026-08-03T18:51:47.364014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2602.20913","last_updated":"2026-04-15T16:09:22Z","snapshot_observed_at":"2026-08-02T12:38:41.181077Z","submitted_at":"2026-02-24T13:49:47Z","title":"LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T20:01:31.129959Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2602.20913"},"observation_digest":"sha256:2ecfc64d63ac31e97b7c38d1e8b4927a84f1fe8bec017272562537f9e0da39b9","observation_id":"0a6561cf-1670-4043-9c5b-917a27057784","resolution":{"observed_at":"2026-05-15T20:01:33.571971Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:32.778695Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2604.05015"},"observation_digest":"sha256:ca78b7b41be52d5052a74cf03b75f66c96d37a90dd4b212801881367cfbbfbb8","observation_id":"1b19dd71-4df7-4e16-8470-2e82d041f4d5","resolution":{"observed_at":"2026-05-10T23:55:51.234332Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:c879f2615dba9d528634e0a9287f1cf49a3bb2852df3b8ff5bb9723a68d44795","observation_id":"764be880-7bed-4ff1-91da-956030d866be","resolution":{"observed_at":"2026-05-10T12:10:22.165296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2605.13228","last_updated":"2026-05-13T09:19:22Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:19:22Z","title":"ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T20:08:13.214803Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2605.13228"},"observation_digest":"sha256:0bc1785733076665cdbddbb121ba61d632a6b5ef47aa74c477f63ecf8cdc2d9c","observation_id":"9b921024-34a3-4271-9a43-c1d4c8002411","resolution":{"observed_at":"2026-05-14T20:09:26.412402Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2605.16079","last_updated":"2026-05-15T15:43:28Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:43:28Z","title":"VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T19:37:09.244578Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2605.16079"},"observation_digest":"sha256:166ed086578ef68fbeb497e2bb971c17a9683ebd2b45d60caa2679286db40cba","observation_id":"109b9733-637a-465b-a045-29273b932d53","resolution":{"observed_at":"2026-05-20T19:38:56.129604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2605.22907","last_updated":"2026-05-21T18:00:22Z","snapshot_observed_at":"2026-08-02T16:30:28.109405Z","submitted_at":"2026-05-21T18:00:22Z","title":"VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:49.390597Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2605.22907"},"observation_digest":"sha256:f6cccc49ef7a233b5c99444e76721c7d33d67c11788f2d643a6ccde7d494f22c","observation_id":"d03ee091-bbaf-449d-864a-bfac5179e861","resolution":{"observed_at":"2026-05-25T05:55:24.960208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2606.02482","last_updated":"2026-06-29T07:37:14Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T16:52:11Z","title":"X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T15:06:22.102725Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2606.02482"},"observation_digest":"sha256:23ca613782c99ec82f5a18cce5cfa5ab66729a24aead3a823ea6f5290bd98f32","observation_id":"0f7b432f-5591-4e87-835a-38cc7a7da685","resolution":{"observed_at":"2026-07-01T22:46:18.952535Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2606.02482","last_updated":"2026-06-29T07:37:14Z","snapshot_observed_at":"2026-07-06T23:42:53.514946Z","submitted_at":"2026-06-01T16:52:11Z","title":"X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T10:42:37.401221Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2606.02482"},"observation_digest":"sha256:fb51cfce6df0bed49b77a132ba717df3b34aa5b9048bbdd7dd2b54f0570026b2","observation_id":"c90aeb62-6807-4de8-8d28-c75d9f25beaa","resolution":{"observed_at":"2026-06-30T10:44:36.440259Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":"2506.13654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-02T17:27:15.209497Z","title":"Qwen3.5-omni technical report, 2026a","venue":null,"work_id":"530e118a-54d5-4bd0-a0cc-13fe5e98eda5","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":240,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:23fbb77b4564fcc3f0f1c2f97faa9d2caa68b82035058f5281387531c4e16a3f","observation_id":"5d5e67b7-0380-49e4-98be-e109d7be32a1","resolution":{"observed_at":"2026-07-02T17:27:15.211047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-11T06:35:35.951554Z","title":"Ego-r1: Chain-of-tool- thought for ultra-long egocentric video reasoning.arXiv preprint arXiv:2506.13654, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05511","last_updated":"2026-07-06T18:00:06Z","snapshot_observed_at":"2026-08-06T10:36:18.804889Z","submitted_at":"2026-07-06T18:00:06Z","title":"Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T06:35:35.951554Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2607.05511"},"observation_digest":"sha256:84e4ccf47bd4052a627c1423735d60926f5f1b873d93efdd1b637d99cc3bdde6","observation_id":"b3a46354-b2c7-4b15-b292-0dad84c0b2ac","resolution":{"observed_at":"2026-07-11T06:35:35.951554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-07-14T05:16:32.658643Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11487","last_updated":"2026-07-13T12:40:17Z","snapshot_observed_at":"2026-08-08T11:38:15.879727Z","submitted_at":"2026-07-13T12:40:17Z","title":"LightMem-Ego: Your AI Memory for Everyday Life","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-14T05:16:32.658643Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2607.11487"},"observation_digest":"sha256:27dc749b2d5f035275671bdc560ce15b90dc9a042b4229c771d0eb40d4669563","observation_id":"7d6ab86a-d0c6-477e-b5d3-a324d5fbe87a","resolution":{"observed_at":"2026-07-14T05:16:32.658643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13654","snapshot_observed_at":"2026-08-05T04:44:30.600425Z","title":"arXiv preprint arXiv:2506.13654 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03979","last_updated":"2026-08-04T17:45:16Z","snapshot_observed_at":"2026-08-08T12:10:34.293322Z","submitted_at":"2026-08-04T17:45:16Z","title":"Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T04:44:30.600425Z"},"links":{"cited_paper":"/paper/2506.13654","citing_paper":"/paper/2608.03979"},"observation_digest":"sha256:692efe0d198b6454294ea3f0e0349acbdc05f5079a847a806789c925ddff985f","observation_id":"2c336cee-0198-4967-87ef-4c11cc1ca7a0","resolution":{"observed_at":"2026-08-05T04:44:30.600425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13654/citation-record","integrity":"/paper/2506.13654/integrity","json":"/paper/2506.13654/citation-record.json","paper":"/paper/2506.13654"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:34:27.715661Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:27.715661Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:20348aa687e6da597a2a3a5fb910259522de09e1ea44bb9f5938482bff13fb5a","observation_id":"77c1d815-7bbd-4456-a308-069b52de66df","resolution":{"observed_at":"2026-08-07T00:34:27.715661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:27.854755Z","title":"Claude 3.5 sonnet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:27.854755Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:1729ac88d18ee1ccad22437c3a9a26aa5eea33645da0e15b575d7e4c0c130163","observation_id":"fb2ff0e1-b835-4ba3-90d6-c1c5ebe72dbb","resolution":{"observed_at":"2026-08-07T00:34:27.854755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T00:34:27.934755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:27.934755Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ed58535160ec5a9d402dcf065dd9a85e1d44e68a1fb8bac7dfb67e9bc2ceb744","observation_id":"ec9bbc5d-975a-4081-8c2e-3c9edd79f5fc","resolution":{"observed_at":"2026-08-07T00:34:27.934755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.038072Z","title":"Hourvideo: 1-hour video- language understanding.Advances in Neural Information Processing Systems, 37:53168–53197, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.038072Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ee2247c2d64676ffaa4c2824a50374d241ea4937e39ec65aee988a809d83d54c","observation_id":"f8097abb-5e8c-4e6b-a2de-e53eb40f8c57","resolution":{"observed_at":"2026-08-07T00:34:28.038072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.116311Z","title":"Grounded multi-hop videoqa in long-form egocentric videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.116311Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:97d5add2bae0a7f3b688b1a05fc0d81c901bbcbb71b1e622557005dc6ba00c90","observation_id":"04155ab7-ec8e-4c92-b802-8000d3153b6a","resolution":{"observed_at":"2026-08-07T00:34:28.116311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.228491Z","title":"Egoplan-bench: Benchmarking egocentric embodied planning with multimodal large language models.CoRR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.228491Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:76ed9bcf8a02dc8cfdfecd8ea60fe0020aae6fa97c0eea26b0b5cc3fd67e8e40","observation_id":"0b910e81-0d1c-4adb-8d5d-e11d9543dcd0","resolution":{"observed_at":"2026-08-07T00:34:28.228491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T00:34:28.324818Z","title":"Longvila: Scaling long-context visual language models for long videos.arXiv preprint arXiv:2408.10188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.324818Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:37022b9369c1fbc28b773da8bfd531cde659ecc5708da061ecee27f9d28300fc","observation_id":"e82aa700-434c-4361-b9f2-dc66b162c905","resolution":{"observed_at":"2026-08-07T00:34:28.324818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.406475Z","title":"Egothink: Evaluating first-person perspective thinking capability of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.406475Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:73d189012416fe8eccc0a89e27967dc89265df8ab4a6adf925c548fdd6810218","observation_id":"1e5864e8-3152-445c-a021-412e78351f40","resolution":{"observed_at":"2026-08-07T00:34:28.406475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.479394Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.479394Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:a376cb63a91c4f092fef9eb2d7cd6368c9c5408086c833da805bb6c062931a73","observation_id":"48277516-df54-46c9-b12a-482e3e8141c2","resolution":{"observed_at":"2026-08-07T00:34:28.479394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:28.631909Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.631909Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:6b8ca247a6aeaa20284babf9fe7a7c01a4a4a07643fb5dd86ec047ed01d269df","observation_id":"37974fcf-67f1-4d7f-8a02-581d624ababb","resolution":{"observed_at":"2026-08-07T00:34:28.631909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-07T00:34:28.767290Z","title":"Open- vlthinker: An early exploration to complex vision-language reasoning via iterative self- improvement.arXiv preprint arXiv:2503.17352, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.767290Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:24f29a449b54f8bada6dee1a4be810c18f87099e69b96e926317f86bec02f7b0","observation_id":"1bb9fd6f-27f8-44b2-a799-f0dc217a43c1","resolution":{"observed_at":"2026-08-07T00:34:28.767290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:49.017080Z","title":"Grounded question-answering in long egocentric videos","venue":null,"work_id":"45b59348-7fe6-4aed-83fc-9d29d9ff9324","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.835969Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:c2d1216b8453d3267b98f524f7c286ba00047a933e388dd82f553187a491477d","observation_id":"63a9ee3b-861f-44c4-833e-201481194c0a","resolution":{"observed_at":"2026-08-07T00:34:49.138120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-07-06T19:53:56.407834Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-07T00:34:28.953249Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models.arXiv preprint arXiv:2411.14432, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.953249Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:1f51c3d6eeb4f89c61fb80f1db501dfb061747a79b429a1bf389c1f4158f1e36","observation_id":"a718607d-b096-44db-8248-2b437ce2e913","resolution":{"observed_at":"2026-08-07T00:34:28.953249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:48.794891Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding","venue":null,"work_id":"6ec08b20-32cf-4736-aaca-df258ac0604b","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.117356Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3502f951dc54b7e3202a224d04f0ac52886d994387ef60865813dc1c495cbc4b","observation_id":"05a88b46-0edf-441e-be1e-6709e73c4ae3","resolution":{"observed_at":"2026-08-07T00:34:48.840240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-07T00:34:29.268798Z","title":"Retool: Reinforcement learning for strategic tool use in llms.arXiv preprint arXiv:2504.11536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.268798Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7a9fb97a0f3ba4dc604715cb7724490f236296ef68228446e6011256f6d19a61","observation_id":"84ada132-884c-47b6-94cb-8bee98ea965d","resolution":{"observed_at":"2026-08-07T00:34:29.268798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T00:34:29.469915Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.469915Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:f2882af25faf9a632c3d0621796196f91b90890f1dbd41c681950a7724e57550","observation_id":"056ac988-be6e-4cdf-868d-b6f4df668eda","resolution":{"observed_at":"2026-08-07T00:34:29.469915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:48.652093Z","title":"The equivalence of weighted kappa and the intraclass correlation coefficient as measures of reliability.Educational and psychological measurement, 33(3):613–619, 1973","venue":null,"work_id":"39e4476b-db76-4ee4-bde5-1f206bfa2004","year":1973},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.593139Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7ad7a967495ad80c9a0b8a4a8fd8d1d26a22afdae94fb909771802c4a5c827dc","observation_id":"ee829ba0-4dd4-4e21-b5b4-ee8e4e8a1ccd","resolution":{"observed_at":"2026-08-07T00:34:48.683570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T00:34:29.704806Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.arXiv preprint arXiv:2405.21075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.704806Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:9a988d4bcd44460071c39d79c47ea036295e29ddc667d0e7c017e866f05ad60e","observation_id":"a280903e-47cb-4ccd-94f3-793f00c266a7","resolution":{"observed_at":"2026-08-07T00:34:29.704806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:48.463429Z","title":"Amego: Active memory from long egocentric videos","venue":null,"work_id":"ec7063f4-0a40-4745-839a-3568440140ff","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.814772Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:44007eae282d3cd8f9b0cca93dd91e1d3cd6f731e84109eb3969524600ef917f","observation_id":"efee3ed6-83c3-4f14-847e-d2e31233d5de","resolution":{"observed_at":"2026-08-07T00:34:48.507874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:29.984751Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:29.984751Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:cd80a7cbcb86283c4edd51df5d7182203042b19c2faa42ab62c7af3666742d91","observation_id":"e9195358-fb87-4ebd-8599-7b26bd391a37","resolution":{"observed_at":"2026-08-07T00:34:29.984751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17452","last_updated":"2024-02-21T12:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:38Z","title":"ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17452","snapshot_observed_at":"2026-08-07T00:34:30.095135Z","title":"Tora: A tool-integrated reasoning agent for mathematical problem solving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.095135Z"},"links":{"cited_paper":"/paper/2309.17452","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:c704936e3f3e3e1ef96311f8c6014bab36017901cfb42723b470f6a359a8d182","observation_id":"f864f294-2cd2-4a2e-aa0e-9c2bd59a2ce7","resolution":{"observed_at":"2026-08-07T00:34:30.095135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:30.170542Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.170542Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:9f22f348c496a5f3e3a5685e1307721b9de97bc714b1c919fc06974b4806e150","observation_id":"e58a8d84-802c-44ed-8dfe-62b7b08ed55d","resolution":{"observed_at":"2026-08-07T00:34:30.170542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:30.323468Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.323468Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3c7fb3ca4c5ebd7d2d4cab87df1c89cf6254aef4f4a7ac9605feaf182624d867","observation_id":"d53dff87-bdbf-4fad-8a7d-b2e660162ca9","resolution":{"observed_at":"2026-08-07T00:34:30.323468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-07T00:34:30.431091Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.431091Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:bcf37b3f1cfcb78d02c7ced4c18b792c0fa161205103c5591ed844da8ef486d7","observation_id":"eb14bfe4-aead-4dd5-9345-b44e27e63e1c","resolution":{"observed_at":"2026-08-07T00:34:30.431091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:48.014334Z","title":"Token-efficient long video understanding for multimodal llms, 2025","venue":null,"work_id":"0c940d57-4abe-4aac-8125-f1de3156fee9","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.665241Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7e7d996a73f5725fc22a3ec137e7c1dd67cd9fdd2dab43e199ab10312edaac33","observation_id":"07905b58-de41-435f-ad73-5b106c5084ce","resolution":{"observed_at":"2026-08-07T00:34:48.184753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T00:34:30.764896Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.764896Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:10ab4b8e6a60b0dee23949228e0adad4d6bf2927e3616a08c8f02432c8e47939","observation_id":"e9efc2bf-6aed-4a91-b6fe-7c0e65536a28","resolution":{"observed_at":"2026-08-07T00:34:30.764896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:30.903806Z","title":"Dwim: Towards tool-aware visual rea- soning via discrepancy-aware workflow generation & instruct-masking tuning.arXiv preprint arXiv:2503.19263, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:30.903806Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:4b2566f0c71d7e80adffbf815cd03fb258d41535a34b7ae33b1f402417249c5d","observation_id":"08665631-7fcd-4bc9-97e6-df55d69ee054","resolution":{"observed_at":"2026-08-07T00:34:30.903806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:34:31.034179Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.034179Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:1ff1531d6bce1f30ea42c3428cf591c8f22bfae5e0fcb33b90888d190457649b","observation_id":"016c1196-e6bb-415d-b6af-530b941c8c3d","resolution":{"observed_at":"2026-08-07T00:34:31.034179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:31.194830Z","title":"Videochat: Chat-centric video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.194830Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:9b1d24d5a9f1f05a1d20b0ce5ec5a89e4d37346fd9d2a8948fa682b7465a8987","observation_id":"c629ab87-098a-4265-8948-64674485df2b","resolution":{"observed_at":"2026-08-07T00:34:31.194830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T00:34:31.307164Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.307164Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3e640a22d68cdf354b046b3724cbba5206ad683101281c3417a8d83d25d182ac","observation_id":"be98b4be-dba1-44c8-bb83-0f574e20da63","resolution":{"observed_at":"2026-08-07T00:34:31.307164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22152","last_updated":"2025-03-28T05:10:59Z","snapshot_observed_at":"2026-08-07T16:31:01.637325Z","submitted_at":"2025-03-28T05:10:59Z","title":"EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22152","snapshot_observed_at":"2026-08-07T00:34:31.617064Z","title":"Egotom: Benchmarking theory of mind reasoning from egocentric videos.arXiv preprint arXiv:2503.22152, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.617064Z"},"links":{"cited_paper":"/paper/2503.22152","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:324806c5f0839dc77289e15b14bce65dc455c8f566fbe6cb5e8c5be18353483e","observation_id":"3185ca9f-fdfd-4cd8-b3d3-5367744f0b2e","resolution":{"observed_at":"2026-08-07T00:34:31.617064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08190","last_updated":"2024-02-21T20:28:13Z","snapshot_observed_at":"2026-07-30T23:49:06.775533Z","submitted_at":"2024-01-16T08:08:01Z","title":"MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08190","snapshot_observed_at":"2026-08-07T00:34:31.944608Z","title":"Mario: Math reasoning with code interpreter output–a reproducible pipeline.arXiv preprint arXiv:2401.08190, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.944608Z"},"links":{"cited_paper":"/paper/2401.08190","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ae7c2cd8e7bd474d2a3e8622cf64c398fb763b4dc729158e528c56deea4dbc5b","observation_id":"e435e1c0-17de-4a56-b516-e273264d7ac2","resolution":{"observed_at":"2026-08-07T00:34:31.944608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00754","last_updated":"2024-11-21T18:52:31Z","snapshot_observed_at":"2026-07-06T18:55:45.493755Z","submitted_at":"2024-08-01T17:57:12Z","title":"Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00754","snapshot_observed_at":"2026-08-07T00:34:32.084749Z","title":"Coarse correspondence elicit 3d spacetime understanding in multimodal language model.arXiv preprint arXiv:2408.00754, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.084749Z"},"links":{"cited_paper":"/paper/2408.00754","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:c62ef3db38a6a0b4ed8f98effa59cea7ab023d6d8cd11ed91fc530c4f1b08e8f","observation_id":"ed1433d7-667b-469a-9390-b35f87b0fbe0","resolution":{"observed_at":"2026-08-07T00:34:32.084749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T00:34:32.189262Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution.arXiv preprint arXiv:2409.12961, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.189262Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:733ae3467d86031d9dea955f44acc1beee0a5078bf36a2cd26fdf970236355b5","observation_id":"98ea8d80-91eb-45a2-b744-d3f1e36301d0","resolution":{"observed_at":"2026-08-07T00:34:32.189262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-07T00:34:32.299228Z","title":"Chain-of-spot: Interactive reasoning improves large vision-language models.arXiv preprint arXiv:2403.12966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.299228Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:b136b3320e7f40ee18da4d6d7dd5c6226f0374390ef3d686e267a3ed494bacf2","observation_id":"b64d36b5-fdc8-43d7-9c26-6476c5b90630","resolution":{"observed_at":"2026-08-07T00:34:32.299228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T00:34:32.454824Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.454824Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:b5e259da66d8c5652ddb459cfb7cdf185ccc1ae4e10004917246a81a1fce61ba","observation_id":"6a229ab0-3baa-4764-bed8-d65f74e078af","resolution":{"observed_at":"2026-08-07T00:34:32.454824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:32.624750Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.arXiv preprint arXiv:2411.13093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.624750Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:0374c06e98e8163077b7e85ef2f12beeb207c1ff9d7aaa9d01024541e82c6c64","observation_id":"20ea198d-1471-437e-95d9-af28d818f29e","resolution":{"observed_at":"2026-08-07T00:34:32.624750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:47.713084Z","title":"Taco: Learning multi-modal action models with synthetic chains-of-thought-and-action, 2024","venue":null,"work_id":"5e8882e8-4f9e-4c42-a112-75f9a8e93eaa","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.784761Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:d26c714fcb5e56630b85f275635e47653313d87d2eca78dc33a90eaafc1d2920","observation_id":"0294306e-54cb-4eb9-bb50-e731bdc16648","resolution":{"observed_at":"2026-08-07T00:34:47.887292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:47.292060Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models, 2024","venue":null,"work_id":"d615c779-ae37-4a31-8f4c-d94a7692c02d","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.884917Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:1d82de20dd65ae387b8d2a03ff6c662ca3430afd7cd528c5fadc8c62a8268af1","observation_id":"d50bc019-234a-4f69-8934-83d8e9e137b2","resolution":{"observed_at":"2026-08-07T00:34:47.552435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:32.974861Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:32.974861Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:cda6bd938398b642a6c2c96132c6d2d097724aa32cf6ecd6a2510a2c7431e4d2","observation_id":"a3bd5bb5-9a28-4015-84ca-b80cf9816fed","resolution":{"observed_at":"2026-08-07T00:34:32.974861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:33.174757Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.174757Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:a40929e8e803da44c9e726b5e95f5c0345206d1786d665a64760257b1ad3babc","observation_id":"f4daed76-de73-4fba-99d2-6b20fada6f4a","resolution":{"observed_at":"2026-08-07T00:34:33.174757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:33.282474Z","title":"Introducing gpt-4.1 in the api, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.282474Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:292b7e4302222c9bafdb928fbc947ced3d9518af99163e34cec593c0900bb09e","observation_id":"d4f0092c-7af2-4866-aa21-fc927993833c","resolution":{"observed_at":"2026-08-07T00:34:33.282474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:33.376167Z","title":"Openai o3 and o4-mini system card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.376167Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:598f9b6e1d6d80e5bba4bcc16c4ef65268a3150ff42eb81d127d0a929ca7879a","observation_id":"02234b0c-54bf-4d1f-b1c2-17aaa52408e9","resolution":{"observed_at":"2026-08-07T00:34:33.376167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12255","last_updated":"2022-05-24T17:58:13Z","snapshot_observed_at":"2026-08-07T07:09:50.694532Z","submitted_at":"2022-05-24T17:58:13Z","title":"TALM: Tool Augmented Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12255","snapshot_observed_at":"2026-08-07T00:34:33.555377Z","title":"Talm: Tool augmented language models.arXiv preprint arXiv:2205.12255, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.555377Z"},"links":{"cited_paper":"/paper/2205.12255","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:1d90b14029c476ecb0f859cb33fa01103d345c9bc29c4d5d03d0bcaf0862891f","observation_id":"682ef09d-1204-4ced-b32a-c2d0d4b805bf","resolution":{"observed_at":"2026-08-07T00:34:33.555377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-05T14:19:26.939328Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-07T00:34:33.661243Z","title":"Hd-epic: A highly-detailed egocentric video dataset.arXiv preprint arXiv:2502.04144, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.661243Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:681542c5eac95227d3909c36b0042a853ccde626b2dc664ebcd7e54106a81be5","observation_id":"7c640ee3-a711-4b62-a391-8a8c515ba6f7","resolution":{"observed_at":"2026-08-07T00:34:33.661243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-07T00:34:33.755199Z","title":"Toolrl: Reward is all tool learning needs.arXiv preprint arXiv:2504.13958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.755199Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:a1b890e9161f82aa6088db5179d03772ff0bc43f6bbff0b08d2129329db20dd5","observation_id":"2faef582-a453-4cc7-9aea-2afeffe60fa8","resolution":{"observed_at":"2026-08-07T00:34:33.755199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-07T00:34:33.845268Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis.arXiv preprint arXiv:2307.16789, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.845268Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:6142c21b482bc0eff93bab0ab96936ca998473354d9d84444dcc6f25cdd5341c","observation_id":"8ca254fd-421f-492f-8ebb-8a906aa7b788","resolution":{"observed_at":"2026-08-07T00:34:33.845268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:46.734747Z","title":"Does your vision-language model get lost in the long video sampling dilemma?, 2025","venue":null,"work_id":"72a1ecd0-b813-4d5e-89bd-81f1c7729a51","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:33.944845Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:fc7796ef2293f6255c5dc3d2685a5046bbd6ce600ece7337454248b80e282886","observation_id":"ca93dab1-70b7-4cb6-98ec-8236c5b4fd98","resolution":{"observed_at":"2026-08-07T00:34:46.930358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:46.395623Z","title":"Action scene graphs for long-form understanding of egocentric videos","venue":null,"work_id":"c33c68f3-6d7f-462b-8e43-b3695ac0bfda","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.034827Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:dd12222319c8f901bd576e1eb4fda453d905d8414a458406e1a160821d1afa6b","observation_id":"bfa7678d-da38-4f4a-91d2-65d77ef1e83d","resolution":{"observed_at":"2026-08-07T00:34:46.496211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:46.128729Z","title":"Toolformer: Language models can teach themselves to use tools.Advances in Neural Information Processing Systems, 36:68539– 68551, 2023","venue":null,"work_id":"ac11e55e-208d-4d0d-b80c-3d94eafc30e9","year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.145870Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:617290bc2a30a6cd4aa24a50a9f77392212a165daf8e677f48520f45e3595053","observation_id":"42e2d3ce-dc0a-4e83-aece-cb79bc4834ad","resolution":{"observed_at":"2026-08-07T00:34:46.227231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T00:34:34.295555Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.295555Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:d3f1fcac9e45d4f501f4db5e2f32a62bfeae113c9fd1e781b0710b03f91f20d9","observation_id":"d3e0efdd-9c31-4ba4-977e-6f5b56a44954","resolution":{"observed_at":"2026-08-07T00:34:34.295555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:34.522339Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoorthi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.522339Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:f6746d16ee2241ec35516dbbbd3617eeefe1e66bccf5e8686daf628d1559e2c9","observation_id":"af796e8e-0e42-4619-a00b-d47a6e9c0d34","resolution":{"observed_at":"2026-08-07T00:34:34.522339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:45.767605Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding, 2024","venue":null,"work_id":"6f9c57fa-371e-4503-9ec8-7fa0a0c5aeb9","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.651708Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:478ee84ea2b71965f72a45975a0f0b636b2e717aa14e2d3405751496c3777e89","observation_id":"801deda3-d498-4980-8b95-b9ddb2588e39","resolution":{"observed_at":"2026-08-07T00:34:45.864825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:45.343793Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"cae3b5aa-bfaf-4f84-8079-f682ce6ad188","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.778221Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:6eb35484f05a5c669f2ab117a7c48c05e35fa0f0eec56d06b9c286d2cae0a7b0","observation_id":"927d623b-5136-49a0-9169-9f941d2b0ab7","resolution":{"observed_at":"2026-08-07T00:34:45.577610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:45.094798Z","title":"Ego4d goal-step: Toward hierarchical understanding of procedural activities.Advances in Neural Information Processing Systems, 36:38863–38886, 2023","venue":null,"work_id":"0524a6e0-1e14-468b-b430-52ab6c512d60","year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:34.985585Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7b6ba5a982f7c1b733f6dfc8a2b8298460abf8b44f3142d1729af7dc0250183b","observation_id":"538b414f-b625-4a72-9922-df5956c5d97c","resolution":{"observed_at":"2026-08-07T00:34:45.235132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:44.784817Z","title":"Openthinkimg: Learning to think with images via visual tool reinforcement learning, 2025","venue":null,"work_id":"10022e6d-c76d-4c2a-91a0-1672ef62cae2","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.114748Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:433728a2ce9f9806a1717efdd1fe8388df2f31a3a2c42c93afe15d40e4512e6d","observation_id":"fee4ebd7-a425-485a-8833-8add7c4bf034","resolution":{"observed_at":"2026-08-07T00:34:44.957037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:44.412727Z","title":"Egotracks: A long-term egocentric visual object tracking dataset.Advances in Neural Information Processing Systems, 36:75716–75739, 2023","venue":null,"work_id":"bb8af7ac-c62f-4f1a-96f1-c9bd5699e998","year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.235816Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:8f049c16fc4f3a5f88f10a71fb6d3652422517bdd70a1c6a90be60e56220c105","observation_id":"3dc1e182-de8f-47fa-8b49-4a158309394e","resolution":{"observed_at":"2026-08-07T00:34:44.564617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T00:34:35.334942Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.334942Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:d716c3e15e7bf31c771c9797bcbf3e22b06fc2e57ab973801b295ab86082186d","observation_id":"d583ca93-973d-4c47-9a5e-7ea95bf9be32","resolution":{"observed_at":"2026-08-07T00:34:35.334942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T00:34:35.434855Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms.arXiv preprint arXiv:2501.06186, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.434855Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:095e275cc124907e99bae4c8c1a86703e64d29cb8784148053758eeb712890bd","observation_id":"403ae0c8-4d4a-4692-be7f-3b812a64bed0","resolution":{"observed_at":"2026-08-07T00:34:35.434855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14870","last_updated":"2025-05-31T20:08:42Z","snapshot_observed_at":"2026-08-08T02:02:02.959157Z","submitted_at":"2025-04-21T05:40:05Z","title":"Acting Less is Reasoning More! Teaching Model to Act Efficiently","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14870","snapshot_observed_at":"2026-08-07T00:34:35.524752Z","title":"Otc: Optimal tool calls via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.524752Z"},"links":{"cited_paper":"/paper/2504.14870","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ed4f0c0fbe9d393cb15f7c61262839a0b9e1c3898441883d0c0af86ab0566484","observation_id":"71e6db71-59c1-4988-b623-b51841b9e338","resolution":{"observed_at":"2026-08-07T00:34:35.524752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03731","last_updated":"2023-10-05T17:52:09Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:52:09Z","title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03731","snapshot_observed_at":"2026-08-07T00:34:35.704789Z","title":"Mathcoder: Seamless code integration in llms for enhanced mathematical reasoning.arXiv preprint arXiv:2310.03731, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.704789Z"},"links":{"cited_paper":"/paper/2310.03731","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:f8e6b63185e40ac43aec21af3e572e97fd8e3842d4f6524306ff195e68dc8d5b","observation_id":"5c171505-cd23-422d-9e0a-4bcda81e82f7","resolution":{"observed_at":"2026-08-07T00:34:35.704789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-07T15:56:47.824864Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02867","snapshot_observed_at":"2026-08-07T00:34:35.817428Z","title":"Resanything: Attribute prompting for arbitrary referring segmen- tation.arXiv preprint arXiv:2505.02867, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.817428Z"},"links":{"cited_paper":"/paper/2505.02867","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:c30022fe608d3a73ba5bc403459b1b11c8f795330ee04d5924e1920a82805dac","observation_id":"02ca7b66-8a4a-412c-a107-88844dd75ccc","resolution":{"observed_at":"2026-08-07T00:34:35.817428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:35.924786Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:35.924786Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3c169d19411461d029739d46ed6b4a1cf6ff65f71cc2763a06f1f520c14312bd","observation_id":"eed1c324-086e-462a-892f-bdf86347d5f7","resolution":{"observed_at":"2026-08-07T00:34:35.924786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T00:34:36.092629Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.092629Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:f81bf4871b2bb56aa0ccb6149452eb7c6c92f33da94fb7da5e5ebe2d8b2003e2","observation_id":"bdd91320-29dd-4a1d-9682-0486a7bc0404","resolution":{"observed_at":"2026-08-07T00:34:36.092629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05269","last_updated":"2024-11-05T22:08:14Z","snapshot_observed_at":"2026-08-01T08:49:09.735566Z","submitted_at":"2023-12-07T19:19:25Z","title":"LifelongMemory: Leveraging LLMs for Answering Queries in Long-form Egocentric Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05269","snapshot_observed_at":"2026-08-07T00:34:36.222356Z","title":"Lifelongmemory: Leveraging llms for answering queries in long-form egocentric videos.arXiv preprint arXiv:2312.05269, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.222356Z"},"links":{"cited_paper":"/paper/2312.05269","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:e7fcb8ed8051d84793b36e4728bf729d43adbac97a213055a91720f3da052d74","observation_id":"09e77375-5a56-42d8-abc5-9c5285e27993","resolution":{"observed_at":"2026-08-07T00:34:36.222356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19209","last_updated":"2025-03-14T13:57:16Z","snapshot_observed_at":"2026-08-05T17:33:53.862042Z","submitted_at":"2024-05-29T15:49:09Z","title":"VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19209","snapshot_observed_at":"2026-08-07T00:34:36.343155Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos.arXiv preprint arXiv:2405.19209, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.343155Z"},"links":{"cited_paper":"/paper/2405.19209","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3e88ce4e146e988ea57f146109d3be0750e1c5d9dad74e354348be568f7ac974","observation_id":"fd24e478-93f4-46ad-87fa-1ca87619db4e","resolution":{"observed_at":"2026-08-07T00:34:36.343155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:36.414746Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.414746Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:55f84211653e46c2bf90aa101c7e46d46bfc12a56f66c04e86ddc2db6a4d1f1a","observation_id":"902f15dd-bdd0-4330-b8eb-f081805dc878","resolution":{"observed_at":"2026-08-07T00:34:36.414746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:44.167089Z","title":"Longvlm: Efficient long video understanding via large language models, 2024","venue":null,"work_id":"ee680a96-0adc-414b-963f-e21bdc7ce886","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.564826Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:03ab7bfaf5a5eeb1ef4b56996a42076a659d4751c13937cc4bc48e7af19f1597","observation_id":"c05ca396-a014-45a9-8047-8f4f24c7c12d","resolution":{"observed_at":"2026-08-07T00:34:44.265636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:36.694838Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.694838Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:6c84a91dea5f7081ba00a5d6aa5a996c3471f4cf8ad390c75476d8b611a5ad5b","observation_id":"6bff34e6-1b41-4f46-b402-c6ace4595e26","resolution":{"observed_at":"2026-08-07T00:34:36.694838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-07T00:34:36.765233Z","title":"Grounded chain-of-thought for multimodal large language models.arXiv preprint arXiv:2503.12799, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.765233Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:4c4e4d6a6cf63ecd1fc82f8e85123f5c9a5d8a567be2c5030fbfd76d7a35d4fa","observation_id":"2ea0c3d6-bc3a-43b0-b421-951261aefd76","resolution":{"observed_at":"2026-08-07T00:34:36.765233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T00:34:36.884832Z","title":"Llava-o1: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:36.884832Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:208b5c7ec391cc3bb76d937c7d737ffde8242895ee40bb95401c40279d1fd750","observation_id":"8600a680-4d36-4d28-8a71-8786249cd788","resolution":{"observed_at":"2026-08-07T00:34:36.884832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:43.744744Z","title":"Retrieval-augmented egocentric video captioning","venue":null,"work_id":"aa0032be-b2f7-40a4-8056-a832cff17f6c","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.035116Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:53d155c20c14d92f5a3e058eb7cc840f672b0e59718073fb743c4792ab9f3f39","observation_id":"892e91a0-7c7f-4878-b4f5-9ea2bdb9b8db","resolution":{"observed_at":"2026-08-07T00:34:43.854826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T00:34:37.189771Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.189771Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:037fb3d5b5d9e060de5d9f5e1b9c81edcea3ac6e92e6f0d6b5dc48f32dda00fa","observation_id":"803ca2df-9a02-4814-a5d3-d1c1baf9d34a","resolution":{"observed_at":"2026-08-07T00:34:37.189771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:43.399120Z","title":"Octopus: Embodied vision-language programmer from environmental feedback","venue":null,"work_id":"34b3244b-fb99-4a85-b477-2eb84db4fe25","year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.307201Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ade3f9cbdbdaa2586a9eaa87ea09fa5445796f5fc0acc44d82d8b16228f337ce","observation_id":"7af531b5-b3fa-4528-9329-0cfeaabc85ee","resolution":{"observed_at":"2026-08-07T00:34:43.493927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:43.148431Z","title":"Egolife: Towards egocentric life assistant, 2025","venue":null,"work_id":"fa786916-6afe-4199-af25-f39e2d01d915","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.455810Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:9a8d6ee1ef8d5cb31806d791495516470fc6e584a86bc342b62307be7f17a168","observation_id":"d3db0406-64cf-4c97-9059-28ae7b940012","resolution":{"observed_at":"2026-08-07T00:34:43.248598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-07T00:34:37.634819Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.634819Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:ce13f83300e7bb3fbbaea8f3fe24e1347a00651b2530136c412cc566fa6b5613","observation_id":"bf5636e5-baec-4cb4-8ef0-755930318bce","resolution":{"observed_at":"2026-08-07T00:34:37.634819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.03238","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:40.303498Z","title":"Fans–formal answer selection for natural language math reasoning using lean4.arXiv preprint arXiv:2503.03238, 2025","venue":null,"work_id":"688f2a2b-2e9e-4aaa-a2ac-826d5b7eb02e","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.810673Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7312dc811f38a6fa76403a987600b6a23bff229058054c6735993100516ee9ed","observation_id":"5bd27a12-b017-4fca-8fcc-d97733421f84","resolution":{"observed_at":"2026-08-07T00:34:40.475550Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:37.907343Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:37.907343Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:0040d765aba1b333da266b3aa3f33a498ed5c832bac639e8e7247044df869471","observation_id":"b651686e-0d6f-408a-ad0e-9c8cca9a66d4","resolution":{"observed_at":"2026-08-07T00:34:37.907343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:42.797872Z","title":"Re-thinking temporal search for long-form video understanding, 2025","venue":null,"work_id":"037087ca-c01c-47d7-9ef4-97ac12463280","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.184402Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:199e54ec692951e865549bed2f75976b066b00fa05fa78885abf79c77aecad9b","observation_id":"e3a801b6-ffdd-4b5f-8250-8ba633dfbdb1","resolution":{"observed_at":"2026-08-07T00:34:42.894034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T00:34:38.344923Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.344923Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:7e64fd4f42694c22b9c3bb41673bff9adae04649006de3596b3c615746823125","observation_id":"19945513-2a41-4fdd-aee4-746b50179f0a","resolution":{"observed_at":"2026-08-07T00:34:38.344923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T00:34:38.476955Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.476955Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:646d70d9f4c5a634fe12c677789794f97594e1d235466df9833ce581ac2f84a4","observation_id":"d807b7f7-e6c9-475d-93ee-a9cd1cf256d3","resolution":{"observed_at":"2026-08-07T00:34:38.476955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:38.854867Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.854867Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:f626b2965f9b0b3472fdd3e941c91554ce09860df86d800467a065166f6e7791","observation_id":"6a5704f4-5d7c-4a26-88f5-f0bc04d41b62","resolution":{"observed_at":"2026-08-07T00:34:38.854867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-07T00:34:38.995006Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments.arXiv preprint arXiv:2504.03160, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.995006Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:98bcf739e93317b74f40f77b5c4c8b6159f0e7e856aaae3e0b2b222a52877d2c","observation_id":"bcd6bd6b-e740-4f15-8423-b6b03dccf5de","resolution":{"observed_at":"2026-08-07T00:34:38.995006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:42.474054Z","title":"Videoagent2: Enhancing the llm-based agent system for long-form video understanding by uncertainty-aware cot, 2025","venue":null,"work_id":"99ab4d8d-3687-47a1-853b-6660aa8e8818","year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:39.161275Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:9ade9548cd2ee9c56d894ebfbdffe1933edbbec35326234a13fc722057475c18","observation_id":"f0ed8dc1-b5e8-40de-8926-ee09a359e1be","resolution":{"observed_at":"2026-08-07T00:34:42.583883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07921","last_updated":"2023-08-15T17:58:45Z","snapshot_observed_at":"2026-08-08T02:31:17.924386Z","submitted_at":"2023-08-15T17:58:45Z","title":"Solving Challenging Math Word Problems Using GPT-4 Code Interpreter with Code-based Self-Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07921","snapshot_observed_at":"2026-08-07T00:34:39.345662Z","title":"day”levelbackwardfromDAY3_16391802,usingthekeyword“supermarket","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:39.345662Z"},"links":{"cited_paper":"/paper/2308.07921","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:47b9de31f369dede8cd497820ecbecb685b494dfaa79fc936dcde6ed00c98b6c","observation_id":"75d6ff91-e960-4f8e-af03-926e0ab8e6dc","resolution":{"observed_at":"2026-08-07T00:34:39.345662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:34:42.254690Z","title":"name \" :","venue":null,"work_id":"a78afe5b-0ffb-4b92-ab86-1cb321a0be9a","year":null},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:39.654749Z"},"links":{"citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:adcdcb44fe4a533a8285e9782e2014c34ad396a43fa078a3f591cd1258ea8b1e","observation_id":"1b93aa26-4d71-4a60-90a5-65d3013b49de","resolution":{"observed_at":"2026-08-07T00:34:42.366546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 17 inbound Pith citation observations for arXiv:2506.13654."}