{"as_of":"2026-08-07T22:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6849124fb639f42497ae1c5f1c1a3ed5ce89c8aa06e58506555b72c3105da07d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:41:08.568366Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:48:02.918791Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:b2d11dc77063cc7f5235c96dcd845496cd7b61ced390da90045075500995661f","observation_id":"51649a7d-f4f2-4ec0-8e87-21456cbedbd9","resolution":{"observed_at":"2026-05-17T02:52:20.833571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:21abc1aec09cd1a0a5f9398ae0f1bea49c34723ebcbac5ac4e5b7c3ce3cb9386","observation_id":"3ca642b1-742d-46e3-9920-106d019fb4c1","resolution":{"observed_at":"2026-05-11T01:20:00.181502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T15:41:08.568366Z","title":"Apollo: An exploration of video understanding in large multimodal models.arXiv:2412.10360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14321","last_updated":"2025-05-20T13:07:55Z","snapshot_observed_at":"2026-08-07T15:34:19.390004Z","submitted_at":"2025-05-20T13:07:55Z","title":"Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:41:08.568366Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2505.14321"},"observation_digest":"sha256:368fd70f7c62b377a8a21ec1c8f0d7eba4e4e5511d31b61a29fd60389c0aebf4","observation_id":"73db5c87-2b89-4b6e-abd9-9da8866b837f","resolution":{"observed_at":"2026-08-07T15:41:08.568366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T15:34:55.930004Z","title":"Apollo: An exploration of video understanding in large multimodal models.arXiv:2412.10360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-07T20:35:28.075030Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.930004Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:d8867a32786b8801a65f8c7f04bf74d847c5293fe3399e337e36d3212c0c4aac","observation_id":"208b340b-771f-4eda-aa3a-b4fde362b2f0","resolution":{"observed_at":"2026-08-07T15:34:55.930004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T14:14:47.811975Z","title":"Apollo: An exploration of video understanding in large multimodal models.arXiv preprint arXiv:2412.10360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-07T14:07:13.987973Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:47.811975Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:431c273d68a45f2b7fa481a6a08f481d097393b910ee5b7913989bf243b05665","observation_id":"3e01e98a-c288-4951-bc8a-ad6f1c0fdcf2","resolution":{"observed_at":"2026-08-07T14:14:47.811975Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T12:37:24.588694Z","title":"A. High heels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-08-07T12:29:44.012678Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:24.588694Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2505.24158"},"observation_digest":"sha256:d131c5efda5319d56c3f7eb49642d1c5b55aa6eb757612d3a69106226f8bf0db","observation_id":"447bbede-b0be-4fbc-9feb-22827ba5a7bd","resolution":{"observed_at":"2026-08-07T12:37:24.588694Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T11:59:11.354129Z","title":"Apollo: An exploration of video understanding in large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-07T11:51:01.535430Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:11.354129Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:c2d75d3dd284dafc32f0a2597f70442a931ab31be5065cfb66ca2bb0ad61f29e","observation_id":"0ff19277-4d81-42ea-a6ca-e0b1fdb91644","resolution":{"observed_at":"2026-08-07T11:59:11.354129Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T11:18:16.401147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-07T11:06:24.823592Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:16.401147Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:fdf6a29c59f3555d9adaf9f12cbadbd9b761ab6411756d71f34dc4c606a6462a","observation_id":"1ab9b6da-ae28-476b-9d98-ef9bd5fe884c","resolution":{"observed_at":"2026-08-07T11:18:16.401147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-07T05:41:39.827734Z","title":"Yes” (confirming the presence of information in the video) and another “leading/hallucinated","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07371","last_updated":"2025-06-10T13:33:53Z","snapshot_observed_at":"2026-08-07T10:51:02.440475Z","submitted_at":"2025-06-09T02:42:13Z","title":"ARGUS: Hallucination and Omission Evaluation in Video-LLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:39.827734Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2506.07371"},"observation_digest":"sha256:2f61dbee2dfafcbb53aa2012f2537178b2415644e4ea47fde95c4d565c3af694","observation_id":"1645717c-29a1-4eb3-8e9f-e7e2978c2325","resolution":{"observed_at":"2026-08-07T05:41:39.827734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T22:24:36.976093Z","title":"Apollo: An exploration of video understanding in large multimodal models.arXiv preprint arXiv:2412.10360, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-07T08:24:31.697101Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:36.976093Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:3ef9d4162493ce824409f494f046d850af8a1996791343a642966a9b1d7053c5","observation_id":"aff8f26f-bed7-41c0-a3c2-a8a286242dcd","resolution":{"observed_at":"2026-08-06T22:24:36.976093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T20:29:57.031289Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-07T06:17:01.457380Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:57.031289Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:1bfdcbe44938bef0d88575b10712615ee0507536594f13688683785fb05cf37f","observation_id":"0a20b61a-a85a-4611-93dc-11fbe6e68ff3","resolution":{"observed_at":"2026-08-06T20:29:57.031289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T17:55:45.498173Z","title":"id\": \"\",","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09693","last_updated":"2025-07-13T16:09:58Z","snapshot_observed_at":"2026-08-06T19:46:33.050466Z","submitted_at":"2025-07-13T16:09:58Z","title":"ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:55:45.498173Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2507.09693"},"observation_digest":"sha256:6d10c4831a72f082a00c8bc11890d7f02ad00721dcd01d7faf07ba0384789891","observation_id":"5f9be675-8665-4051-ba81-0ff362f1473c","resolution":{"observed_at":"2026-08-06T17:55:45.498173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T05:15:43.575145Z","title":"left” and “right","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02094","last_updated":"2025-08-04T06:05:36Z","snapshot_observed_at":"2026-08-06T05:14:34.110582Z","submitted_at":"2025-08-04T06:05:36Z","title":"\"Harmless to You, Hurtful to Me!\": Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-06T05:15:43.575145Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2508.02094"},"observation_digest":"sha256:f4674e28ef52c671b6c234a0c0041982b548a36d41043e9b54b553cfe0d972aa","observation_id":"44079027-0ad8-4f25-8acd-0306ad0d4fb3","resolution":{"observed_at":"2026-08-06T05:15:43.575145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-06T05:12:38.512195Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-06T05:12:28.147197Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.512195Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:f287f71e75035575b99423f8cd735492f010584f4e06562b478307564dc05246","observation_id":"6cf8de07-4242-40f0-a445-23d5848dd7d5","resolution":{"observed_at":"2026-08-06T05:12:38.512195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-05T11:27:47.145067Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02807","last_updated":"2025-09-02T20:21:11Z","snapshot_observed_at":"2026-08-05T11:27:46.361625Z","submitted_at":"2025-09-02T20:21:11Z","title":"PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:27:47.145067Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2509.02807"},"observation_digest":"sha256:ad423e8659a4216f767b77232fa7a1644ddfe218816797e27176b9c7d19194e4","observation_id":"4ebc1d82-7cb1-49f5-9264-9aaf78b8426d","resolution":{"observed_at":"2026-08-05T11:27:47.145067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:95e032176c6b0dbaa93852192aabff97f10824bf34cc1eb420b764ca87bd0098","observation_id":"bf372c0d-9bca-492b-a2ab-78d4e97b3cb7","resolution":{"observed_at":"2026-05-16T22:21:18.860880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2604.17375","last_updated":"2026-04-19T10:58:40Z","snapshot_observed_at":"2026-08-02T21:21:44.410489Z","submitted_at":"2026-04-19T10:58:40Z","title":"When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T06:41:59.641410Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2604.17375"},"observation_digest":"sha256:c27fa5435ffb9fd7f2d2b28aff6fd621c793c19d5d49952549df995ccc40e352","observation_id":"318777ff-820e-4174-8411-3e46e8365194","resolution":{"observed_at":"2026-05-10T06:46:37.520929Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2605.21625","last_updated":"2026-05-20T18:36:57Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:36:57Z","title":"Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T09:20:32.920925Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.21625"},"observation_digest":"sha256:b423502b1deb640891cdfdba675796ff48fd56c1f178d793b8147f86aa537bae","observation_id":"e639179c-8052-4189-8f40-7fd587b4e7c3","resolution":{"observed_at":"2026-05-22T09:21:20.639077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:bc93341e55f7020baf2745ed7df195c0239fefa0484989066890afa88415b35a","observation_id":"0a37124e-a73b-4485-b966-0c8d1371122d","resolution":{"observed_at":"2026-06-29T22:13:59.596352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-12T15:34:37.002001Z","title":"Apollo: An Exploration of Video Understanding in Large Multi- modal Models, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T15:34:37.002001Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:e6a68d838bcebebc688d26051e504c1245b517fc9cda666bc12bf7242e33a350","observation_id":"3113e5cd-019c-4b5e-9caf-e93928e905c7","resolution":{"observed_at":"2026-07-12T15:34:37.002001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-14T18:39:24.915547Z","title":"Apollo: An Exploration of Video Understanding in Large Multi- modal Models, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T18:39:24.915547Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:06b47a8441cb98b255cc153644b2fdcdc86210d4253301c3c8b96b2569168b28","observation_id":"842d6468-15ae-4852-8695-f90881a5b040","resolution":{"observed_at":"2026-07-14T18:39:24.915547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2605.31029","last_updated":"2026-05-29T09:01:56Z","snapshot_observed_at":"2026-07-06T23:40:12.939143Z","submitted_at":"2026-05-29T09:01:56Z","title":"PEEK: Picking Essential frames via Efficient Knowledge distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T22:46:53.704892Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2605.31029"},"observation_digest":"sha256:91036526993feb468d1f1899617c1f89594130c3227b2a0c9f9ba1678cac58dc","observation_id":"e62a9e4e-ff01-4793-b538-68d25de14127","resolution":{"observed_at":"2026-07-01T19:16:01.314765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":263,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:8c55ccc2db5a89ea96e3460535ea299eed2c0b171f57d162ab1eab931e796271","observation_id":"1b33d8c6-4bb1-49b1-bbfa-ae9e82327cbc","resolution":{"observed_at":"2026-07-03T10:48:02.920378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2412.10360","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-07-03T10:48:02.918791Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","venue":null,"work_id":"a2514001-657a-44cc-8c33-0562df7ac008","year":2024},"citing_paper":{"arxiv_id":"2606.29472","last_updated":"2026-06-28T15:59:31Z","snapshot_observed_at":"2026-08-01T16:45:40.105247Z","submitted_at":"2026-06-28T15:59:31Z","title":"Agent-Computer Observation Interfaces Enable Dynamic Computer Use","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T06:59:20.295818Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2606.29472"},"observation_digest":"sha256:fec0f509270205f2cf044556a8f518a2d735d55bc3a90924096f79c8e4907b5b","observation_id":"c9dbe76f-b26c-4668-9b61-2ec3dea2696c","resolution":{"observed_at":"2026-06-30T07:04:21.211164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10360/citation-record","integrity":"/paper/2412.10360/integrity","json":"/paper/2412.10360/citation-record.json","paper":"/paper/2412.10360"},"outbound":[],"paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T08:59:28.938249Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2412.10360."}