{"as_of":"2026-08-09T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:740baaf21f6f1716231fac0293f0a354154b64258acc6f286e4286e67c9ce4a8","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:03:06.244486Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:40.649758Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:46:04.353404Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20124","snapshot_observed_at":"2026-08-07T14:14:40.649758Z","title":"Tuna: Comprehensive fine-grained temporal understanding evaluation on dense dynamic videos.arXiv preprint arXiv:2505.20124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.649758Z"},"links":{"cited_paper":"/paper/2505.20124","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a58ccfdacbb3e71cdb37daaf8e2e1943dd24951d57c307725b3fa986ce1a72e7","observation_id":"e0a6ae9e-06f8-4ccb-b4df-16bb641e9b7d","resolution":{"observed_at":"2026-08-07T14:14:40.649758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"cited_work":{"arxiv_id":"2505.20124","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20124","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tuna: Comprehensive fine-grained temporal understanding evaluation on dense dynamic videos","venue":null,"work_id":"bd5ebac4-eb10-44a4-a280-08c6e10954ef","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2505.20124","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:6754897a6fe2c6a9acde21004c77f0c933777dbd617132090c0c4c11e0a3a75d","observation_id":"4a43f467-6b72-4538-8332-b8e9ab49a570","resolution":{"observed_at":"2026-05-11T13:46:04.355382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20124/citation-record","integrity":"/paper/2505.20124/integrity","json":"/paper/2505.20124/citation-record.json","paper":"/paper/2505.20124"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.02477","last_updated":"2024-07-02T17:55:03Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:55:03Z","title":"Understanding Alignment in Multimodal LLMs: A Comprehensive Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02477","snapshot_observed_at":"2026-08-07T14:02:59.199626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.199626Z"},"links":{"cited_paper":"/paper/2407.02477","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:10108eef1377ec33fb4d1ea7980feaffef9ba7ea1ad93c2529805d5f1bb1004b","observation_id":"a2e78cdb-1c50-4de0-aa61-8865a41e9cfc","resolution":{"observed_at":"2026-08-07T14:02:59.199626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.246252Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.246252Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:29300c711efc3301e0c9b6e1b89f4ccdaaafb40d64ce315d7264176fb1b46d8b","observation_id":"41705b25-296a-4005-860d-dce17fb10c5c","resolution":{"observed_at":"2026-08-07T14:02:59.246252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.954954Z","title":null,"venue":null,"work_id":"551730d6-a6c6-4489-9dee-3306560844df","year":2005},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.294091Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:3889132554b53137d93234b92838c5a810c3c89aaa5ba986a4be96527530a265","observation_id":"f397b61a-8a5f-4a43-ae33-1993211da792","resolution":{"observed_at":"2026-08-07T14:03:09.003643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.442683Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.442683Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:6b67af9524968489b13f2e7ba9ad08eb05667cfb46297d0f82a0928589ac2b98","observation_id":"df306f69-2a36-4e3e-8c23-a42c8f1ee57e","resolution":{"observed_at":"2026-08-07T14:02:59.442683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.520698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.520698Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:70384d48902eb6316f153d3475a53bc9c432cea05112271329bb0b8ca73224d1","observation_id":"80e16319-d3dc-4d02-8a36-8145025e4d50","resolution":{"observed_at":"2026-08-07T14:02:59.520698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T14:02:59.572640Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.572640Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:fa44fd29234465395b697282cba8f8370ae25ead867150f496f06154c7619f48","observation_id":"0068b704-aecd-46cc-a8c5-175b3944aa05","resolution":{"observed_at":"2026-08-07T14:02:59.572640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-07T14:02:59.661583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.661583Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:f021fcbbd7668ed721e0fa5b5cafa8034cb526dbd2a164704a19b40512150a96","observation_id":"286408a4-2bf5-439d-b8c2-c1f170a644df","resolution":{"observed_at":"2026-08-07T14:02:59.661583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:59.743322Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.743322Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:a37787e08b89e372e88b4b8e1de63505ef9c850a1637233f263e82d7e86a17db","observation_id":"a3aa7095-d028-4925-91ae-e2e3f847ba48","resolution":{"observed_at":"2026-08-07T14:02:59.743322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-07T14:02:59.821440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.821440Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:d4a340ae112e656c29768140d5bf9b43a15c476bc88a63d6be96b4f433350eea","observation_id":"b07fa147-f2c7-48ef-9f80-c9173bc1072a","resolution":{"observed_at":"2026-08-07T14:02:59.821440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T14:02:59.956644Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.956644Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:702977d1db69f936ada3cb9f314eb8eeaeff59ace5e165d44d0a83ab9f862bc6","observation_id":"da4f4b77-7c28-4072-a886-c665760fd6c7","resolution":{"observed_at":"2026-08-07T14:02:59.956644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T14:03:00.079127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.079127Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:720144f948608fc2117ff4a755e8002b00a529e52f18121fce97da5997df2dfc","observation_id":"4626b8e1-9e19-4dcb-8b8b-52c89701e126","resolution":{"observed_at":"2026-08-07T14:03:00.079127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.159794Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.159794Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:fe92777b01b4621ceb8231f0e374d4dade34e40420129de04217dc463f8f1116","observation_id":"b4861b3d-5a97-4ec7-9860-a77518a71238","resolution":{"observed_at":"2026-08-07T14:03:00.159794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.270242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.270242Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:043df56ee8a4159883653afd68a1ccae007165e7ef8c4e9b8671a3cf36c76585","observation_id":"0efa1912-aefd-4af8-9142-d311875dbf8b","resolution":{"observed_at":"2026-08-07T14:03:00.270242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T14:03:00.394498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.394498Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:b59400d39e7d6e74e96c0304f165cf51686cd6d6f7d12ca77dd17a1da5fad152","observation_id":"a19f9c5e-082f-42f2-8df3-e98e009b5aea","resolution":{"observed_at":"2026-08-07T14:03:00.394498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06358","last_updated":"2024-07-08T19:58:59Z","snapshot_observed_at":"2026-08-07T01:27:15.618968Z","submitted_at":"2024-07-08T19:58:59Z","title":"MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06358","snapshot_observed_at":"2026-08-07T14:03:00.523964Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.523964Z"},"links":{"cited_paper":"/paper/2407.06358","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:5b69a0c49267aeaee09f5c2f70a41aadf7e038b3306b30eaf9d1213332f04ee0","observation_id":"81cb9156-82e7-46a4-b478-d22e37d2b0f9","resolution":{"observed_at":"2026-08-07T14:03:00.523964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-07T14:03:00.563577Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.563577Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:7fe0b729334231492f75e870d5034fb409a0436a109968f84d2ab3b0dc7b8910","observation_id":"ee1ebd9e-a9c9-45ae-ae6a-38cd48861805","resolution":{"observed_at":"2026-08-07T14:03:00.563577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:03:00.612315Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.612315Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:6bfa703335ee7d42418dbcbb9efb88655b0aabae25b6b2767a26951c14ca09ac","observation_id":"88da6a61-1098-458e-aae6-1b954ffffd3a","resolution":{"observed_at":"2026-08-07T14:03:00.612315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.817934Z","title":null,"venue":null,"work_id":"f4091335-fc9e-47d9-b8cf-6d0fba66c031","year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.700267Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:38a9e5f8fc5db0cd416a535749c25ea3a216d1707677c09d17d232ce06377648","observation_id":"7a3edf5a-335a-46e3-8640-4596701da0cc","resolution":{"observed_at":"2026-08-07T14:03:08.868288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:03:00.801599Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.801599Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:4970e80cd48a419925e6146770c262f3d141ca43cfcfac9f910deeb062bbbd13","observation_id":"2c500152-2066-4fa1-bda7-fbb376034dcc","resolution":{"observed_at":"2026-08-07T14:03:00.801599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:00.902430Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.902430Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:7a168959c29db0689d89d8b5a89ec084551a907e229cf11899dc66dcbf6ae61a","observation_id":"2f28c05f-7e0f-4e68-a8ed-f7965d2fda89","resolution":{"observed_at":"2026-08-07T14:03:00.902430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.683486Z","title":null,"venue":null,"work_id":"f0d18c60-d63d-4d90-b2ac-0009e4d504f3","year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.002391Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:a606a2a67f91f4ba2c598fd3b30750d4798a82c4b6930542384d4b118f5c6630","observation_id":"f9f4d8f5-6009-45e4-a19e-944027a23dcf","resolution":{"observed_at":"2026-08-07T14:03:08.753423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-04T15:53:11.168523Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-07T14:03:01.131871Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.131871Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:320e75f97a4e31bb9be3a0ab2798d9ec61df8c29630d2237ae44e38ea688343c","observation_id":"fc66876d-c16b-4d4b-977f-7b397612597f","resolution":{"observed_at":"2026-08-07T14:03:01.131871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T14:03:01.247504Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.247504Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:4934dedabbd76991b5378404db7582ce6eae289bd7d98fabd56babbf4a6effd5","observation_id":"ef150987-a2c5-45e0-a3d5-702b85fe7a7c","resolution":{"observed_at":"2026-08-07T14:03:01.247504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.560363Z","title":null,"venue":null,"work_id":"690af7fe-c400-4f4b-9d2d-03ec177e197c","year":2004},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.395106Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:ea2a92e6029ca773a6d8926e773c754b893fbf007780c994b956f286e7c8a0b9","observation_id":"fdc38e7b-2f62-4df1-90fe-f9e2af9676f2","resolution":{"observed_at":"2026-08-07T14:03:08.613580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:01.472952Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.472952Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:365381d232ca1ab0de9ec7a13cdff46668ed42b583ceb607c3f773a61179d333","observation_id":"939917f6-b643-4797-8579-7fd096dd09fa","resolution":{"observed_at":"2026-08-07T14:03:01.472952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:01.537050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.537050Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:3035b51de8e075642228eb58fbce3cfb71359d093f1a9ceb99449b3f453a7067","observation_id":"eaf1a766-f09c-4e41-81bb-9f2a1980feff","resolution":{"observed_at":"2026-08-07T14:03:01.537050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:01.649741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.649741Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:b51d909a974cd35e29071a43ec40e2a6506785c7eb5fc8c0f5cf597b6da02f70","observation_id":"823e7951-5281-48db-96cf-5fbfa37e4a81","resolution":{"observed_at":"2026-08-07T14:03:01.649741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-07T14:03:01.765688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.765688Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:bde36e2ecc7191a5d21d9a2a0fe6c1a5cf50dfc3f6d38d2b4324363893dbe09c","observation_id":"06c314bb-4e5b-4358-8610-210596f6fd2f","resolution":{"observed_at":"2026-08-07T14:03:01.765688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.392014Z","title":null,"venue":null,"work_id":"c00e2a72-fe46-4e6f-9040-d5f3bec94916","year":2025},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.863307Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:c7f10bd7c9a8b6cf4159d7b2a851858e3eb7c3fbc4b9428972459da6b91eb68c","observation_id":"2708f173-e9f6-4777-bc34-1c8c981b00c6","resolution":{"observed_at":"2026-08-07T14:03:08.460404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.772","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:06.319034Z","title":null,"venue":null,"work_id":"f02dca9c-6130-4c02-910f-08742101aff6","year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:01.985384Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:025faae66241357eabad85618bf8cab51b8fe4fbb510276fe441fd4a0d44759a","observation_id":"b0da131c-681c-43d1-b8fb-429e428d7ddc","resolution":{"observed_at":"2026-08-07T14:03:06.407763Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.271736Z","title":null,"venue":null,"work_id":"8c2cf730-939c-4787-8807-0384281bdc86","year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:02.097684Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:5d1d1858d0ae841f27fe0ff8e3a6f23f76e1b322de3f8c406cdfd1eea8007e9e","observation_id":"f6b2953b-07dd-4141-9b12-7b53440de8a4","resolution":{"observed_at":"2026-08-07T14:03:08.331787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T14:03:02.241996Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:02.241996Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:060a09ac2d71ef47150d8fd0bf1118d6662d2763eaa9746a0b29cc1c9b3df376","observation_id":"1a75c005-db20-4cb0-81a9-836b5db1d00b","resolution":{"observed_at":"2026-08-07T14:03:02.241996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T14:03:02.338167Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:02.338167Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:20786fb2d69ce4812764ac79877d674bf36e2549cfbda969bad17cab6bbf2e04","observation_id":"814615de-d147-4635-acdd-43e0022c6a84","resolution":{"observed_at":"2026-08-07T14:03:02.338167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-07T14:03:02.474751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:02.474751Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:fa8f9174dfa504bac0e8b8153365d83a222fb08d55799dd10fd2d3af8843f6c6","observation_id":"f82032cd-ba4f-40fb-82a5-c206f06c27c6","resolution":{"observed_at":"2026-08-07T14:03:02.474751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:02.600039Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:02.600039Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:3b95dd6406f9c3fedb05d31611e2b44b89a8f329ce7c7ba06271670edcc1249c","observation_id":"64c62bc4-45ba-466d-b1f0-16217a8a3487","resolution":{"observed_at":"2026-08-07T14:03:02.600039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.143431Z","title":null,"venue":null,"work_id":"422a61dc-7eee-456e-8562-6c96f050267b","year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:02.730496Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:a0c374b20b218ff247c40e9faa5ea567c7b39b3465c70a15caf8297c894dcdd0","observation_id":"6045837f-b5fc-435c-b5bc-db17e642bb90","resolution":{"observed_at":"2026-08-07T14:03:08.181720Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05615","last_updated":"2026-05-12T03:37:41Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-09T02:36:28Z","title":"Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05615","snapshot_observed_at":"2026-08-07T14:03:02.880664Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:02.880664Z"},"links":{"cited_paper":"/paper/2406.05615","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:d8e9b5fbffa883f1cf121be1c4567e63161a67df480cf2c8c9717475db2f82fc","observation_id":"f193fbcd-8a53-448d-81b8-fe09f3edb86b","resolution":{"observed_at":"2026-08-07T14:03:02.880664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:03.032042Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.032042Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:ba0624a1280edbfc389878cd09d34412da263b359595879d5b666af6e957f72a","observation_id":"6d75305c-4f53-45f0-97b3-b2dc4ef734d6","resolution":{"observed_at":"2026-08-07T14:03:03.032042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-07-06T16:27:47.445841Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T14:03:03.103132Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.103132Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:dfaa82784db63633ad97a5db6c42beeb785a50b0208219d43d4ac2685285871b","observation_id":"bcf822f8-01b4-4cdd-a64d-b01db4ae688a","resolution":{"observed_at":"2026-08-07T14:03:03.103132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:03.200373Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.200373Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:4b590755f0da7f324b931976b085ffa338d82d0c204db8dbbbb294b1b1898182","observation_id":"45cc3515-caa7-461f-ac3c-8ce2ac862378","resolution":{"observed_at":"2026-08-07T14:03:03.200373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:08.017904Z","title":null,"venue":null,"work_id":"98a72ec8-2721-448a-8f0b-adf2710b3545","year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.298169Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:d392d4f84328bcaeed5c122a8b80a4f16194511fb9bda7e00494368c420361b9","observation_id":"20e9437e-6383-4d8d-8bdf-f9ce4e318449","resolution":{"observed_at":"2026-08-07T14:03:08.059921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.897532Z","title":null,"venue":null,"work_id":"f968a7a4-8ae6-4bcb-b424-7ef47c49e06f","year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.381534Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:45a8d3292038eb91a2acb2ded6f719eb1f7408a7ddd5c1f99b8c787ed2afc7bc","observation_id":"e206d0a8-c434-41f9-9fbf-de7113a64fd3","resolution":{"observed_at":"2026-08-07T14:03:07.962130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.790920Z","title":null,"venue":null,"work_id":"48dc8ca9-ca02-4848-9114-8b1ef9d3d342","year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.463228Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:f79a88293ee5df6fefd95a4fa72297755fce3ba3294cbf2e5ba4501c3da5d43f","observation_id":"009a03e2-e055-4955-b7cd-101054a0af00","resolution":{"observed_at":"2026-08-07T14:03:07.847620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T14:03:03.532534Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.532534Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:77a2c5b2da9838e62297dcfc3a3d586625b9716094f2315566bf88ef5a645c06","observation_id":"402c1531-b64c-435c-ad8c-4374b7d67849","resolution":{"observed_at":"2026-08-07T14:03:03.532534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T14:03:03.622919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.622919Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:67849563225c097f6e60d62d9a51aa142df771f9777feac9dfe561a7789242c8","observation_id":"df2f6b77-c048-4a91-bd1f-0b4b0a405676","resolution":{"observed_at":"2026-08-07T14:03:03.622919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10889","last_updated":"2025-03-30T14:07:22Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T10:42:21Z","title":"VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10889","snapshot_observed_at":"2026-08-07T14:03:03.688658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.688658Z"},"links":{"cited_paper":"/paper/2406.10889","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:95a63b0014c2748aa0a454c2a1b04daf4537eddad2db0aea21a12e3dbf00fa8d","observation_id":"796d7a1c-a07c-4139-af8b-cce63c3964a0","resolution":{"observed_at":"2026-08-07T14:03:03.688658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-08-07T14:03:03.750220Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.750220Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:df1e5835bcec187018e0adfffd7cec27108eabb03dbf744ec3c55e33700b1ec8","observation_id":"ebbce05a-4324-48b2-8795-b111606f7354","resolution":{"observed_at":"2026-08-07T14:03:03.750220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-06T06:21:45.459224Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-07T14:03:03.857463Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.857463Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:f5093d6abcbc61f7d549593707c6ff17a1389d14351e0d26b9b377851aae21c8","observation_id":"e562b6aa-ddbf-4d8b-8895-fcd721069b93","resolution":{"observed_at":"2026-08-07T14:03:03.857463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:03.973288Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:03.973288Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:64b164f2cdc0395b5717a927a30ae209cbfe3d62d0a979eaeb7fbc8c9e3bd34a","observation_id":"72e2641c-295d-4f6c-9362-3a01008ddd38","resolution":{"observed_at":"2026-08-07T14:03:03.973288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:04.045136Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.045136Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:5d27f74253b6c4637125e7a67616c9071822905cf95e2fe8bb8198c977638972","observation_id":"08356e42-bbe9-408a-9ed4-959675dd8a05","resolution":{"observed_at":"2026-08-07T14:03:04.045136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-07T00:13:25.095002Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T14:03:04.111822Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.111822Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:4ebdf53de621e8fdb9ad73e548b7a77b3147284d727970e452bb689084968e80","observation_id":"e152143e-f3e1-440b-be7d-f896473bbd0b","resolution":{"observed_at":"2026-08-07T14:03:04.111822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:03:04.187637Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.187637Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:5851c2b62811757f15320346de53133b17581a8a7b8d0994ed8a35caa6a1cc21","observation_id":"8123c0de-d03b-4fec-919f-b86d2ec5268c","resolution":{"observed_at":"2026-08-07T14:03:04.187637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.656048Z","title":null,"venue":null,"work_id":"d0dc41cd-2380-421e-85ae-9325986882c8","year":2022},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.271561Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:fa819e384d2108f6a02d124d1b875a71244c298c2af8d8e75fb9054f46b43b86","observation_id":"2f1cbbcd-3dc2-45c9-9f81-db94517fd77b","resolution":{"observed_at":"2026-08-07T14:03:07.725180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:04.374879Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.374879Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:37ad3761d7c204a76d6e7314edc5db25bb06af8d19a047e19cedf2ec45369657","observation_id":"fcfd79c1-2c4a-41f0-b40b-429b1b89195f","resolution":{"observed_at":"2026-08-07T14:03:04.374879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10816","last_updated":"2024-10-14T17:59:56Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:56Z","title":"LVD-2M: A Long-take Video Dataset with Temporally Dense Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10816","snapshot_observed_at":"2026-08-07T14:03:04.506043Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.506043Z"},"links":{"cited_paper":"/paper/2410.10816","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:477a195eee8115dea645872f775d34da6aaf44312c92848ae9a67fa52b052b2b","observation_id":"265a3136-d705-4abf-b83b-6620edcb1c5b","resolution":{"observed_at":"2026-08-07T14:03:04.506043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T14:03:04.655235Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.655235Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:8b9726d4dc95ef8925f06dc9ac20ebf32b9aa9e9cca711b2f5e8ac1a44d418e0","observation_id":"7cee4432-0fb8-4c1c-a2d2-7c0a4a137b7e","resolution":{"observed_at":"2026-08-07T14:03:04.655235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:03:04.827954Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.827954Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:7dddcc115178d319e8b026bcfa68e2bd0702c38884caebd71b6bb6fcfcfcbd8a","observation_id":"07fee8e3-fcbb-424e-90ab-64d20723cb18","resolution":{"observed_at":"2026-08-07T14:03:04.827954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-08T11:20:34.553955Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-07T14:03:04.955570Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:04.955570Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:b591be637d9204ad58f355ca82b2647f126c88eed0e6c45ebc54023a3675fb66","observation_id":"17caf676-8060-4872-a08a-74ceb034ca59","resolution":{"observed_at":"2026-08-07T14:03:04.955570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12316","last_updated":"2025-04-10T07:20:54Z","snapshot_observed_at":"2026-08-07T16:06:58.044831Z","submitted_at":"2025-04-10T07:20:54Z","title":"Data Metabolism: An Efficient Data Design Schema For Vision Language Model","version":1},"cited_work":{"arxiv_id":"2504.12316","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12316","snapshot_observed_at":"2026-08-07T14:03:06.568512Z","title":"Data Metabolism: An Efficient Data Design Schema For Vision Language Model","venue":"cs.CL","work_id":"6b91ab5b-112d-4af1-aef2-94cffcd11ed9","year":2025},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.067370Z"},"links":{"cited_paper":"/paper/2504.12316","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:ff4e0cedd1e9b0796c11bb69890af40603ce8008439e74b344e0cc545188c7ba","observation_id":"5311021e-f9c7-4ee0-ad3b-82cca5cecd7f","resolution":{"observed_at":"2026-08-07T14:03:06.692996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-07T14:03:05.169239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.169239Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:a9aaceab23faa84ab8490c5393717e4497b5d7175d873810e743b8a686f53316","observation_id":"a121405d-cc86-4038-9de0-7513e1cfd982","resolution":{"observed_at":"2026-08-07T14:03:05.169239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T14:03:05.277632Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.277632Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:20d369f1188c58703916d39b6fc29aba5c76b2c0d381ca17a64c3a00e632141b","observation_id":"2108de4d-6b3d-48a7-8140-aff954899ef2","resolution":{"observed_at":"2026-08-07T14:03:05.277632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T14:03:05.370546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.370546Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:13534af8a1a3147be6e7e13fbc90a7474373346eacab308f80fcc03013aec8bc","observation_id":"c4d6965b-11f5-4237-b7fc-1258b9907527","resolution":{"observed_at":"2026-08-07T14:03:05.370546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T14:03:05.437658Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.437658Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:2beb9db131db8b087e9c23acf96e0c1c3880757ccde739a7605488d82b0cf0d4","observation_id":"cb14725c-c296-4ee6-9a97-6465dacc2bbd","resolution":{"observed_at":"2026-08-07T14:03:05.437658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:05.567061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.567061Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:92a57664cc469ac2bedb80cb37e676c4a8ccd088a73ab892e3da9cccf83e05d2","observation_id":"d8ca32b8-0707-439c-8c3d-198fa2f7a0cb","resolution":{"observed_at":"2026-08-07T14:03:05.567061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T14:03:05.687068Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.687068Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:695537dc5f0f33044565f953e1865736cd5c27d249dda5bcc474fa6f82cd5d55","observation_id":"b1a20b4b-0c71-4321-a18f-87146e3c31f0","resolution":{"observed_at":"2026-08-07T14:03:05.687068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:03:05.767363Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.767363Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:6ed8dce72e9c4b87828c842fd9c22d837ca417fe08e94473b3d31473cc229606","observation_id":"b0fcf885-c808-484a-984b-460da8e0881b","resolution":{"observed_at":"2026-08-07T14:03:05.767363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T14:03:05.923132Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.923132Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:7a0af2fedc31ec478e989b3ffcab8c72600a4ee7f79dca7af5778cdd59e90cce","observation_id":"658e07f5-9c74-4d90-b731-0b39d9dc1f45","resolution":{"observed_at":"2026-08-07T14:03:05.923132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:07.524567Z","title":null,"venue":null,"work_id":"d12d50a3-7ed6-4ba0-b776-df5f43d38786","year":2018},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:06.003724Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:cfb0640ba987f4520a3fe3a8ccec1b2650786584cec198cb571542f73cb8feee","observation_id":"54e75afa-a7fe-4b6c-aab9-cedbd134b567","resolution":{"observed_at":"2026-08-07T14:03:07.585506Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:03:06.085212Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:06.085212Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:3c386eb3b06c87c959dfaa733915c95eec970e1fd9f0f174a960156b6e989e43","observation_id":"b2cca2ff-6b23-4958-abd3-54644a51dca4","resolution":{"observed_at":"2026-08-07T14:03:06.085212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:06.145059Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:06.145059Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:6715e786f7e7f14f1edc53dbc9945dd33d84a78254683a6de4e1ac09765c5fd9","observation_id":"303c9067-77cd-49e0-9bc7-fd9427d2bd23","resolution":{"observed_at":"2026-08-07T14:03:06.145059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:03:06.244486Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:06.244486Z"},"links":{"citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:dc01abec9a3c5d1fdb2a650359de3fefc0d38076c3960d8b75a37ba95b163c6f","observation_id":"bb7d58e0-a630-4026-8b74-743761450c9b","resolution":{"observed_at":"2026-08-07T14:03:06.244486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2505.20124."}