{"as_of":"2026-08-09T02:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b9a1a8016ba410f85881e1852d370257639095a3ffd4d457e71032df73780b6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:26:20.268946Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:39:03.234328Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":216,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:d43e9e61f27dfdbe5449b7af4c873497b2a4ae39f1dc6fdd4a755f58f2bec471","observation_id":"d5b6241f-c506-4dde-888a-5ebddaa3d455","resolution":{"observed_at":"2026-05-10T23:20:33.170271Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:c891b9f780d6c999d7157ab8e4483c36faed42cd3dd3d81db7ccf3a892a380df","observation_id":"8728683d-c1dd-4cae-8913-cb685f76a829","resolution":{"observed_at":"2026-05-14T00:32:41.302744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-08T23:26:20.268946Z","title":"TemporalBench: Towards fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-08T23:19:12.430722Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.268946Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:e04af2d5f6f02b202ee635656b3f3b10ba108f50fe8e9d429861fcec0540c0a1","observation_id":"333f9254-8eb1-45d4-bb86-ce42e95dab06","resolution":{"observed_at":"2026-08-08T23:26:20.268946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:fcdeb9b8edd338156ff686708d52c36bcd445ea5ceaf94ca2106ca74b7f324fb","observation_id":"4d7bc3d6-cca5-45e2-9860-084fb8cfc5d9","resolution":{"observed_at":"2026-05-11T05:26:05.681583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T14:24:07.209929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19125","last_updated":"2025-05-25T12:44:12Z","snapshot_observed_at":"2026-08-07T14:17:46.430576Z","submitted_at":"2025-05-25T12:44:12Z","title":"RTime-QA: A Benchmark for Atomic Temporal Event Understanding in Large Multi-modal Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:24:07.209929Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.19125"},"observation_digest":"sha256:ab00dede70f7719ffd482dec8eda1b2b23e84a219a5905a17a19b9105ff90738","observation_id":"a6bc6d7e-b309-427f-aa28-fe817f779cc3","resolution":{"observed_at":"2026-08-07T14:24:07.209929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T14:02:59.572640Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:02:59.572640Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:fa44fd29234465395b697282cba8f8370ae25ead867150f496f06154c7619f48","observation_id":"0068b704-aecd-46cc-a8c5-175b3944aa05","resolution":{"observed_at":"2026-08-07T14:02:59.572640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2505.20715","last_updated":"2026-04-18T02:55:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-27T04:50:07Z","title":"MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T13:13:40.485342Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.20715"},"observation_digest":"sha256:1d09f990f87675c698358600bb8cf65c97bcbdd09bb550e48cd035261a7440a1","observation_id":"358b7850-828e-4e44-905f-3a296da34640","resolution":{"observed_at":"2026-05-19T13:17:18.545824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T13:10:40.431117Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-07T13:04:26.186923Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:40.431117Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:0e7ff06564237f6aa751ddbf696078d6dda08a6887985b1a52f2de54d8069f8f","observation_id":"8c97c53f-09c4-49cc-a2be-eebe6f273efc","resolution":{"observed_at":"2026-08-07T13:10:40.431117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-07T11:58:08.121411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00928","last_updated":"2025-06-01T09:45:41Z","snapshot_observed_at":"2026-08-07T11:52:21.890261Z","submitted_at":"2025-06-01T09:45:41Z","title":"Deep Temporal Reasoning in Video Language Models: A Cross-Linguistic Evaluation of Action Duration and Completion through Perfect Times","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:08.121411Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2506.00928"},"observation_digest":"sha256:4630abfde5a40b1f905560c6e4eb7f996b13c4cf104def89a76a4eeadac7408a","observation_id":"305f6973-6c73-49c7-a805-d19b14918540","resolution":{"observed_at":"2026-08-07T11:58:08.121411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2506.07180","last_updated":"2026-04-30T12:27:19Z","snapshot_observed_at":"2026-07-06T21:38:39.914904Z","submitted_at":"2025-06-08T15:00:21Z","title":"Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T11:03:59.222849Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2506.07180"},"observation_digest":"sha256:60128602e8fd68c89e1b8906b5cd7f74d5a9c2adaed202faf84fb09f798c8ba7","observation_id":"0a22fff6-cf20-4c15-89bc-b46ffd20a18e","resolution":{"observed_at":"2026-05-19T11:07:15.380828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:dfb0885c5c781e91ea1a079af05691515a709fc09a54847b7741d7163ae627ee","observation_id":"b3e7157c-7b90-4817-989b-f5200612b389","resolution":{"observed_at":"2026-05-11T00:33:50.948202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-06T18:03:13.972207Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09313","last_updated":"2025-07-15T11:48:07Z","snapshot_observed_at":"2026-08-07T00:34:11.228009Z","submitted_at":"2025-07-12T15:11:50Z","title":"ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:03:13.972207Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2507.09313"},"observation_digest":"sha256:03ce750c9a0075b0bbd6cabbf4c2a8f3045f89ef6eaed78f1fa29105b69bf799","observation_id":"e849daa4-bf69-475c-8e19-353675a6c28c","resolution":{"observed_at":"2026-08-06T18:03:13.972207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-06T17:58:26.999928Z","title":"arXiv preprint arXiv:2410.10818","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:26.999928Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:4d51d9e8eaad3c3a5889e83a34194e15a4aed76ab2c4aa785d4188e9c1c62aeb","observation_id":"bbe643d1-35b2-4d2e-9e1a-e0b64b67fc02","resolution":{"observed_at":"2026-08-06T17:58:26.999928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-06T15:48:31.035101Z","title":"Temporalbench: Towards fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15028","last_updated":"2025-07-20T16:30:33Z","snapshot_observed_at":"2026-08-08T09:10:28.397518Z","submitted_at":"2025-07-20T16:30:33Z","title":"Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:31.035101Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2507.15028"},"observation_digest":"sha256:a855547acadce70eb2123ccf7f7ccd17f9937d000bb3a28f60894c22e03c7ba9","observation_id":"f91d00e8-c6f6-491f-b1a5-7bdc970597a8","resolution":{"observed_at":"2026-08-06T15:48:31.035101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-06T15:14:17.287285Z","title":"Cao, P.; Men, T.; Liu, W.; Zhang, J.; Li, X.; Lin, X.; Sui, D.; Cao, Y .; Liu, K.; and Zhao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16878","last_updated":"2025-07-22T12:29:13Z","snapshot_observed_at":"2026-08-08T07:13:57.213076Z","submitted_at":"2025-07-22T12:29:13Z","title":"CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:17.287285Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2507.16878"},"observation_digest":"sha256:5f4c63af8bf5dc2bb8e6b1fccc44801a857fd339744718b11b32c4abb06a3030","observation_id":"ad492195-bd08-400d-a93c-a65b26054333","resolution":{"observed_at":"2026-08-06T15:14:17.287285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-04T20:20:36.661579Z","title":"Temporalbench: Bench- marking fine-grained temporal understanding for multimodal video models.CoRR, abs/2410.10818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-06T13:15:27.312512Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.661579Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:5f8d844c78075881f44af32c27c3271d364ccec62f238f89b593a92db99a5fa8","observation_id":"15f9e0ce-387e-4e56-a998-6d9afa19ef88","resolution":{"observed_at":"2026-08-04T20:20:36.661579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-04T13:54:11.277795Z","title":", Tan , R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24563","last_updated":"2026-07-15T12:54:15Z","snapshot_observed_at":"2026-08-08T23:25:33.156446Z","submitted_at":"2025-09-29T10:16:05Z","title":"NeMo: Needle in a Montage for Video-Language Understanding","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T13:54:11.277795Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2509.24563"},"observation_digest":"sha256:daad997e2abc5f7e37b51fb3c7fcaf670e34b01f25f51012eed4effe3ce7045e","observation_id":"af06448f-fba1-4f4c-bcbd-94a2990c6610","resolution":{"observed_at":"2026-08-04T13:54:11.277795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2511.20785","last_updated":"2026-05-21T10:39:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T19:22:48Z","title":"LongVT: Incentivizing \"Thinking with Long Videos\" via Native Tool Calling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T12:26:35.347190Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2511.20785"},"observation_digest":"sha256:ee1f9112377185461f5f8191f14cbb5ab1183401e7fd289238ac652d1dcd2a0e","observation_id":"6a8aaab0-b1f6-4fde-bec6-dbbb05df58b9","resolution":{"observed_at":"2026-05-22T12:31:32.156486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2512.02231","last_updated":"2026-04-10T02:23:14Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-01T21:57:26Z","title":"See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T02:12:55.170296Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2512.02231"},"observation_digest":"sha256:85cd168686c5f390438c8760dbd5731ab6ba80c50ad4076085f12ffa6543cd7e","observation_id":"d12b6c69-c134-451c-910b-20cabb957091","resolution":{"observed_at":"2026-05-17T02:13:52.103038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-03T18:28:15.922879Z","title":"Temporalbench: Benchmarking fine- grained temporal understanding for multimodal video mod- els.arXiv preprint arXiv:2410.10818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05277","last_updated":"2026-06-02T23:07:19Z","snapshot_observed_at":"2026-08-07T00:48:11.221345Z","submitted_at":"2025-12-04T21:57:10Z","title":"From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:28:15.922879Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2512.05277"},"observation_digest":"sha256:bcff2fa9011c0e6b0df688afb9b6394e89c208010ae93539aa0a8e58cd64ea5c","observation_id":"c84d5d53-66bb-46aa-8f21-429c8c812f36","resolution":{"observed_at":"2026-08-03T18:28:15.922879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2604.10385","last_updated":"2026-07-14T05:51:48Z","snapshot_observed_at":"2026-08-08T09:44:03.441004Z","submitted_at":"2026-04-12T00:01:51Z","title":"GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:10.956726Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2604.10385"},"observation_digest":"sha256:76cbae10c96631fc8be6e9e9ada267d6db38ca1b67361b678a9e9bb9d93513ff","observation_id":"f6290141-24a4-455e-b8f9-c5e6fe3d58e8","resolution":{"observed_at":"2026-05-11T08:26:01.762020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:842a0aee20588131b06546b225e303c8786df38ed94cd8571104b41d20a221c2","observation_id":"6968e55c-af11-43d4-910d-b458eb5ba282","resolution":{"observed_at":"2026-05-11T10:41:04.015830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2604.17375","last_updated":"2026-04-19T10:58:40Z","snapshot_observed_at":"2026-08-02T21:21:44.410489Z","submitted_at":"2026-04-19T10:58:40Z","title":"When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T06:41:59.641410Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2604.17375"},"observation_digest":"sha256:07b0656da2956799c3fab2c059ab58ecbba1e0e6c091545e21d00bd800ca5630","observation_id":"4d934730-f911-4785-8ed2-1e50700138de","resolution":{"observed_at":"2026-05-10T06:46:37.546797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.02834","last_updated":"2026-05-05T09:59:53Z","snapshot_observed_at":"2026-08-07T22:39:16.868213Z","submitted_at":"2026-05-04T17:11:16Z","title":"VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T18:35:48.379198Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.02834"},"observation_digest":"sha256:3a93ddb80a7dd0c64d23a0d9ba073dd486e0b1491aeec5d7919397c4b44616bf","observation_id":"ebfb5115-25aa-42a9-8026-15d9f12fafa5","resolution":{"observed_at":"2026-05-09T06:20:41.264335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:13:21.487431Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:5f0231cea9d2653dcbe52ae9fde6965b3432d8b24d5f996267bc3fc23289d8f5","observation_id":"83c7d2dd-2323-4155-b984-2468ff757f85","resolution":{"observed_at":"2026-05-12T06:31:26.606021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T06:53:42.726350Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:26de72f9fd3d5d123f28a8db8a0f2cb736baa8aa07837495cacddfc60c55c4e2","observation_id":"7d3ca994-57b8-40e7-917c-a5a53953eb14","resolution":{"observed_at":"2026-05-13T06:57:28.298673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.13803","last_updated":"2026-05-13T17:25:51Z","snapshot_observed_at":"2026-08-02T10:58:24.692632Z","submitted_at":"2026-05-13T17:25:51Z","title":"EvoGround: Self-Evolving Video Agents for Video Temporal Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T19:29:47.356665Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.13803"},"observation_digest":"sha256:65418e57956dc8430378033017748861a6afb9855c6c08ffe2c24a0267a337a7","observation_id":"7559d5ad-eb08-48c6-aa60-ead607b633ac","resolution":{"observed_at":"2026-05-14T19:32:52.564646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.15342","last_updated":"2026-05-14T19:12:20Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T19:12:20Z","title":"Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T16:02:53.887605Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.15342"},"observation_digest":"sha256:a5ddf45d9651450a58bf8b7a59f5b0996675bdc03bd419e55ed545a348677ede","observation_id":"f1700d39-3c5f-45fb-8f20-19724b4ed41a","resolution":{"observed_at":"2026-05-19T16:03:08.044136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.19846","last_updated":"2026-05-23T07:31:13Z","snapshot_observed_at":"2026-08-02T22:01:11.866294Z","submitted_at":"2026-05-19T13:40:26Z","title":"FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T06:08:12.887394Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.19846"},"observation_digest":"sha256:42b5e607c710134995476044ddbb60e014502ca784396af2dbe315c955cd20ee","observation_id":"aaa66853-e66b-4ffb-8c41-8f8517e6def5","resolution":{"observed_at":"2026-05-20T06:13:05.462877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.19846","last_updated":"2026-05-23T07:31:13Z","snapshot_observed_at":"2026-08-02T22:01:11.866294Z","submitted_at":"2026-05-19T13:40:26Z","title":"FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T07:59:57.488107Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.19846"},"observation_digest":"sha256:eb7f57521b0922819a3bdb34f3c69d3aaaed8d7d2e97b26a6558cea22c7bbb9b","observation_id":"a057f476-9899-436f-91f4-48608cfcacc4","resolution":{"observed_at":"2026-05-21T08:04:02.791065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.19846","last_updated":"2026-05-23T07:31:13Z","snapshot_observed_at":"2026-08-02T22:01:11.866294Z","submitted_at":"2026-05-19T13:40:26Z","title":"FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:09:49.178090Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.19846"},"observation_digest":"sha256:720b8de8b18e4720fe01f3a0b5417560f4b6f85e760771c6db079ec0d2e4b601","observation_id":"165ec764-c51b-4b13-8e50-4780a9e9f8e9","resolution":{"observed_at":"2026-06-30T18:14:59.999305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.21988","last_updated":"2026-05-21T04:38:02Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T04:38:02Z","title":"Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:45:56.473188Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.21988"},"observation_digest":"sha256:5db0804e41b3e986888f6ec860cf1114ddff90d938b20322be56ff58b3a58217","observation_id":"e6080247-df3f-4d8b-944b-8736e0d26d6a","resolution":{"observed_at":"2026-05-22T07:46:14.880613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.23045","last_updated":"2026-07-15T09:38:22Z","snapshot_observed_at":"2026-08-02T18:10:47.588058Z","submitted_at":"2026-05-21T21:22:42Z","title":"The TIME Machine: On The Power of Motion for Efficient Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T05:40:33.752341Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.23045"},"observation_digest":"sha256:68ee1981e0262d9d355560f41250bb1b3ec046583106b069a174ae469362cf41","observation_id":"9aca9f84-e2ee-4eb9-a074-cb6fe0b21f5e","resolution":{"observed_at":"2026-05-25T05:46:40.010650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-15T11:06:23.089564Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.23045","last_updated":"2026-07-15T09:38:22Z","snapshot_observed_at":"2026-08-02T18:10:47.588058Z","submitted_at":"2026-05-21T21:22:42Z","title":"The TIME Machine: On The Power of Motion for Efficient Perception","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-15T11:06:23.089564Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.23045"},"observation_digest":"sha256:cd5a1d1e2ab6a9e41b4ab782f19f94b58ab14143a2913f9dfe2e7c0073aff990","observation_id":"5fa44cfa-c497-42cd-8aa1-84798f581a31","resolution":{"observed_at":"2026-07-15T11:06:23.089564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-02T13:27:48.232517Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.23045","last_updated":"2026-07-15T09:38:22Z","snapshot_observed_at":"2026-08-02T18:10:47.588058Z","submitted_at":"2026-05-21T21:22:42Z","title":"The TIME Machine: On The Power of Motion for Efficient Perception","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T13:27:48.232517Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.23045"},"observation_digest":"sha256:aea5d1bc4bed405b92459bf310cf7d100d0997abae5a5eaf41b824206753f833","observation_id":"de64e0c2-82c2-414a-a70c-739353ac54ac","resolution":{"observed_at":"2026-08-02T13:27:48.232517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.27074","last_updated":"2026-05-26T14:23:25Z","snapshot_observed_at":"2026-08-02T20:44:04.329111Z","submitted_at":"2026-05-26T14:23:25Z","title":"IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T18:24:57.881644Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.27074"},"observation_digest":"sha256:f33c0dfa2286a1042095653e74241e93e6ac1978e3e041b9268466cf61d176fd","observation_id":"b5eb221b-48ea-48d7-8e50-f892bc12077b","resolution":{"observed_at":"2026-06-29T18:33:51.073077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:a93cf414f3a3d6f3c3cbd79bb26db78f7aa3ec478ece5b0cd5efaa110fa1490e","observation_id":"2a848339-a283-4131-80eb-97e8b045757f","resolution":{"observed_at":"2026-06-29T08:33:15.588037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.30673","last_updated":"2026-07-06T14:01:36Z","snapshot_observed_at":"2026-08-02T07:17:06.461529Z","submitted_at":"2026-05-29T00:06:54Z","title":"TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:11:43.712391Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.30673"},"observation_digest":"sha256:c1c20c7bbc440904471af4fcbc63ad0519851e2303ed9684f99f368e1104c912","observation_id":"f8049609-c217-4dd0-9b2a-88c25912653e","resolution":{"observed_at":"2026-06-28T23:12:46.638618Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2606.03920","last_updated":"2026-06-02T17:12:05Z","snapshot_observed_at":"2026-08-02T12:14:20.077142Z","submitted_at":"2026-06-02T17:12:05Z","title":"Benchmarking Visual State Tracking in Multimodal Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T10:43:06.811228Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2606.03920"},"observation_digest":"sha256:1191864cd92b6b590ce839b638e75144b676089024e7145ef6b2306b48e2607f","observation_id":"8ba65bc2-aaee-4236-9f7a-44708d0b76f4","resolution":{"observed_at":"2026-07-02T02:46:27.984113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2606.04880","last_updated":"2026-06-02T17:59:57Z","snapshot_observed_at":"2026-08-06T01:54:13.672479Z","submitted_at":"2026-06-02T17:59:57Z","title":"MAOAM: Unified Object and Material Selection with Vision-Language Models","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-06-28T11:08:59.900161Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2606.04880"},"observation_digest":"sha256:99a2ab8e0e08c0147914263085449f27136448496b411dc89733e6265f9fae4f","observation_id":"a21a8d1f-e3e0-4d18-957e-68a4b6df0fbb","resolution":{"observed_at":"2026-07-02T02:16:26.337706Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2606.18586","last_updated":"2026-06-17T01:26:50Z","snapshot_observed_at":"2026-08-02T17:47:20.748005Z","submitted_at":"2026-06-17T01:26:50Z","title":"APT: Atomic Physical Transitions for Causal Video-Language Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T22:06:00.249819Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2606.18586"},"observation_digest":"sha256:a9bdab04e0a9061ce235cd3fa989242433bb371de86b6218357e670481e1597b","observation_id":"4544884c-2f76-421b-ae9b-7d6aabf2f597","resolution":{"observed_at":"2026-07-03T23:39:03.236843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2606.28593","last_updated":"2026-06-26T20:38:04Z","snapshot_observed_at":"2026-07-07T00:02:38.226622Z","submitted_at":"2026-06-26T20:38:04Z","title":"Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T00:53:52.724902Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2606.28593"},"observation_digest":"sha256:fd523ef0f61753300fcaaa6943aa4d2db4e30a13396c00085e45b2dbe711055c","observation_id":"fe62423f-d61e-4782-aac6-fa2f3577de9c","resolution":{"observed_at":"2026-07-01T16:05:49.779006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.10818/citation-record","integrity":"/paper/2410.10818/integrity","json":"/paper/2410.10818/citation-record.json","paper":"/paper/2410.10818"},"outbound":[],"paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2410.10818."}